# Modely — fakta a strategie Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu `/model `; trvalá změna defaultu = `agents.defaults.modelPreset` v `~/.nanobot/config.json`. --- ## Nakonfigurované presety (`/model`) Zdroj: `~/.nanobot/config.json` → `model_presets`. Všechny mají `maxTokens = 16384`, `temperature = 0.1`, `provider = ollama`. | Preset | Model id | Kontext | reasoningEffort | |---|---|---|---| | `glm` *(default)* | `glm-5.3-flash:cloud` | 976 000 | high | | `glm53` | `glm-5.3:cloud` | 976 000 | high | | `glm52` *(legacy)* | `glm-5.2:cloud` | 976 000 | high | | `glmi51` *(legacy)* | `glm-5.1:cloud` | 196 608 | — | | `kimi` | `kimi-k2.6:cloud` | 262 144 | — | | `kimi27` | `kimi-k2.7-code:cloud` | 262 144 | — | | `kimi3` | `kimi-k3:cloud` | 1 020 000 | — | `glmi51` a `glm52` jsou legacní — jen pro regression srovnání, k práci nepoužívat. `kimi3` nepoužívat (viz níž), zvaž odstranění presetu z configu. --- ## Strategie modelů (potvrzeno uživatelem, 2026-02) | Role | Model | |---|---| | **Daily driver** | `glm` — glm-5.3-flash | | **Těžké úlohy** | `glm53` — glm-5.3 | | **Kódování** | `kimi27` — kimi-k2.7-code (fallback: `kimi`) | | **Běžné agentní práce na Kimi** | `kimi` — kimi-k2.6 | | **Nepoužívat** | `kimi3` — extra high usage, zasekávání v agentním modu (2026-02) | ### Kdy přepnout na glm53 („těžká úloha") - Multi-step research / deep-research skill (30+ iterací, cross-checking, dlouhé syntézy). - Multi-file refactor (5+ souborů, velký kontext). - Dlouhý debug / root-cause analýza přes víc systémů. - Wiki-compile s velkými vstupy (drain tisíců řádků). - Prompt injection / security analýza. Pravidlo: nejdřív `glm` (flash); když task „cuchne" (model ztrácí nit, opakuje tool call, potřebuje přes 100 iterací), restartuj na `glm53`. ### GLM-5.3 řada — srovnání (deep research, 2026-06) | Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext | |---|---|---|---|---| | GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, **text-only** | | GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) | - Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4 (Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na Toolathlon vede Kimi K3). - GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research. - **GLM-5.3** = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen na flash — 5.3 je text-only (docs.z.ai). ### Kimi K2.6 vs K2.7 Code — kdo na co K2.7 Code je **coding-focused fork** K2.6 (rel. 12. 6. 2026) — stejná architektura (1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video vstup, což je u coding modelu neobvyklé. | | K2.6 | K2.7 Code | |---|---|---| | Pozice | generalista | coding fork | | Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % | | Thinking tokeny | baseline | −~30 % | | Non-thinking mode | ano | zrušen (thinking-on natvrdo) | | Agent swarm 300 agentů / 4000 kroků | ano | necíleno | - **K2.6**: 4000+ tool callů v jedné 12–13h session, 300 sub-agentů — stability strop generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty (remind/heartbeat/dream workflow v nanobotu). - **K2.7 Code**: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci. - **K3**: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno ollama.com/library) + extrémní verbozita, v agentním modu se zaseká. Nepoužívat. --- ## Provozní fakta - **Ollama Cloud** (endpoint `nvidia.hell`): max 3 paralelní dotazy; žádný rychlý provider (Fireworks/Cerebras). - **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock` — ollama a gemini presety žádné cache breakpointy. - **Kontextová okna**: nanobot má hardcoded default `context_window_tokens = 65 536`; pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity. Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů. - **Reasoning/thinking režim = pomalé + drahé na out tokeny** (měřeno 2026-06 na glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output ~44 t/s, verbozita 170M toků/eval, 4× nad průměrem). - **Vendor vs produkce:** ~37 % propad mezi lab benchmark skóre a reálným nasazením (Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index, Code Arena Elo. --- *Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3, glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage), huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code), platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.*