5.3 KiB
Modely — fakta a strategie
Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu /model <preset>;
trvalá změna defaultu = agents.defaults.modelPreset v ~/.nanobot/config.json.
Nakonfigurované presety (/model)
Zdroj: ~/.nanobot/config.json → model_presets. Všechny mají maxTokens = 16384,
temperature = 0.1, provider = ollama.
| Preset | Model id | Kontext | reasoningEffort |
|---|---|---|---|
glm (default) |
glm-5.3-flash:cloud |
976 000 | high |
glm53 |
glm-5.3:cloud |
976 000 | high |
glm52 (legacy) |
glm-5.2:cloud |
976 000 | high |
glmi51 (legacy) |
glm-5.1:cloud |
196 608 | — |
kimi |
kimi-k2.6:cloud |
262 144 | — |
kimi27 |
kimi-k2.7-code:cloud |
262 144 | — |
kimi3 |
kimi-k3:cloud |
1 020 000 | — |
glmi51 a glm52 jsou legacní — jen pro regression srovnání, k práci nepoužívat.
kimi3 nepoužívat (viz níž), zvaž odstranění presetu z configu.
Strategie modelů (potvrzeno uživatelem, 2026-02)
| Role | Model |
|---|---|
| Daily driver | glm — glm-5.3-flash |
| Těžké úlohy | glm53 — glm-5.3 |
| Kódování | kimi27 — kimi-k2.7-code (fallback: kimi) |
| Běžné agentní práce na Kimi | kimi — kimi-k2.6 |
| Nepoužívat | kimi3 — extra high usage, zasekávání v agentním modu (2026-02) |
Kdy přepnout na glm53 („těžká úloha")
- Multi-step research / deep-research skill (30+ iterací, cross-checking, dlouhé syntézy).
- Multi-file refactor (5+ souborů, velký kontext).
- Dlouhý debug / root-cause analýza přes víc systémů.
- Wiki-compile s velkými vstupy (drain tisíců řádků).
- Prompt injection / security analýza.
Pravidlo: nejdřív glm (flash); když task „cuchne" (model ztrácí nit, opakuje tool
call, potřebuje přes 100 iterací), restartuj na glm53.
GLM-5.3 řada — srovnání (deep research, 2026-06)
| Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext |
|---|---|---|---|---|
| GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, text-only |
| GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) |
- Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4 (Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na Toolathlon vede Kimi K3).
- GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
- GLM-5.3 = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen na flash — 5.3 je text-only (docs.z.ai).
Kimi K2.6 vs K2.7 Code — kdo na co
K2.7 Code je coding-focused fork K2.6 (rel. 12. 6. 2026) — stejná architektura (1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video vstup, což je u coding modelu neobvyklé.
| K2.6 | K2.7 Code | |
|---|---|---|
| Pozice | generalista | coding fork |
| Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % |
| Thinking tokeny | baseline | −~30 % |
| Non-thinking mode | ano | zrušen (thinking-on natvrdo) |
| Agent swarm 300 agentů / 4000 kroků | ano | necíleno |
- K2.6: 4000+ tool callů v jedné 12–13h session, 300 sub-agentů — stability strop generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty (remind/heartbeat/dream workflow v nanobotu).
- K2.7 Code: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
- K3: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno ollama.com/library) + extrémní verbozita, v agentním modu se zaseká. Nepoužívat.
Provozní fakta
- Ollama Cloud (endpoint
nvidia.hell): max 3 paralelní dotazy; žádný rychlý provider (Fireworks/Cerebras). - Prompt caching zapíná nanobot jen pro
openrouter,anthropic,bedrock— ollama a gemini presety žádné cache breakpointy. - Kontextová okna: nanobot má hardcoded default
context_window_tokens = 65 536; pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity. Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů. - Reasoning/thinking režim = pomalé + drahé na out tokeny (měřeno 2026-06 na glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output ~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
- Vendor vs produkce: ~37 % propad mezi lab benchmark skóre a reálným nasazením (Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index, Code Arena Elo.
Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3, glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage), huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code), platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.