Files
nanobot-runtime/knowledge/models.md
2026-09-02 15:23:13 +02:00

5.3 KiB
Raw Blame History

Modely — fakta a strategie

Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu /model <preset>; trvalá změna defaultu = agents.defaults.modelPreset v ~/.nanobot/config.json.


Nakonfigurované presety (/model)

Zdroj: ~/.nanobot/config.jsonmodel_presets. Všechny mají maxTokens = 16384, temperature = 0.1, provider = ollama.

Preset Model id Kontext reasoningEffort
glm (default) glm-5.3-flash:cloud 976 000 high
glm53 glm-5.3:cloud 976 000 high
glm52 (legacy) glm-5.2:cloud 976 000 high
glmi51 (legacy) glm-5.1:cloud 196 608
kimi kimi-k2.6:cloud 262 144
kimi27 kimi-k2.7-code:cloud 262 144
kimi3 kimi-k3:cloud 1 020 000

glmi51 a glm52 jsou legacní — jen pro regression srovnání, k práci nepoužívat. kimi3 nepoužívat (viz níž), zvaž odstranění presetu z configu.


Strategie modelů (potvrzeno uživatelem, 2026-02)

Role Model
Daily driver glm — glm-5.3-flash
Těžké úlohy glm53 — glm-5.3
Kódování kimi27 — kimi-k2.7-code (fallback: kimi)
Běžné agentní práce na Kimi kimi — kimi-k2.6
Nepoužívat kimi3 — extra high usage, zasekávání v agentním modu (2026-02)

Kdy přepnout na glm53 („těžká úloha")

  • Multi-step research / deep-research skill (30+ iterací, cross-checking, dlouhé syntézy).
  • Multi-file refactor (5+ souborů, velký kontext).
  • Dlouhý debug / root-cause analýza přes víc systémů.
  • Wiki-compile s velkými vstupy (drain tisíců řádků).
  • Prompt injection / security analýza.

Pravidlo: nejdřív glm (flash); když task „cuchne" (model ztrácí nit, opakuje tool call, potřebuje přes 100 iterací), restartuj na glm53.

GLM-5.3 řada — srovnání (deep research, 2026-06)

Model AA Intelligence Index v4.1.1 Ollama Cloud tok/s TTFT Kontext
GLM-5.3 60 ~134 ~0,7 s 1M, text-only
GLM-5.3-Flash 57 ~131 ~0,4 s 1M, multimodální, MIT (320B/18B MoE)
  • Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4 (Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na Toolathlon vede Kimi K3).
  • GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
  • GLM-5.3 = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen na flash — 5.3 je text-only (docs.z.ai).

Kimi K2.6 vs K2.7 Code — kdo na co

K2.7 Code je coding-focused fork K2.6 (rel. 12. 6. 2026) — stejná architektura (1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video vstup, což je u coding modelu neobvyklé.

K2.6 K2.7 Code
Pozice generalista coding fork
Agentní benchy (MCP Atlas, Claw 24/7) baseline +~10 %
Thinking tokeny baseline ~30 %
Non-thinking mode ano zrušen (thinking-on natvrdo)
Agent swarm 300 agentů / 4000 kroků ano necíleno
  • K2.6: 4000+ tool callů v jedné 1213h session, 300 sub-agentů — stability strop generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty (remind/heartbeat/dream workflow v nanobotu).
  • K2.7 Code: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
  • K3: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno ollama.com/library) + extrémní verbozita, v agentním modu se zaseká. Nepoužívat.

Provozní fakta

  • Ollama Cloud (endpoint nvidia.hell): max 3 paralelní dotazy; žádný rychlý provider (Fireworks/Cerebras).
  • Prompt caching zapíná nanobot jen pro openrouter, anthropic, bedrock — ollama a gemini presety žádné cache breakpointy.
  • Kontextová okna: nanobot má hardcoded default context_window_tokens = 65 536; pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity. Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů.
  • Reasoning/thinking režim = pomalé + drahé na out tokeny (měřeno 2026-06 na glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output ~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
  • Vendor vs produkce: ~37 % propad mezi lab benchmark skóre a reálným nasazením (Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index, Code Arena Elo.

Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3, glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage), huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code), platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.