Files
nanobot-runtime/knowledge/models.md
2026-09-16 08:56:28 +02:00

5.6 KiB
Raw Blame History

Modely — fakta a strategie

Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu /model <preset>; trvalá změna defaultu = agents.defaults.modelPreset v ~/.nanobot/config.json.


Nakonfigurované presety (/model)

Zdroj: ~/.nanobot/config.jsonmodel_presets. Všechny mají maxTokens = 16384 a temperature = 0.1. Default je glm, fallback kimi.

Preset Provider Model id Kontext reasoningEffort
glm (default) ollama glm-5.3:cloud 976 000 high
flash ollama glm-5.3-flash:cloud 976 000 high
glm52 (legacy) ollama glm-5.2:cloud 976 000 high
glm51 (legacy) ollama glm-5.1:cloud 196 608
kimi ollama kimi-k2.7-code:cloud 262 144
kimi26 ollama kimi-k2.6:cloud 262 144
kimi3 ollama kimi-k3:cloud 1 020 000
sonnet openrouter anthropic/claude-sonnet-4.6 256 000
haiku openrouter anthropic/claude-haiku-4.5 200 000
gemini-flash openrouter google/gemini-3.5-flash 256 000
gemini-flash-lite openrouter google/gemini-3.1-flash-lite 256 000

glm51 a glm52 jsou legacní — jen pro regression srovnání, k práci nepoužívat. kimi3 nepoužívat (viz níž), zvaž odstranění presetu z configu.


Strategie modelů (potvrzeno uživatelem, 2026-09)

Role Model
Daily driver + těžké úlohy glm — glm-5.3
Kódování kimi — kimi-k2.7-code
Běžné agentní práce na Kimi kimi26 — kimi-k2.6
Levnější/rychlejší + multimodální vstup flash — glm-5.3-flash
Nepoužívat kimi3 — extra high usage, zasekávání v agentním modu (2026-02)

Kdy sáhnout po flash

  • Multimodální vstup — obrázek, screenshot, sken, video. glm (glm-5.3) je text-only, flash je jediný GLM preset, co obrázky přijme (viz níž).
  • Levné rutinní tahy, kde nejde o maximální kvalitu a záleží na rychlosti (TTFT ~0,4 s vs ~0,7 s).

GLM-5.3 řada — srovnání (deep research, 2026-06)

Model AA Intelligence Index v4.1.1 Ollama Cloud tok/s TTFT Kontext
GLM-5.3 60 ~134 ~0,7 s 1M, text-only
GLM-5.3-Flash 57 ~131 ~0,4 s 1M, multimodální, MIT (320B/18B MoE)
  • Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4 (Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na Toolathlon vede Kimi K3).
  • GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
  • GLM-5.3 = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen na flash — 5.3 je text-only (docs.z.ai).

Kimi K2.6 vs K2.7 Code — kdo na co

K2.7 Code je coding-focused fork K2.6 (rel. 12. 6. 2026) — stejná architektura (1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video vstup, což je u coding modelu neobvyklé.

K2.6 K2.7 Code
Pozice generalista coding fork
Agentní benchy (MCP Atlas, Claw 24/7) baseline +~10 %
Thinking tokeny baseline ~30 %
Non-thinking mode ano zrušen (thinking-on natvrdo)
Agent swarm 300 agentů / 4000 kroků ano necíleno
  • K2.6: 4000+ tool callů v jedné 1213h session, 300 sub-agentů — stability strop generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty (remind/heartbeat/dream workflow v nanobotu).
  • K2.7 Code: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
  • K3: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno ollama.com/library) + extrémní verbozita, v agentním modu se zaseká. Nepoužívat.

Provozní fakta

  • Ollama Cloud (endpoint nvidia.hell): max 3 paralelní dotazy; žádný rychlý provider (Fireworks/Cerebras).
  • Prompt caching zapíná nanobot jen pro openrouter, anthropic, bedrock — ollama a gemini presety žádné cache breakpointy.
  • Kontextová okna: nanobot má hardcoded default context_window_tokens = 65 536; pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity. Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů.
  • Reasoning/thinking režim = pomalé + drahé na out tokeny (měřeno 2026-06 na glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output ~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
  • Vendor vs produkce: ~37 % propad mezi lab benchmark skóre a reálným nasazením (Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index, Code Arena Elo.

Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3, glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage), huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code), platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.