5.6 KiB
Modely — fakta a strategie
Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu /model <preset>;
trvalá změna defaultu = agents.defaults.modelPreset v ~/.nanobot/config.json.
Nakonfigurované presety (/model)
Zdroj: ~/.nanobot/config.json → model_presets. Všechny mají maxTokens = 16384
a temperature = 0.1. Default je glm, fallback kimi.
| Preset | Provider | Model id | Kontext | reasoningEffort |
|---|---|---|---|---|
glm (default) |
ollama | glm-5.3:cloud |
976 000 | high |
flash |
ollama | glm-5.3-flash:cloud |
976 000 | high |
glm52 (legacy) |
ollama | glm-5.2:cloud |
976 000 | high |
glm51 (legacy) |
ollama | glm-5.1:cloud |
196 608 | — |
kimi |
ollama | kimi-k2.7-code:cloud |
262 144 | — |
kimi26 |
ollama | kimi-k2.6:cloud |
262 144 | — |
kimi3 |
ollama | kimi-k3:cloud |
1 020 000 | — |
sonnet |
openrouter | anthropic/claude-sonnet-4.6 |
256 000 | — |
haiku |
openrouter | anthropic/claude-haiku-4.5 |
200 000 | — |
gemini-flash |
openrouter | google/gemini-3.5-flash |
256 000 | — |
gemini-flash-lite |
openrouter | google/gemini-3.1-flash-lite |
256 000 | — |
glm51 a glm52 jsou legacní — jen pro regression srovnání, k práci nepoužívat.
kimi3 nepoužívat (viz níž), zvaž odstranění presetu z configu.
Strategie modelů (potvrzeno uživatelem, 2026-09)
| Role | Model |
|---|---|
| Daily driver + těžké úlohy | glm — glm-5.3 |
| Kódování | kimi — kimi-k2.7-code |
| Běžné agentní práce na Kimi | kimi26 — kimi-k2.6 |
| Levnější/rychlejší + multimodální vstup | flash — glm-5.3-flash |
| Nepoužívat | kimi3 — extra high usage, zasekávání v agentním modu (2026-02) |
Kdy sáhnout po flash
- Multimodální vstup — obrázek, screenshot, sken, video.
glm(glm-5.3) je text-only, flash je jediný GLM preset, co obrázky přijme (viz níž). - Levné rutinní tahy, kde nejde o maximální kvalitu a záleží na rychlosti (TTFT ~0,4 s vs ~0,7 s).
GLM-5.3 řada — srovnání (deep research, 2026-06)
| Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext |
|---|---|---|---|---|
| GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, text-only |
| GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) |
- Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4 (Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na Toolathlon vede Kimi K3).
- GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
- GLM-5.3 = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen na flash — 5.3 je text-only (docs.z.ai).
Kimi K2.6 vs K2.7 Code — kdo na co
K2.7 Code je coding-focused fork K2.6 (rel. 12. 6. 2026) — stejná architektura (1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video vstup, což je u coding modelu neobvyklé.
| K2.6 | K2.7 Code | |
|---|---|---|
| Pozice | generalista | coding fork |
| Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % |
| Thinking tokeny | baseline | −~30 % |
| Non-thinking mode | ano | zrušen (thinking-on natvrdo) |
| Agent swarm 300 agentů / 4000 kroků | ano | necíleno |
- K2.6: 4000+ tool callů v jedné 12–13h session, 300 sub-agentů — stability strop generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty (remind/heartbeat/dream workflow v nanobotu).
- K2.7 Code: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
- K3: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno ollama.com/library) + extrémní verbozita, v agentním modu se zaseká. Nepoužívat.
Provozní fakta
- Ollama Cloud (endpoint
nvidia.hell): max 3 paralelní dotazy; žádný rychlý provider (Fireworks/Cerebras). - Prompt caching zapíná nanobot jen pro
openrouter,anthropic,bedrock— ollama a gemini presety žádné cache breakpointy. - Kontextová okna: nanobot má hardcoded default
context_window_tokens = 65 536; pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity. Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů. - Reasoning/thinking režim = pomalé + drahé na out tokeny (měřeno 2026-06 na glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output ~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
- Vendor vs produkce: ~37 % propad mezi lab benchmark skóre a reálným nasazením (Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index, Code Arena Elo.
Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3, glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage), huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code), platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.