115 lines
5.3 KiB
Markdown
115 lines
5.3 KiB
Markdown
# Modely — fakta a strategie
|
||
|
||
Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu `/model <preset>`;
|
||
trvalá změna defaultu = `agents.defaults.modelPreset` v `~/.nanobot/config.json`.
|
||
|
||
---
|
||
|
||
## Nakonfigurované presety (`/model`)
|
||
|
||
Zdroj: `~/.nanobot/config.json` → `model_presets`. Všechny mají `maxTokens = 16384`,
|
||
`temperature = 0.1`, `provider = ollama`.
|
||
|
||
| Preset | Model id | Kontext | reasoningEffort |
|
||
|---|---|---|---|
|
||
| `glm` *(default)* | `glm-5.3-flash:cloud` | 976 000 | high |
|
||
| `glm53` | `glm-5.3:cloud` | 976 000 | high |
|
||
| `glm52` *(legacy)* | `glm-5.2:cloud` | 976 000 | high |
|
||
| `glmi51` *(legacy)* | `glm-5.1:cloud` | 196 608 | — |
|
||
| `kimi` | `kimi-k2.6:cloud` | 262 144 | — |
|
||
| `kimi27` | `kimi-k2.7-code:cloud` | 262 144 | — |
|
||
| `kimi3` | `kimi-k3:cloud` | 1 020 000 | — |
|
||
|
||
`glmi51` a `glm52` jsou legacní — jen pro regression srovnání, k práci nepoužívat.
|
||
`kimi3` nepoužívat (viz níž), zvaž odstranění presetu z configu.
|
||
|
||
---
|
||
|
||
## Strategie modelů (potvrzeno uživatelem, 2026-02)
|
||
|
||
| Role | Model |
|
||
|---|---|
|
||
| **Daily driver** | `glm` — glm-5.3-flash |
|
||
| **Těžké úlohy** | `glm53` — glm-5.3 |
|
||
| **Kódování** | `kimi27` — kimi-k2.7-code (fallback: `kimi`) |
|
||
| **Běžné agentní práce na Kimi** | `kimi` — kimi-k2.6 |
|
||
| **Nepoužívat** | `kimi3` — extra high usage, zasekávání v agentním modu (2026-02) |
|
||
|
||
### Kdy přepnout na glm53 („těžká úloha")
|
||
|
||
- Multi-step research / deep-research skill (30+ iterací, cross-checking, dlouhé syntézy).
|
||
- Multi-file refactor (5+ souborů, velký kontext).
|
||
- Dlouhý debug / root-cause analýza přes víc systémů.
|
||
- Wiki-compile s velkými vstupy (drain tisíců řádků).
|
||
- Prompt injection / security analýza.
|
||
|
||
Pravidlo: nejdřív `glm` (flash); když task „cuchne" (model ztrácí nit, opakuje tool
|
||
call, potřebuje přes 100 iterací), restartuj na `glm53`.
|
||
|
||
### GLM-5.3 řada — srovnání (deep research, 2026-06)
|
||
|
||
| Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext |
|
||
|---|---|---|---|---|
|
||
| GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, **text-only** |
|
||
| GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) |
|
||
|
||
- Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4
|
||
(Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na
|
||
Toolathlon vede Kimi K3).
|
||
- GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
|
||
- **GLM-5.3** = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je
|
||
první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen
|
||
na flash — 5.3 je text-only (docs.z.ai).
|
||
|
||
### Kimi K2.6 vs K2.7 Code — kdo na co
|
||
|
||
K2.7 Code je **coding-focused fork** K2.6 (rel. 12. 6. 2026) — stejná architektura
|
||
(1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho
|
||
pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s
|
||
vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video
|
||
vstup, což je u coding modelu neobvyklé.
|
||
|
||
| | K2.6 | K2.7 Code |
|
||
|---|---|---|
|
||
| Pozice | generalista | coding fork |
|
||
| Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % |
|
||
| Thinking tokeny | baseline | −~30 % |
|
||
| Non-thinking mode | ano | zrušen (thinking-on natvrdo) |
|
||
| Agent swarm 300 agentů / 4000 kroků | ano | necíleno |
|
||
|
||
- **K2.6**: 4000+ tool callů v jedné 12–13h session, 300 sub-agentů — stability strop
|
||
generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty
|
||
(remind/heartbeat/dream workflow v nanobotu).
|
||
- **K2.7 Code**: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód
|
||
nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
|
||
- **K3**: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem
|
||
srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno
|
||
ollama.com/library) + extrémní verbozita, v agentním modu se zaseká.
|
||
Nepoužívat.
|
||
|
||
---
|
||
|
||
## Provozní fakta
|
||
|
||
- **Ollama Cloud** (endpoint `nvidia.hell`): max 3 paralelní dotazy; žádný rychlý
|
||
provider (Fireworks/Cerebras).
|
||
- **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock` —
|
||
ollama a gemini presety žádné cache breakpointy.
|
||
- **Kontextová okna**: nanobot má hardcoded default `context_window_tokens = 65 536`;
|
||
pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity.
|
||
Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je
|
||
výraznější u slabších MoE modelů.
|
||
- **Reasoning/thinking režim = pomalé + drahé na out tokeny** (měřeno 2026-06 na
|
||
glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output
|
||
~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
|
||
- **Vendor vs produkce:** ~37 % propad mezi lab benchmark skóre a reálným nasazením
|
||
(Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index,
|
||
Code Arena Elo.
|
||
|
||
---
|
||
|
||
*Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3,
|
||
glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage),
|
||
huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code),
|
||
platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.*
|