Files
nanobot-runtime/knowledge/models.md
2026-09-16 08:56:28 +02:00

115 lines
5.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Modely — fakta a strategie
Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu `/model <preset>`;
trvalá změna defaultu = `agents.defaults.modelPreset` v `~/.nanobot/config.json`.
---
## Nakonfigurované presety (`/model`)
Zdroj: `~/.nanobot/config.json``model_presets`. Všechny mají `maxTokens = 16384`
a `temperature = 0.1`. Default je `glm`, fallback `kimi`.
| Preset | Provider | Model id | Kontext | reasoningEffort |
|---|---|---|---|---|
| `glm` *(default)* | ollama | `glm-5.3:cloud` | 976 000 | high |
| `flash` | ollama | `glm-5.3-flash:cloud` | 976 000 | high |
| `glm52` *(legacy)* | ollama | `glm-5.2:cloud` | 976 000 | high |
| `glm51` *(legacy)* | ollama | `glm-5.1:cloud` | 196 608 | — |
| `kimi` | ollama | `kimi-k2.7-code:cloud` | 262 144 | — |
| `kimi26` | ollama | `kimi-k2.6:cloud` | 262 144 | — |
| `kimi3` | ollama | `kimi-k3:cloud` | 1 020 000 | — |
| `sonnet` | openrouter | `anthropic/claude-sonnet-4.6` | 256 000 | — |
| `haiku` | openrouter | `anthropic/claude-haiku-4.5` | 200 000 | — |
| `gemini-flash` | openrouter | `google/gemini-3.5-flash` | 256 000 | — |
| `gemini-flash-lite` | openrouter | `google/gemini-3.1-flash-lite` | 256 000 | — |
`glm51` a `glm52` jsou legacní — jen pro regression srovnání, k práci nepoužívat.
`kimi3` nepoužívat (viz níž), zvaž odstranění presetu z configu.
---
## Strategie modelů (potvrzeno uživatelem, 2026-09)
| Role | Model |
|---|---|
| **Daily driver + těžké úlohy** | `glm` — glm-5.3 |
| **Kódování** | `kimi` — kimi-k2.7-code |
| **Běžné agentní práce na Kimi** | `kimi26` — kimi-k2.6 |
| **Levnější/rychlejší + multimodální vstup** | `flash` — glm-5.3-flash |
| **Nepoužívat** | `kimi3` — extra high usage, zasekávání v agentním modu (2026-02) |
### Kdy sáhnout po `flash`
- **Multimodální vstup** — obrázek, screenshot, sken, video. `glm` (glm-5.3) je
**text-only**, flash je jediný GLM preset, co obrázky přijme (viz níž).
- Levné rutinní tahy, kde nejde o maximální kvalitu a záleží na rychlosti
(TTFT ~0,4 s vs ~0,7 s).
### GLM-5.3 řada — srovnání (deep research, 2026-06)
| Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext |
|---|---|---|---|---|
| GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, **text-only** |
| GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) |
- Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4
(Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na
Toolathlon vede Kimi K3).
- GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
- **GLM-5.3** = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je
první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen
na flash — 5.3 je text-only (docs.z.ai).
### Kimi K2.6 vs K2.7 Code — kdo na co
K2.7 Code je **coding-focused fork** K2.6 (rel. 12. 6. 2026) — stejná architektura
(1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho
pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s
vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video
vstup, což je u coding modelu neobvyklé.
| | K2.6 | K2.7 Code |
|---|---|---|
| Pozice | generalista | coding fork |
| Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % |
| Thinking tokeny | baseline | ~30 % |
| Non-thinking mode | ano | zrušen (thinking-on natvrdo) |
| Agent swarm 300 agentů / 4000 kroků | ano | necíleno |
- **K2.6**: 4000+ tool callů v jedné 1213h session, 300 sub-agentů — stability strop
generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty
(remind/heartbeat/dream workflow v nanobotu).
- **K2.7 Code**: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód
nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
- **K3**: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem
srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno
ollama.com/library) + extrémní verbozita, v agentním modu se zaseká.
Nepoužívat.
---
## Provozní fakta
- **Ollama Cloud** (endpoint `nvidia.hell`): max 3 paralelní dotazy; žádný rychlý
provider (Fireworks/Cerebras).
- **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock`
ollama a gemini presety žádné cache breakpointy.
- **Kontextová okna**: nanobot má hardcoded default `context_window_tokens = 65 536`;
pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity.
Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je
výraznější u slabších MoE modelů.
- **Reasoning/thinking režim = pomalé + drahé na out tokeny** (měřeno 2026-06 na
glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output
~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
- **Vendor vs produkce:** ~37 % propad mezi lab benchmark skóre a reálným nasazením
(Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index,
Code Arena Elo.
---
*Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3,
glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage),
huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code),
platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.*