Files
nanobot-runtime/knowledge/models.md
2026-06-10 06:39:52 +02:00

162 lines
7.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Modely — fakta a naměřené hodnoty
Co je o dostupných modelech ověřeno a změřeno. **Žádná doporučení** — rozhodnutí, co
použít, je na tobě. Mezi presety přepínáš v chatu příkazem `/model <preset>`.
---
## Nakonfigurované presety (`/model`)
Zdroj: `~/.nanobot/config.json``model_presets` (stav k 2026-06-07). Všechny mají
`maxTokens = 16384`, `temperature = 0.1`.
| Preset | Provider | Model id | Kontext | Vstup |
|---|---|---|---|---|
| `glm-5.1` *(default)* | ollama (cloud) | `glm-5.1:cloud` | 196 608 | **čistě textový** |
| `minimax-m3` | ollama (cloud) | `minimax-m3:cloud` | 1 048 576 | multimodální |
| `kimi-k2.6` | ollama (cloud) | `kimi-k2.6:cloud` | 262 144 | multimodální |
| `sonnet` | openrouter | `anthropic/claude-sonnet-4.6` | 256 000 | multimodální |
| `haiku` | openrouter | `anthropic/claude-haiku-4.5` | 200 000 | multimodální |
| `gemini-flash` | gemini | `gemini-3.5-flash` | 256 000 | multimodální |
| `gemini-flash-lite` | openrouter | `google/gemini-3.1-flash-lite` | 256 000 | multimodální |
Multimodalita GLM/M3/Kimi je z porovnání níž (GLM-5.1 nepřijímá obrázky/sken/video);
Claude a Gemini přijímají obrázky dle vendor dokumentace.
---
## Rychlost — přímé měření na Ollama Cloud (2026-06-07)
Měřeno proti Ollamě na `nvidia.hell` (stejný endpoint jako agent), streaming
`/api/chat`, identický prompt, 3 běhy/model. `:cloud` modely nevracejí sub-durations,
takže tok/s měřeno přes streaming (TTFT = čas 1. content chunku). **Tohle je to, co
reálně dostaneš** (na rozdíl od native-class čísel od Artificial Analysis níž).
| Model | TTFT (medián) | Total wall (medián) | Out tok | End-to-end průtok |
|---|---|---|---|---|
| `glm-5.1` | ~5,9 s | ~7,5 s | 12001730 | **~198 tok/s** |
| `minimax-m3` | ~6,8 s | ~10,8 s | 420460 | **~40 tok/s** |
`minimax-m3` je o cca **50 % pomalejší v celkové době, i přes 34× MÉNĚ vygenerovaných
tokenů**. TTFT mají srovnatelný (start není problém). Čistá generace m3 je ~95120 tok/s
(streamuje plynule), ale end-to-end průtok glm je ~5× vyšší. Pozn.: „1300 tok/s" u glm
z post-TTFT okna nebrat doslovně — cloud buffer flushne dávku, proto se měří `out/total`.
---
## Profil rychlosti a verbozity — Artificial Analysis (nezávislé)
Native-class profil (na optimální infře, ne na našem Ollama Cloud endpointu — reálnou
latenci viz měření výš). Wall-clock per turn ≈ vygenerované tokeny ÷ tok/s, takže
verbozita zdržuje stejně jako nízká propustnost.
| Model | Intelligence Index | Output speed | Verbozita (tok na II) | TTFT | AA verdikt |
|---|---|---|---|---|---|
| GLM-5.1 | 51 | ~62 t/s | nižší | ~1,6 s | faster than average |
| MiniMax M3 | 55 | ~40 t/s | 91M (průměr 29M) | ~2,32,5 s | notably slow + very verbose |
| Kimi K2.6 | 54 | ~44 t/s | 170M (průměr 43M) | ~2,23,0 s | notably slow + very verbose |
M3 i Kimi sdílejí slow+verbose profil; vyšší Intelligence Index se v interaktivní
smyčce může utopit v latenci.
---
## Schopnosti — kde se modely liší (GLM-5.1 vs M3 vs Kimi K2.6)
Některé rozdíly jsou capability cliff (GLM to neumí vůbec), jiné jen rozdíl míry.
**Capability cliffs (GLM-5.1 nemá):**
- **Multimodální vstup** (M3 i Kimi): obrázky, screenshoty, video, naskenované
dokumenty. GLM-5.1 je čistě textový.
- **Porozumění dokumentům** (M3): OmniDocBench 91,6 % — nejvyšší v porovnání, nad Opus
4.7 (89,3 %). *(vendor číslo)*
**Rozdíl míry (M3/Kimi měřitelně lepší):**
- **Tvrdé znalosti / expert reasoning** (Kimi): HLE 52,3 % vs GLM 34,7 %.
- **Kódování / agentní složitost** (Kimi): kódování ø 72 vs 60,9; agentní ø 73,1 vs
65,3. *(BenchLM, semi-nezávislý agregát)*
- **Dlouhý kontext v jednom průchodu**: M3 1M, Kimi 256K, GLM 200K.
- **Long-horizon agentní stabilita** (Kimi): 4000+ tool callů přes 13 h, swarm až 300
sub-agentů.
**Kde vede GLM-5.1:**
- **Code Arena Elo 1530** — nezávislý head-to-head signál developer-preference (3. na
světě v agentním web devu).
- Čistší MIT licence, levnější vstupní cena než Kimi.
---
## Caveaty k číslům
- **Vendor vs produkce:** Kili Technology zdokumentoval ~37% propad mezi lab benchmark
skóre a reálným nasazením. Benchmark měří schopnost, produkce spolehlivost.
- **Vendor benchmarky** (SWE-Bench, Terminal-Bench, OmniDocBench…) běží na vlastní infře
vendora s jeho scaffoldingem; nejsou napříč vendory přímo srovnatelné. Nejdůvěryhodnější
jsou nezávislé: AA Intelligence Index a Code Arena Elo.
- **Ollama Cloud:** předplatné povoluje max 3 paralelní dotazy. Žádný rychlý provider
(Fireworks/Cerebras/…) k dispozici, takže u ollama presetů platí native-class rychlost.
- **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock`. `ollama`
a `gemini` cache nedostávají — ollama presety (`glm-5.1`, `minimax-m3`, `kimi-k2.6`)
tedy žádné cache breakpointy.
---
## Kontextová okna
Nanobot má hardcoded default `context_window_tokens = 65 536`; pokud preset hodnotu
nepřepíše, jede model na 65k bez ohledu na to, co umí. Presety výš mají nastavené reálné
limity. U `:cloud` modelů hostí kontext Ollama cloud (nežere lokální RAM). Vyšší okno
znamená méně častou konsolidaci paměti, ale „lost in the middle" propad je výraznější u
slabších MoE modelů než u špičkových.
---
## Appendix: měření z MiniLoop (jiný kontext — NE agent presety)
Tahle čísla jsou ze samostatného `.NET` PoC parseru `/remind add` (text→JSON,
`src/MiniLoop/`), ne z agenta. Modely jako `mistral-small` nejsou nakonfigurované jako
presety — jsou tu jen jako naměřená fakta. Měřeno 2026-06-03, prompt-only parse, 17 párů.
**Ollama + OpenRouter, gate=3 na ollama (kvóta 3 paralelní dotazy):**
| Model | Provider | Úspěšnost | Wall median / avg | Tok in / out |
|---|---|---|---|---|
| glm-5.1 | ollama | 17/17 | 1690 / 1927 ms | 21118 / 2896 |
| deepseek-v4-flash | ollama | 17/17 | 4894 / 6118 ms | 21654 / 3487 |
| minimax-m2.7 | ollama | 17/17 | 4815 / 4604 ms | 21969 / 2317 |
| claude-haiku-4.5 | openrouter | 16/17* | 1064 / 1135 ms | 23668 / 691 |
| gpt-5.4-nano | openrouter | 17/17 | 3034 / 4003 ms | 20987 / 553 |
**Levné / OSS modely z OpenRouteru** (cena $/M tok in/out):
| Model | Cena | Úspěšnost | Wall median / avg | out tok |
|---|---|---|---|---|
| `mistralai/mistral-small-3.2-24b-instruct` | 0.075/0.20 | 17/17 | **934 / 1050 ms** | 610 |
| `google/gemma-3-27b-it` | 0.08/0.16 | 17/17 | 1413 / 1611 ms | 608 |
| `z-ai/glm-4-32b` | 0.10/0.10 | 16/17* | 1905 / 2072 ms | 519 |
| `qwen/qwen3-30b-a3b-instruct-2507` | 0.043/0.17 | 16/17* | 1991 / 1866 ms | 588 |
| `openai/gpt-oss-120b` | levný | 16/17 | 7238 / 12164 ms | 3769 |
**Malé ollama modely** (`:cloud`):
| Model | Úspěšnost | Wall median / avg | out tok |
|---|---|---|---|
| `ministral-3:8b-cloud` | 15/17 | 1043 / 1169 ms | 653 |
| `nemotron-3-nano:30b-cloud` | 16/17 | 2015 / 2277 ms | 7805 |
\* část „FAILů" jsou false negatives ve striktním porovnání (slovosled), ne chyby modelu.
Klíčová pozorování z MiniLoop: **reasoning/thinking režim = pomalé + drahé na out tokeny**
(deepseek/minimax/gpt-oss/nemotron-nano generují násobně víc tokenů → násobně delší wall);
přímé parsery (haiku, gpt-nano, mistral-small) jsou rychlé. Hrdlo souběhu na ollama je
kvóta 3 paralelních dotazů, ne výpočet.
---
*Zdroje: rychlostní/inteligenční čísla Artificial Analysis (nezávislé); capability čísla
mix nezávislých (BenchLM, AA) a vendor dat (označeno); přímá měření na `nvidia.hell`.
Stav k červnu 2026.*