# Modely — fakta a naměřené hodnoty Co je o dostupných modelech ověřeno a změřeno. **Žádná doporučení** — rozhodnutí, co použít, je na tobě. Mezi presety přepínáš v chatu příkazem `/model `. --- ## Nakonfigurované presety (`/model`) Zdroj: `~/.nanobot/config.json` → `model_presets` (stav k 2026-06-07). Všechny mají `maxTokens = 16384`, `temperature = 0.1`. | Preset | Provider | Model id | Kontext | Vstup | |---|---|---|---|---| | `glm-5.1` *(default)* | ollama (cloud) | `glm-5.1:cloud` | 196 608 | **čistě textový** | | `minimax-m3` | ollama (cloud) | `minimax-m3:cloud` | 1 048 576 | multimodální | | `kimi-k2.6` | ollama (cloud) | `kimi-k2.6:cloud` | 262 144 | multimodální | | `sonnet` | openrouter | `anthropic/claude-sonnet-4.6` | 256 000 | multimodální | | `haiku` | openrouter | `anthropic/claude-haiku-4.5` | 200 000 | multimodální | | `gemini-flash` | gemini | `gemini-3.5-flash` | 256 000 | multimodální | | `gemini-flash-lite` | openrouter | `google/gemini-3.1-flash-lite` | 256 000 | multimodální | Multimodalita GLM/M3/Kimi je z porovnání níž (GLM-5.1 nepřijímá obrázky/sken/video); Claude a Gemini přijímají obrázky dle vendor dokumentace. --- ## Rychlost — přímé měření na Ollama Cloud (2026-06-07) Měřeno proti Ollamě na `nvidia.hell` (stejný endpoint jako agent), streaming `/api/chat`, identický prompt, 3 běhy/model. `:cloud` modely nevracejí sub-durations, takže tok/s měřeno přes streaming (TTFT = čas 1. content chunku). **Tohle je to, co reálně dostaneš** (na rozdíl od native-class čísel od Artificial Analysis níž). | Model | TTFT (medián) | Total wall (medián) | Out tok | End-to-end průtok | |---|---|---|---|---| | `glm-5.1` | ~5,9 s | ~7,5 s | 1200–1730 | **~198 tok/s** | | `minimax-m3` | ~6,8 s | ~10,8 s | 420–460 | **~40 tok/s** | `minimax-m3` je o cca **50 % pomalejší v celkové době, i přes 3–4× MÉNĚ vygenerovaných tokenů**. TTFT mají srovnatelný (start není problém). Čistá generace m3 je ~95–120 tok/s (streamuje plynule), ale end-to-end průtok glm je ~5× vyšší. Pozn.: „1300 tok/s" u glm z post-TTFT okna nebrat doslovně — cloud buffer flushne dávku, proto se měří `out/total`. --- ## Profil rychlosti a verbozity — Artificial Analysis (nezávislé) Native-class profil (na optimální infře, ne na našem Ollama Cloud endpointu — reálnou latenci viz měření výš). Wall-clock per turn ≈ vygenerované tokeny ÷ tok/s, takže verbozita zdržuje stejně jako nízká propustnost. | Model | Intelligence Index | Output speed | Verbozita (tok na II) | TTFT | AA verdikt | |---|---|---|---|---|---| | GLM-5.1 | 51 | ~62 t/s | nižší | ~1,6 s | faster than average | | MiniMax M3 | 55 | ~40 t/s | 91M (průměr 29M) | ~2,3–2,5 s | notably slow + very verbose | | Kimi K2.6 | 54 | ~44 t/s | 170M (průměr 43M) | ~2,2–3,0 s | notably slow + very verbose | M3 i Kimi sdílejí slow+verbose profil; vyšší Intelligence Index se v interaktivní smyčce může utopit v latenci. --- ## Schopnosti — kde se modely liší (GLM-5.1 vs M3 vs Kimi K2.6) Některé rozdíly jsou capability cliff (GLM to neumí vůbec), jiné jen rozdíl míry. **Capability cliffs (GLM-5.1 nemá):** - **Multimodální vstup** (M3 i Kimi): obrázky, screenshoty, video, naskenované dokumenty. GLM-5.1 je čistě textový. - **Porozumění dokumentům** (M3): OmniDocBench 91,6 % — nejvyšší v porovnání, nad Opus 4.7 (89,3 %). *(vendor číslo)* **Rozdíl míry (M3/Kimi měřitelně lepší):** - **Tvrdé znalosti / expert reasoning** (Kimi): HLE 52,3 % vs GLM 34,7 %. - **Kódování / agentní složitost** (Kimi): kódování ø 72 vs 60,9; agentní ø 73,1 vs 65,3. *(BenchLM, semi-nezávislý agregát)* - **Dlouhý kontext v jednom průchodu**: M3 1M, Kimi 256K, GLM 200K. - **Long-horizon agentní stabilita** (Kimi): 4000+ tool callů přes 13 h, swarm až 300 sub-agentů. **Kde vede GLM-5.1:** - **Code Arena Elo 1530** — nezávislý head-to-head signál developer-preference (3. na světě v agentním web devu). - Čistší MIT licence, levnější vstupní cena než Kimi. --- ## Caveaty k číslům - **Vendor vs produkce:** Kili Technology zdokumentoval ~37% propad mezi lab benchmark skóre a reálným nasazením. Benchmark měří schopnost, produkce spolehlivost. - **Vendor benchmarky** (SWE-Bench, Terminal-Bench, OmniDocBench…) běží na vlastní infře vendora s jeho scaffoldingem; nejsou napříč vendory přímo srovnatelné. Nejdůvěryhodnější jsou nezávislé: AA Intelligence Index a Code Arena Elo. - **Ollama Cloud:** předplatné povoluje max 3 paralelní dotazy. Žádný rychlý provider (Fireworks/Cerebras/…) k dispozici, takže u ollama presetů platí native-class rychlost. - **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock`. `ollama` a `gemini` cache nedostávají — ollama presety (`glm-5.1`, `minimax-m3`, `kimi-k2.6`) tedy žádné cache breakpointy. --- ## Kontextová okna Nanobot má hardcoded default `context_window_tokens = 65 536`; pokud preset hodnotu nepřepíše, jede model na 65k bez ohledu na to, co umí. Presety výš mají nastavené reálné limity. U `:cloud` modelů hostí kontext Ollama cloud (nežere lokální RAM). Vyšší okno znamená méně častou konsolidaci paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů než u špičkových. --- ## Appendix: měření z MiniLoop (jiný kontext — NE agent presety) Tahle čísla jsou ze samostatného `.NET` PoC parseru `/remind add` (text→JSON, `src/MiniLoop/`), ne z agenta. Modely jako `mistral-small` nejsou nakonfigurované jako presety — jsou tu jen jako naměřená fakta. Měřeno 2026-06-03, prompt-only parse, 17 párů. **Ollama + OpenRouter, gate=3 na ollama (kvóta 3 paralelní dotazy):** | Model | Provider | Úspěšnost | Wall median / avg | Tok in / out | |---|---|---|---|---| | glm-5.1 | ollama | 17/17 | 1690 / 1927 ms | 21118 / 2896 | | deepseek-v4-flash | ollama | 17/17 | 4894 / 6118 ms | 21654 / 3487 | | minimax-m2.7 | ollama | 17/17 | 4815 / 4604 ms | 21969 / 2317 | | claude-haiku-4.5 | openrouter | 16/17* | 1064 / 1135 ms | 23668 / 691 | | gpt-5.4-nano | openrouter | 17/17 | 3034 / 4003 ms | 20987 / 553 | **Levné / OSS modely z OpenRouteru** (cena $/M tok in/out): | Model | Cena | Úspěšnost | Wall median / avg | out tok | |---|---|---|---|---| | `mistralai/mistral-small-3.2-24b-instruct` | 0.075/0.20 | 17/17 | **934 / 1050 ms** | 610 | | `google/gemma-3-27b-it` | 0.08/0.16 | 17/17 | 1413 / 1611 ms | 608 | | `z-ai/glm-4-32b` | 0.10/0.10 | 16/17* | 1905 / 2072 ms | 519 | | `qwen/qwen3-30b-a3b-instruct-2507` | 0.043/0.17 | 16/17* | 1991 / 1866 ms | 588 | | `openai/gpt-oss-120b` | levný | 16/17 | 7238 / 12164 ms | 3769 | **Malé ollama modely** (`:cloud`): | Model | Úspěšnost | Wall median / avg | out tok | |---|---|---|---| | `ministral-3:8b-cloud` | 15/17 | 1043 / 1169 ms | 653 | | `nemotron-3-nano:30b-cloud` | 16/17 | 2015 / 2277 ms | 7805 | \* část „FAILů" jsou false negatives ve striktním porovnání (slovosled), ne chyby modelu. Klíčová pozorování z MiniLoop: **reasoning/thinking režim = pomalé + drahé na out tokeny** (deepseek/minimax/gpt-oss/nemotron-nano generují násobně víc tokenů → násobně delší wall); přímé parsery (haiku, gpt-nano, mistral-small) jsou rychlé. Hrdlo souběhu na ollama je kvóta 3 paralelních dotazů, ne výpočet. --- *Zdroje: rychlostní/inteligenční čísla Artificial Analysis (nezávislé); capability čísla mix nezávislých (BenchLM, AA) a vendor dat (označeno); přímá měření na `nvidia.hell`. Stav k červnu 2026.*