Files
nanobot-runtime/knowledge/models.md
2026-06-10 06:39:52 +02:00

7.6 KiB
Raw Blame History

Modely — fakta a naměřené hodnoty

Co je o dostupných modelech ověřeno a změřeno. Žádná doporučení — rozhodnutí, co použít, je na tobě. Mezi presety přepínáš v chatu příkazem /model <preset>.


Nakonfigurované presety (/model)

Zdroj: ~/.nanobot/config.jsonmodel_presets (stav k 2026-06-07). Všechny mají maxTokens = 16384, temperature = 0.1.

Preset Provider Model id Kontext Vstup
glm-5.1 (default) ollama (cloud) glm-5.1:cloud 196 608 čistě textový
minimax-m3 ollama (cloud) minimax-m3:cloud 1 048 576 multimodální
kimi-k2.6 ollama (cloud) kimi-k2.6:cloud 262 144 multimodální
sonnet openrouter anthropic/claude-sonnet-4.6 256 000 multimodální
haiku openrouter anthropic/claude-haiku-4.5 200 000 multimodální
gemini-flash gemini gemini-3.5-flash 256 000 multimodální
gemini-flash-lite openrouter google/gemini-3.1-flash-lite 256 000 multimodální

Multimodalita GLM/M3/Kimi je z porovnání níž (GLM-5.1 nepřijímá obrázky/sken/video); Claude a Gemini přijímají obrázky dle vendor dokumentace.


Rychlost — přímé měření na Ollama Cloud (2026-06-07)

Měřeno proti Ollamě na nvidia.hell (stejný endpoint jako agent), streaming /api/chat, identický prompt, 3 běhy/model. :cloud modely nevracejí sub-durations, takže tok/s měřeno přes streaming (TTFT = čas 1. content chunku). Tohle je to, co reálně dostaneš (na rozdíl od native-class čísel od Artificial Analysis níž).

Model TTFT (medián) Total wall (medián) Out tok End-to-end průtok
glm-5.1 ~5,9 s ~7,5 s 12001730 ~198 tok/s
minimax-m3 ~6,8 s ~10,8 s 420460 ~40 tok/s

minimax-m3 je o cca 50 % pomalejší v celkové době, i přes 34× MÉNĚ vygenerovaných tokenů. TTFT mají srovnatelný (start není problém). Čistá generace m3 je ~95120 tok/s (streamuje plynule), ale end-to-end průtok glm je ~5× vyšší. Pozn.: „1300 tok/s" u glm z post-TTFT okna nebrat doslovně — cloud buffer flushne dávku, proto se měří out/total.


Profil rychlosti a verbozity — Artificial Analysis (nezávislé)

Native-class profil (na optimální infře, ne na našem Ollama Cloud endpointu — reálnou latenci viz měření výš). Wall-clock per turn ≈ vygenerované tokeny ÷ tok/s, takže verbozita zdržuje stejně jako nízká propustnost.

Model Intelligence Index Output speed Verbozita (tok na II) TTFT AA verdikt
GLM-5.1 51 ~62 t/s nižší ~1,6 s faster than average
MiniMax M3 55 ~40 t/s 91M (průměr 29M) ~2,32,5 s notably slow + very verbose
Kimi K2.6 54 ~44 t/s 170M (průměr 43M) ~2,23,0 s notably slow + very verbose

M3 i Kimi sdílejí slow+verbose profil; vyšší Intelligence Index se v interaktivní smyčce může utopit v latenci.


Schopnosti — kde se modely liší (GLM-5.1 vs M3 vs Kimi K2.6)

Některé rozdíly jsou capability cliff (GLM to neumí vůbec), jiné jen rozdíl míry.

Capability cliffs (GLM-5.1 nemá):

  • Multimodální vstup (M3 i Kimi): obrázky, screenshoty, video, naskenované dokumenty. GLM-5.1 je čistě textový.
  • Porozumění dokumentům (M3): OmniDocBench 91,6 % — nejvyšší v porovnání, nad Opus 4.7 (89,3 %). (vendor číslo)

Rozdíl míry (M3/Kimi měřitelně lepší):

  • Tvrdé znalosti / expert reasoning (Kimi): HLE 52,3 % vs GLM 34,7 %.
  • Kódování / agentní složitost (Kimi): kódování ø 72 vs 60,9; agentní ø 73,1 vs 65,3. (BenchLM, semi-nezávislý agregát)
  • Dlouhý kontext v jednom průchodu: M3 1M, Kimi 256K, GLM 200K.
  • Long-horizon agentní stabilita (Kimi): 4000+ tool callů přes 13 h, swarm až 300 sub-agentů.

Kde vede GLM-5.1:

  • Code Arena Elo 1530 — nezávislý head-to-head signál developer-preference (3. na světě v agentním web devu).
  • Čistší MIT licence, levnější vstupní cena než Kimi.

Caveaty k číslům

  • Vendor vs produkce: Kili Technology zdokumentoval ~37% propad mezi lab benchmark skóre a reálným nasazením. Benchmark měří schopnost, produkce spolehlivost.
  • Vendor benchmarky (SWE-Bench, Terminal-Bench, OmniDocBench…) běží na vlastní infře vendora s jeho scaffoldingem; nejsou napříč vendory přímo srovnatelné. Nejdůvěryhodnější jsou nezávislé: AA Intelligence Index a Code Arena Elo.
  • Ollama Cloud: předplatné povoluje max 3 paralelní dotazy. Žádný rychlý provider (Fireworks/Cerebras/…) k dispozici, takže u ollama presetů platí native-class rychlost.
  • Prompt caching zapíná nanobot jen pro openrouter, anthropic, bedrock. ollama a gemini cache nedostávají — ollama presety (glm-5.1, minimax-m3, kimi-k2.6) tedy žádné cache breakpointy.

Kontextová okna

Nanobot má hardcoded default context_window_tokens = 65 536; pokud preset hodnotu nepřepíše, jede model na 65k bez ohledu na to, co umí. Presety výš mají nastavené reálné limity. U :cloud modelů hostí kontext Ollama cloud (nežere lokální RAM). Vyšší okno znamená méně častou konsolidaci paměti, ale „lost in the middle" propad je výraznější u slabších MoE modelů než u špičkových.


Appendix: měření z MiniLoop (jiný kontext — NE agent presety)

Tahle čísla jsou ze samostatného .NET PoC parseru /remind add (text→JSON, src/MiniLoop/), ne z agenta. Modely jako mistral-small nejsou nakonfigurované jako presety — jsou tu jen jako naměřená fakta. Měřeno 2026-06-03, prompt-only parse, 17 párů.

Ollama + OpenRouter, gate=3 na ollama (kvóta 3 paralelní dotazy):

Model Provider Úspěšnost Wall median / avg Tok in / out
glm-5.1 ollama 17/17 1690 / 1927 ms 21118 / 2896
deepseek-v4-flash ollama 17/17 4894 / 6118 ms 21654 / 3487
minimax-m2.7 ollama 17/17 4815 / 4604 ms 21969 / 2317
claude-haiku-4.5 openrouter 16/17* 1064 / 1135 ms 23668 / 691
gpt-5.4-nano openrouter 17/17 3034 / 4003 ms 20987 / 553

Levné / OSS modely z OpenRouteru (cena $/M tok in/out):

Model Cena Úspěšnost Wall median / avg out tok
mistralai/mistral-small-3.2-24b-instruct 0.075/0.20 17/17 934 / 1050 ms 610
google/gemma-3-27b-it 0.08/0.16 17/17 1413 / 1611 ms 608
z-ai/glm-4-32b 0.10/0.10 16/17* 1905 / 2072 ms 519
qwen/qwen3-30b-a3b-instruct-2507 0.043/0.17 16/17* 1991 / 1866 ms 588
openai/gpt-oss-120b levný 16/17 7238 / 12164 ms 3769

Malé ollama modely (:cloud):

Model Úspěšnost Wall median / avg out tok
ministral-3:8b-cloud 15/17 1043 / 1169 ms 653
nemotron-3-nano:30b-cloud 16/17 2015 / 2277 ms 7805

* část „FAILů" jsou false negatives ve striktním porovnání (slovosled), ne chyby modelu.

Klíčová pozorování z MiniLoop: reasoning/thinking režim = pomalé + drahé na out tokeny (deepseek/minimax/gpt-oss/nemotron-nano generují násobně víc tokenů → násobně delší wall); přímé parsery (haiku, gpt-nano, mistral-small) jsou rychlé. Hrdlo souběhu na ollama je kvóta 3 paralelních dotazů, ne výpočet.


Zdroje: rychlostní/inteligenční čísla Artificial Analysis (nezávislé); capability čísla mix nezávislých (BenchLM, AA) a vendor dat (označeno); přímá měření na nvidia.hell. Stav k červnu 2026.