Files
nanobot-runtime/results/2026-08-29_model-choice-agent-nanobot.md
2026-09-02 15:23:13 +02:00

7.9 KiB
Raw Blame History

Model pro běžný agentní provoz v nanobotu — deep research (2026-08-29)

Kandidáti: Kimi K3, Kimi K2.7 Code, GLM-5.3, GLM-5.3-Flash. Kontext: Ollama Cloud prepaid, kvóta 3 paralelní dotazy, workload z historie (remind-dominantní, note/keep/wiki, občas deep-research a kód).

Shrnutí

GLM-5.3-Flash (glm-5.3-flash:cloud) zůstává nejlepší volbou pro běžný nanobot agent. Má Intelligence Index 57,5 (jen ~2,5 bodu pod oběma flagšipy), druhý nejrychlejší TTFT (410 ms), multimodální vstup, 1M kontext a — rozhodující pro prepaid okno — Medium Usage tier, zatímco GLM-5.3 a K2.7 jsou High a K3 Extra High. Kimi K3 sice intelektem těží s GLM-5.3 (60 vs 59,5), ale je na Ollama Cloud nejdražší tier, ~2× verboznější, ~20 % pomalejší a v nanobotu se mi dříve zasekával. GLM-5.3 dává smysl jen jako ruční preset pro těžké úlohy (je text-only).

Zjištění

1. Inteligence / agentní benchmarky

Model AA Intelligence Index LLM-Stats agents index Tool use index
Kimi K3 59,7 [1] 41,3 (#4) [2] 36,9 (#1) [2]
GLM-5.3 59,5 [1] 41,2 (#5) [2] 35,4 (#2) [2]
GLM-5.3-Flash 57,5 [1]
Kimi K2.7 Code 43 [3]
  • K3 a GLM-5.3 jsou na II statisticky nerozlišitelné (60 vs 59,560). Head-to-head sdílených benchmarků: K3 vyhrává 5/9 (DeepSWE, FrontierSWE, Program Bench, Terminal-Bench 2.1, Toolathlon), GLM-5.3 4/9 (AutomationBench, HLE, PostTrainBench, SWE-Marathon) [2].
  • GLM-5.3 má specificky silné long-horizon agentní skóre: Terminal-Bench 3.0 skok 4,6 → 28,3, SWE-Marathon 19,4 → 42,5 (vendor-run, nezávisle nereplikováno) [4].
  • K2.7 Code je na II 43 výrazně pod ostatními — jeho síla je úzké kódování (MCPMark 81,1 > Opus 4.8 76,4), ne obecný agent [5].

2. Rychlost na Ollama Cloud (ollamatps, 24h avg, živé měření proti stejnému endpointu)

Model tok/s TTFT Reliability
GLM-5.3 134 699 ms 100 % [6]
GLM-5.3-Flash 131 410 ms 99 % [7]
Kimi K2.7 Code 130 628 ms 100 % [8]
Kimi K3 107 894 ms 100 % [9]

Flash má nejlepší TTFT; K3 je ~20 % pomalejší v propustnosti a ~2× pomalejší na start. Pro interaktivní smyčku (remind-cron, krátké tahy přes Telegram) je TTFT dominantní metrika.

3. Ekonomika prepaid okna — hlavní rozdílovač

Usage tier na Ollama Cloud [10][11][12][13]:

Model Usage tier Verbozita (output tokenů na II eval) $/II task (AA)
GLM-5.3-Flash Medium nižší ~$0,09 [14]
GLM-5.3 High nižší ~0,25× GLM-5.2 úrovně (odvozeno z ceny)
Kimi K2.7 Code High -30 % thinking tokenů vs K2.6 [5]
Kimi K3 Extra High ~130M (2× průměr 63M) ~$0,94 [15]
  • K3 pálí okno dvojnásobně: nejvyšší tier a ~2× verbozita. Na AA eval stál K3 $2 690 celkem vs Flash ~$0,09/task — řádově 10× rozdíl v nákladech na úlohu [14][15].
  • Nezávislé API ceny potvrzují poměr: GLM-5.3 $1,40/$4,40 vs K3 $3/$15 per M tok; Flash na vlastním API $0,15/$0,50 list (proměrně ~9× levnější než GLM-5.3) [2][14].
  • Komunitní měření High-tier modelu (GLM-5.2, Pro plán): ~53M tokenů / 5h okno — Extra High K3 to vyzírá násobně rychleji [16].

4. Reliability v agentním provozu

  • Kimi K3 v nanobotu: vlastní provozní pozorování (2026-02) — v agentním modu se po několika minutách zasekl; knowledge base ho už tehdy vyřadila z defaultu. K3 navíc always-on exposed CoT; max effort u krátké úlohy spálil 13 000+ thinking tokenů [17].
  • GLM na Ollama: komunitní zkušenost s GLM-5.2/5.3 řadou — stabilní, občasné dlouhé thinking s auto-stop (nutné ručně pokračovat; ~5× za měsíc) [16]. Thinking je u 5.3 řady vždy zapnutý, effort low/high/max; pro chat se doporučuje clear_thinking [4].
  • Flash caveat: při defaultním OpenAI-kompatibilním requestu může většinu output tokenů spálit reasoning a viditelná odpověď být prázdná; pomohlo nastavení GLM-style thinking + větší output ceiling [14]. V nanobotu (maxTokens: 16384) by to neměl být problém, ale stojí za pozornost.
  • Historie ukazuje jedno vyčerpání 200 iterací (deep-research, 2026-06-18) — verbozní modely toto riziko zvyšují.

5. Match na tvůj workload

  • Dominantně remind/note/keep + heartbeat + cron: krátké tool-cally, Čeština, nízká latence důležitější než špičkový IQ → Flash (TTFT 410 ms, medium usage = okno vydrží).
  • Deep-research / wiki-compile: dlouhé multi-step tahy, 30+ iterací, cross-checking → tady by GLM-5.3 přidal ~2,5 II bodu, ale za High tier a text-only. Stávající strategie „startuj na Flash, při zaseknutí restartuj na 5.3" je pořád rozumná.
  • Kódování: K2.7 Code jen pro úzké coding session (II 43 je pro obecné agentování málo; 256K kontext).
  • Multimodalita: Flash i K3 multimodální, GLM-5.3 čistě textový, K2.7 má vision (MoonViT) [5].

Rozpory a nejistoty

  • AA II pro GLM-5.3: 59,5 (ollamatps ref) vs 60 (explainx/officechai z AA evaluace 18. 8.) — v rámci šumu, obě ~rovno K3.
  • GLM-5.3 vendor benchmarky (Terminal-Bench 3.0, CyberGym) nebyly nezávisle replikovány [4][17].
  • Usage tier Multiplier mezi Medium/High/Extra High Ollama oficiálně nezveřejňuje — poměry odvozeny z komunitních měření a cen API, ne z primárního zdroje.
  • glm-5.3-flash:cloud je na Ollama nový (tag 2 dny starý, ee13009634e3) — dlouhodobá reliability na našem endpointu neměřená.

Verdikt

Role Model Důvod
Daily driver GLM-5.3-Flash II 57,5 za Medium usage, nejlepší TTFT, multimodální, 1M ctx — nejlepší intelligence/cena/rychlost
Těžké úlohy (ručně) GLM-5.3 II 60, High tier — jen pro/deep-research, text-only
Kódování Kimi K2.7 Code MCPMark 81,1, High tier, II 43 jen pro coding
Nepoužívat Kimi K3 Extra High usage × 2× verbozita × pomalejší × zasekávání v nanobotu

Potvrzuje se strategie z knowledge/models.md z června — aktualizovaná fakta ji jen upevňují (Flash nyní explicitně Medium tier, rychlosti a II potvrzeny živými daty).

Zdroje

[1] Artificial Analysis — glm-5.3-flash / kimi-k3 / glm-5.3 — https://artificialanalysis.ai/models/glm-5-3-flash (a související model pages) [2] LLM-Stats — GLM-5.3 vs Kimi K3 — https://llm-stats.com/models/compare/glm-5.3-vs-kimi-k3 [3] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ (II ref 43) [4] Ollama library — glm-5.3 — https://ollama.com/library/glm-5.3 [5] Ollama library — kimi-k2.7-code:cloud — https://ollama.com/library/kimi-k2.7-code:cloud [6] ollamatps — glm-5.3 — https://ollamatps.com/models/ollama/glm-5.3/ [7] ollamatps — glm-5.3-flash — https://ollamatps.com/models/ollama/glm-5.3-flash/ [8] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ [9] ollamatps — kimi-k3 — https://ollamatps.com/models/ollama/kimi-k3/ [10] Ollama library — kimi-k3:cloud (Usage: extra high) — https://ollama.com/library/kimi-k3:cloud [11] Ollama library — glm-5.3:cloud (Usage: high) — https://ollama.com/library/glm-5.3:cloud [12] Ollama library — kimi-k2.7-code:cloud (Usage: high) — https://ollama.com/library/kimi-k2.7-code:cloud [13] Ollama library — glm-5.3-flash:cloud (Usage: medium, tags page) — https://ollama.com/library/glm-5.3-flash/tags [14] GLBGPT — GLM-5.3 Flash Review (ceny Z.AI, AA $0.09/task) — https://www.glbgpt.com/hub/glm-5-3-flash-review/ [15] markhuang.ai — Kimi K3 130M output tokens catch — https://markhuang.ai/news/kimi-k3-130-million-token-catch [16] linux.do — Ollama Pro GLM-5.2 usage test (53M/5h, reliability) — https://linux.do/t/topic/2597086 [17] TechTimes — K3 reasoning modes, 13k thinking tokens — https://www.techtimes.com/articles/320937/20260718/kimi-k3-adds-standard-high-reasoning-modes-documentation-maps-three-effort-tiers.htm