Files
nanobot-runtime/results/2026-08-29_model-choice-agent-nanobot.md
2026-09-02 15:23:13 +02:00

100 lines
7.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Model pro běžný agentní provoz v nanobotu — deep research (2026-08-29)
Kandidáti: Kimi K3, Kimi K2.7 Code, GLM-5.3, GLM-5.3-Flash. Kontext: Ollama Cloud prepaid, kvóta 3 paralelní dotazy, workload z historie (remind-dominantní, note/keep/wiki, občas deep-research a kód).
## Shrnutí
**GLM-5.3-Flash (`glm-5.3-flash:cloud`) zůstává nejlepší volbou pro běžný nanobot agent.** Má Intelligence Index 57,5 (jen ~2,5 bodu pod oběma flagšipy), druhý nejrychlejší TTFT (410 ms), multimodální vstup, 1M kontext a — rozhodující pro prepaid okno — **Medium Usage tier**, zatímco GLM-5.3 a K2.7 jsou High a K3 Extra High. Kimi K3 sice intelektem těží s GLM-5.3 (60 vs 59,5), ale je na Ollama Cloud nejdražší tier, ~2× verboznější, ~20 % pomalejší a v nanobotu se mi dříve zasekával. GLM-5.3 dává smysl jen jako ruční preset pro těžké úlohy (je text-only).
## Zjištění
### 1. Inteligence / agentní benchmarky
| Model | AA Intelligence Index | LLM-Stats agents index | Tool use index |
|---|---|---|---|
| Kimi K3 | 59,7 [1] | 41,3 (#4) [2] | 36,9 (#1) [2] |
| GLM-5.3 | 59,5 [1] | 41,2 (#5) [2] | 35,4 (#2) [2] |
| GLM-5.3-Flash | 57,5 [1] | — | — |
| Kimi K2.7 Code | 43 [3] | — | — |
- K3 a GLM-5.3 jsou na II statisticky nerozlišitelné (60 vs 59,560). Head-to-head sdílených benchmarků: K3 vyhrává 5/9 (DeepSWE, FrontierSWE, Program Bench, Terminal-Bench 2.1, Toolathlon), GLM-5.3 4/9 (AutomationBench, HLE, PostTrainBench, SWE-Marathon) [2].
- GLM-5.3 má specificky silné long-horizon agentní skóre: Terminal-Bench 3.0 skok 4,6 → 28,3, SWE-Marathon 19,4 → 42,5 (vendor-run, nezávisle nereplikováno) [4].
- K2.7 Code je na II 43 výrazně pod ostatními — jeho síla je úzké kódování (MCPMark 81,1 > Opus 4.8 76,4), ne obecný agent [5].
### 2. Rychlost na Ollama Cloud (ollamatps, 24h avg, živé měření proti stejnému endpointu)
| Model | tok/s | TTFT | Reliability |
|---|---|---|---|
| GLM-5.3 | 134 | 699 ms | 100 % [6] |
| GLM-5.3-Flash | 131 | **410 ms** | 99 % [7] |
| Kimi K2.7 Code | 130 | 628 ms | 100 % [8] |
| Kimi K3 | 107 | 894 ms | 100 % [9] |
Flash má nejlepší TTFT; K3 je ~20 % pomalejší v propustnosti a ~2× pomalejší na start. Pro interaktivní smyčku (remind-cron, krátké tahy přes Telegram) je TTFT dominantní metrika.
### 3. Ekonomika prepaid okna — hlavní rozdílovač
Usage tier na Ollama Cloud [10][11][12][13]:
| Model | Usage tier | Verbozita (output tokenů na II eval) | $/II task (AA) |
|---|---|---|---|
| GLM-5.3-Flash | **Medium** | nižší | ~$0,09 [14] |
| GLM-5.3 | High | nižší | ~0,25× GLM-5.2 úrovně (odvozeno z ceny) |
| Kimi K2.7 Code | High | -30 % thinking tokenů vs K2.6 [5] | — |
| Kimi K3 | **Extra High** | **~130M (2× průměr 63M)** | **~$0,94** [15] |
- K3 pálí okno dvojnásobně: nejvyšší tier **a** ~2× verbozita. Na AA eval stál K3 $2 690 celkem vs Flash ~$0,09/task — řádově 10× rozdíl v nákladech na úlohu [14][15].
- Nezávislé API ceny potvrzují poměr: GLM-5.3 $1,40/$4,40 vs K3 $3/$15 per M tok; Flash na vlastním API $0,15/$0,50 list (proměrně ~9× levnější než GLM-5.3) [2][14].
- Komunitní měření High-tier modelu (GLM-5.2, Pro plán): ~53M tokenů / 5h okno — Extra High K3 to vyzírá násobně rychleji [16].
### 4. Reliability v agentním provozu
- **Kimi K3 v nanobotu**: vlastní provozní pozorování (2026-02) — v agentním modu se po několika minutách zasekl; knowledge base ho už tehdy vyřadila z defaultu. K3 navíc always-on exposed CoT; max effort u krátké úlohy spálil 13 000+ thinking tokenů [17].
- **GLM na Ollama**: komunitní zkušenost s GLM-5.2/5.3 řadou — stabilní, občasné dlouhé thinking s auto-stop (nutné ručně pokračovat; ~5× za měsíc) [16]. Thinking je u 5.3 řady vždy zapnutý, effort low/high/max; pro chat se doporučuje `clear_thinking` [4].
- **Flash caveat**: při defaultním OpenAI-kompatibilním requestu může většinu output tokenů spálit reasoning a viditelná odpověď být prázdná; pomohlo nastavení GLM-style thinking + větší output ceiling [14]. V nanobotu (`maxTokens: 16384`) by to neměl být problém, ale stojí za pozornost.
- Historie ukazuje jedno vyčerpání 200 iterací (deep-research, 2026-06-18) — verbozní modely toto riziko zvyšují.
### 5. Match na tvůj workload
- **Dominantně remind/note/keep + heartbeat + cron**: krátké tool-cally, Čeština, nízká latence důležitější než špičkový IQ → Flash (TTFT 410 ms, medium usage = okno vydrží).
- **Deep-research / wiki-compile**: dlouhé multi-step tahy, 30+ iterací, cross-checking → tady by GLM-5.3 přidal ~2,5 II bodu, ale za High tier a text-only. Stávající strategie „startuj na Flash, při zaseknutí restartuj na 5.3" je pořád rozumná.
- **Kódování**: K2.7 Code jen pro úzké coding session (II 43 je pro obecné agentování málo; 256K kontext).
- **Multimodalita**: Flash i K3 multimodální, GLM-5.3 čistě textový, K2.7 má vision (MoonViT) [5].
## Rozpory a nejistoty
- AA II pro GLM-5.3: 59,5 (ollamatps ref) vs 60 (explainx/officechai z AA evaluace 18. 8.) — v rámci šumu, obě ~rovno K3.
- GLM-5.3 vendor benchmarky (Terminal-Bench 3.0, CyberGym) nebyly nezávisle replikovány [4][17].
- Usage tier Multiplier mezi Medium/High/Extra High Ollama oficiálně nezveřejňuje — poměry odvozeny z komunitních měření a cen API, ne z primárního zdroje.
- `glm-5.3-flash:cloud` je na Ollama nový (tag 2 dny starý, ee13009634e3) — dlouhodobá reliability na našem endpointu neměřená.
## Verdikt
| Role | Model | Důvod |
|---|---|---|
| **Daily driver** | **GLM-5.3-Flash** | II 57,5 za Medium usage, nejlepší TTFT, multimodální, 1M ctx — nejlepší intelligence/cena/rychlost |
| Těžké úlohy (ručně) | GLM-5.3 | II 60, High tier — jen pro/deep-research, text-only |
| Kódování | Kimi K2.7 Code | MCPMark 81,1, High tier, II 43 jen pro coding |
| Nepoužívat | Kimi K3 | Extra High usage × 2× verbozita × pomalejší × zasekávání v nanobotu |
Potvrzuje se strategie z knowledge/models.md z června — aktualizovaná fakta ji jen upevňují (Flash nyní explicitně Medium tier, rychlosti a II potvrzeny živými daty).
## Zdroje
[1] Artificial Analysis — glm-5.3-flash / kimi-k3 / glm-5.3 — https://artificialanalysis.ai/models/glm-5-3-flash (a související model pages)
[2] LLM-Stats — GLM-5.3 vs Kimi K3 — https://llm-stats.com/models/compare/glm-5.3-vs-kimi-k3
[3] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ (II ref 43)
[4] Ollama library — glm-5.3 — https://ollama.com/library/glm-5.3
[5] Ollama library — kimi-k2.7-code:cloud — https://ollama.com/library/kimi-k2.7-code:cloud
[6] ollamatps — glm-5.3 — https://ollamatps.com/models/ollama/glm-5.3/
[7] ollamatps — glm-5.3-flash — https://ollamatps.com/models/ollama/glm-5.3-flash/
[8] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/
[9] ollamatps — kimi-k3 — https://ollamatps.com/models/ollama/kimi-k3/
[10] Ollama library — kimi-k3:cloud (Usage: extra high) — https://ollama.com/library/kimi-k3:cloud
[11] Ollama library — glm-5.3:cloud (Usage: high) — https://ollama.com/library/glm-5.3:cloud
[12] Ollama library — kimi-k2.7-code:cloud (Usage: high) — https://ollama.com/library/kimi-k2.7-code:cloud
[13] Ollama library — glm-5.3-flash:cloud (Usage: medium, tags page) — https://ollama.com/library/glm-5.3-flash/tags
[14] GLBGPT — GLM-5.3 Flash Review (ceny Z.AI, AA $0.09/task) — https://www.glbgpt.com/hub/glm-5-3-flash-review/
[15] markhuang.ai — Kimi K3 130M output tokens catch — https://markhuang.ai/news/kimi-k3-130-million-token-catch
[16] linux.do — Ollama Pro GLM-5.2 usage test (53M/5h, reliability) — https://linux.do/t/topic/2597086
[17] TechTimes — K3 reasoning modes, 13k thinking tokens — https://www.techtimes.com/articles/320937/20260718/kimi-k3-adds-standard-high-reasoning-modes-documentation-maps-three-effort-tiers.htm