# Model pro běžný agentní provoz v nanobotu — deep research (2026-08-29) Kandidáti: Kimi K3, Kimi K2.7 Code, GLM-5.3, GLM-5.3-Flash. Kontext: Ollama Cloud prepaid, kvóta 3 paralelní dotazy, workload z historie (remind-dominantní, note/keep/wiki, občas deep-research a kód). ## Shrnutí **GLM-5.3-Flash (`glm-5.3-flash:cloud`) zůstává nejlepší volbou pro běžný nanobot agent.** Má Intelligence Index 57,5 (jen ~2,5 bodu pod oběma flagšipy), druhý nejrychlejší TTFT (410 ms), multimodální vstup, 1M kontext a — rozhodující pro prepaid okno — **Medium Usage tier**, zatímco GLM-5.3 a K2.7 jsou High a K3 Extra High. Kimi K3 sice intelektem těží s GLM-5.3 (60 vs 59,5), ale je na Ollama Cloud nejdražší tier, ~2× verboznější, ~20 % pomalejší a v nanobotu se mi dříve zasekával. GLM-5.3 dává smysl jen jako ruční preset pro těžké úlohy (je text-only). ## Zjištění ### 1. Inteligence / agentní benchmarky | Model | AA Intelligence Index | LLM-Stats agents index | Tool use index | |---|---|---|---| | Kimi K3 | 59,7 [1] | 41,3 (#4) [2] | 36,9 (#1) [2] | | GLM-5.3 | 59,5 [1] | 41,2 (#5) [2] | 35,4 (#2) [2] | | GLM-5.3-Flash | 57,5 [1] | — | — | | Kimi K2.7 Code | 43 [3] | — | — | - K3 a GLM-5.3 jsou na II statisticky nerozlišitelné (60 vs 59,5–60). Head-to-head sdílených benchmarků: K3 vyhrává 5/9 (DeepSWE, FrontierSWE, Program Bench, Terminal-Bench 2.1, Toolathlon), GLM-5.3 4/9 (AutomationBench, HLE, PostTrainBench, SWE-Marathon) [2]. - GLM-5.3 má specificky silné long-horizon agentní skóre: Terminal-Bench 3.0 skok 4,6 → 28,3, SWE-Marathon 19,4 → 42,5 (vendor-run, nezávisle nereplikováno) [4]. - K2.7 Code je na II 43 výrazně pod ostatními — jeho síla je úzké kódování (MCPMark 81,1 > Opus 4.8 76,4), ne obecný agent [5]. ### 2. Rychlost na Ollama Cloud (ollamatps, 24h avg, živé měření proti stejnému endpointu) | Model | tok/s | TTFT | Reliability | |---|---|---|---| | GLM-5.3 | 134 | 699 ms | 100 % [6] | | GLM-5.3-Flash | 131 | **410 ms** | 99 % [7] | | Kimi K2.7 Code | 130 | 628 ms | 100 % [8] | | Kimi K3 | 107 | 894 ms | 100 % [9] | Flash má nejlepší TTFT; K3 je ~20 % pomalejší v propustnosti a ~2× pomalejší na start. Pro interaktivní smyčku (remind-cron, krátké tahy přes Telegram) je TTFT dominantní metrika. ### 3. Ekonomika prepaid okna — hlavní rozdílovač Usage tier na Ollama Cloud [10][11][12][13]: | Model | Usage tier | Verbozita (output tokenů na II eval) | $/II task (AA) | |---|---|---|---| | GLM-5.3-Flash | **Medium** | nižší | ~$0,09 [14] | | GLM-5.3 | High | nižší | ~0,25× GLM-5.2 úrovně (odvozeno z ceny) | | Kimi K2.7 Code | High | -30 % thinking tokenů vs K2.6 [5] | — | | Kimi K3 | **Extra High** | **~130M (2× průměr 63M)** | **~$0,94** [15] | - K3 pálí okno dvojnásobně: nejvyšší tier **a** ~2× verbozita. Na AA eval stál K3 $2 690 celkem vs Flash ~$0,09/task — řádově 10× rozdíl v nákladech na úlohu [14][15]. - Nezávislé API ceny potvrzují poměr: GLM-5.3 $1,40/$4,40 vs K3 $3/$15 per M tok; Flash na vlastním API $0,15/$0,50 list (proměrně ~9× levnější než GLM-5.3) [2][14]. - Komunitní měření High-tier modelu (GLM-5.2, Pro plán): ~53M tokenů / 5h okno — Extra High K3 to vyzírá násobně rychleji [16]. ### 4. Reliability v agentním provozu - **Kimi K3 v nanobotu**: vlastní provozní pozorování (2026-02) — v agentním modu se po několika minutách zasekl; knowledge base ho už tehdy vyřadila z defaultu. K3 navíc always-on exposed CoT; max effort u krátké úlohy spálil 13 000+ thinking tokenů [17]. - **GLM na Ollama**: komunitní zkušenost s GLM-5.2/5.3 řadou — stabilní, občasné dlouhé thinking s auto-stop (nutné ručně pokračovat; ~5× za měsíc) [16]. Thinking je u 5.3 řady vždy zapnutý, effort low/high/max; pro chat se doporučuje `clear_thinking` [4]. - **Flash caveat**: při defaultním OpenAI-kompatibilním requestu může většinu output tokenů spálit reasoning a viditelná odpověď být prázdná; pomohlo nastavení GLM-style thinking + větší output ceiling [14]. V nanobotu (`maxTokens: 16384`) by to neměl být problém, ale stojí za pozornost. - Historie ukazuje jedno vyčerpání 200 iterací (deep-research, 2026-06-18) — verbozní modely toto riziko zvyšují. ### 5. Match na tvůj workload - **Dominantně remind/note/keep + heartbeat + cron**: krátké tool-cally, Čeština, nízká latence důležitější než špičkový IQ → Flash (TTFT 410 ms, medium usage = okno vydrží). - **Deep-research / wiki-compile**: dlouhé multi-step tahy, 30+ iterací, cross-checking → tady by GLM-5.3 přidal ~2,5 II bodu, ale za High tier a text-only. Stávající strategie „startuj na Flash, při zaseknutí restartuj na 5.3" je pořád rozumná. - **Kódování**: K2.7 Code jen pro úzké coding session (II 43 je pro obecné agentování málo; 256K kontext). - **Multimodalita**: Flash i K3 multimodální, GLM-5.3 čistě textový, K2.7 má vision (MoonViT) [5]. ## Rozpory a nejistoty - AA II pro GLM-5.3: 59,5 (ollamatps ref) vs 60 (explainx/officechai z AA evaluace 18. 8.) — v rámci šumu, obě ~rovno K3. - GLM-5.3 vendor benchmarky (Terminal-Bench 3.0, CyberGym) nebyly nezávisle replikovány [4][17]. - Usage tier Multiplier mezi Medium/High/Extra High Ollama oficiálně nezveřejňuje — poměry odvozeny z komunitních měření a cen API, ne z primárního zdroje. - `glm-5.3-flash:cloud` je na Ollama nový (tag 2 dny starý, ee13009634e3) — dlouhodobá reliability na našem endpointu neměřená. ## Verdikt | Role | Model | Důvod | |---|---|---| | **Daily driver** | **GLM-5.3-Flash** | II 57,5 za Medium usage, nejlepší TTFT, multimodální, 1M ctx — nejlepší intelligence/cena/rychlost | | Těžké úlohy (ručně) | GLM-5.3 | II 60, High tier — jen pro/deep-research, text-only | | Kódování | Kimi K2.7 Code | MCPMark 81,1, High tier, II 43 jen pro coding | | Nepoužívat | Kimi K3 | Extra High usage × 2× verbozita × pomalejší × zasekávání v nanobotu | Potvrzuje se strategie z knowledge/models.md z června — aktualizovaná fakta ji jen upevňují (Flash nyní explicitně Medium tier, rychlosti a II potvrzeny živými daty). ## Zdroje [1] Artificial Analysis — glm-5.3-flash / kimi-k3 / glm-5.3 — https://artificialanalysis.ai/models/glm-5-3-flash (a související model pages) [2] LLM-Stats — GLM-5.3 vs Kimi K3 — https://llm-stats.com/models/compare/glm-5.3-vs-kimi-k3 [3] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ (II ref 43) [4] Ollama library — glm-5.3 — https://ollama.com/library/glm-5.3 [5] Ollama library — kimi-k2.7-code:cloud — https://ollama.com/library/kimi-k2.7-code:cloud [6] ollamatps — glm-5.3 — https://ollamatps.com/models/ollama/glm-5.3/ [7] ollamatps — glm-5.3-flash — https://ollamatps.com/models/ollama/glm-5.3-flash/ [8] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ [9] ollamatps — kimi-k3 — https://ollamatps.com/models/ollama/kimi-k3/ [10] Ollama library — kimi-k3:cloud (Usage: extra high) — https://ollama.com/library/kimi-k3:cloud [11] Ollama library — glm-5.3:cloud (Usage: high) — https://ollama.com/library/glm-5.3:cloud [12] Ollama library — kimi-k2.7-code:cloud (Usage: high) — https://ollama.com/library/kimi-k2.7-code:cloud [13] Ollama library — glm-5.3-flash:cloud (Usage: medium, tags page) — https://ollama.com/library/glm-5.3-flash/tags [14] GLBGPT — GLM-5.3 Flash Review (ceny Z.AI, AA $0.09/task) — https://www.glbgpt.com/hub/glm-5-3-flash-review/ [15] markhuang.ai — Kimi K3 130M output tokens catch — https://markhuang.ai/news/kimi-k3-130-million-token-catch [16] linux.do — Ollama Pro GLM-5.2 usage test (53M/5h, reliability) — https://linux.do/t/topic/2597086 [17] TechTimes — K3 reasoning modes, 13k thinking tokens — https://www.techtimes.com/articles/320937/20260718/kimi-k3-adds-standard-high-reasoning-modes-documentation-maps-three-effort-tiers.htm