runtime backup

This commit is contained in:
lachtan
2026-09-02 15:23:13 +02:00
parent 442ddc3c24
commit 812c30ed1a
17 changed files with 2238 additions and 315 deletions

View File

@@ -0,0 +1,100 @@
# Model pro běžný agentní provoz v nanobotu — deep research (2026-08-29)
Kandidáti: Kimi K3, Kimi K2.7 Code, GLM-5.3, GLM-5.3-Flash. Kontext: Ollama Cloud prepaid, kvóta 3 paralelní dotazy, workload z historie (remind-dominantní, note/keep/wiki, občas deep-research a kód).
## Shrnutí
**GLM-5.3-Flash (`glm-5.3-flash:cloud`) zůstává nejlepší volbou pro běžný nanobot agent.** Má Intelligence Index 57,5 (jen ~2,5 bodu pod oběma flagšipy), druhý nejrychlejší TTFT (410 ms), multimodální vstup, 1M kontext a — rozhodující pro prepaid okno — **Medium Usage tier**, zatímco GLM-5.3 a K2.7 jsou High a K3 Extra High. Kimi K3 sice intelektem těží s GLM-5.3 (60 vs 59,5), ale je na Ollama Cloud nejdražší tier, ~2× verboznější, ~20 % pomalejší a v nanobotu se mi dříve zasekával. GLM-5.3 dává smysl jen jako ruční preset pro těžké úlohy (je text-only).
## Zjištění
### 1. Inteligence / agentní benchmarky
| Model | AA Intelligence Index | LLM-Stats agents index | Tool use index |
|---|---|---|---|
| Kimi K3 | 59,7 [1] | 41,3 (#4) [2] | 36,9 (#1) [2] |
| GLM-5.3 | 59,5 [1] | 41,2 (#5) [2] | 35,4 (#2) [2] |
| GLM-5.3-Flash | 57,5 [1] | — | — |
| Kimi K2.7 Code | 43 [3] | — | — |
- K3 a GLM-5.3 jsou na II statisticky nerozlišitelné (60 vs 59,560). Head-to-head sdílených benchmarků: K3 vyhrává 5/9 (DeepSWE, FrontierSWE, Program Bench, Terminal-Bench 2.1, Toolathlon), GLM-5.3 4/9 (AutomationBench, HLE, PostTrainBench, SWE-Marathon) [2].
- GLM-5.3 má specificky silné long-horizon agentní skóre: Terminal-Bench 3.0 skok 4,6 → 28,3, SWE-Marathon 19,4 → 42,5 (vendor-run, nezávisle nereplikováno) [4].
- K2.7 Code je na II 43 výrazně pod ostatními — jeho síla je úzké kódování (MCPMark 81,1 > Opus 4.8 76,4), ne obecný agent [5].
### 2. Rychlost na Ollama Cloud (ollamatps, 24h avg, živé měření proti stejnému endpointu)
| Model | tok/s | TTFT | Reliability |
|---|---|---|---|
| GLM-5.3 | 134 | 699 ms | 100 % [6] |
| GLM-5.3-Flash | 131 | **410 ms** | 99 % [7] |
| Kimi K2.7 Code | 130 | 628 ms | 100 % [8] |
| Kimi K3 | 107 | 894 ms | 100 % [9] |
Flash má nejlepší TTFT; K3 je ~20 % pomalejší v propustnosti a ~2× pomalejší na start. Pro interaktivní smyčku (remind-cron, krátké tahy přes Telegram) je TTFT dominantní metrika.
### 3. Ekonomika prepaid okna — hlavní rozdílovač
Usage tier na Ollama Cloud [10][11][12][13]:
| Model | Usage tier | Verbozita (output tokenů na II eval) | $/II task (AA) |
|---|---|---|---|
| GLM-5.3-Flash | **Medium** | nižší | ~$0,09 [14] |
| GLM-5.3 | High | nižší | ~0,25× GLM-5.2 úrovně (odvozeno z ceny) |
| Kimi K2.7 Code | High | -30 % thinking tokenů vs K2.6 [5] | — |
| Kimi K3 | **Extra High** | **~130M (2× průměr 63M)** | **~$0,94** [15] |
- K3 pálí okno dvojnásobně: nejvyšší tier **a** ~2× verbozita. Na AA eval stál K3 $2 690 celkem vs Flash ~$0,09/task — řádově 10× rozdíl v nákladech na úlohu [14][15].
- Nezávislé API ceny potvrzují poměr: GLM-5.3 $1,40/$4,40 vs K3 $3/$15 per M tok; Flash na vlastním API $0,15/$0,50 list (proměrně ~9× levnější než GLM-5.3) [2][14].
- Komunitní měření High-tier modelu (GLM-5.2, Pro plán): ~53M tokenů / 5h okno — Extra High K3 to vyzírá násobně rychleji [16].
### 4. Reliability v agentním provozu
- **Kimi K3 v nanobotu**: vlastní provozní pozorování (2026-02) — v agentním modu se po několika minutách zasekl; knowledge base ho už tehdy vyřadila z defaultu. K3 navíc always-on exposed CoT; max effort u krátké úlohy spálil 13 000+ thinking tokenů [17].
- **GLM na Ollama**: komunitní zkušenost s GLM-5.2/5.3 řadou — stabilní, občasné dlouhé thinking s auto-stop (nutné ručně pokračovat; ~5× za měsíc) [16]. Thinking je u 5.3 řady vždy zapnutý, effort low/high/max; pro chat se doporučuje `clear_thinking` [4].
- **Flash caveat**: při defaultním OpenAI-kompatibilním requestu může většinu output tokenů spálit reasoning a viditelná odpověď být prázdná; pomohlo nastavení GLM-style thinking + větší output ceiling [14]. V nanobotu (`maxTokens: 16384`) by to neměl být problém, ale stojí za pozornost.
- Historie ukazuje jedno vyčerpání 200 iterací (deep-research, 2026-06-18) — verbozní modely toto riziko zvyšují.
### 5. Match na tvůj workload
- **Dominantně remind/note/keep + heartbeat + cron**: krátké tool-cally, Čeština, nízká latence důležitější než špičkový IQ → Flash (TTFT 410 ms, medium usage = okno vydrží).
- **Deep-research / wiki-compile**: dlouhé multi-step tahy, 30+ iterací, cross-checking → tady by GLM-5.3 přidal ~2,5 II bodu, ale za High tier a text-only. Stávající strategie „startuj na Flash, při zaseknutí restartuj na 5.3" je pořád rozumná.
- **Kódování**: K2.7 Code jen pro úzké coding session (II 43 je pro obecné agentování málo; 256K kontext).
- **Multimodalita**: Flash i K3 multimodální, GLM-5.3 čistě textový, K2.7 má vision (MoonViT) [5].
## Rozpory a nejistoty
- AA II pro GLM-5.3: 59,5 (ollamatps ref) vs 60 (explainx/officechai z AA evaluace 18. 8.) — v rámci šumu, obě ~rovno K3.
- GLM-5.3 vendor benchmarky (Terminal-Bench 3.0, CyberGym) nebyly nezávisle replikovány [4][17].
- Usage tier Multiplier mezi Medium/High/Extra High Ollama oficiálně nezveřejňuje — poměry odvozeny z komunitních měření a cen API, ne z primárního zdroje.
- `glm-5.3-flash:cloud` je na Ollama nový (tag 2 dny starý, ee13009634e3) — dlouhodobá reliability na našem endpointu neměřená.
## Verdikt
| Role | Model | Důvod |
|---|---|---|
| **Daily driver** | **GLM-5.3-Flash** | II 57,5 za Medium usage, nejlepší TTFT, multimodální, 1M ctx — nejlepší intelligence/cena/rychlost |
| Těžké úlohy (ručně) | GLM-5.3 | II 60, High tier — jen pro/deep-research, text-only |
| Kódování | Kimi K2.7 Code | MCPMark 81,1, High tier, II 43 jen pro coding |
| Nepoužívat | Kimi K3 | Extra High usage × 2× verbozita × pomalejší × zasekávání v nanobotu |
Potvrzuje se strategie z knowledge/models.md z června — aktualizovaná fakta ji jen upevňují (Flash nyní explicitně Medium tier, rychlosti a II potvrzeny živými daty).
## Zdroje
[1] Artificial Analysis — glm-5.3-flash / kimi-k3 / glm-5.3 — https://artificialanalysis.ai/models/glm-5-3-flash (a související model pages)
[2] LLM-Stats — GLM-5.3 vs Kimi K3 — https://llm-stats.com/models/compare/glm-5.3-vs-kimi-k3
[3] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/ (II ref 43)
[4] Ollama library — glm-5.3 — https://ollama.com/library/glm-5.3
[5] Ollama library — kimi-k2.7-code:cloud — https://ollama.com/library/kimi-k2.7-code:cloud
[6] ollamatps — glm-5.3 — https://ollamatps.com/models/ollama/glm-5.3/
[7] ollamatps — glm-5.3-flash — https://ollamatps.com/models/ollama/glm-5.3-flash/
[8] ollamatps — kimi-k2.7-code — https://ollamatps.com/models/ollama/kimi-k2.7-code/
[9] ollamatps — kimi-k3 — https://ollamatps.com/models/ollama/kimi-k3/
[10] Ollama library — kimi-k3:cloud (Usage: extra high) — https://ollama.com/library/kimi-k3:cloud
[11] Ollama library — glm-5.3:cloud (Usage: high) — https://ollama.com/library/glm-5.3:cloud
[12] Ollama library — kimi-k2.7-code:cloud (Usage: high) — https://ollama.com/library/kimi-k2.7-code:cloud
[13] Ollama library — glm-5.3-flash:cloud (Usage: medium, tags page) — https://ollama.com/library/glm-5.3-flash/tags
[14] GLBGPT — GLM-5.3 Flash Review (ceny Z.AI, AA $0.09/task) — https://www.glbgpt.com/hub/glm-5-3-flash-review/
[15] markhuang.ai — Kimi K3 130M output tokens catch — https://markhuang.ai/news/kimi-k3-130-million-token-catch
[16] linux.do — Ollama Pro GLM-5.2 usage test (53M/5h, reliability) — https://linux.do/t/topic/2597086
[17] TechTimes — K3 reasoning modes, 13k thinking tokens — https://www.techtimes.com/articles/320937/20260718/kimi-k3-adds-standard-high-reasoning-modes-documentation-maps-three-effort-tiers.htm