runtime backup
This commit is contained in:
@@ -1,161 +1,114 @@
|
||||
# Modely — fakta a naměřené hodnoty
|
||||
# Modely — fakta a strategie
|
||||
|
||||
Co je o dostupných modelech ověřeno a změřeno. **Žádná doporučení** — rozhodnutí, co
|
||||
použít, je na tobě. Mezi presety přepínáš v chatu příkazem `/model <preset>`.
|
||||
Co je ověřeno o modelech, které používáš. Presety přepínáš v chatu `/model <preset>`;
|
||||
trvalá změna defaultu = `agents.defaults.modelPreset` v `~/.nanobot/config.json`.
|
||||
|
||||
---
|
||||
|
||||
## Nakonfigurované presety (`/model`)
|
||||
|
||||
Zdroj: `~/.nanobot/config.json` → `model_presets` (stav k 2026-06-07). Všechny mají
|
||||
`maxTokens = 16384`, `temperature = 0.1`.
|
||||
Zdroj: `~/.nanobot/config.json` → `model_presets`. Všechny mají `maxTokens = 16384`,
|
||||
`temperature = 0.1`, `provider = ollama`.
|
||||
|
||||
| Preset | Provider | Model id | Kontext | Vstup |
|
||||
|---|---|---|---|---|
|
||||
| `glm-5.1` *(default)* | ollama (cloud) | `glm-5.1:cloud` | 196 608 | **čistě textový** |
|
||||
| `minimax-m3` | ollama (cloud) | `minimax-m3:cloud` | 1 048 576 | multimodální |
|
||||
| `kimi-k2.6` | ollama (cloud) | `kimi-k2.6:cloud` | 262 144 | multimodální |
|
||||
| `sonnet` | openrouter | `anthropic/claude-sonnet-4.6` | 256 000 | multimodální |
|
||||
| `haiku` | openrouter | `anthropic/claude-haiku-4.5` | 200 000 | multimodální |
|
||||
| `gemini-flash` | gemini | `gemini-3.5-flash` | 256 000 | multimodální |
|
||||
| `gemini-flash-lite` | openrouter | `google/gemini-3.1-flash-lite` | 256 000 | multimodální |
|
||||
|
||||
Multimodalita GLM/M3/Kimi je z porovnání níž (GLM-5.1 nepřijímá obrázky/sken/video);
|
||||
Claude a Gemini přijímají obrázky dle vendor dokumentace.
|
||||
|
||||
---
|
||||
|
||||
## Rychlost — přímé měření na Ollama Cloud (2026-06-07)
|
||||
|
||||
Měřeno proti Ollamě na `nvidia.hell` (stejný endpoint jako agent), streaming
|
||||
`/api/chat`, identický prompt, 3 běhy/model. `:cloud` modely nevracejí sub-durations,
|
||||
takže tok/s měřeno přes streaming (TTFT = čas 1. content chunku). **Tohle je to, co
|
||||
reálně dostaneš** (na rozdíl od native-class čísel od Artificial Analysis níž).
|
||||
|
||||
| Model | TTFT (medián) | Total wall (medián) | Out tok | End-to-end průtok |
|
||||
|---|---|---|---|---|
|
||||
| `glm-5.1` | ~5,9 s | ~7,5 s | 1200–1730 | **~198 tok/s** |
|
||||
| `minimax-m3` | ~6,8 s | ~10,8 s | 420–460 | **~40 tok/s** |
|
||||
|
||||
`minimax-m3` je o cca **50 % pomalejší v celkové době, i přes 3–4× MÉNĚ vygenerovaných
|
||||
tokenů**. TTFT mají srovnatelný (start není problém). Čistá generace m3 je ~95–120 tok/s
|
||||
(streamuje plynule), ale end-to-end průtok glm je ~5× vyšší. Pozn.: „1300 tok/s" u glm
|
||||
z post-TTFT okna nebrat doslovně — cloud buffer flushne dávku, proto se měří `out/total`.
|
||||
|
||||
---
|
||||
|
||||
## Profil rychlosti a verbozity — Artificial Analysis (nezávislé)
|
||||
|
||||
Native-class profil (na optimální infře, ne na našem Ollama Cloud endpointu — reálnou
|
||||
latenci viz měření výš). Wall-clock per turn ≈ vygenerované tokeny ÷ tok/s, takže
|
||||
verbozita zdržuje stejně jako nízká propustnost.
|
||||
|
||||
| Model | Intelligence Index | Output speed | Verbozita (tok na II) | TTFT | AA verdikt |
|
||||
|---|---|---|---|---|---|
|
||||
| GLM-5.1 | 51 | ~62 t/s | nižší | ~1,6 s | faster than average |
|
||||
| MiniMax M3 | 55 | ~40 t/s | 91M (průměr 29M) | ~2,3–2,5 s | notably slow + very verbose |
|
||||
| Kimi K2.6 | 54 | ~44 t/s | 170M (průměr 43M) | ~2,2–3,0 s | notably slow + very verbose |
|
||||
|
||||
M3 i Kimi sdílejí slow+verbose profil; vyšší Intelligence Index se v interaktivní
|
||||
smyčce může utopit v latenci.
|
||||
|
||||
---
|
||||
|
||||
## Schopnosti — kde se modely liší (GLM-5.1 vs M3 vs Kimi K2.6)
|
||||
|
||||
Některé rozdíly jsou capability cliff (GLM to neumí vůbec), jiné jen rozdíl míry.
|
||||
|
||||
**Capability cliffs (GLM-5.1 nemá):**
|
||||
|
||||
- **Multimodální vstup** (M3 i Kimi): obrázky, screenshoty, video, naskenované
|
||||
dokumenty. GLM-5.1 je čistě textový.
|
||||
- **Porozumění dokumentům** (M3): OmniDocBench 91,6 % — nejvyšší v porovnání, nad Opus
|
||||
4.7 (89,3 %). *(vendor číslo)*
|
||||
|
||||
**Rozdíl míry (M3/Kimi měřitelně lepší):**
|
||||
|
||||
- **Tvrdé znalosti / expert reasoning** (Kimi): HLE 52,3 % vs GLM 34,7 %.
|
||||
- **Kódování / agentní složitost** (Kimi): kódování ø 72 vs 60,9; agentní ø 73,1 vs
|
||||
65,3. *(BenchLM, semi-nezávislý agregát)*
|
||||
- **Dlouhý kontext v jednom průchodu**: M3 1M, Kimi 256K, GLM 200K.
|
||||
- **Long-horizon agentní stabilita** (Kimi): 4000+ tool callů přes 13 h, swarm až 300
|
||||
sub-agentů.
|
||||
|
||||
**Kde vede GLM-5.1:**
|
||||
|
||||
- **Code Arena Elo 1530** — nezávislý head-to-head signál developer-preference (3. na
|
||||
světě v agentním web devu).
|
||||
- Čistší MIT licence, levnější vstupní cena než Kimi.
|
||||
|
||||
---
|
||||
|
||||
## Caveaty k číslům
|
||||
|
||||
- **Vendor vs produkce:** Kili Technology zdokumentoval ~37% propad mezi lab benchmark
|
||||
skóre a reálným nasazením. Benchmark měří schopnost, produkce spolehlivost.
|
||||
- **Vendor benchmarky** (SWE-Bench, Terminal-Bench, OmniDocBench…) běží na vlastní infře
|
||||
vendora s jeho scaffoldingem; nejsou napříč vendory přímo srovnatelné. Nejdůvěryhodnější
|
||||
jsou nezávislé: AA Intelligence Index a Code Arena Elo.
|
||||
- **Ollama Cloud:** předplatné povoluje max 3 paralelní dotazy. Žádný rychlý provider
|
||||
(Fireworks/Cerebras/…) k dispozici, takže u ollama presetů platí native-class rychlost.
|
||||
- **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock`. `ollama`
|
||||
a `gemini` cache nedostávají — ollama presety (`glm-5.1`, `minimax-m3`, `kimi-k2.6`)
|
||||
tedy žádné cache breakpointy.
|
||||
|
||||
---
|
||||
|
||||
## Kontextová okna
|
||||
|
||||
Nanobot má hardcoded default `context_window_tokens = 65 536`; pokud preset hodnotu
|
||||
nepřepíše, jede model na 65k bez ohledu na to, co umí. Presety výš mají nastavené reálné
|
||||
limity. U `:cloud` modelů hostí kontext Ollama cloud (nežere lokální RAM). Vyšší okno
|
||||
znamená méně častou konsolidaci paměti, ale „lost in the middle" propad je výraznější u
|
||||
slabších MoE modelů než u špičkových.
|
||||
|
||||
---
|
||||
|
||||
## Appendix: měření z MiniLoop (jiný kontext — NE agent presety)
|
||||
|
||||
Tahle čísla jsou ze samostatného `.NET` PoC parseru `/remind add` (text→JSON,
|
||||
`src/MiniLoop/`), ne z agenta. Modely jako `mistral-small` nejsou nakonfigurované jako
|
||||
presety — jsou tu jen jako naměřená fakta. Měřeno 2026-06-03, prompt-only parse, 17 párů.
|
||||
|
||||
**Ollama + OpenRouter, gate=3 na ollama (kvóta 3 paralelní dotazy):**
|
||||
|
||||
| Model | Provider | Úspěšnost | Wall median / avg | Tok in / out |
|
||||
|---|---|---|---|---|
|
||||
| glm-5.1 | ollama | 17/17 | 1690 / 1927 ms | 21118 / 2896 |
|
||||
| deepseek-v4-flash | ollama | 17/17 | 4894 / 6118 ms | 21654 / 3487 |
|
||||
| minimax-m2.7 | ollama | 17/17 | 4815 / 4604 ms | 21969 / 2317 |
|
||||
| claude-haiku-4.5 | openrouter | 16/17* | 1064 / 1135 ms | 23668 / 691 |
|
||||
| gpt-5.4-nano | openrouter | 17/17 | 3034 / 4003 ms | 20987 / 553 |
|
||||
|
||||
**Levné / OSS modely z OpenRouteru** (cena $/M tok in/out):
|
||||
|
||||
| Model | Cena | Úspěšnost | Wall median / avg | out tok |
|
||||
|---|---|---|---|---|
|
||||
| `mistralai/mistral-small-3.2-24b-instruct` | 0.075/0.20 | 17/17 | **934 / 1050 ms** | 610 |
|
||||
| `google/gemma-3-27b-it` | 0.08/0.16 | 17/17 | 1413 / 1611 ms | 608 |
|
||||
| `z-ai/glm-4-32b` | 0.10/0.10 | 16/17* | 1905 / 2072 ms | 519 |
|
||||
| `qwen/qwen3-30b-a3b-instruct-2507` | 0.043/0.17 | 16/17* | 1991 / 1866 ms | 588 |
|
||||
| `openai/gpt-oss-120b` | levný | 16/17 | 7238 / 12164 ms | 3769 |
|
||||
|
||||
**Malé ollama modely** (`:cloud`):
|
||||
|
||||
| Model | Úspěšnost | Wall median / avg | out tok |
|
||||
| Preset | Model id | Kontext | reasoningEffort |
|
||||
|---|---|---|---|
|
||||
| `ministral-3:8b-cloud` | 15/17 | 1043 / 1169 ms | 653 |
|
||||
| `nemotron-3-nano:30b-cloud` | 16/17 | 2015 / 2277 ms | 7805 |
|
||||
| `glm` *(default)* | `glm-5.3-flash:cloud` | 976 000 | high |
|
||||
| `glm53` | `glm-5.3:cloud` | 976 000 | high |
|
||||
| `glm52` *(legacy)* | `glm-5.2:cloud` | 976 000 | high |
|
||||
| `glmi51` *(legacy)* | `glm-5.1:cloud` | 196 608 | — |
|
||||
| `kimi` | `kimi-k2.6:cloud` | 262 144 | — |
|
||||
| `kimi27` | `kimi-k2.7-code:cloud` | 262 144 | — |
|
||||
| `kimi3` | `kimi-k3:cloud` | 1 020 000 | — |
|
||||
|
||||
\* část „FAILů" jsou false negatives ve striktním porovnání (slovosled), ne chyby modelu.
|
||||
|
||||
Klíčová pozorování z MiniLoop: **reasoning/thinking režim = pomalé + drahé na out tokeny**
|
||||
(deepseek/minimax/gpt-oss/nemotron-nano generují násobně víc tokenů → násobně delší wall);
|
||||
přímé parsery (haiku, gpt-nano, mistral-small) jsou rychlé. Hrdlo souběhu na ollama je
|
||||
kvóta 3 paralelních dotazů, ne výpočet.
|
||||
`glmi51` a `glm52` jsou legacní — jen pro regression srovnání, k práci nepoužívat.
|
||||
`kimi3` nepoužívat (viz níž), zvaž odstranění presetu z configu.
|
||||
|
||||
---
|
||||
|
||||
*Zdroje: rychlostní/inteligenční čísla Artificial Analysis (nezávislé); capability čísla
|
||||
mix nezávislých (BenchLM, AA) a vendor dat (označeno); přímá měření na `nvidia.hell`.
|
||||
Stav k červnu 2026.*
|
||||
## Strategie modelů (potvrzeno uživatelem, 2026-02)
|
||||
|
||||
| Role | Model |
|
||||
|---|---|
|
||||
| **Daily driver** | `glm` — glm-5.3-flash |
|
||||
| **Těžké úlohy** | `glm53` — glm-5.3 |
|
||||
| **Kódování** | `kimi27` — kimi-k2.7-code (fallback: `kimi`) |
|
||||
| **Běžné agentní práce na Kimi** | `kimi` — kimi-k2.6 |
|
||||
| **Nepoužívat** | `kimi3` — extra high usage, zasekávání v agentním modu (2026-02) |
|
||||
|
||||
### Kdy přepnout na glm53 („těžká úloha")
|
||||
|
||||
- Multi-step research / deep-research skill (30+ iterací, cross-checking, dlouhé syntézy).
|
||||
- Multi-file refactor (5+ souborů, velký kontext).
|
||||
- Dlouhý debug / root-cause analýza přes víc systémů.
|
||||
- Wiki-compile s velkými vstupy (drain tisíců řádků).
|
||||
- Prompt injection / security analýza.
|
||||
|
||||
Pravidlo: nejdřív `glm` (flash); když task „cuchne" (model ztrácí nit, opakuje tool
|
||||
call, potřebuje přes 100 iterací), restartuj na `glm53`.
|
||||
|
||||
### GLM-5.3 řada — srovnání (deep research, 2026-06)
|
||||
|
||||
| Model | AA Intelligence Index v4.1.1 | Ollama Cloud tok/s | TTFT | Kontext |
|
||||
|---|---|---|---|---|
|
||||
| GLM-5.3 | 60 | ~134 | ~0,7 s | 1M, **text-only** |
|
||||
| GLM-5.3-Flash | 57 | ~131 | ~0,4 s | 1M, multimodální, MIT (320B/18B MoE) |
|
||||
|
||||
- Flash: nejlepší poměr inteligence/cena/rychlost; Toolathlon Verified 78.4
|
||||
(Z.ai-reported, nejvyšší v jejich srovnávací sadě; nezávislé srovnání ale na
|
||||
Toolathlon vede Kimi K3).
|
||||
- GLM-5.3: stejné II jako Kimi K3, levnější, stabilnější — na těžší research.
|
||||
- **GLM-5.3** = post-training upgrade GLM-5.2 (stejný base model); GLM-5.3-Flash je
|
||||
první nativně multimodální GLM-5. Multimodální vstup (obrázky, screenshoty, video) jen
|
||||
na flash — 5.3 je text-only (docs.z.ai).
|
||||
|
||||
### Kimi K2.6 vs K2.7 Code — kdo na co
|
||||
|
||||
K2.7 Code je **coding-focused fork** K2.6 (rel. 12. 6. 2026) — stejná architektura
|
||||
(1T / 32B aktivní, 256K kontext, Modified MIT), liší se jen fine-tuningem. Moonshot ho
|
||||
pozicuje jako doplněk: pro obecnou práci zůstat na K2.6 (v Kimi Code se requesty s
|
||||
vypnutým thinkingem automaticky obsluhují K2.6). Přes MoonViT encoder umí i image/video
|
||||
vstup, což je u coding modelu neobvyklé.
|
||||
|
||||
| | K2.6 | K2.7 Code |
|
||||
|---|---|---|
|
||||
| Pozice | generalista | coding fork |
|
||||
| Agentní benchy (MCP Atlas, Claw 24/7) | baseline | +~10 % |
|
||||
| Thinking tokeny | baseline | −~30 % |
|
||||
| Non-thinking mode | ano | zrušen (thinking-on natvrdo) |
|
||||
| Agent swarm 300 agentů / 4000 kroků | ano | necíleno |
|
||||
|
||||
- **K2.6**: 4000+ tool callů v jedné 12–13h session, 300 sub-agentů — stability strop
|
||||
generace; model card ho explicitně pozicuje na persistentní 24/7 background agenty
|
||||
(remind/heartbeat/dream workflow v nanobotu).
|
||||
- **K2.7 Code**: jen kód, debugging, multi-file refactor, MCP-heavy smyčky. Mimo kód
|
||||
nevýhodný — vždy reasoning (pomalejší, dražší), neumí swarm orchestraci.
|
||||
- **K3**: AA II 60, multimodální (2.8T, KDA/AttnRes), 1M kontext — intelektuem
|
||||
srovnatelný s GLM-5.3, ale na Ollama Cloud „extra high usage" (potvrzeno
|
||||
ollama.com/library) + extrémní verbozita, v agentním modu se zaseká.
|
||||
Nepoužívat.
|
||||
|
||||
---
|
||||
|
||||
## Provozní fakta
|
||||
|
||||
- **Ollama Cloud** (endpoint `nvidia.hell`): max 3 paralelní dotazy; žádný rychlý
|
||||
provider (Fireworks/Cerebras).
|
||||
- **Prompt caching** zapíná nanobot jen pro `openrouter`, `anthropic`, `bedrock` —
|
||||
ollama a gemini presety žádné cache breakpointy.
|
||||
- **Kontextová okna**: nanobot má hardcoded default `context_window_tokens = 65 536`;
|
||||
pokud preset hodnotu nepřepíše, jede model na 65k. Presety výš mají reálné limity.
|
||||
Vyšší okno = méně častá konsolidace paměti, ale „lost in the middle" propad je
|
||||
výraznější u slabších MoE modelů.
|
||||
- **Reasoning/thinking režim = pomalé + drahé na out tokeny** (měřeno 2026-06 na
|
||||
glm-5.1/minimax: non-thinking modely ~198 tok/s end-to-end vs ~40; AA: K2.6 output
|
||||
~44 t/s, verbozita 170M toků/eval, 4× nad průměrem).
|
||||
- **Vendor vs produkce:** ~37 % propad mezi lab benchmark skóre a reálným nasazením
|
||||
(Kili Technology). Nejdůvěryhodnější nezávislé metriky: AA Intelligence Index,
|
||||
Code Arena Elo.
|
||||
|
||||
---
|
||||
|
||||
*Zdroje: artificialanalysis.ai (glm-5-3-flash — II v4.1.1 = 57), docs.z.ai (glm-5.3,
|
||||
glm-5.3-flash), ollama.com/library (glm-5.3-flash, kimi-k3 — extra high usage),
|
||||
huggingface.co (zai-org/GLM-5.3, moonshotai/Kimi-K3, Kimi-K2.7-Code),
|
||||
platform.kimi.ai (thinking models). Ověřeno proti internetu 2026-08-29.*
|
||||
|
||||
Reference in New Issue
Block a user