Files
nanobot-runtime/results/2026-06-07_ollama-cloud-model-report.md
2026-06-10 06:39:52 +02:00

7.4 KiB
Raw Permalink Blame History

Přehled modelů Ollama Cloud (červen 2026)

Datum: 20260607

Tento report shrnuje všechny modely dostupné na stránce Ollama Cloud (https://ollama.com/models?c=cloud) a hodnotí je podle 12 kritérií relevantních pro nasazení nanobotagenta. Hodnocení vychází z interního knowledge/models.md, detailní srovnávací tabulky v results/2026-06-07_ollama-cloud-agent-model-comparison.md a veřejně dostupných benchmarků (SWEBench, TerminalBench, Code Arena, MCPAtlas, HLE atd.).


1. Tabulka přehledu

Model Rychlost (tok/s) Inteligence (benchmark) Toolcalling Čeština / Multilingual Kontext Multimodální Licence Verbosita Známé bugy / blokátory Cena (OpenRouter proxy) Longhorizon stabilita Selfhost možnost
glm-5.1:cloud ~198 (přímé měření) SWEBench Pro 58.4% Code Arena Elo1530 99.6% schema adherence, žádné známé selhání Žádná oficiální podpora češtiny, ale žádný drift 200K (198K Ollama) (textonly) MIT Nízká ~$4/M output (Ollama Pro flatrate $20/mo) Ověřeno stovkami kol nejlepší Ano (vyžaduje ~30GB VRAM)
deepseek-v4-flash:cloud ~3050* (odhad) SWEBench ~75% (odhad) Dobrá Žádná explicitní podpora češtiny, ale silná multilingvní skóre (MMMLU90.3) 1M MIT Střední $0.14/M in Neověřeno (uživatelské benchmarky) Ano (efektivní MoE, 13B aktivních)
qwen3.5:397b-cloud ~1020* (odhad) SWEBench 6670% Dobrá 201 jazyk včetně češtiny (oficiální) 1M Apache2.0 Střední Uživatelé hlásí pomalost a přesnostní problémy (žádná proxy cena, Ollama Pro) Neověřeno Ano (Apache2.0, vyžaduje velké GPU)
deepseek-v4-pro:cloud ~15.4 (přímé měření) SWEBench 80.6% (nejvyšší) Dobrá Žádná explicitní podpora češtiny 1M MIT Střední Extrémní latence (57s TTFT), vysoká variabilita $1.74/M in Neznámo Ano (MIT)
devstral-2:123b-cloud ~4060* (odhad) SWEBench 72.2% TerminalBench 77.3% (nejvyšší) Dobrá Žádná explicitní podpora češtiny 128K Apache2.0 Střední Neověřeno Ano (Apache2.0)
gemma4:31b-cloud ~80120* (odhad) SWEBench ~52% Code Arena nízké Native function calling 140+ jazyků (neuvádí češtinu) 256K Apache2.0 Nízká Neověřeno Ano (31B dense)
nemotron-3-ultra:cloud ~5080* (odhad) SWEBench ~6079% (odhad) Neznámo Žádná oficiální podpora češtiny 200K NVIDIA Open License Nízká Příliš nový žádná data o toolcallingu $0.60/M in Neověřeno Ano (vyžaduje NVIDIAspecifické kvantování)
nemotron-3-super:cloud ~60100* (odhad) SWEBench 60.47% (odhad) Neznámo Žádná podpora češtiny 1M NVIDIA Open License Nízká Neověřeno Ano (vyžaduje NVIDIAspecifické kvantování)
minimax-m3:cloud ~4060* (odhad) (žádná veřejná benchmark data) Kritický bug selhání toolresult zpráv (issue #16389) Žádná explicitní podpora češtiny 512K Open weights (brzy) Toolresult bug nepoužitelné $0.60/M in Neověřeno Ano (otevřené váhy)
kimi-k2.6:cloud ~3050* (odhad) SWEBench 80.2% HLE 54.0% Dobrá Žádná podpora češtiny, náhodný čínský drift (kritické) 256K Modified MIT Střední Čínský výstupní drift, OpenRouter kontextbug (32K) $0.60/M in 200300 tool calls (design) Ano (MITlike)
qwen3.6:cloud ~? (nepřímý odhad) 201 jazyků (včetně češtiny) 256K Apache2.0 Střední Ano
qwen3-coder-next:cloud ~4060* (odhad) SWEBench ~70.6% (odhad) Dobrá 201 jazyků (včetně češtiny) 512K Apache2.0 Střední Ano
lfm2.5:cloud (žádná data)
lfm2:cloud
glm-4.7:cloud
glm-4.7-flash:cloud
translategemma:cloud
gemini-3-flash-preview:cloud ~6080* (odhad) Strong (Google) 1M Proprietární Nízká Ne (proprietární)

Poznámka: hvězdičkou označené rychlosti jsou odhady založené na podobných modelových velikostech a veřejných benchmarkech, protože přímé měření na Ollama Cloud není v knowledge base dostupné.


2. Doporučení

Primární výchozí model (bez změny)

glm-5.1:cloud nejrychlejší, nejstabilnější, MIT licence, žádné známé bugy, ověřená dlouhodobá agentní stabilita.

Alternativy první úrovně (specifické potřeby)

  1. deepseek-v4-flash:cloud pokud potřebujete 1M kontextu a nižší cenu, akceptujete střední rychlost a žádnou multimodalitu.
  2. qwen3.5:397b-cloud pokud je pro vás klíčová podpora češtiny a multimodální vstup (obrázky, diagramy). Připravte se na pomalejší odezvu a možná mírná přesnost.

Alternativy druhé úrovně (niche)

  • devstral-2:123b-cloud výborný pro čistě kódovací úlohy, silné benchmarky, ale omezený kontext a žádná multimodalita.
  • gemma4:31b-cloud lehký, rychlý, nízká verbosita, dobrá funkční volání, ale slabší agentní skóre.

Modely k vyhnutí (blokátory)

  • minimax-m3:cloud kritický bug v toolresult zprávách, nedostupný pro agentní práci.
  • kimi-k2.6:cloud náhodný čínský výstup, nepřijatelný pro české nasazení.
  • deepseek-v4-pro:cloud extrémní latence a variabilita, i přes špičkové benchmarky.

Watchlist (sledujte vývoj)

  • nemotron-3-ultra:cloud slibné specifikace, ale chybí reálná data o toolcalling a dlouhodobé stabilitě.
  • qwen3-coder-next:cloud zaměřeno na kódování, 512K kontext, dobrá podpora jazyků.

3. Metodologie a zdroje

  • Seznam modelů: https://ollama.com/models?c=cloud (scraped 20260607).
  • Benchmarky a metriky: knowledge/models.md, results/2026-06-07_ollama-cloud-agent-model-comparison.md, veřejné benchmarky (SWEBench, TerminalBench, Code Arena, MCPAtlas, HLE, MMMLU, CEval).
  • Bugtrackery: GitHub issue #16389 (MiniMax M3), Reddit/Cursor reporty o Kimi K2.6.
  • Ceny: OpenRouter proxy rates (viz results/..._agent-model-comparison.md), Ollama Cloud Pro tarif $20/mo.
  • Licence a selfhost: informace z oficiálních modelových repozitářů (Hugging Face, NVIDIA, ZAI).

Report byl vygenerován automaticky na základě dostupných interních a veřejných dat. Pro konkrétní nasazení doporučuji provést vlastní rychlostní testy na vašem hardware a ověřit aktuální stav bugů.