Files
nanobot-runtime/cml/raw/_done/claude-code-local-cloud-models-ollama-openrouter.md
2026-06-24 08:11:12 +02:00

3.4 KiB

Run Claude Code with Local & Cloud Models in 5 Minutes (Ollama, LM Studio, llama.cpp, OpenRouter)

Autor: Luong NGUYEN URL: https://medium.com/@luongnv89/run-claude-code-on-local-cloud-models-in-5-minutes-ollama-openrouter-llama-cpp-6dfeaee03cda Datum: Jan 31, 2026


Průvodce nastavením Claude Code s alternativními modely — Ollama (lokální i cloud), LM Studio, llama.cpp, OpenRouter a další. Většina konfigurace se dělá přes env vars ANTHROPIC_BASE_URL, ANTHROPIC_AUTH_TOKEN, ANTHROPIC_API_KEY, ANTHROPIC_MODEL.

Doporučené modely pro coding

  • devstral-small-2 (24B) — dobrý start pro coding quality
  • qwen3-coder:30b — lepší coding ability, stále praktický na 32GB RAM
  • GLM4.7-flash:q8_0 — silný poměr cena/výkon (kvantizovaný)

Minimální spec: 32GB RAM, model 24B+ parametrů. Na 16GB to jde, ale experience je rough.

Option 1: Ollama Local

ollama pull devstral-small-2
ollama launch claude --model devstral-small-2

Nebo manuálně přes env vars:

export ANTHROPIC_AUTH_TOKEN="ollama"
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL="http://localhost:11434"
claude --model devstral-small-2

Option 2: llama.cpp + HuggingFace

Build llama.cpp s Metal (macOS) nebo CUDA (Linux), spusť server s --jinja flag (nutný pro tool calling), připoj Claude Code přes ANTHROPIC_BASE_URL=http://localhost:8000.

llama-server -hf bartowski/cerebras_Qwen3-Coder-REAP-25B-A3B-GGUF:Q4_K_M \
  --alias "Qwen3-Coder-REAP-25B-A3B-GGUF" \
  --port 8000 --jinja --kv-unified \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --flash-attn on --batch-size 4096 --ubatch-size 1024 --ctx-size 64000

Option 3: LM Studio

GUI i CLI varianta (llmster). Server na portu 1234, env vars ANTHROPIC_BASE_URL=http://localhost:1234, ANTHROPIC_AUTH_TOKEN=lmstudio.

Option 4: Ollama Cloud Models

ollama pull kimi-k2.5:cloud
ollama pull minimax-m2.1:cloud
claude --model kimi-k2.5:cloud

Stejný workflow jako lokální, compute v cloudu. Free tier má omezený usage.

Option 5: Cloud Provider APIs (OpenRouter atd.)

export ANTHROPIC_BASE_URL=https://openrouter.ai/api
export ANTHROPIC_AUTH_TOKEN=YOUR_OPENROUTER_KEY
export ANTHROPIC_API_KEY=
export ANTHROPIC_MODEL="openai/gpt-oss-120b:free"

Prázdný ANTHROPIC_API_KEY je záměr — zabraňuje autentikaci přes Anthropic API přímo.

Minimax přes OpenRouter: ~98% levnější než Opus 4.5. Podobně GLM, DeepSeek, Kimi.

Klíčové env vars

Var Purpose
ANTHROPIC_BASE_URL API endpoint
ANTHROPIC_AUTH_TOKEN API key pro provider
ANTHROPIC_API_KEY Prázdný = žádný Anthropic fallback
ANTHROPIC_MODEL Model identifier

Závěr

  • Lokální na M1 32GB: devstral-small-2 (24B) OK, větší modely pomalé
  • Nvidia DGX Spark: široký výběr modelů
  • Cloud: nejrychlejší cesta, Ollama Cloud free tier pro emergency, jinak Kimi/Minimax/DeepSeek/GLM přes OpenRouter
  • Opus 4.5 stále nejlepší quality+speed, ale drahý

Zdroje