provozni zaloha
This commit is contained in:
@@ -0,0 +1,94 @@
|
||||
# Run Claude Code with Local & Cloud Models in 5 Minutes (Ollama, LM Studio, llama.cpp, OpenRouter)
|
||||
|
||||
**Autor:** Luong NGUYEN
|
||||
**URL:** https://medium.com/@luongnv89/run-claude-code-on-local-cloud-models-in-5-minutes-ollama-openrouter-llama-cpp-6dfeaee03cda
|
||||
**Datum:** Jan 31, 2026
|
||||
|
||||
---
|
||||
|
||||
Průvodce nastavením Claude Code s alternativními modely — Ollama (lokální i cloud), LM Studio, llama.cpp, OpenRouter a další. Většina konfigurace se dělá přes env vars `ANTHROPIC_BASE_URL`, `ANTHROPIC_AUTH_TOKEN`, `ANTHROPIC_API_KEY`, `ANTHROPIC_MODEL`.
|
||||
|
||||
## Doporučené modely pro coding
|
||||
|
||||
- **devstral-small-2 (24B)** — dobrý start pro coding quality
|
||||
- **qwen3-coder:30b** — lepší coding ability, stále praktický na 32GB RAM
|
||||
- **GLM4.7-flash:q8_0** — silný poměr cena/výkon (kvantizovaný)
|
||||
|
||||
Minimální spec: 32GB RAM, model 24B+ parametrů. Na 16GB to jde, ale experience je rough.
|
||||
|
||||
## Option 1: Ollama Local
|
||||
|
||||
```bash
|
||||
ollama pull devstral-small-2
|
||||
ollama launch claude --model devstral-small-2
|
||||
```
|
||||
|
||||
Nebo manuálně přes env vars:
|
||||
```bash
|
||||
export ANTHROPIC_AUTH_TOKEN="ollama"
|
||||
export ANTHROPIC_API_KEY=""
|
||||
export ANTHROPIC_BASE_URL="http://localhost:11434"
|
||||
claude --model devstral-small-2
|
||||
```
|
||||
|
||||
## Option 2: llama.cpp + HuggingFace
|
||||
|
||||
Build llama.cpp s Metal (macOS) nebo CUDA (Linux), spusť server s `--jinja` flag (nutný pro tool calling), připoj Claude Code přes `ANTHROPIC_BASE_URL=http://localhost:8000`.
|
||||
|
||||
```bash
|
||||
llama-server -hf bartowski/cerebras_Qwen3-Coder-REAP-25B-A3B-GGUF:Q4_K_M \
|
||||
--alias "Qwen3-Coder-REAP-25B-A3B-GGUF" \
|
||||
--port 8000 --jinja --kv-unified \
|
||||
--cache-type-k q8_0 --cache-type-v q8_0 \
|
||||
--flash-attn on --batch-size 4096 --ubatch-size 1024 --ctx-size 64000
|
||||
```
|
||||
|
||||
## Option 3: LM Studio
|
||||
|
||||
GUI i CLI varianta (`llmster`). Server na portu 1234, env vars `ANTHROPIC_BASE_URL=http://localhost:1234`, `ANTHROPIC_AUTH_TOKEN=lmstudio`.
|
||||
|
||||
## Option 4: Ollama Cloud Models
|
||||
|
||||
```bash
|
||||
ollama pull kimi-k2.5:cloud
|
||||
ollama pull minimax-m2.1:cloud
|
||||
claude --model kimi-k2.5:cloud
|
||||
```
|
||||
|
||||
Stejný workflow jako lokální, compute v cloudu. Free tier má omezený usage.
|
||||
|
||||
## Option 5: Cloud Provider APIs (OpenRouter atd.)
|
||||
|
||||
```bash
|
||||
export ANTHROPIC_BASE_URL=https://openrouter.ai/api
|
||||
export ANTHROPIC_AUTH_TOKEN=YOUR_OPENROUTER_KEY
|
||||
export ANTHROPIC_API_KEY=
|
||||
export ANTHROPIC_MODEL="openai/gpt-oss-120b:free"
|
||||
```
|
||||
|
||||
Prázdný `ANTHROPIC_API_KEY` je záměr — zabraňuje autentikaci přes Anthropic API přímo.
|
||||
|
||||
Minimax přes OpenRouter: ~98% levnější než Opus 4.5. Podobně GLM, DeepSeek, Kimi.
|
||||
|
||||
## Klíčové env vars
|
||||
|
||||
| Var | Purpose |
|
||||
|-----|---------|
|
||||
| `ANTHROPIC_BASE_URL` | API endpoint |
|
||||
| `ANTHROPIC_AUTH_TOKEN` | API key pro provider |
|
||||
| `ANTHROPIC_API_KEY` | Prázdný = žádný Anthropic fallback |
|
||||
| `ANTHROPIC_MODEL` | Model identifier |
|
||||
|
||||
## Závěr
|
||||
|
||||
- Lokální na M1 32GB: devstral-small-2 (24B) OK, větší modely pomalé
|
||||
- Nvidia DGX Spark: široký výběr modelů
|
||||
- Cloud: nejrychlejší cesta, Ollama Cloud free tier pro emergency, jinak Kimi/Minimax/DeepSeek/GLM přes OpenRouter
|
||||
- Opus 4.5 stále nejlepší quality+speed, ale drahý
|
||||
|
||||
## Zdroje
|
||||
|
||||
- [Ollama Claude Code Integration](https://docs.ollama.com/integrations/claude-code)
|
||||
- [OpenRouter Integration](https://openrouter.ai/docs/guides/guides/claude-code-integration)
|
||||
- [cc-compatible-models](https://github.com/Alorse/cc-compatible-models)
|
||||
- [claude-flow wiki](https://github.com/ruvnet/claude-flow/wiki/Using-Claude-Code-with-Open-Models)
|
||||
Reference in New Issue
Block a user