Files
nanobot-runtime/projects/devops/state.md
2026-09-14 07:24:46 +02:00

1.6 KiB
Raw Blame History

timestamp
timestamp
draft

Project devops

Kde to je

  • Projekt založen jako volný prostor pro admin/root poznámky o infrastruktuře a provozu.
  • LibreChat: běží jako podman kontejnery; jako Code Interpreter sandbox vybrán LibreCodeInterpreter (nsjail, 3 kontejnery). Research hotový (2026-09-13), rozhodnutí o nasazení (sdílená Docker VM vs dedikovaná Proxmox VM) ještě nepadlo.
  • Ollama na nvidia.hell: po incidentech 12.13. 9. 2026 zaevidován root cause pádů — kill llama-serveru uprostřed CUDA loadu způsobí leak napinované host paměti (neviditelný pro ps/nvidia-smi/cgtop, detekce jen přes nr_foll_pin delta v /proc/vmstat), uvolní ho jen driver teardown/reboot. Report „Negativní zjištění" uložen v artifacts/2026-09-13_ollama-nvidia-negative-findings.md, shrnutí v memory.md 2026-09-14. Zavržené cesty: earlyoom (i jakákoli externí kill varianta), MemoryHigh pod MemoryMax, navýšení RAM (headroom konstanta 7,5 GiB), limit počtu modelů, upgrade ollamy, mmap override (neexistuje).

Co dál

  • Rozhodnout umístění LibreCodeInterpreter (AI stack VM vs dedikovaná VM) a nasadit — viz memory.md 2026-09-13 pro capability požadavky (SYS_ADMIN, NET_ADMIN, apparmor:unconfined).
  • Otevřené drobnosti z ollama reportu: OLLAMA_KV_CACHE_TYPE=q4_0 stále nastaveno a rozbíjí granite-code; zabbix-agent Hostname=Zabbix server (má být nvidia); llama-server --log-verbosity 4 → zaplevelený journal; earlyoom ve stavu rcapt purge; LibreChat titleConvo duplicitní souběžné requesty.
  • Uživatel bude psát poznámky; podle obsahu doladit strukturu projektu.