nanobot: 2026-09-18 19:16:59
This commit is contained in:
@@ -175,3 +175,7 @@ Otevřené body po migraci:
|
||||
- Nový **1TB NVMe disk** k instalaci
|
||||
- **Proxmox Backup Server** nahodit, aby bylo kam zálohovat — kandidát pivo.hell (Atom stroj)
|
||||
- Dlouhodobě: plánování nového HW. Průzkum hotový — dnešní nabídky jsou skříňky 15–20 l, kde za peníze dostane jen víc jader; víc jader uživatel nechce, směr zatím nevyhovuje. Zvažovat alternativy: mini-ITX SFF skříňě, používání Optiplexu jako mezikroku, případně custom build.
|
||||
- 2026-09-18: correction: předchozí zápis uváděl pád Proxmox serveru na 2026-09-20 večer a příchod Optiplexu na 2026-09-20 — špatné datum. Správně: server padl **2026-09-17 večer** ("vcera večer" z pohledu dneška 2026-09-18), Optiplex 9010 sehnán a migrace provedena **2026-09-18** ("dneska"). Doplňující upřesnění od uživatele:
|
||||
|
||||
- Zdroje Optiplexu nebyly "pročistěné/zbavené" — uživatel je **prohlédl/pro kontroloval** a použil.
|
||||
- Při vyjmutí paměti speaker pípal = RAM sloty fungovaly, ale board sám o sobě se nechoval jako mrtvý; diagnóza root cause boardu nebyla proveditelná, necháme u neznámého.
|
||||
|
||||
@@ -5,7 +5,7 @@ timestamp: draft
|
||||
# Project devops
|
||||
|
||||
## Kde to je
|
||||
- **HW základna: Dell Optiplex 9010** (od 2026-09-20). Původní Proxmox server náhle zemřel (večer 2026-09-20, po vyjmutí RAM jen pískání speakeru, board mrtvý, root cause neznám). Do Optiplexu přesunuty RAM, disky i RTX 4060 — vše jede. BIOS měl problémy (celý přesun >1 h), změny v BIOSu se neukládají — k dořešení. Původní nvidia.hell incidenty (12.–13. 9.) se týkaly ještě původního stroje.
|
||||
- **HW základna: Dell Optiplex 9010** (od 2026-09-18). Původní Proxmox server náhle zemřel (večer 2026-09-17, po vyjmutí RAM jen pískání speakeru, board mrtvý, root cause neznám). Do Optiplexu přesunuty RAM, disky i RTX 4060 — vše jede. BIOS měl problémy (celý přesun >1 h), změny v BIOSu se neukládají — k dořešení. Původní nvidia.hell incidenty (12.–13. 9.) se týkaly ještě původního stroje.
|
||||
- LibreChat: běží jako podman kontejnery; jako Code Interpreter sandbox vybrán LibreCodeInterpreter (nsjail, 3 kontejnery). Research hotový (2026-09-13), rozhodnutí o nasazení (sdílená Docker VM vs dedikovaná Proxmox VM) ještě nepadlo.
|
||||
- Ollama na nvidia.hell: po incidentech 12.–13. 9. 2026 zaevidován root cause pádů — kauzální řetěz: ollama rozhoduje load podle VRAM ne volné RAM + vypíná mmap (podmínka na 9,5 GiB stroji nesplnitelná nikdy, regrese od 2026-06-05) + PLE host buffer u gemma4 + přerušený load leakuje napinovanou host paměť (neviditelná pro ps/nvidia-smi/cgtop, detekce jen `nr_foll_pin` delta v /proc/vmstat), uvolní **jen reboot** (rmmod driveru ověřeně NE). Cgroup pojistka (`MemoryMax=6G`, `MemorySwapMax=0`, bez MemoryHigh) ověřena zátěžovým testem: 240/240 SSH heartbeatů, load 3,41 vs 81 při incidentu. Skutečný zdroj zátěže = nanobot.hell (dávky přes ~10 modelů + embedding), LibreChat jen zesilovač. Reporty v `artifacts/2026-09-13_ollama-nvidia-full-report.md` (ucelený, s kuchařkou pro triáž) a `artifacts/2026-09-13_ollama-nvidia-negative-findings.md` (negativní zjištění), shrnutí v memory.md 2026-09-14. Zavržené cesty: earlyoom i jakákoli externí kill varianta, MemoryHigh pod MemoryMax, navýšení RAM (headroom konstanta 7,5 GiB), limit počtu modelů, OLLAMA_LOAD_TIMEOUT, upgrade ollamy, mmap override (neexistuje), ballooning (`balloon: 0` + pevná paměť), rmmod jako remedy.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user