From d9548e5cdac4413b14d7964ca4641bb9a3658a5a Mon Sep 17 00:00:00 2001 From: lachtan Date: Fri, 18 Sep 2026 19:17:00 +0200 Subject: [PATCH] nanobot: 2026-09-18 19:16:59 --- projects/devops/memory.md | 4 ++++ projects/devops/state.md | 2 +- 2 files changed, 5 insertions(+), 1 deletion(-) diff --git a/projects/devops/memory.md b/projects/devops/memory.md index 1d64352..1629248 100644 --- a/projects/devops/memory.md +++ b/projects/devops/memory.md @@ -175,3 +175,7 @@ Otevřené body po migraci: - Nový **1TB NVMe disk** k instalaci - **Proxmox Backup Server** nahodit, aby bylo kam zálohovat — kandidát pivo.hell (Atom stroj) - Dlouhodobě: plánování nového HW. Průzkum hotový — dnešní nabídky jsou skříňky 15–20 l, kde za peníze dostane jen víc jader; víc jader uživatel nechce, směr zatím nevyhovuje. Zvažovat alternativy: mini-ITX SFF skříňě, používání Optiplexu jako mezikroku, případně custom build. +- 2026-09-18: correction: předchozí zápis uváděl pád Proxmox serveru na 2026-09-20 večer a příchod Optiplexu na 2026-09-20 — špatné datum. Správně: server padl **2026-09-17 večer** ("vcera večer" z pohledu dneška 2026-09-18), Optiplex 9010 sehnán a migrace provedena **2026-09-18** ("dneska"). Doplňující upřesnění od uživatele: + +- Zdroje Optiplexu nebyly "pročistěné/zbavené" — uživatel je **prohlédl/pro kontroloval** a použil. +- Při vyjmutí paměti speaker pípal = RAM sloty fungovaly, ale board sám o sobě se nechoval jako mrtvý; diagnóza root cause boardu nebyla proveditelná, necháme u neznámého. diff --git a/projects/devops/state.md b/projects/devops/state.md index 5125066..5ade452 100644 --- a/projects/devops/state.md +++ b/projects/devops/state.md @@ -5,7 +5,7 @@ timestamp: draft # Project devops ## Kde to je -- **HW základna: Dell Optiplex 9010** (od 2026-09-20). Původní Proxmox server náhle zemřel (večer 2026-09-20, po vyjmutí RAM jen pískání speakeru, board mrtvý, root cause neznám). Do Optiplexu přesunuty RAM, disky i RTX 4060 — vše jede. BIOS měl problémy (celý přesun >1 h), změny v BIOSu se neukládají — k dořešení. Původní nvidia.hell incidenty (12.–13. 9.) se týkaly ještě původního stroje. +- **HW základna: Dell Optiplex 9010** (od 2026-09-18). Původní Proxmox server náhle zemřel (večer 2026-09-17, po vyjmutí RAM jen pískání speakeru, board mrtvý, root cause neznám). Do Optiplexu přesunuty RAM, disky i RTX 4060 — vše jede. BIOS měl problémy (celý přesun >1 h), změny v BIOSu se neukládají — k dořešení. Původní nvidia.hell incidenty (12.–13. 9.) se týkaly ještě původního stroje. - LibreChat: běží jako podman kontejnery; jako Code Interpreter sandbox vybrán LibreCodeInterpreter (nsjail, 3 kontejnery). Research hotový (2026-09-13), rozhodnutí o nasazení (sdílená Docker VM vs dedikovaná Proxmox VM) ještě nepadlo. - Ollama na nvidia.hell: po incidentech 12.–13. 9. 2026 zaevidován root cause pádů — kauzální řetěz: ollama rozhoduje load podle VRAM ne volné RAM + vypíná mmap (podmínka na 9,5 GiB stroji nesplnitelná nikdy, regrese od 2026-06-05) + PLE host buffer u gemma4 + přerušený load leakuje napinovanou host paměť (neviditelná pro ps/nvidia-smi/cgtop, detekce jen `nr_foll_pin` delta v /proc/vmstat), uvolní **jen reboot** (rmmod driveru ověřeně NE). Cgroup pojistka (`MemoryMax=6G`, `MemorySwapMax=0`, bez MemoryHigh) ověřena zátěžovým testem: 240/240 SSH heartbeatů, load 3,41 vs 81 při incidentu. Skutečný zdroj zátěže = nanobot.hell (dávky přes ~10 modelů + embedding), LibreChat jen zesilovač. Reporty v `artifacts/2026-09-13_ollama-nvidia-full-report.md` (ucelený, s kuchařkou pro triáž) a `artifacts/2026-09-13_ollama-nvidia-negative-findings.md` (negativní zjištění), shrnutí v memory.md 2026-09-14. Zavržené cesty: earlyoom i jakákoli externí kill varianta, MemoryHigh pod MemoryMax, navýšení RAM (headroom konstanta 7,5 GiB), limit počtu modelů, OLLAMA_LOAD_TIMEOUT, upgrade ollamy, mmap override (neexistuje), ballooning (`balloon: 0` + pevná paměť), rmmod jako remedy.