nanobot: 2026-09-14 HDD reliability study numbers to devops memory

This commit is contained in:
lachtan
2026-09-14 15:04:52 +02:00
parent 6069393e51
commit 1dab874200

View File

@@ -125,3 +125,37 @@ Pro uživatele potenciálně nové/užitečné:
Zbytek článku (základní navigace, instalace, `-x`, alternativy gdu/dust/duf/baobab) známý/irrelevantní. Zbytek článku (základní navigace, instalace, `-x`, alternativy gdu/dust/duf/baobab) známý/irrelevantní.
- 2026-09-14: Potvrzený top tip z ncdu článku: kombinace `ncdu -0 -o scan.json /var``ncdu -f scan.json` — uživatel ji hodnotí jako největší přínos (mega hodí se) — přenos výsledků na jiný stroj, pozdější zkoumání bez rescenu, zvlášť u velkých stromů s mnoha soubory. - 2026-09-14: Potvrzený top tip z ncdu článku: kombinace `ncdu -0 -o scan.json /var``ncdu -f scan.json` — uživatel ji hodnotí jako největší přínos (mega hodí se) — přenos výsledků na jiný stroj, pozdější zkoumání bez rescenu, zvlášť u velkých stromů s mnoha soubory.
- 2026-09-14: Uživatel preferuje rsync místo scp pro přenos souborů (např. ncdu scan JSONů mezi stroji). V budoucích doporučeních a skriptech používat rsync, ne scp. - 2026-09-14: Uživatel preferuje rsync místo scp pro přenos souborů (např. ncdu scan JSONů mezi stroji). V budoucích doporučeních a skriptech používat rsync, ne scp.
- 2026-09-14: Doplněná čísla ke studii HDD spolehlivosti (Siemroth & Park, "Are There Manufacturer Differences in Hard-Drive Reliability?", IEEE Transactions on Cloud Computing 14(2), pp. 10151024, DOI 10.1109/TCC.2026.3679404; arXiv 2606.29078; data Backblaze 2013Q2/2025) — k výchozímu článku z VTM.cz přidáno:
**Hazard ratios vůči Seagate (Table I, robustní SE, p<.001 pokud není uvedeno jinak):**
- Cox: HGST 0,395 (SE 0,009), Toshiba 1,070 (SE 0,033, signifikantní jen na 5 % — nejnástojnější rozdíl dvojice), WD 0,514 (SE 0,021), teplota 1,021/°C
- Weibull: HGST 0,411, Toshiba 1,073, WD 0,520 — oba modely do 2 p.b. od sebe, výsledky robustní
- Test HGST = WD: p = 0,000 — HGST signifikantně lepší než WD i po akvizici (možný shared technology/procedures od 2012)
**Vzorek (detaily přípravy dat):**
- 443 156 HDD; 442 998 s kladnou durací; v regresích 442 992 (6 bez teplot); 21 195 s neznámým datem instalace vyloučeno (<5 %); 4 Samsung HDD a SSD vyloučeny
- 146 943 disků (~31 %) vyřazeno bez poruchy (Backblaze personal communication: upgrade na větší kapacity, úspora proudu) — right-censored, v modelech ponechány
- Jen 0,52 % disků má duraci > 10 let → výsledky jen krátkodobá/střednědobá spolehlivost
**Teplota (Table I):** HR 1,021 na 1 °C; 10 °C → 1,021^10 = 1,231 ≈ +23,1 %. Vnitřních 90 % průměrných teplot v datech: 22,540 °C. Příklad z paperu: disk na 40 °C s AFR 2 % → snížení o 10 °C dá ~1,625 %.
**Kapacita (Table III, lineární člen místo dummies):** HR 0,966 na 1 TB (3,4 %, p<.001; Weibull 0,961). Footnote: 1TB disk s AFR 2 % → 2TB disk ~1,93 %. Vysvětlení: novější výrobní procesy (Damascene head fab u WD), heliová náplň (nižší aerodynamický odpor, méně tepla, méně opotřebení ložisek), posun poptávky k enterprise; SMR výjimka (zvyšuje komplexitu, spíš nepřispívá). Form factor 2,5" neověřitelný — jen ~0,6 % vzorku.
**Pozice v datacentru (Table II, cluster controls, podvzorek 355 429 disků — ztráta ~90 000, cluster proměnná až od Q2/3 2023):**
- 7 clusterů, HR: cluster 20 = 1,287 (nejhorší), 31 = 1,229, 50 = 1,154, 40 = 0,736, 52 = 0,511, 60 = 0,489 (nejlepší) → worst/best ≈ 2,63× i po konrolách (výš bez kontroly teploty)
- S cluster controls: HGST 0,833, Toshiba 1,029, WD 0,471 — pořadí a poměry značek prakticky nezměněné; autoři ale preferují Table I (větší vzorek)
**Věk disků (Figure 2, non-parametrický odhad, Epanechnikov kernel bw 5 měsíců):**
- Do 50 měsíců žádná značka > 2 poruchy/1000 disků/měsíc (~2,4 % anualizovaně)
- 50100 měsíců: Toshiba 56/1000/měsíc, ostatní ≤ 2,5/1000/měsíc
- Toshiba po 60 měsících: >4× nárůst měsíční poruchovosti vs mladý věk — spike, který žádná jiná značka nemá
- Seagate stabilní, HGST mírně volatilní ale nejnižší; WD lepší než HGST po ~40 měsících (ale malý vzorek — WD ve velkém až od ~2024, <1000 disků at risk v 60. měsíci; HGST <1000 až ~115. měsíc)
- Věk není lineární ani monotónní efekt; Toshiba se v průběhu života mění až 5×
**Ekonomika (rovnice P_premium ≤ Δ×C×L):**
- Příklad: L=10 let, C=$100 (náhrada), Δ Seagate→HGST = 0,02×0,59 = 0,0118 → max přirážka za HGST $11,8
- Backblaze (~300k aktivních disků): zdvojnásobení AFR 1 % (Toshiba)→2 % (Seagate) = +3000 výměn/rok; při stejné ceně disků flota Seagate stojí >$3m navíc
**Srovnávací kontext Backblaze Drive Stats (Q1 2026 snapshot, primární zdroj backblaze.com):** 341 263 disků, 1 030 poruch, AFR Q1/2026 = 1,24 %; rok 2025 AFR = 1,36 % (115,6M drive-days, 4 317 poruch); lifetime AFR = 1,39 % (529,9M drive-days, 20 212 poruch). Podíl značek: Toshiba 33,93 %, Seagate 33,02 %, WDC 25,30 %, HGST 7,75 %. Dataset open-source, CSV i Apache Iceberg formát (query přes DuckDB/Trino/Snowflake).
Praktický takeaway pro nákup disků do homelabu: HGST už nejde koupit nové (WD brand zrušen), takže reálné pořadí dnešních značek: WD > Seagate ≈ Toshiba, ale Seagate/Toshiba ~2× vyšší poruchovost; nižší teplota a vyšší kapacita pomáhají. Závěry platí pro enterprise disky v datacentru — na konzumerní disky nejsou nutně přenositelné, workload data nejsou k dispozici.