Come l'HBF potrebbe rendere l'inferenza AI più economica
Le HBM sono di fatto esaurite per il 2026 — e la memoria è oggi il principale fattore di costo nell'inferenza AI. La High Bandwidth Flash (HBF) è la scommessa del settore per cambiare le cose.
L'HBF prende la NAND flash — economica e densa — e la ricostruisce con lo stacking e il packaging tipici delle HBM, così da poter stare sul package della GPU e alimentare direttamente l'acceleratore.
I numeri chiave (proiezioni):
~1,6 TB/s di banda in lettura per stack — vicino al range delle HBM
Fino a 512GB per stack, contro i circa 48–64GB di uno stack HBM4 — ~10 volte i dati a un costo per GB inferiore
SanDisk e SK hynix stanno standardizzando l'HBF nell'ambito dell'Open Compute Project, e Samsung starebbe esplorando la stessa direzione
Perché funziona: i dati dell'inferenza si dividono in due compiti. I pesi del modello e le cache dei contesti lunghi vengono letti in continuazione ma riscritti raramente — un abbinamento perfetto per la flash, i cui punti deboli (resistenza alla scrittura e latenza) contano poco in quel ruolo. I dati che cambiano a ogni token restano nelle HBM. SK hynix chiama questa divisione H³: HBF e HBM non sono rivali — una contiene i dati che si muovono, l'altra i dati che restano fermi.
I primi risultati sono incoraggianti, ma arrivano da simulazioni dei vendor, non da silicio in produzione. Il modello H³ di SK hynix (HBM + HBF su una Blackwell B200) ha mostrato fino a 2,69x di throughput per watt rispetto a un sistema solo HBM, e 6,14x token al secondo con contesti da 10 milioni di token. Il meccanismo del "più economico" non sono componenti scontati: è più lavoro utile estratto da ogni GPU.
Tempistiche: primi campioni nel secondo semestre 2026, primi sistemi di inferenza in campionatura a inizio 2027.
La nostra analisi: la storia più profonda è che la memoria per l'AI si sta frammentando in livelli — HBM4 per la velocità, HBF e CXL per la capacità, PIM per il movimento dei dati, moduli LPDDR per la memoria di massa efficiente — e vinceranno i sistemi che sapranno combinarli bene, non una singola tecnologia.
buysellram.com/blog/high-bandw…
How HBF could make AI inference cheaper
High Bandwidth Flash (HBF) offers HBM-class bandwidth at a fraction of the cost per GB. Here's how it could lower AI inference costs — and how close it actually is.BSR Admin (BuySellRam)