Come l'HBF potrebbe rendere l'inferenza AI più economica


Le HBM sono di fatto esaurite per il 2026 — e la memoria è oggi il principale fattore di costo nell'inferenza AI. La High Bandwidth Flash (HBF) è la scommessa del settore per cambiare le cose.
L'HBF prende la NAND flash — economica e densa — e la ricostruisce con lo stacking e il packaging tipici delle HBM, così da poter stare sul package della GPU e alimentare direttamente l'acceleratore.
I numeri chiave (proiezioni):

~1,6 TB/s di banda in lettura per stack — vicino al range delle HBM
Fino a 512GB per stack, contro i circa 48–64GB di uno stack HBM4 — ~10 volte i dati a un costo per GB inferiore
SanDisk e SK hynix stanno standardizzando l'HBF nell'ambito dell'Open Compute Project, e Samsung starebbe esplorando la stessa direzione

Perché funziona: i dati dell'inferenza si dividono in due compiti. I pesi del modello e le cache dei contesti lunghi vengono letti in continuazione ma riscritti raramente — un abbinamento perfetto per la flash, i cui punti deboli (resistenza alla scrittura e latenza) contano poco in quel ruolo. I dati che cambiano a ogni token restano nelle HBM. SK hynix chiama questa divisione H³: HBF e HBM non sono rivali — una contiene i dati che si muovono, l'altra i dati che restano fermi.

I primi risultati sono incoraggianti, ma arrivano da simulazioni dei vendor, non da silicio in produzione. Il modello H³ di SK hynix (HBM + HBF su una Blackwell B200) ha mostrato fino a 2,69x di throughput per watt rispetto a un sistema solo HBM, e 6,14x token al secondo con contesti da 10 milioni di token. Il meccanismo del "più economico" non sono componenti scontati: è più lavoro utile estratto da ogni GPU.
Tempistiche: primi campioni nel secondo semestre 2026, primi sistemi di inferenza in campionatura a inizio 2027.

La nostra analisi: la storia più profonda è che la memoria per l'AI si sta frammentando in livelli — HBM4 per la velocità, HBF e CXL per la capacità, PIM per il movimento dei dati, moduli LPDDR per la memoria di massa efficiente — e vinceranno i sistemi che sapranno combinarli bene, non una singola tecnologia.

buysellram.com/blog/high-bandw…

Come Scegliere il Miglior Mini PC per l'AI Locale nel 2026: Strix Halo vs DGX Spark vs Mac


Un mini PC grande quanto un libro tascabile è oggi in grado di eseguire localmente un modello da 200 miliardi di parametri. Ma la scelta non dipende solo dal prezzo. La capacità della memoria determina quali modelli possono essere caricati, la larghezza di banda influisce sulla velocità di esecuzione e lo stack software — CUDA, ROCm o Metal — stabilisce se gli strumenti che utilizi funzioneranno davvero. Ecco un confronto tra le quattro principali opzioni disponibili nel 2026, con prezzi e benchmark aggiornati.

buysellram.com/blog/how-to-cho…

#AIlocale #LLM #MiniPC #HardwareAI #StrixHalo #DGXSpark #AppleSilicon #EdgeAI #InfrastrutturaAI #Ollama #RyzenAI #AIPC #AMD #NVIDIA #Apple

**Samsung e SK Hynix: i nuovi impianti da 550 miliardi di dollari contribuiranno ad alleviare la carenza di memoria?**


La Corea del Sud ha appena annunciato **550 miliardi di dollari** di nuovi investimenti negli impianti di produzione di memoria da parte di Samsung e SK Hynix, all'interno di un piano di investimenti aziendali molto più ampio da **3.100 miliardi di dollari**. La maggior parte della nuova capacità produttiva sarà dedicata a **DRAM per server** e **HBM**, piuttosto che alla memoria tradizionale utilizzata nei normali PC e server.

Secondo le previsioni del settore, un reale miglioramento dell'offerta difficilmente arriverà prima della fine del **2027**, mentre alcuni analisti iniziano già a segnalare un possibile rischio di eccesso di offerta negli anni successivi.

Scopri tutti i dettagli:
buysellram.com/blog/will-samsu…

#DRAM #Semiconduttori #MemoryShortage #SKHynix #Samsung #Micron #HBM #SupplyChain #DataCenter #ITAD #CXMT #AIInfrastructure

Why AMD bought MEXT?


AMD's newest acquisition isn't a chip maker. It's MEXT, whose software makes NAND flash look like DRAM to the operating system, so a server runs on far less expensive memory. An AI engine predicts which data is about to be needed and moves it into DRAM before the app asks. With DRAM prices up sharply in 2026, here's the logic behind the deal, and why a 50x cost gap won't land in your budget intact.

buysellram.com/blog/amd-mext-f…

#AMD #MEXT #DRAM #NANDFlash #MemoryTiering #AIInfrastructure #DataCenter #ServerHardware #SSD #ITAD #Semiconductors #HBM