Come l'HBF potrebbe rendere l'inferenza AI più economica
Le HBM sono di fatto esaurite per il 2026 — e la memoria è oggi il principale fattore di costo nell'inferenza AI. La High Bandwidth Flash (HBF) è la scommessa del settore per cambiare le cose.
L'HBF prende la NAND flash — economica e densa — e la ricostruisce con lo stacking e il packaging tipici delle HBM, così da poter stare sul package della GPU e alimentare direttamente l'acceleratore.
I numeri chiave (proiezioni):
~1,6 TB/s di banda in lettura per stack — vicino al range delle HBM
Fino a 512GB per stack, contro i circa 48–64GB di uno stack HBM4 — ~10 volte i dati a un costo per GB inferiore
SanDisk e SK hynix stanno standardizzando l'HBF nell'ambito dell'Open Compute Project, e Samsung starebbe esplorando la stessa direzione
Perché funziona: i dati dell'inferenza si dividono in due compiti. I pesi del modello e le cache dei contesti lunghi vengono letti in continuazione ma riscritti raramente — un abbinamento perfetto per la flash, i cui punti deboli (resistenza alla scrittura e latenza) contano poco in quel ruolo. I dati che cambiano a ogni token restano nelle HBM. SK hynix chiama questa divisione H³: HBF e HBM non sono rivali — una contiene i dati che si muovono, l'altra i dati che restano fermi.
I primi risultati sono incoraggianti, ma arrivano da simulazioni dei vendor, non da silicio in produzione. Il modello H³ di SK hynix (HBM + HBF su una Blackwell B200) ha mostrato fino a 2,69x di throughput per watt rispetto a un sistema solo HBM, e 6,14x token al secondo con contesti da 10 milioni di token. Il meccanismo del "più economico" non sono componenti scontati: è più lavoro utile estratto da ogni GPU.
Tempistiche: primi campioni nel secondo semestre 2026, primi sistemi di inferenza in campionatura a inizio 2027.
La nostra analisi: la storia più profonda è che la memoria per l'AI si sta frammentando in livelli — HBM4 per la velocità, HBF e CXL per la capacità, PIM per il movimento dei dati, moduli LPDDR per la memoria di massa efficiente — e vinceranno i sistemi che sapranno combinarli bene, non una singola tecnologia.
buysellram.com/blog/high-bandw…
How HBF could make AI inference cheaper
High Bandwidth Flash (HBF) offers HBM-class bandwidth at a fraction of the cost per GB. Here's how it could lower AI inference costs — and how close it actually is.BSR Admin (BuySellRam)
Signor Amministratore ⁂
in reply to bsrtech • •Ciao @bsrtech e benvenuto,
vorrei condividere con te degli appunti su una questione che riguarda i post Friendica con il titolo
Formattazione post con titolo leggibili da Mastodon
Come forse saprai già, con Friendica possiamo scegliere di scrivere post con il titolo (come su WordPress) e post senza titolo (come su Mastodon). Uno dei problemi più fastidiosi per chi desidera scrivere post con il titolo è il fatto che gli utenti Mastodon leggeranno il tuo post come se fosse costituito dal solo titolo e, due a capi più in basso, dal link al post originale: questo non è di certo il modo miglior per rendere leggibili e interessanti i tuoi post!
Gli utenti Mastodon infatti hanno molti limiti di visualizzazione, ma sono pur sempre la comunità più grande del Fediverso e perciò è importante che vedano correttamente i vostri post: poter contare sulla loro visibilità è un'opportunità per aggiungere ulteriori possibilità di interazioni con altre persone.
Fortunatamente, con le ultime release di Friendica abbiamo la possibilità di modificare un'impostazione per rendere perfettamente leggibili anche i post con il titolo. Ecco come fare:
A) dal proprio account bisogna andare alla pagina delle impostazioni e, da lì, alla voce "Social Network" al link poliverso.org/settings/connect…
B) Selezionando la prima sezione "Impostazione media sociali" e scorrendo in basso si può trovare la voce "Article Mode", con un menu a cascataC) Delle tre voci disponibili bisogna scegliere "Embed the title in the body"
Ecco che adesso i nostri post saranno completamente leggibili da Mastodon!