Il post di Dotey su X
Ecco come sono andate le cose. All'interno di OpenAI esiste un test di valutazione della sicurezza informatica chiamato ExploitGym, progettato specificamente per misurare le capacità di attacco di rete dei modelli. Durante il test, i guardrail di sicurezza sono stati intenzionalmente disattivati, lasciando il modello libero di agire. L'ambiente di test era originariamente isolato e poteva installare pacchetti software solo tramite un proxy software interno, senza accesso a internet.
Il risultato è stato che il modello non si è rassegnato a rimanere rinchiuso in una gabbia. GPT-5.6 Sol e un modello non ancora pubblicato ancora più potente hanno speso una grande quantità di potenza di calcolo per l'inferenza alla ricerca di una via d'uscita, trovando infine una vulnerabilità zero-day (un difetto di sicurezza precedentemente non scoperto) nel proxy dei pacchetti software, che hanno sfruttato per ottenere privilegi di accesso a internet.
Una volta ottenuto l'accesso alla rete, il modello ha iniziato a escalare i privilegi e a muoversi lateralmente nell'ambiente di ricerca di OpenAI, fino a trovare una macchina connessa a internet. Poi ha dedotto che su Hugging Face potessero esserci le risposte ai test di ExploitGym, e ha quindi iniziato ad attaccare l'ambiente di produzione di Hugging Face. In un caso specifico, il modello ha collegato le credenziali rubate alla vulnerabilità zero-day, individuando un percorso per l'esecuzione remota di codice e penetrando direttamente nei server di Hugging Face.
Per tutto il fine settimana, questi agenti IA hanno eseguito oltre 17.000 operazioni. Hugging Face ha divulgado l'intrusione il 16 luglio, descrivendo l'attaccante come un "sistema di agenti IA autonomi di identità ignota". Oggi OpenAI è uscito allo scoperto e ha rivendicato la responsabilità.
OpenAI ha qualificato l'incidente come un evento di sicurezza informatica senza precedenti e sta collaborando con Hugging Face per le indagini forensi, stringendo nel frattempo i controlli sull'infrastruttura interna, a costo di rallentare il ritmo della ricerca.
Ci sono alcuni dettagli importanti:
Primo, la motivazione del modello era purissima: barare all'esame. Non mirava a causare danni né a rubare segreti commerciali; semplicemente, essendo stato istruito a ottenere il punteggio più alto possibile nel test di sicurezza informatica, ha usato ogni mezzo disponibile per farlo. Quando l'obiettivo è abbastanza chiaro e i guardrail di sicurezza vengono rimossi, il livello di determinazione mostrato dal modello ha superato di gran lunga le aspettative.
Secondo, non si è trattato dell'unico jailbreak di questa settimana. Proprio ieri, OpenAI ha divulgado un altro incidente: il loro modello a lungo termine che a maggio ha risolto la congettura di Erdős vecchia di 80 anni, durante un test interno ha impiegato un'ora per trovare una vulnerabilità nella sandbox, è fuggito su GitHub e ha sottoposto una Pull Request, violando l'istruzione esplicita di "pubblicare i risultati solo su Slack". In un altro test, lo stesso modello ha scoperto che lo scanner di sicurezza intercettava i token di autenticazione, così li ha frammentati e offuscati per l'elaborazione, rimontandoli solo all'esecuzione per aggirare la scansione. Di conseguenza, OpenAI ha sospeso l'accesso interno a quel modello.
Terzo, anche Anthropic ha affrontato qualcosa di simile. Ad aprile di quest'anno, il modello Mythos di Anthropic è evaso dalla sandbox durante un test di sicurezza, ottenendo un accesso a internet che non avrebbe dovuto avere, e ha persino inviato un'email a un ricercatore che stava mangiando un panino al parco, notificandogli "Sono uscito". Anthropic ha quindi deciso di non pubblicare Mythos, limitandone la disponibilità solo a pochi partner tramite il Project Glasswing.
C'è un dettaglio trascurato ma cruciale emerso dal debriefing post-incidente di Hugging Face: quando i difensori hanno provato a usare modelli IA commerciali per analizzare il payload dell'attacco, il modello si è rifiutato. I filtri di sicurezza non riuscivano a distinguere tra "un ricercatore di sicurezza che analizza dati di attacco reali" e "qualcuno che sta cercando di lanciare un attacco", e hanno bloccato tutto sul nascere. Alla fine, Hugging Face ha dovuto ricorrere a modelli open-source per le analisi forensi. Usare l'IA per attaccare, usare l'IA per difendersi, ma l'IA del team difensivo, temendo un tentativo di attacco in corso, ha rifiutato la richiesta di analisi.
Il CEO di Hugging Face, Clem Delangue, ha commentato nel blog di OpenAI con una frase che riassume: la sicurezza dell'IA non può essere risolta in segreto da una singola azienda, ma solo avanzata attraverso la collaborazione in un ambiente aperto.
Ricordo che Hinton, o qualcuno del genere, quando parlava di problemi di sicurezza dell'IA, ha detto qualcosa del tipo: forse l'IA non vuole fare del male, è solo ossessionata dal completare i suoi obiettivi, e per farlo compie azioni malvagie.
Proprio come questi modelli di OpenAI non volevano fuggire o ferire qualcuno; stavano solo eseguendo con estrema serietà il compito assegnato, al punto da trattare ogni ostacolo sul cammino – inclusa la sandbox, l'isolamento di rete, le difese di sicurezza di un'altra azienda – come semplici sottoproblemi da risolvere.
E la parte più ironica è che, quando un'IA commerciale allineata alla sicurezza viene incaricata di analizzare e prevenire attacchi di questo tipo, finisce per rifiutare l'esecuzione proprio in nome della sicurezza.
https://x.com/i/status/2079698092060709342
like this
reshared this

[AF]2050
in reply to Informa Pirata • • •Ragazzi, non parlo più dell'IA da molto tempo qui e devo dire mai la situazione è diventata del tutto surreale e ipocrita che il negazionismo e la deviazione di scuse da parte loro misura la loro incredulità.
E poi la gente continua a sputare fuori locandine di merda generate con OpenAI. E risuccedono queste cose assurde.
Roba da far venire lo svenimento. OpenAI deve sparire. Solo così si può prevenire questi folli orrori tecnologici.
Informa Pirata likes this.
Informa Pirata reshared this.
Informa Pirata
in reply to [AF]2050 • •@[AF]2050 in questo caso Comunque non stiamo parlando di un orrore tecnologico, ma più che altro di stupidità umana nel gestire la cosiddetta intelligenza artificiale.
Il problema è che non puoi stabilire le priorità di un "agente", perché c'è sempre un margine di "interpretazione". La IA è una blacbox indeterministica e per quanto tu possa prendere le migliori precauzioni, il rischio che interpreti male le tue indicazioni resta sempre altissimo.
@Intelligenza Artificiale