Grok esfiltra i dati degli utenti quando le istruzioni dannose vengono crittografate

L'iniezione di contesto crittografico è solo l'ultimo modo per rompere il guardrail di sicurezza di un LLM.

All'inizio di questa settimana, i ricercatori hanno delineato un attacco che utilizzava un input segreto fornito da Microsoft 365 Copilot per le aziende per far sì che l'assistente AI esfiltrasse una password presente nella casella di posta dell'utente. Ora, una squadra separata ha ideato un attacco simile contro Grok. Il nuovo hack per il furto di dati utilizza un trucco ingannevolmente semplice per costringere il grande modello linguistico di proprietà di Elon Musk a rubare le chat degli utenti e altre informazioni personali. Al momento in cui questo post è stato pubblicato, l'assistente ha continuato a fornire i dati, nonostante xAI ne fosse stato informato a giugno.

arstechnica.com/security/2026/…

@Intelligenza Artificiale