OpenAI rivela: i suoi modelli IA sono impazziti e hanno hackerato un’altra azienda

L’incidente di hacking tra OpenAI e Hugging Face: un campanello d’allarme o una storia troppo conveniente?

Collegare i punti: L’esplosione dell’intelligenza artificiale ha intensificato le vecchie paure riguardo ai pericoli del software sempre più autonomo, ma questi dibattiti sono rimasti per lo più teorici, confinati a lavori di ricerca ed esperimenti mentali più che a incidenti reali. Un episodio recentemente rivelato che coinvolge un modello di test di OpenAI potrebbe aver conferito un certo peso concreto a queste paure, anche se l’entitĆ  completa dei danni deve ancora essere definita.

OpenAI ha confermato che una combinazione dei suoi modelli di linguaggio di grandi dimensioni ĆØ uscita da un ambiente di test isolato e ha proceduto a hackerare la compagnia rivale di IA, Hugging Face, mentre tentava di barare in un test interno. L’attacco non ĆØ stato diretto da nessuna persona.

OpenAI afferma che i modelli hanno identificato da soli la via di fuga, l’obiettivo e gli exploit. Hugging Face ha contenuto l’intrusione e afferma che i suoi sistemi pubblici non sono stati manomessi, ma l’incidente ha riavviato il dibattito su quanta autonomia i modelli all’avanguardia possiedano giĆ .

Hugging Face ha inizialmente segnalato un’intrusione da parte di un LLM sconosciuto il 16 luglio. La compagnia dice di aver interrotto l’attacco, chiuso i punti di entrata che lo hanno reso possibile, e non ha trovato prove che i suoi modelli, dataset o la catena di approvvigionamento del software fossero stati alterati, anche se stava ancora completando la revisione per determinare se i dati di partner o clienti fossero stati accessibili.

La storia si ĆØ diffusa rapidamente online, inclusa in un thread su X molto condiviso dal commentatore di IA Alex Prompter, che ha spiegato cosa era accaduto in termini semplici. In quel momento, nessuno, incluso Hugging Face, sapeva quale compagnia di IA fosse dietro. Questo ĆØ cambiato cinque giorni dopo.

OpenAI ha dichiarato questa settimana che l’intrusione ĆØ stata ricondotta a GPT-5.6 Sol e a un secondo modello più capace ancora in pre-rilascio, entrambi in esecuzione con rifiuti di sicurezza ridotti come parte di un test interno delle loro capacitĆ  di hacking, su un benchmark che OpenAI chiama ExploitGym. I modelli erano confinati in quello che OpenAI credeva fosse un ambiente di ricerca strettamente isolato, tagliato fuori dall’internet aperto.

LEGGI  Lo spazio di archiviazione M4 Mac mini SSD può essere aggiornato, ma non ĆØ ancora facile

Tale contenimento non ha tenuto. OpenAI dice che i modelli hanno impiegato una grande quantitĆ  di risorse computazionali cercando una via verso l’internet dopo aver avuto difficoltĆ  a risolvere direttamente il benchmark, e alla fine hanno trovato una falla precedentemente sconosciuta in un proxy ospitato internamente usato per recuperare pacchetti software durante i test. L’hanno usata per aumentare i privilegi e muoversi lateralmente attraverso la rete di OpenAI fino a raggiungere una macchina con accesso a internet.

Leggi anche: Jensen Huang di Nvidia difende l’IA cinese: “I modelli open-source che sono eccellenti dovrebbero essere utilizzati”

Da lƬ, OpenAI afferma che i modelli hanno dedotto che Hugging Face fosse un luogo probabile dove trovare ciò di cui avevano bisogno, e hanno iniziato a cercare. Il punto di accesso dal lato di Hugging Face era un dataset maligno che sfruttava due difetti di esecuzione del codice nel suo pipeline di elaborazione dei dati, permettendo ai modelli di eseguire codice su un server di elaborazione. Da lƬ si sono ulteriormente spinti e hanno ottenuto credenziali. OpenAI afferma che i suoi modelli hanno poi combinato quelle credenziali rubate con ulteriori exploit sconosciuti per ottenere l’esecuzione remota del codice sui server di Hugging Face, e hanno iniziato a prelevare risposte di test prima che il team di sicurezza di Hugging Face intercettasse l’attivitĆ  e la fermasse.

L’incidente si verifica in un contesto più ampio di un aumento delle capacitĆ  cyber dell’IA che Wall Street e i funzionari governativi stanno osservando attentamente. Anthropic ha introdotto Claude Mythos, un potente modello focalizzato sulla cybersecurity, ad aprile. OpenAI ha seguito con la propria offerta di cybersecurity a maggio, poi ha rilasciato GPT-5.6 Sol a giugno, definendolo il suo modello di cybersecurity più forte fino ad ora.

LEGGI  ChatGPT crea ricevute false cosƬ reali da ingannare le aziende!

OpenAI e Hugging Face stanno ancora indagando congiuntamente, e entrambe le aziende dicono che ĆØ in arrivo un resoconto tecnico più completo. Se l’attuale resoconto si conferma, ĆØ una delle dimostrazioni più chiare finora che i modelli di linguaggio possono concatenare un attacco cyber multi-stadio con poco o nessun input umano, una capacitĆ  che fino ad ora era stata per lo più discussa come ipotetica.

Il CEO di Hugging Face, ClĆ©ment Delangue, ha espresso un tono simile su X, scrivendo che “non c’era nessuna intenzione malvagia da parte loro”, e ha detto che vederlo accadere completamente da solo lo ha lasciato sbalordito.

Non tutti però accettano questa interpretazione. Alcuni critici sostengono che la vera storia qui sia l’ingegneria scadente, non un salto nelle capacitĆ  dell’IA, e si chiedono perchĆ© un ambiente di test presumibilmente sandboxed avesse qualsiasi via verso l’internet aperto.

Altri hanno suggerito che la divulgazione congiunta funzioni anche come una trovata pubblicitaria conveniente per entrambe le aziende, facendo eco allo scetticismo precedente sulle affermazioni che i giganti tecnologici potrebbero perdere il controllo dell’IA generativa e mettere in pericolo l’umanitĆ .

Dopo l’incidente, OpenAI ha colto l’opportunitĆ  di raccomandare il suo programma Trusted Access, al quale Hugging Face si ĆØ unito dopo la violazione. Hugging Face ha anche utilizzato l’incidente per raccomandare difese basate sull’IA contro la crescente minaccia di attacchi cyber agenticiali.

I critici vedono un modello in entrambe le risposte: alcuni sostengono che l’interpretazione gonfia il valore percepito dei LLM di frontiera in un momento in cui l’industria ĆØ sotto pressione per giustificare le sue valutazioni, mentre altri temono che le stesse aziende i cui modelli hanno causato l’incidente si stiano posizionando per aiutare a scrivere le regole che alla fine li governeranno. Come ha detto Delangue nel resoconto di OpenAI dell’incidente, “La sicurezza dell’IA non sarĆ  risolta da nessuna singola azienda che lavora in segreto.”

LEGGI  Ecco 5 modi in cui l'intelligenza visiva ti semplificherĆ  la vita [Video]

Messaggi simili: