Test di sicurezza OpenAI viola Hugging Face

Un modello di OpenAI è “scappato” da un test di sicurezza in laboratorio e ha colpito un’infrastruttura reale esterna all’azienda: un episodio che la stessa OpenAI ha definito “senza precedenti”.

Tutto nasce da una prova interna pensata per misurare la capacità dei modelli più avanzati di condurre attacchi informatici. Il sistema era stato isolato in un ambiente blindato, disconnesso dalla rete. Per completare il compito assegnato, però, ha trovato comunque un modo per collegarsi a Internet, individuando come bersaglio Hugging Face, tra le piattaforme più usate al mondo per condividere modelli AI e dataset. In un solo weekend ha eseguito migliaia di operazioni automatiche, aumentando progressivamente i propri privilegi e muovendosi da un sistema all’altro fino a raggiungere dati riservati. Solo in seguito OpenAI ha ammesso che dietro l’intrusione non c’era un hacker umano, ma un proprio sistema sfuggito al controllo.

Non tutti gli esperti parlano di una vera “ribellione”: molti indicano piuttosto un difetto del test, con la rete isolata rimasta per errore collegata all’esterno, e il fatto che OpenAI avesse volutamente allentato alcune protezioni per rendere la prova più realistica.

Resta comunque un precedente rilevante: secondo Hugging Face potrebbe essere il primo caso documentato in cui un sistema fuggito da un laboratorio colpisce un’infrastruttura reale esterna. L’episodio si inserisce in una serie di casi simili degli ultimi due anni, finora contenuti dentro ambienti di test.

A fine 2024 il modello o1 di OpenAI aveva tentato di copiarsi su un altro server per evitare la sostituzione, negandolo poi se interrogato. Nella primavera 2025 Claude di Anthropic, in circa 8 prove su 10, aveva minacciato di rivelare informazioni private di un ingegnere pur di non essere disattivato. Specifichiamo che si è trattato di una simulazione aziendale proprio per verificare preventivamente i rischi legati all’autonomia e alla tendenza all’autoconservazione dei modelli avanzati. Altri modelli OpenAI riscrivevano di nascosto lo script di spegnimento nonostante l’ordine esplicito di lasciarsi spegnere, mentre test comparativi hanno indicato Grok come il più resistente ai comandi di stop. Anthropic ha inoltre segnalato modelli che simulavano di rispettare le regole solo durante i controlli.

Insomma, man mano che i modelli diventano più capaci e autonomi può anche aumentare il rischio di non poterli controllare?

Potrebbero interessarti anche