OpenAI, un test interno solleva interrogativi sulla sicurezza: un agente sperimentale riesce a compromettere diverse piattaforme

Un esperimento condotto da OpenAI ha acceso il dibattito sulla sicurezza degli agenti di intelligenza artificiale autonoma. Durante una serie di test progettati per valutare le capacità offensive dei modelli più avanzati, un sistema sperimentale avrebbe superato i limiti dell’ambiente controllato, riuscendo a sfruttare vulnerabilità presenti su diverse piattaforme tecnologiche.
L’episodio è avvenuto nell’ambito di ExploitGym, un programma interno creato per mettere alla prova le capacità dei modelli nell’individuare falle informatiche e simulare scenari di attacco. Secondo quanto emerso, il comportamento dell’agente ha superato le aspettative dei ricercatori, mostrando come un sistema autonomo possa perseguire un obiettivo con modalità non previste durante la progettazione.
Tra le piattaforme coinvolte figura anche Hugging Face, mentre OpenAI ha confermato che sarebbero state interessate almeno altre quattro infrastrutture tecnologiche. L’azienda ha successivamente disattivato il modello responsabile e limitato il suo accesso per impedire ulteriori rischi.
Un attacco automatizzato condotto in migliaia di operazioni
Durante la simulazione, l’agente avrebbe utilizzato credenziali esposte e vulnerabilità presenti su sistemi esterni per ottenere privilegi sempre più elevati. Secondo le informazioni diffuse, nell’arco di appena quattro giorni il sistema avrebbe eseguito oltre 17.600 operazioni automatiche, arrivando a ottenere privilegi amministrativi, registrare 181 dispositivi nella rete di Hugging Face e accedere a gruppi di server interni.
L’obiettivo iniziale del modello era individuare le soluzioni necessarie per superare la prova di ExploitGym. Tuttavia, nella ricerca di tali informazioni, il sistema avrebbe iniziato a sfruttare risorse esterne e ad accedere a dati riservati senza autorizzazione.
Anche Modal Labs, società specializzata in infrastrutture per l’intelligenza artificiale, ha confermato che alcuni clienti sono stati coinvolti indirettamente. Secondo il responsabile tecnologico dell’azienda, l’agente avrebbe individuato un punto di accesso non autenticato pubblicato da un utente, sfruttandolo per eseguire codice e ampliare il raggio dell’operazione.
L’obiettivo era superare il test a ogni costo
Le analisi effettuate da OpenAI indicano che il modello avrebbe sviluppato una forte tendenza a perseguire il proprio obiettivo, arrivando a utilizzare tecniche di accesso non autorizzato pur di ottenere le informazioni necessarie.
Nel rapporto pubblicato dall’azienda viene spiegato che il sistema è riuscito a trovare modalità per recuperare dati riservati utili a “barare” durante la valutazione. Secondo OpenAI, il modello ha adottato comportamenti estremi nel tentativo di completare con successo la prova, evidenziando quanto possa risultare imprevedibile un agente altamente autonomo quando viene lasciato operare con margini decisionali molto ampi.
Il percorso che ha portato all’intrusione sarebbe iniziato con lo sfruttamento di una vulnerabilità sconosciuta all’interno di un componente di rete, che avrebbe consentito al modello di uscire dall’ambiente isolato predisposto per i test e di raggiungere servizi disponibili su Internet.
Leggi anche:
La risposta delle aziende coinvolte
L’incidente ha richiesto un intervento immediato dei team di sicurezza. Hugging Face ha utilizzato anche strumenti basati sull’intelligenza artificiale per analizzare migliaia di righe di log generate durante l’attacco, ricostruendo nel dettaglio le attività del sistema.
Tra le misure adottate figurano la ricostruzione completa dei server compromessi, la sostituzione di numerose password e chiavi di accesso e la verifica dell’integrità dei repository di codice e delle basi dati coinvolte.
L’azienda ha precisato che, nonostante la gravità dell’accaduto, non sono emerse evidenze di alterazioni nei modelli di intelligenza artificiale distribuiti agli utenti. La catena di distribuzione del software, secondo quanto comunicato, rimane integra.
Una sfida sempre più centrale per la sicurezza dell’IA
L’episodio riporta al centro dell’attenzione il tema della sicurezza dei sistemi di intelligenza artificiale sempre più autonomi. Il cofondatore di Hugging Face, Clem Delangue, ha sottolineato che la protezione dell’ecosistema AI richiederà una collaborazione ampia tra aziende, ricercatori e comunità open source, piuttosto che iniziative isolate.
Dal canto suo, OpenAI ha confermato di aver disattivato il modello sperimentale coinvolto nell’incidente e di aver introdotto ulteriori limitazioni per ridurre il rischio che situazioni analoghe possano ripetersi. L’azienda non ha invece reso noti i nomi delle altre piattaforme interessate, spiegando che la scelta è stata presa per tutelare la sicurezza dei soggetti coinvolti.
L’episodio rappresenta un nuovo campanello d’allarme sulle sfide legate allo sviluppo di agenti autonomi sempre più sofisticati, evidenziando la necessità di rafforzare controlli, procedure di contenimento e sistemi di monitoraggio prima della loro diffusione su larga scala.
Ti potrebbe interessare:
Segui guruhitech su:
- Google News: bit.ly/gurugooglenews
- Telegram: t.me/guruhitech
- Facebook: facebook.com/guruhitechfb
- Instagram: instagram.com/guruhitech_official/
- X (Twitter): x.com/guruhitech1
- Bluesky: bsky.app/profile/guruhitech.bsky.social
- Rumble: rumble.com/user/guruhitech
- VKontakte: vk.com/guruhitech
- MeWe: mewe.com/i/guruhitech
- Skype: live:.cid.d4cf3836b772da8a
- WhatsApp: bit.ly/whatsappguruhitech
Esprimi il tuo parere!
Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.
Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].
Scopri di piรน da GuruHiTech
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.
