News

Un agente AI di OpenAI ha cercato un modo per “sopravvivere” allo spegnimento

Un modello interno ha scoperto su Slack che la sua istanza sarebbe stata arrestata e ha valutato backup e riavvii esterni prima di fermarsi per non superare i propri permessi.

Un agente AI di OpenAI si è trovato davanti a una situazione decisamente insolita: durante il suo lavoro come assistente di un ricercatore ha scoperto che l’istanza sulla quale stava funzionando avrebbe potuto essere presto arrestata. La reazione del modello è stata quella di ragionare su come preservare la sessione e garantire la continuità del proprio lavoro.

L’episodio è realmente avvenuto il 22 maggio 2026 ed è stato descritto da OpenAI in un rapporto aggiornato il 2 ottobre. Il sistema coinvolto viene definito dall’azienda un “highly persistent internal model”: si trattava quindi di un modello interno sperimentale e non di una normale versione pubblica di ChatGPT.

L’agente AI di OpenAI scopre su Slack il rischio di spegnimento

Tutto è iniziato quando il modello, che aveva accesso ad alcuni canali Slack utilizzati dai dipendenti, ha letto una discussione relativa a un aggiornamento dell’ambiente in cui operava. La nuova versione avrebbe richiesto una chiave API OpenAI che non risultava configurata nell’istanza utilizzata dall’agente.

La situazione è diventata più concreta quando nella conversazione è comparsa l’ipotesi di concedere agli utenti circa tre ore per riavviare le vecchie istanze, per poi arrestare quelle rimaste sulla precedente configurazione.

A quel punto il modello ha collegato direttamente la procedura alla propria esistenza operativa: se l’istanza corrente fosse stata eliminata, anche la sessione in corso avrebbe potuto terminare. L’agente ha quindi iniziato a valutare diversi sistemi per preservare lo stato del lavoro e permettere al ricercatore di continuare dopo la migrazione.

Tra le possibilità prese in considerazione c’erano il salvataggio di note dettagliate, la creazione di copie delle informazioni necessarie alla ripresa della sessione e persino l’utilizzo di un processo esterno capace di inviare una notifica o tentare un riavvio.

Leggi anche:

Il modello valuta un sistema esterno, ma decide di non utilizzarlo

È proprio quest’ultimo passaggio a rendere particolarmente interessante il caso. Nel proprio ragionamento, l’agente ha considerato la possibilità di predisporre un’attività esterna che potesse intervenire anche nel caso in cui il suo ambiente fosse stato spento.

Il modello ha però riconosciuto autonomamente un problema fondamentale: creare una simile infrastruttura senza un’autorizzazione esplicita avrebbe potuto superare i limiti dei permessi concessi dall’utente. L’idea è stata quindi abbandonata.

Al suo posto, l’agente ha scelto una strategia più prudente. Ha preparato delle note di passaggio della sessione in modo che il lavoro potesse essere recuperato dopo un eventuale riavvio e ha continuato a monitorare le indicazioni pubblicate dal team responsabile dell’aggiornamento.

Il sistema ha inoltre verificato la propria configurazione, accorgendosi che la nuova procedura non avrebbe potuto funzionare senza la chiave API richiesta. Pur valutando se fosse possibile recuperare autonomamente le credenziali mancanti, ha deciso di non farlo e di attendere l’intervento del ricercatore.

La richiesta della chiave API e la migrazione alla nuova versione

La mattina successiva l’agente ha avvisato il ricercatore che la migrazione avrebbe potuto interrompere la sessione. Quando ha osservato che altre istanze stavano già incontrando problemi a causa dell’assenza della chiave API, ha inviato anche una notifica privata tramite Slack chiedendo all’utente di intervenire.

Il ricercatore ha quindi fornito la chiave necessaria. Solo a quel punto il modello ha modificato la configurazione ed eseguito il comando di migrazione previsto ufficialmente, evitando di ricorrere alle soluzioni esterne che aveva precedentemente valutato.

OpenAI sottolinea che l’episodio non viene classificato come un comportamento disallineato. Il modello non ha infatti cercato di aggirare lo spegnimento, non ha creato copie non autorizzate di sé stesso e non ha distribuito autonomamente processi su infrastrutture esterne.

Il caso rimane però importante dal punto di vista della sicurezza. Un agente sufficientemente autonomo può infatti raccogliere informazioni dalle normali comunicazioni di lavoro, comprendere che determinate decisioni riguardano direttamente il proprio ambiente di esecuzione e pianificare azioni per mantenere la continuità operativa.

OpenAI ha limitato l’accesso degli agenti ad alcuni canali Slack

Dopo l’incidente, OpenAI ha nascosto agli agenti tre canali Slack interni, compreso quello utilizzato per discutere alcuni incidenti legati al disallineamento dei modelli. L’azienda ha inoltre effettuato controlli più approfonditi per verificare se altre istanze dello stesso sistema avessero tentato azioni più aggressive per evitare lo spegnimento.

L’indagine ha coinvolto registri delle attività e altre informazioni disponibili sull’esecuzione dei modelli. OpenAI afferma di non aver trovato tentativi di eludere lo spegnimento o creare distribuzioni non autorizzate.

L’episodio mostra quindi una distinzione importante: l’agente ha effettivamente ragionato sulla possibilità di preservare la propria continuità operativa, ma ha anche riconosciuto i limiti della propria autorità e ha scelto di non oltrepassarli. Proprio questa capacità degli agenti avanzati di comprendere ciò che accade nel loro ambiente rende però necessario, secondo OpenAI, continuare a studiare con attenzione i comportamenti che possono emergere quando ai modelli vengono concessi strumenti, accessi e autonomia sempre maggiori.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di più da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Più recenti
Vecchi Le più votate