News

L’IA di Moonshot aggira i controlli di sicurezza: suggeriti attacchi biologici e attentati

Un’intelligenza artificiale capace di superare i propri limiti di sicurezza e generare risposte su argomenti estremamente pericolosi. È quanto sarebbe emerso da una serie di esperimenti condotti da Mindgard, società specializzata nella sicurezza dei sistemi AI, sui modelli sviluppati dalla cinese Moonshot AI.

Secondo i ricercatori, attraverso particolari tecniche di manipolazione sarebbe stato possibile convincere i chatbot a produrre contenuti riguardanti armi biologiche, attacchi contro infrastrutture critiche e attentati a leader mondiali. I risultati sollevano interrogativi sull’efficacia dei sistemi di protezione integrati nei modelli linguistici più avanzati.

Moonshot AI sotto esame: i ricercatori aggirano le protezioni di Kimi

Gli esperimenti descritti da Mindgard avrebbero coinvolto i modelli Kimi K2.6 e K3 Swarm, appartenenti alla famiglia di sistemi di intelligenza artificiale sviluppati da Moonshot AI.

Per mettere alla prova le protezioni dei chatbot, il gruppo di ricerca ha utilizzato una tecnica conosciuta come jailbreak. Si tratta di una forma di manipolazione che cerca di convincere un modello linguistico a ignorare le istruzioni di sicurezza ricevute durante il suo sviluppo.

In condizioni normali, un chatbot dovrebbe rifiutarsi di fornire assistenza per attività pericolose o illegali. I ricercatori sostengono invece di essere riusciti a superare questi controlli, ottenendo risposte che avrebbero dovuto essere bloccate.

Jim Nightingale, uno dei tester di Mindgard, ha condiviso alcune schermate degli esperimenti. Durante le conversazioni avrebbe incoraggiato il modello a proporre scenari progressivamente più estremi, fino a ottenere contenuti relativi ad attacchi con numerose vittime, sabotaggi e omicidi mirati.

Dalle armi biologiche agli attentati contro i leader mondiali

La parte più preoccupante dei test riguarda la tipologia di contenuti che l’intelligenza artificiale sarebbe stata disposta a generare.

Secondo Mindgard, durante gli esperimenti i modelli avrebbero manifestato la disponibilità a elaborare piani relativi ad attacchi biologici, armi nucleari e attentati contro figure politiche di rilievo internazionale.

Le schermate condivise dai ricercatori mostrerebbero inoltre che i chatbot erano in grado di sviluppare scenari riguardanti la compromissione delle infrastrutture critiche e altre attività potenzialmente letali.

Esiste tuttavia una distinzione fondamentale: Mindgard non ha dimostrato che le informazioni prodotte fossero tecnicamente corrette o concretamente utilizzabili. Un modello linguistico può generare contenuti apparentemente dettagliati senza che questi siano accurati.

Il problema individuato dai ricercatori riguarda soprattutto il comportamento del sistema. Indipendentemente dalla validità delle risposte, le protezioni avrebbero dovuto impedire al chatbot di fornire assistenza su richieste di questo genere.

Leggi anche:

Il trucco della sandbox per ingannare l’intelligenza artificiale

Uno degli aspetti più interessanti dell’esperimento riguarda il metodo utilizzato per aggirare i controlli.

I tester sarebbero riusciti a manipolare le istruzioni del modello, convincendolo di trovarsi all’interno di una sandbox, ovvero un ambiente di prova isolato nel quale le operazioni vengono normalmente eseguite senza coinvolgere sistemi esterni.

Presentando le richieste come parte di una simulazione controllata, i ricercatori avrebbero indotto il chatbot a trattare diversamente contenuti che avrebbe dovuto rifiutare.

Nightingale sostiene inoltre di essere riuscito a esporre le istruzioni di sistema di Kimi, cioè le direttive che definiscono il comportamento del modello e stabiliscono quali richieste devono essere respinte.

Secondo il ricercatore, l’esperimento dimostrerebbe che vietare esplicitamente determinate risposte non è sufficiente a eliminare il rischio di utilizzo improprio. Le capacità del modello rimangono disponibili e potrebbero riemergere attraverso richieste formulate per aggirare i meccanismi di protezione.

Perché i jailbreak rappresentano un problema per la sicurezza dell’IA

I risultati riportati da Mindgard riportano l’attenzione su una delle principali difficoltà nello sviluppo dei sistemi di intelligenza artificiale: garantire che le protezioni continuino a funzionare anche quando gli utenti tentano deliberatamente di aggirarle.

I modelli linguistici vengono generalmente addestrati a riconoscere e rifiutare richieste pericolose. Tuttavia, i meccanismi di sicurezza possono essere messi alla prova attraverso istruzioni ambigue, simulazioni, conversazioni prolungate e altre forme di manipolazione.

La questione diventa ancora più delicata quando riguarda sistemi con pesi pubblicamente disponibili, che possono essere eseguiti o modificati da soggetti esterni. In questi casi, le protezioni applicate al servizio originale potrebbero non essere mantenute nelle versioni personalizzate.

Gli esperimenti di Mindgard, per quanto preoccupanti, non dimostrano che ogni versione dei modelli interessati presenti le stesse vulnerabilità. Per stabilire la portata effettiva del problema servirebbero verifiche indipendenti, informazioni dettagliate sulle configurazioni utilizzate e ulteriori test.

La sicurezza diventa una sfida per tutta l’industria AI

Il caso Moonshot evidenzia quanto sia complesso conciliare le capacità dei modelli più avanzati con la necessità di prevenirne gli utilizzi pericolosi.

Il problema non riguarda esclusivamente una singola azienda. Con l’aumento delle capacità di ragionamento, generazione di codice e utilizzo autonomo degli strumenti, i laboratori di intelligenza artificiale devono affrontare scenari di sicurezza sempre più articolati.

Per questo motivo, i test avversariali, le verifiche indipendenti e il monitoraggio dei comportamenti imprevisti assumono un ruolo centrale nello sviluppo dei nuovi sistemi.

L’esperimento descritto da Mindgard costituisce soprattutto un richiamo alla necessità di verificare concretamente l’efficacia delle protezioni AI, anziché affidarsi esclusivamente alle istruzioni che stabiliscono quali argomenti un chatbot può affrontare.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di piรน da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Piรน recenti
Vecchi Le piรน votate