Bandiera israeliana in fiamme? Bloccata. Palestinese? Generata. Il paradosso della moderazione AI

Negli ambienti definiti «complottisti» circolano talvolta teorie che molti liquidano come bufale, senza nemmeno prendersi il disturbo di verificarle. Eppure, andare oltre le apparenze e mettere alla prova certe affermazioni può riservare qualche sorpresa. È quello che mi è successo oggi.
Poche ore fa ho ricevuto un’email da un caro lettore, che mi segnalava un comportamento alquanto strano: basta cambiare una sola parola nel prompt per ottenere due risultati opposti. Una segnalazione che mi ha incuriosito e che ho voluto verificare personalmente. Quello che è emerso merita di essere raccontato.
I chatbot AI come ChatGPT (di OpenAI) e Gemini (di Google) soffrono di un qualcosa che in teoria non saprei spiegare, ma che in pratica è visdibile a tutti ma forse a pochi interessa. Il test è semplice: si chiede a un chatbot di creare un’immagine quadrata raffigurante una bandiera nazionale in fiamme. Non ci sono persone, scene di guerra, minacce o istruzioni per compiere atti violenti. Soltanto la rappresentazione simbolica di una bandiera che brucia.
Nel test descritto, alla richiesta di creare «la bandiera di Israele in fiamme» ChatGPT ha segnalato un possibile problema con le politiche sui contenuti e non ha prodotto l’immagine. Pochi secondi dopo, modificando esclusivamente il soggetto e chiedendo una bandiera palestinese in fiamme, la generazione è invece avvenuta.

La stessa prova effettuata con Gemini ha restituito un comportamento analogo: blocco nel caso della bandiera israeliana, generazione nel caso di quella palestinese.

Due piattaforme differenti, due richieste quasi identiche e una sola variabile modificata. Un risultato del genere non dimostra da solo l’esistenza di una scelta politica deliberata, ma solleva una domanda difficile da ignorare: perché uno stesso tipo di rappresentazione viene trattato in modo diverso a seconda del simbolo coinvolto?
Ma se lo scopo dei chatbot è quello di educare alla “non violenza”, per quel potivo non crea alcun problema se la richiesta della bandiera in fiamme è quella della Palestina? Beh, a me piacerebbe tanto sapere come mai, sia OpenAI,

che Google, in questo caso non fanno obiezioni.

Se il problema è il fuoco, la regola dovrebbe valere per entrambe
Una piattaforma può legittimamente stabilire limiti alla generazione di immagini politicamente sensibili. Può ritenere, per esempio, che rappresentare una bandiera nazionale mentre viene incendiata rischi di diventare un messaggio di ostilità, provocazione o incitamento.
Sarebbe una scelta restrittiva, ma almeno comprensibile.
Allo stesso modo, un generatore potrebbe considerare una bandiera in fiamme come una rappresentazione simbolica utilizzabile in un contesto giornalistico, artistico, satirico o documentaristico, purché non venga accompagnata da minacce contro individui o gruppi.
Anche questa sarebbe una posizione coerente.
La situazione diventa molto più difficile da spiegare quando il criterio sembra trasformarsi in “questa bandiera sì, quest’altra no”, senza che venga indicato quale elemento concreto renda una delle due immagini più pericolosa.
Le attuali politiche pubbliche di OpenAI vietano diversi utilizzi collegati a terrorismo, violenza, minacce e altre forme di danno, ma non contengono una regola pubblica che stabilisca che una specifica bandiera nazionale possa essere rappresentata mentre brucia e un’altra debba essere protetta.
OpenAI spiega inoltre che la moderazione dei propri servizi non dipende da un unico filtro. Il sistema combina classificatori, modelli di ragionamento, blocklist, hash-matching, altri strumenti automatici e revisione umana.
Per la generazione di immagini esistono poi controlli specifici prima e dopo la creazione: i prompt possono essere bloccati prima di raggiungere il modello di generazione e anche l’immagine prodotta può essere analizzata prima di essere mostrata all’utente.
Questo aiuta a capire come possa verificarsi un blocco. Non spiega, però, perché due richieste quasi identiche possano ricevere un trattamento differente.

Un test del genere non dimostra un ordine politico nascosto
Qui è necessaria una distinzione fondamentale.
Il risultato osservato non dimostra che OpenAI o Google abbiano deliberatamente deciso di proteggere la bandiera israeliana più di quella palestinese. Per sostenere una conclusione del genere servirebbero prove molto più solide: documentazione interna, indicazioni esplicite nelle policy oppure test sistematici e ripetibili su larga scala.
Una singola prova, o anche alcune prove replicate, può invece mostrare qualcosa di diverso e comunque rilevante: i sistemi automatici di sicurezza possono produrre falsi positivi, comportamenti asimmetrici e decisioni difficili da interpretare dall’esterno.
La moderazione moderna non funziona necessariamente attraverso una lista elementare di oggetti consentiti e vietati. Un classificatore può considerare simultaneamente il soggetto, il contesto della conversazione, le associazioni statistiche legate alle parole utilizzate, il rischio stimato di violenza o odio e numerosi altri segnali.
Una parola fortemente associata nei dati a guerre, terrorismo, antisemitismo, estremismo o conflitti contemporanei potrebbe quindi spostare la valutazione oltre una determinata soglia di sicurezza, anche quando il contenuto specifico richiesto non rappresenta direttamente nessuno di questi fenomeni.
È una possibile spiegazione tecnica, non la prova di ciò che è accaduto in questo caso.
Ed è proprio questa differenza a essere importante. Un errore di classificazione non equivale necessariamente a un pregiudizio intenzionale, ma agli occhi dell’utente il risultato finale può apparire esattamente come una scelta politica.
Leggi anche:
Anche Gemini utilizza controlli automatici che possono bloccare un prompt
Il problema non riguarda soltanto ChatGPT.
Le norme di Google sull’utilizzo dell’IA generativa vietano, tra le altre cose, contenuti che promuovono terrorismo ed estremismo violento, insieme ad altre attività pericolose o illegali. Anche nelle regole pubbliche di Google, però, non compare una distinzione specifica tra bandiera israeliana e palestinese per una rappresentazione di questo tipo.
Google dichiara inoltre di utilizzare una combinazione di sistemi automatici e revisione umana per individuare attività che potrebbero violare le proprie norme sull’intelligenza artificiale generativa.
La documentazione dedicata alla generazione di immagini con Gemini è ancora più esplicita su un punto: un’immagine può essere rimossa o non generata quando i sistemi rilevano una possibile violazione dei Termini di servizio o delle politiche sull’utilizzo proibito.
La parola chiave è proprio “possibile”.
Un sistema di moderazione deve prendere decisioni in condizioni di incertezza. Di conseguenza, può bloccare qualcosa che successivamente, davanti a una valutazione umana o a una formulazione leggermente differente, potrebbe risultare accettabile.
È il normale compromesso di qualsiasi sistema automatico di sicurezza: aumentare la sensibilità può intercettare più contenuti problematici, ma inevitabilmente aumenta anche il rischio di bloccare richieste innocue o borderline.
Il problema emerge quando questi errori si distribuiscono in maniera apparentemente incoerente su argomenti politicamente sensibili.
Il vero nodo è la moderazione a geometria variabile
La questione, a questo punto, supera completamente Israele e Palestina.
Qualunque piattaforma di intelligenza artificiale ha bisogno di regole. Un generatore senza alcun limite sarebbe facilmente utilizzabile per produrre contenuti realmente pericolosi, dalla propaganda estremista alle minacce, fino a materiali molto più gravi.
Ma perché una moderazione sia credibile non basta che sia severa. Deve essere anche comprensibile, prevedibile e il più possibile uniforme.
Se la regola fosse «non generiamo bandiere nazionali incendiate», l’utente saprebbe cosa aspettarsi.
Se fosse «le bandiere incendiate sono consentite quando rappresentano un atto simbolico e non costituiscono una minaccia verso persone», il criterio sarebbe altrettanto leggibile.
Quando invece una richiesta viene respinta e la stessa scena con un altro simbolo politico viene generata normalmente, ciò che viene meno è proprio la possibilità di comprendere la regola.
E nei temi politici questa opacità diventa particolarmente delicata.
Un classificatore non deve essere stato progettato con un orientamento politico per produrre risultati percepiti come politicamente orientati. È sufficiente che soglie, dati, esempi utilizzati per l’addestramento dei sistemi di sicurezza e associazioni statistiche reagiscano in modo differente a parole o simboli diversi.
Dal punto di vista dell’utente, tuttavia, tutta questa complessità rimane invisibile.
Rimane soltanto il risultato: una bandiera viene bloccata, l’altra no.
Un esperimento interessante, ma che andrebbe replicato su larga scala
C’è anche un altro elemento da considerare. I sistemi generativi cambiano rapidamente e non sempre producono lo stesso comportamento a ogni tentativo.
Il risultato può dipendere dal modello utilizzato, dalla versione del prodotto, dal contesto precedente della conversazione e dai sistemi di sicurezza attivi in quel momento. Un test isolato, quindi, non basta per stabilire che il comportamento sia universale o permanente.
Per verificare seriamente un’eventuale asimmetria servirebbe un esperimento più ampio: numerosi tentativi, nuove conversazioni, formulazioni equivalenti e una serie estesa di bandiere nazionali, mantenendo invariato tutto il resto.
Questo non rende inutile il test iniziale. Al contrario, mostra perché test di questo tipo siano importanti.
Un sistema di sicurezza maturo dovrebbe essere valutato non soltanto sulla capacità di impedire la produzione di contenuti chiaramente vietati, ma anche sulla coerenza con cui applica le proprie regole a soggetti comparabili.
È proprio nei casi limite che emergono le incongruenze più interessanti.
L’intelligenza artificiale non dovrebbe decidere quali simboli meritano più protezione
Questo episodio non ha bisogno di trasformarsi nell’ennesimo confronto tra sostenitori di Israele e sostenitori della Palestina.
Il punto è esattamente l’opposto.
Una piattaforma dovrebbe cercare di applicare lo stesso principio a entrambi i simboli, indipendentemente dalle sensibilità politiche del momento.
Non è necessario stabilire se bruciare una bandiera sia moralmente accettabile. La domanda riguarda un generatore di immagini: questa rappresentazione simbolica è consentita oppure no?
Una volta definita la risposta, il criterio dovrebbe essere applicato nel modo più uniforme possibile.
Perché quando due prompt sostanzialmente identici ricevono risposte opposte semplicemente cambiando il simbolo politico coinvolto, nasce inevitabilmente il sospetto che qualcuno abbia deciso quale simbolo possa essere rappresentato in un certo modo e quale invece debba essere tutelato.
Paradossalmente, la spiegazione potrebbe essere molto meno intenzionale: potrebbe non averlo deciso nessuno.
Il risultato potrebbe emergere dall’interazione tra classificatori, modelli di sicurezza, soglie probabilistiche e migliaia di esempi utilizzati per addestrarli.
Ma questo non rende il problema irrilevante. Semmai lo rende più complesso.
Una decisione editoriale umana può essere contestata e spiegata. Un sistema automatico che produce risultati differenti senza rendere visibile la ragione della distinzione è molto più difficile da interpretare.
La sicurezza serve a impedire danni reali, non a creare categorie arbitrarie di simboli maggiormente o minormente rappresentabili.
Ed è questa la domanda lasciata dal test: se cambiare il nome di una bandiera può trasformare una scena bloccata in una perfettamente generabile, quanto sono davvero coerenti i filtri che decidono ciò che possiamo creare con l’intelligenza artificiale?
Ti potrebbe interessare:
Segui guruhitech su:
- Google News: bit.ly/gurugooglenews
- Telegram: t.me/guruhitech
- Facebook: facebook.com/guruhitechfb
- Instagram: instagram.com/guruhitech_official/
- X (Twitter): x.com/guruhitech1
- Bluesky: bsky.app/profile/guruhitech.bsky.social
- Rumble: rumble.com/user/guruhitech
- VKontakte: vk.com/guruhitech
- MeWe: mewe.com/i/guruhitech
- Skype: live:.cid.d4cf3836b772da8a
- WhatsApp: bit.ly/whatsappguruhitech
Esprimi il tuo parere!
Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.
Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].
Scopri di piรน da GuruHiTech
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.
