News

ChatGPT, gli autori accusano OpenAI: “Costruito sulla pirateria di massa”

La battaglia legale sul materiale utilizzato per addestrare i modelli di intelligenza artificiale entra in una nuova fase. Un gruppo di autori sostiene che OpenAI abbia utilizzato senza autorizzazione copie di libri protetti da copyright per sviluppare i suoi modelli GPT, arrivando ad accusare la società di aver costruito le fondamenta della propria attività sulla «pirateria di massa».

Le accuse emergono da una mozione per il giudizio sommario presentata nell’ambito dei procedimenti sul copyright riuniti davanti al giudice Sidney Stein a New York. Gli autori chiedono al tribunale di stabilire, prima di un eventuale processo, che la copia delle loro opere sia avvenuta senza autorizzazione e che tale utilizzo non possa essere considerato fair use.

La richiesta riguarda 194 titoli e, in questa fase, punta a ottenere una decisione sulla responsabilità, non sulla quantificazione degli eventuali danni.

Le accuse sui libri provenienti da LibGen

Uno dei punti centrali della controversia riguarda la provenienza dei libri utilizzati per l’addestramento dei primi modelli.

Secondo quanto sostenuto dagli autori nella documentazione depositata in tribunale, OpenAI avrebbe acquisito libri tramite Library Genesis (LibGen), una biblioteca digitale non autorizzata nota per distribuire copie di opere protette da copyright.

Il documento presentato dagli autori contiene diverse parti oscurate, ma sostiene che OpenAI avrebbe scaricato tramite torrent libri provenienti da LibGen anziché acquistare regolarmente le opere.

Gli autori sottolineano inoltre che, all’epoca dei fatti contestati, LibGen era già comparsa nell’elenco dei mercati considerati problematici per la pirateria dall’U.S. Trade Representative. Secondo la loro ricostruzione, quindi, OpenAI sarebbe stata consapevole della natura controversa della fonte.

Un altro elemento portato all’attenzione del tribunale riguarda la terminologia utilizzata per descrivere alcuni dataset. Gli autori affermano che raccolte precedentemente indicate internamente come “Libgen1” e “Libgen2” sarebbero successivamente comparse nel documento tecnico dedicato a GPT-3 con i nomi più generici “Books1” e “Books2”.

Per i ricorrenti, questo cambiamento sarebbe un indizio della volontà di non rendere evidente l’origine dei dati. Si tratta, tuttavia, della ricostruzione avanzata dalla parte che ha presentato la mozione e non di una conclusione definitiva del tribunale.

La cancellazione dei dataset e le preoccupazioni legali

Le contestazioni non si fermano alla denominazione delle raccolte. Secondo la mozione, OpenAI avrebbe eliminato i propri file provenienti da LibGen nell’estate del 2022 per preoccupazioni di natura legale.

Gli autori sostengono inoltre che questi sarebbero gli unici due corpus di addestramento eliminati dall’azienda.

Prima della cancellazione, secondo l’accusa, il materiale sarebbe già stato utilizzato per addestrare i primi modelli GPT. Da qui una delle affermazioni più dure contenute nella documentazione: OpenAI avrebbe costruito le basi della propria attività sulla “pirateria di massa”.

La questione è particolarmente importante perché distingue due aspetti che possono avere conseguenze giuridiche differenti: l’impiego di un’opera protetta per addestrare un modello di IA e il modo in cui la copia di quell’opera è stata inizialmente ottenuta.

Leggi anche:

Il caso George R.R. Martin e le dichiarazioni sull’IA

La mozione affronta anche il possibile impatto dell’intelligenza artificiale sul lavoro degli scrittori.

Tra gli elementi citati compare Tarun Gogineni, entrato in OpenAI nel 2022 per lavorare sulla qualità della scrittura prodotta dai modelli. Gli autori richiamano alcune sue dichiarazioni pubbliche per sostenere che all’interno dell’azienda fosse prevista la possibilità che i sistemi di IA sostituissero almeno parte del lavoro degli scrittori.

Particolare attenzione viene dedicata a George R.R. Martin, uno degli autori coinvolti nel contenzioso e creatore della saga A Song of Ice and Fire, dalla quale è stata tratta la serie televisiva Game of Thrones.

Secondo la mozione, nel 2025, quasi due anni dopo l’avvio della causa di Martin, Gogineni avrebbe scritto pubblicamente che uno dei suoi obiettivi di ricerca era arrivare a modelli GPT capaci di scrivere gli ultimi due libri della saga.

Gli autori utilizzano queste dichiarazioni per sostenere una tesi più ampia: i sistemi sarebbero stati sviluppati utilizzando opere di scrittori con l’obiettivo di raggiungere capacità potenzialmente in concorrenza con quelle degli stessi autori.

Il nodo decisivo del fair use

Al centro dello scontro rimane il fair use, principio del diritto statunitense che, in determinate circostanze, consente l’utilizzo di opere protette da copyright senza il consenso del titolare.

Le aziende che sviluppano modelli di intelligenza artificiale hanno sostenuto in diversi procedimenti che l’addestramento dei sistemi possa rientrare in questa categoria. La questione, tuttavia, diventa più complessa quando i dati utilizzati provengono da fonti non autorizzate.

Gli autori richiamano in particolare Bartz v. Anthropic, procedimento nel quale nel 2025 un tribunale della California ha distinto l’addestramento dei modelli dall’acquisizione delle opere. In quella decisione, l’uso dei libri per l’addestramento poteva beneficiare della protezione del fair use in determinate circostanze, mentre l’acquisizione di copie attraverso una biblioteca pirata è stata trattata separatamente e giudicata illecita.

I ricorrenti sostengono inoltre che la copia delle loro opere non fosse indispensabile per realizzare un modello di intelligenza artificiale generalista. Questo argomento mira a indebolire ulteriormente la difesa basata sul fair use.

Anche Microsoft coinvolta nella battaglia legale

Il procedimento non riguarda esclusivamente OpenAI. Gli autori chiedono al tribunale di riconoscere anche una responsabilità indiretta di Microsoft, sostenendo che l’azienda avesse la possibilità di esercitare un controllo sulla condotta contestata e che ne abbia ottenuto benefici economici.

Nella mozione vengono ricordati gli investimenti di Microsoft in OpenAI, effettuati attraverso accordi siglati nel 2019, 2021 e 2023, per un valore complessivo indicato dagli autori in circa 13 miliardi di dollari.

Anche questa parte rappresenta una tesi dei ricorrenti sulla quale sarà il tribunale a pronunciarsi.

OpenAI, dal canto suo, ha presentato nello stesso giorno una propria mozione incrociata per il giudizio sommario, sostenendo una posizione opposta: secondo la società, l’impiego dei libri per l’addestramento rientrerebbe nel fair use e i casi in cui i modelli riproducono parti dei contenuti appresi sarebbero estremamente rari.

Una causa che potrebbe pesare sul futuro dell’IA

La disputa si inserisce in uno scontro giudiziario molto più ampio sull’uso di materiale protetto da copyright per sviluppare sistemi di intelligenza artificiale generativa.

Negli ultimi anni autori, editori e organizzazioni dei media hanno avviato numerosi procedimenti contro le aziende del settore. Nello stesso fronte giudiziario contro OpenAI e Microsoft sono arrivate iniziative anche da parte di soggetti come The New York Times, Daily News e Center for Investigative Reporting.

La posta in gioco supera quindi il risarcimento economico richiesto nei singoli procedimenti. Le decisioni dei tribunali potrebbero contribuire a definire come le aziende di IA potranno ottenere e utilizzare opere protette per addestrare i propri modelli, distinguendo eventualmente tra l’uso successivo dei contenuti e il modo in cui questi vengono acquisiti.

Per il momento, le accuse sulla presunta “pirateria di massa” restano contestazioni formulate dagli autori nell’ambito di un procedimento ancora in corso. Saranno le decisioni del tribunale a stabilire quali di queste ricostruzioni abbiano fondamento giuridico e quali conseguenze potranno avere per OpenAI, Microsoft e, più in generale, per l’industria dell’intelligenza artificiale.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di piรน da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Piรน recenti
Vecchi Le piรน votate