Meta e i libri pirata per Llama: OpenAI e Anthropic restano fuori dalla battaglia sul torrenting

La disputa legale sull’utilizzo di libri provenienti da shadow library per addestrare i modelli di intelligenza artificiale di Meta entra in una nuova fase. Al centro dello scontro non c’è più soltanto il modo in cui i contenuti sarebbero stati utilizzati per il training di Llama, ma anche ciò che sarebbe accaduto durante il loro download tramite BitTorrent.
Alcuni editori hanno cercato di coinvolgere OpenAI e Anthropic per verificare se altre aziende di intelligenza artificiale fossero riuscite a scaricare raccolte analoghe impedendo il caricamento dei file verso altri utenti. Il tentativo, però, è stato respinto dal tribunale: secondo il giudice, per valutare la posizione di Meta è più utile analizzare direttamente il software BitTorrent e soprattutto i dati conservati sui server della società.
Il nodo del seeding durante il download dei libri
La controversia nasce nel più ampio contesto delle cause intentate contro le aziende di intelligenza artificiale per l’impiego di opere protette dal diritto d’autore.
Tra queste c’è la class action promossa da autori come Richard Kadrey e Sarah Silverman, che hanno accusato Meta di aver utilizzato libri pirata per addestrare i modelli Llama e di averli contemporaneamente condivisi con altri utenti attraverso BitTorrent.
Nell’estate precedente, il giudice Vince Chhabria aveva stabilito nel caso in questione che l’addestramento dei modelli costituisse fair use, lasciando però aperte le contestazioni riguardanti la distribuzione dei contenuti tramite torrent.
In seguito, Meta ha introdotto un’ulteriore linea difensiva. Secondo la società, l’utente ha effettuato gli eventuali upload durante il download dei dataset come parte integrante di un’attività ritenuta legittima.
La società ha inoltre sostenuto che BitTorrent rappresentasse un sistema più efficiente e affidabile per ottenere i dataset e che, nel caso di Anna’s Archive, fosse l’unico metodo disponibile per recuperarli in grandi quantità. La condivisione tra utenti sarebbe quindi derivata dal funzionamento stesso del protocollo, nel quale chi scarica può contemporaneamente distribuire parti dei file ad altri partecipanti.
Queste argomentazioni vengono ora messe alla prova anche in tre controversie correlate promosse da Chicken Soup for the Soul, dall’editore accademico Cognella e dalla Cambronne Inc. di John Carreyrou. Anche questi procedimenti sono stati assegnati al giudice Chhabria e riguardano la stessa attività di download dalle shadow library.
Perché gli editori volevano i dati di OpenAI e Anthropic
Per contestare la tesi di Meta, gli editori hanno provato a ottenere informazioni da due dei suoi principali concorrenti nel settore dell’IA.
Ad agosto hanno citato OpenAI e Anthropic chiedendo informazioni sui client torrent utilizzati dalle due aziende a partire dal 2019, comprese versioni, configurazioni ed eventuali registrazioni relative alle misure adottate per impedire il seeding.
Il ragionamento degli editori era relativamente semplice: se un’altra società fosse riuscita a utilizzare BitTorrent per ottenere dataset simili disattivando gli upload, sarebbe stato possibile contestare l’idea secondo cui la redistribuzione rappresentasse una conseguenza inevitabile dell’utilizzo del protocollo.
La questione è diventata ancora più rilevante dopo l’emersione, nel corso della battaglia giudiziaria, di uno script realizzato da un ingegnere di Meta con l’obiettivo di impedire il seeding, apparentemente senza bloccare il download.
Gli editori avevano proposto anche una soluzione meno invasiva. OpenAI e Anthropic potevano semplicemente spiegare come avevano ottenuto i dati delle shadow library e se avessero adottato misure per evitare l’upload di contenuti verso altri utenti. In cambio, gli editori avrebbero abbandonato le richieste più dettagliate sui documenti relativi ai torrent.
Le due società non hanno accettato.

Leggi anche:
OpenAI e Anthropic: i nostri torrent non dimostrano cosa abbia fatto Meta
La posizione di Anthropic è stata che i client BitTorrent non possono essere considerati automaticamente equivalenti. Software differenti possono avere impostazioni predefinite diverse per gli upload, offrire differenti possibilità di configurazione e consentire o meno di interrompere il caricamento durante o dopo il download.
Di conseguenza, conoscere ciò che permetteva di fare il client utilizzato da Anthropic non dimostrerebbe necessariamente cosa fosse possibile fare con quello impiegato da Meta.
OpenAI ha sostenuto una posizione analoga, sottolineando che non sarebbe stato dimostrato l’utilizzo degli stessi client torrent né la creazione di raccolte direttamente comparabili a quelle ottenute da Meta.
Il Magistrate Judge Thomas Hixson ha dato ragione alle due aziende. Senza pronunciarsi sulla validità della difesa di Meta relativa al seeding, il giudice ha stabilito che i registri torrent dei concorrenti non rappresentano lo strumento più appropriato per verificare le affermazioni della società.
Se la difesa di Meta dipende dalla tesi secondo cui BitTorrent non avrebbe potuto essere utilizzato diversamente, la questione può essere verificata esaminando direttamente le caratteristiche tecniche dei client torrent.
Gli esperti dei ricorrenti possono quindi studiare il funzionamento del software e determinare quali configurazioni fossero effettivamente disponibili, senza utilizzare i dati interni di OpenAI e Anthropic come termine di paragone.
Anche l’affermazione secondo cui determinate raccolte delle shadow library fossero disponibili in massa soltanto tramite torrent potrebbe essere verificata direttamente presso le fonti interessate, invece di ricostruirla attraverso le attività di altre aziende di IA.
I server di Meta diventano la fonte principale delle prove
Tuttavia, l’esclusione di OpenAI e Anthropic da questa parte della discovery non priva gli editori degli strumenti per approfondire la vicenda.
La situazione cambia radicalmente quando si tratta dei dati di diretta proprietà di Meta.
L’11 settembre, Hixson ha accolto una richiesta presentata nella class action collegata promossa da Kadrey e da altri autori. L’ordine riguarda i file con la cronologia dei comandi dei server che Meta utilizzava per le attività torrent, comprese macchine virtuali e istanze AWS.
Questi dati potrebbero rivelarsi fondamentali. La cronologia dei comandi permette infatti di ricostruire le istruzioni che gli operatori hanno impartito ai sistemi e può mostrare come il personale abbia installato e configurato il software torrent, comprese le eventuali modifiche alle impostazioni di upload.
La questione risale all’inizio del 2025, quando Meta aveva ammesso di non aver consegnato alcuni documenti rilevanti prima della scadenza della discovery. In seguito, il giudice Chhabria aveva concesso agli autori ulteriori possibilità di raccogliere prove, incluse le informazioni sulle modalità con cui la società aveva configurato e impiegato i propri client torrent.
Meta riteneva sufficienti i file di log già forniti, ma Hixson non ha condiviso questa posizione e ha ordinato la consegna delle cronologie dei comandi.
La configurazione dei torrent potrebbe diventare decisiva
Gli autori sperano che i nuovi dati permettano anche di stabilire con maggiore precisione quali opere protette da copyright siano state scaricate attraverso i sistemi di Meta. Al momento, tuttavia, non è possibile sapere se le cronologie dei server conterranno effettivamente informazioni sufficienti per arrivare a questa conclusione.
Il punto centrale della controversia rimane quindi aperto: stabilire se Meta avrebbe potuto ottenere i libri attraverso BitTorrent senza redistribuirli ad altri utenti e quale fosse realmente la configurazione adottata sui propri sistemi.
Per rispondere non saranno utilizzate le configurazioni di OpenAI o Anthropic. Saranno invece gli esperti dei ricorrenti a esaminare le caratteristiche tecniche dei client torrent e, soprattutto, i registri provenienti dall’infrastruttura della stessa Meta.
È proprio da questi dati che potrebbero emergere gli elementi più importanti per stabilire cosa sia realmente accaduto durante il download dei dataset utilizzati nello sviluppo di Llama.
Ti potrebbe interessare:
Segui guruhitech su:
- Google News: bit.ly/gurugooglenews
- Telegram: t.me/guruhitech
- Facebook: facebook.com/guruhitechfb
- Instagram: instagram.com/guruhitech_official/
- X (Twitter): x.com/guruhitech1
- Bluesky: bsky.app/profile/guruhitech.bsky.social
- Rumble: rumble.com/user/guruhitech
- VKontakte: vk.com/guruhitech
- MeWe: mewe.com/i/guruhitech
- Skype: live:.cid.d4cf3836b772da8a
- WhatsApp: bit.ly/whatsappguruhitech
Esprimi il tuo parere!
Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.
Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].
Scopri di piรน da GuruHiTech
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.
