ROMA (Public Policy Bytes) – Nuovi dettagli emersi da documenti depositati nell’ambito della causa intentata dal New York Times contro OpenAI e Microsoft per violazione del diritto d’autore indicano che i vertici delle due aziende avrebbero equiparato lo scraping di dati e contenuti per addestrare i modelli di intelligenza artificiale a un furto che avrebbe rappresentato una minaccia per il settore dell’editoria.
Il materiale riporta delle dichiarazioni in cui Brent Hecht, all’epoca direttore della scienza applicata in Microsoft, definiva le pratiche di scraping dati come “il più grande furto nella storia del genere umano”, dalle “proporzioni sbalorditive”. Sul fronte OpenAI, il responsabile di ChatGPT Nick Turley ha descritto i modelli di IA come una “minaccia esistenziale” per gli editori, destinata progressivamente a sostituirli.
Quanto emerso punta a indebolire la linea difensiva delle aziende, che sostengono che l’uso di materiale protetto da diritto d’autore per addestrare i modelli di IA rientra nei casi di cosiddetto “fair use” (uso legittimo), principio legale che consente l’impiego di opere coperte da copyright per scopi trasformativi, a condizione che non compromettano il mercato dell’originale. La posizione delle big tech è stata anche pubblicamente difesa dall’amministrazione Trump in una memoria depositata nell’ambito del processo. Alcuni dati raccolti da Microsoft mostrano che la funzione “answer engine” del suo chatbot Copilot ha causato un crollo della percentuale di clic verso il sito internet del New York Times fino al 93% rispetto alla ricerca tradizionale sul motore di ricerca Bing. Hecht ha definito il dato una “spirale negativa” in grado di danneggiare sia le prestazioni dei modelli IA che l’intero ecosistema di internet.
In una deposizione rilasciata di inizio 2026, l’amministratore delegato di Microsoft Satya Nadella, aveva dichiarato sotto giuramento che i contenuti protetti da paywall sui siti web degli editori dovrebbero essere soggetti al pagamento di una licenza per essere utilizzati nell’addestramento dei modelli. Nadella ha precisato che, se fosse stato a conoscenza di operazioni di scraping di dati a pagamento da parte di OpenAI, avrebbe esercitato il diritto di Microsoft di imporre un nuovo addestramento dei sistemi. Il vertice del colosso di Redmond inoltre ammesso che l’interazione con i chatbot sostituisce la necessità di consultare la fonte originale. I documenti suggeriscono tuttavia un sistematico aggiramento delle restrizioni: in uno scambio di messaggi, il presidente di OpenAI Greg Brockman avrebbe elogiato un ricercatore che proponeva un espediente per superare il paywall che limitano l’accesso ad alcuni articoli del quotidiano newyorkese ai soli abbonati.
Il documenti depositati quantificano anche la scala dell’operazione. I soli set di dati intermedi di OpenAI includono oltre 91.692 copie di articoli di New York Times, Daily News e Center for Investigative Reporting, mentre un archivio derivato dal repository open-source Common Crawl contiene più di 2 milioni di documenti del solo sito web del Nyt. (Public Policy Bytes) DVZ




