La battaglia sul copyright nell'intelligenza artificiale si allarga ancora. Sony Music e Warner Music hanno presentato una causa contro Anthropic presso un tribunale federale della California, accusando l'azienda di aver utilizzato materiale musicale protetto da copyright per l'addestramento dei suoi modelli di intelligenza artificiale. 
Secondo la denuncia, i modelli Claude sarebbero stati addestrati utilizzando testi di canzoni e spartiti senza le necessarie autorizzazioni. I publisher sostengono inoltre che il sistema possa arrivare a riprodurre opere protette in modo sostanzialmente fedele.
Il nodo è l'addestramento dell'AI
Il caso porta al centro una delle questioni più importanti dell'attuale sviluppo dell'intelligenza artificiale: quali contenuti possono essere utilizzati per addestrare un modello?
Le aziende AI hanno bisogno di enormi quantità di dati per sviluppare modelli sempre più capaci. Per l'industria musicale, però, testi, spartiti e registrazioni rappresentano proprietà intellettuale che può avere un valore commerciale significativo.
Anthropic sostiene che le proprie pratiche di addestramento rientrino nei limiti del fair use statunitense e ha dichiarato di essere pronta a difendersi in tribunale. La posizione dei publisher è invece che l'utilizzo non autorizzato delle opere rappresenti una violazione del copyright.
Perché questa causa è importante
La controversia non riguarda soltanto Anthropic. Negli ultimi mesi sono aumentate le azioni legali contro le aziende che sviluppano sistemi di AI generativa, mentre editori, autori e industrie creative cercano di stabilire nuove regole sull'utilizzo dei contenuti protetti.
La causa di Sony Music e Warner Music arriva inoltre dopo altre controversie simili nel settore musicale. Questo potrebbe aumentare la pressione sulle aziende AI affinché trovino accordi di licenza con i titolari dei diritti oppure sviluppino sistemi più rigorosi per controllare i dati utilizzati durante l'addestramento.
Il problema potrebbe arrivare anche all'output
Un altro aspetto delicato riguarda ciò che un modello genera dopo essere stato addestrato. Se un sistema producesse testi o altri contenuti troppo simili a opere esistenti, si aprirebbe un'ulteriore questione sulla responsabilità e sui limiti della generazione automatica.
Per l'industria tecnologica il rischio è quindi duplice: da una parte l'accesso ai dati necessari per addestrare modelli sempre più potenti, dall'altra la necessità di evitare che questi modelli riproducano materiale protetto o competano direttamente con i creatori delle opere originali.
Una partita che può cambiare l'AI
Il risultato della causa potrebbe avere conseguenze ben oltre il settore musicale. Se i tribunali dovessero stabilire limiti più rigidi sull'utilizzo di materiale protetto durante l'addestramento, le aziende AI potrebbero essere costrette a rivedere parte delle proprie strategie sui dati e aumentare il ricorso a contenuti autorizzati.
Se invece le aziende tecnologiche ottenessero maggiore protezione per le proprie pratiche di addestramento, l'industria creativa potrebbe dover cercare nuove modalità per monetizzare l'utilizzo delle proprie opere nell'era dell'AI.
Una cosa è già chiara: la prossima fase della corsa all'intelligenza artificiale non si giocherà soltanto sulla potenza dei modelli, ma anche sulla proprietà dei dati con cui vengono costruiti.