Nieuw vrijgegeven gerechtelijke documenten leggen diepe interne twijfels bloot bij Microsoft en OpenAI over de vraag of hun kunstmatige intelligentiesystemen waren getraind met materiaal van nieuwsuitgevers zonder toestemming.
De stukken komen uit de prominente rechtszaak die is aangespannen door The New York Times en elf andere uitgevers. Zij beschuldigen de techbedrijven ervan auteursrechtelijk beschermde artikelen te hebben gebruikt om grote taalmodellen te bouwen zonder licenties.
Het kernconflict draait om fair use, het juridische principe dat beperkt gebruik van auteursrechtelijk materiaal zonder toestemming toestaat. Techbedrijven stellen dat hun trainingsmethoden kwalificeren als transformatieve innovatie. Uitgevers daarentegen beweren dat de praktijk neerkomt op diefstal op ongekende schaal.
Een intern Microsoft-document uit 2023 dat in de stukken is vastgelegd, waarschuwt dat miljoenen mensen de grootschalige verzameling van hun werk zullen zien als "een verbijsterende diefstal van ongekende proporties". Het document merkt op dat makers nooit toestemming hebben gegeven voor dergelijk gebruik en geen compensatie ontvangen.
Brent Hecht, Microsoft Director of Applied Science, beschreef de opname van auteursrechtelijk beschermde werken volgens de documenten als mogelijk "de grootste diefstal van arbeid in de menselijke geschiedenis".
De documenten beschrijven ook een uitwisseling met OpenAI-president Greg Brockman. Een engineer noemde een "hack om de nytimes-paywall te omzeilen". Brockman antwoordde: "Ah nice."
Alles wat achter een betaalmuur zit, moet worden gelicentieerd door iedereen die het wil gebruiken.
Nick Turley, OpenAI hoofd van ChatGPT, verklaarde in de documenten dat de producten van het bedrijf "grotendeels substituerend zijn, punt". Uitgevers hebben gevallen gedocumenteerd waarin chatbots bijna volledige artikelen letterlijk reproduceerden, wat ver uitstijgt boven typische zoekresultaten.
Interne data toonden aan dat de Times een daling van 87 tot 93 procent in doorklikpercentages ondervond wanneer gebruikers Bing Chat gebruikten in plaats van standaard zoekresultaten. De documenten stellen dat ongeautoriseerde training bestaande en toekomstige licentieovereenkomsten ondermijnt.
In dit stadium rust op Microsoft en OpenAI de bewijslast om aan te tonen dat hun handelingen voldoen aan de criteria voor fair use. De documenten suggereren dat leiders risico’s onderkenden die die verdediging konden ondermijnen, waaronder mogelijke schendingen van ethische normen en betaalmuurbeperkingen.