Une procédure judiciaire d'envergure met en lumière les méthodes de collecte de données d'OpenAI. Des auteurs de renom, dont George R.R. Martin, accusent l'entreprise d'avoir utilisé des milliers d'ouvrages issus de bibliothèques pirates pour entraîner ses modèles, remettant en question la légitimité de ses fondations technologiques.
Des preuves de dissimulation de sources
La requête déposée devant un tribunal fédéral de New York détaille une stratégie de dissimulation orchestrée par OpenAI. Selon les plaignants, l'entreprise aurait téléchargé massivement des contenus depuis la plateforme illégale Library Genesis (LibGen). Pour masquer l'origine de ces données, les jeux de données internes, initialement nommés « Libgen1 » et « Libgen2 », auraient été renommés « Books1 » et « Books2 » dans les documents de recherche officiels. Ces fichiers ont été supprimés par l'entreprise à l'été 2022, une décision que les auteurs interprètent comme une tentative d'effacer des preuves compromettantes.
Le défi juridique du « fair use »
OpenAI invoque le principe du « fair use » (usage équitable) pour justifier l'entraînement de ses modèles. Toutefois, cette défense se heurte à une jurisprudence de plus en plus stricte. En s'appuyant sur le précédent Bartz v. Anthropic, les plaignants soulignent que si l'entraînement sur des données acquises légalement peut être toléré, l'utilisation de sources issues de la contrefaçon est jugée « irrémédiablement contrefaisante ». Cette distinction pourrait fragiliser la position d'OpenAI, indépendamment de la nature technologique de son outil.
Un enjeu de souveraineté et de régulation
Le dossier prend une dimension politique avec l'intervention du ministère de la Justice américain (DOJ). Dans un Statement of Interest, le DOJ a plaidé en faveur d'OpenAI, évoquant des impératifs de sécurité nationale face à la concurrence chinoise dans le domaine de l'IA. Cette position crée une tension entre la protection de la propriété intellectuelle des créateurs et les ambitions stratégiques des États-Unis. L'issue de ce procès pourrait définir un cadre légal contraignant pour l'ensemble du secteur de l'intelligence artificielle, forçant les entreprises à une transparence accrue sur la provenance de leurs données d'entraînement.