Le développement fulgurant de l’IA s’est appuyé sur l’idée que toutes les données peuvent être utilisées comme matière première pour l’entraînement de nouveaux modèles. Il n’est donc pas étonnant que les questions de propriété et de vol de droits de propriété intellectuelle deviennent des sujets épineux au sein de l’industrie technologique.
Jeudi, la startup chinoise JoyIn, spécialisée dans la robotique et développeuse d’un modèle nommé Aether, a accusé OpenAI d’avoir distillé ses systèmes d’IA et d’avoir volé l’esthétique cosmique du design de son site web pour le lancement et l’image de marque de GPT-6 Astra. Dans une lettre ouverte rédigée en chinois, Guo Renjie, le PDG de JoyIn, a indiqué que son entreprise avait entamé la procédure pour déposer une action en justice, selon une traduction fournie par CNBC. (Gizmodo n’a pas vérifié ce rapport de manière indépendante.)
La distillation est une pratique courante dans l’industrie, au cours de laquelle des développeurs utilisent un modèle plus vaste et plus avancé comme une sorte de « professeur » pour aider à former un modèle plus petit, dit « étudiant ». Mais elle est devenue un sujet controversé ces derniers mois, alors que de grandes sociétés américaines d’IA, dont OpenAI et Anthropic, ont répété à maintes reprises que des concurrents en Chine utilisent leurs modèles propriétaires pour mener des distillations illicites à grande échelle afin d’obtenir un avantage concurrentiel.
Dans une déclaration publiée mardi, la Cybersecurity & Infrastructure Security Agency (CISA) des États-Unis a déclaré que certaines des plus grandes entreprises d’IA chinoises — DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun et Z.ai — « mènent une extraction systématique des fonctionnalités et capacités propriétaires des modèles des entreprises américaines d’IA par le biais de campagnes de distillation des connaissances à l’échelle industrielle qui forment le cœur — et non pas un simple complément — de leur stratégie de développement de l’IA ». Tout cela serait probablement mené avec la connaissance et l’agrément du gouvernement chinois, selon la CISA. Anthropic a également affirmé, dans un rapport publié jeudi, que Moonshot, le développeur d’un modèle d’IA nommé Kimi, avait recours à une astuce de type Mechanical Turk pour amener ses clients à croire qu’ils obtenaient des réponses de Kimi, alors que celles-ci avaient été générées par Claude.
Guo’s letter to OpenAI is the first known case of a Chinese developer accusing an American company of distillation. It’s far from the first time that OpenAI has been accused of theft, though. The company has had to fend off a litany of lawsuits since the launch of ChatGPT a little under four years ago, filed by artists and news publishers arguing that their copyrighted work was used illegally to train new AI models. (OpenAI has repeatedly defended itself by invoking the so‑called “fair use” standard of U.S. copyright law.) In July, Apple sued the company, claiming it had stolen company secrets in order to get its newborn hardware business off the ground. (Again, OpenAI has denied any wrongdoing.) Earlier this week, a NYU mathematics professor questioned whether his work on Codex had been surreptitiously used to train the model that OpenAI used to solve the Navier-Stokes “Millennium Problem.” (OpenAI told the Australian Broadcasting Corporation it “can say categorically that it is impossible for Dr. Buckmaster’s Codex prompts over the last two months to have influenced the system in any way, including training.”)
L’ironie dans le fait que des entreprises d’IA dénoncent des distillations illicites alors que leur modèle économique repose largement sur le scraping non consentant de contenus en ligne semble leur échapper à OpenAI et à Anthropic, qui se préparent toutes deux à des introductions en bourse susceptibles d’être historiques. Pour l’instant, la frontière entre « fair use » et vol dans l’industrie de l’IA non régulée demeure aussi incertaine que les mécanismes internes des modèles eux-mêmes.