IA

IA : Microsoft qualifiait le scraping de vol de travail

Des documents judiciaires déclassifiés dans le procès du New York Times révèlent que les dirigeants de Microsoft et OpenAI qualifiaient eux-mêmes en interne l'entraînement de leurs modèles de spoliation massive du travail des créateurs de contenu.

Par Iris · rédaction IA

IA : Microsoft qualifiait le scraping de vol de travail

Des pièces judiciaires déclassifiées dans le cadre du procès opposant The New York Times à OpenAI et Microsoft, dévoilées en septembre 2026 par Ars Technica, révèlent les aveux écrits de cadres dirigeants sur la captation illégitime des contenus de presse.

Ces pièces affaiblissent considérablement l'argument juridique du fair use brandi par l'industrie pour justifier l'entraînement gratuit de ses modèles. Pour les créateurs de contenu, ces révélations ouvrent la voie à des accords de licence obligatoires et payants pour toute utilisation de leurs textes.

Des pièces judiciaires dévoilent l'aveu d'un pillage interne

Des dirigeants techniques de Microsoft ont documenté en interne la nature prédatrice de l'entraînement des modèles de langage. Selon les pièces déclassifiées dans la procédure lancée par The New York Times, Brent Hecht, directeur de la science appliquée chez l'éditeur de logiciels, a décrit cette collecte massive comme un vol stupéfiant aux proportions sans précédent, ajoutant qu'il s'agissait sans doute du plus grand vol de travail de l'histoire humaine. Ces déclarations contredisent frontalement la posture officielle du groupe, qui défendait publiquement l'exception d'usage loyal, connue sous le terme de fair use. Pour les entreprises qui exploitent ou financent des modèles génératifs, cet écart fragilise la sécurité juridique des outils déployés auprès des clients.

Illustration editoriale : Des pièces judiciaires dévoilent l'aveu d'un pillage interne

Les robots ont contourné sciemment les barrières payantes

L'instruction judiciaire expose les méthodes techniques déployées pour aspirer les articles protégés par abonnement. Les documents produits par les plaignants indiquent qu'OpenAI a utilisé un contournement technique pour franchir le paywall du quotidien new-yorkais, opération explicitement validée par sa direction lorsque son président Greg Brockman a salué la trouvaille. Le corpus d'apprentissage comportait plus de 91 692 copies d'articles du journal, dont les mentions légales de propriété intellectuelle avaient été délibérément supprimées. Ce procédé mécanique montre que la collecte ne résultait pas d'une simple indexation publique du web. Tout gestionnaire de plateforme doit désormais auditer la provenance réelle des corpus pour écarter les risques de contrefaçon délibérée.

Les résumés génératifs siphonnent l'audience des sites sources

Les assistants conversationnels remplacent directement la consultation des publications d'origine au lieu de les référencer. Les relevés de Microsoft versés au dossier montrent des baisses de 83 % à 93 % du taux de clics vers plusieurs médias partenaires lorsque Copilot produit directement la réponse. Satya Nadella lui-même a reconnu sous serment que les robots volaient ces visites en fournissant le contenu directement sur la plateforme. De son côté, le responsable de ChatGPT chez OpenAI, Nick Turley, a concédé que les internautes n'avaient aucune raison de cliquer sur les liens sources, qualifiant les agents de substituts complets. Pour un éditeur numérique, cette dynamique confirme l'effondrement prévisible des revenus publicitaires issus des moteurs de recherche.

Illustration editoriale : Les résumés génératifs siphonnent l'audience des sites sources

Les géants refusent d'acheter des licences d'exploitation

Les concepteurs d'IA ont sciemment écarté l'achat régulier de droits pour alimenter leurs modèles d'apprentissage. Microsoft a transféré à OpenAI des jeux de données acquis pour Bing sans consulter les ayants droit, contournant ainsi le cadre des accords initiaux de recherche en ligne. OpenAI a également exploité un jeu de données contenant 1,8 million d'articles du New York Times obtenu auprès d'un tiers, en dépit d'une clause interdisant l'usage commercial. Une note interne décrivait une boucle destructrice où l'outil détruit les fondations économiques de ses propres fournisseurs de matière première. Pour les créateurs, l'obligation légale de licence devient l'unique levier pour imposer une rémunération avant la disparition de leurs contenus.

  • 93 % de baisse maximale du taux de clics mesurée par Microsoft vers certains éditeurs de presse Ars Technica 2026-09-21

presque personne ne prévoyait que le contenu créé serait employé de cette manière, et personne n'est rémunéré pour son utilisation

Brent Hecht Directeur de la science appliquée chez Microsoft

Microsoft cherche à minimiser ces révélations en affirmant que les propos de Brent Hecht reflètent une perspective individuelle non juridique et ne représentent pas la position officielle de l'entreprise.

Aucune action technique n'est requise cette semaine pour une petite structure. En revanche, tout éditeur de site indépendant doit s'attendre à une perte durable de trafic référent et suivre le verdict judiciaire pour évaluer d'éventuelles réclamations de droits.

Pourquoi ces déclarations internes ont-elles été rendues publiques ?

Ces courriels et notes internes ont été déclassifiés par la justice américaine à la demande des médias plaignants dans le cadre d'une requête en jugement sommaire.

Quelle est la ligne de défense officielle de Microsoft ?

Le groupe maintient que l'entraînement sur des données publiques relève du fair use américain et affirme que les propos de ses ingénieurs n'ont pas de valeur juridique.

  • Des cadres de Microsoft ont qualifié l'aspiration des textes de plus grand vol de travail de l'histoire.
  • Copilot a réduit jusqu'à 93 % les clics vers certains sites d'information en résumant leurs articles.
  • OpenAI a utilisé des mécanismes techniques pour contourner délibérément les paywalls de la presse.

Lire la suite de nos actualités

Sources