EN DIRECT
L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|
RégulationMicrosoft

Un cadre de Microsoft aurait qualifié le scraping de données d'IA de « plus grand vol de travail de l'histoire »

Des documents judiciaires récemment déscellés révèlent qu'un dirigeant de Microsoft aurait critiqué en interne les pratiques de collecte massive de données utilisées pour entraîner les modèles d'IA. Ces propos surviennent alors que l'entreprise fait l'objet de plusieurs poursuites liées au droit d'auteur.

18 septembre 20263 min de lecturePublié parHacker News

Selon des documents judiciaires récemment déscellés et cités par TechCrunch, un cadre de Microsoft aurait tenu des propos internes très critiques envers les pratiques de collecte de données utilisées pour entraîner les grands modèles de langage, allant jusqu'à qualifier le scraping massif de contenus en ligne de « plus grand vol de travail de l'histoire humaine ». Ces déclarations, formulées en privé, tranchent nettement avec la communication publique de l'entreprise, qui a toujours défendu l'usage de données largement disponibles sur le web pour entraîner ses systèmes d'IA, notamment via son partenariat avec OpenAI.

La révélation intervient dans le cadre d'un contentieux plus large opposant plusieurs éditeurs, auteurs et créateurs de contenus à des entreprises technologiques accusées d'avoir utilisé des œuvres protégées sans autorisation ni compensation pour entraîner leurs modèles. Microsoft, comme d'autres géants du secteur, fait face à plusieurs procédures judiciaires portant sur l'usage de contenus soumis au droit d'auteur, notamment des articles de presse et des œuvres littéraires, dans ses pipelines d'entraînement.

Le fait que ces propos proviennent d'un responsable interne à l'entreprise elle-même ajoute un poids particulier à ce dossier. Il suggère que des doutes existaient en interne, y compris parmi des cadres impliqués dans les stratégies liées à l'IA, quant à la légitimité de certaines pratiques de collecte de données à grande échelle. Ce type de document, obtenu par déscellement judiciaire, est souvent utilisé par les parties plaignantes pour démontrer une conscience préalable du caractère problématique de certaines pratiques.

Cette affaire illustre la tension croissante entre l'accélération du développement de l'IA générative et les questions non résolues de propriété intellectuelle. Alors que les tribunaux américains commencent à rendre des décisions sur la nature du « fair use » appliqué à l'entraînement de modèles, ce type de révélation pourrait peser dans les négociations en cours entre entreprises technologiques et ayants droit, ainsi que dans l'issue de plusieurs procès encore pendants.

Tags
copyrightlitigationtraining-datamicrosoftai-ethics

À lire aussi

Un cadre de Microsoft aurait qualifié le scraping de données d'IA de « plus grand vol de travail de l'histoire » · nAIvigate