EN DIRECT
Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Terence Tao dénonce une « grave dérive » d'OpenAI dans les mathématiques11/09/26 · OpenAI|Terence Tao alerte sur un « désalignement sévère » de l'IA en mathématiques11/09/26|OpenAI publie un résultat sur Navier-Stokes accompagné d'une preuve formelle en Lean 410/09/26 · OpenAI|OpenAI publie la documentation de son Agents API10/09/26 · OpenAI|OpenAI lance l'Agents API, un service managé pour agents cloud10/09/26 · OpenAI|
BusinessOpenAI

OpenAI investit dans la production de données biologiques pour entraîner ses modèles

OpenAI finance la génération de nouvelles données biologiques, reprenant notamment une idée consistant à récupérer les archives de biotechs en faillite pour enrichir l'entraînement de modèles d'IA.

15 septembre 20263 min de lecturePublié parMIT Tech Review

Le manque de données biologiques de qualité freine depuis longtemps le développement de systèmes d'IA capables d'accélérer la recherche médicale. Contrairement au texte ou à l'image, disponibles en abondance sur internet, les données expérimentales en biologie sont coûteuses à produire, dispersées entre laboratoires et souvent protégées par le secret industriel. OpenAI semble avoir décidé de s'attaquer directement à ce goulot d'étranglement en finançant la production de nouveaux jeux de données plutôt que de se contenter de ceux existants.

L'article de MIT Technology Review revient sur une proposition formulée l'an dernier par l'analyste en politiques d'essais cliniques Ruxandra Teslo. Son idée : exploiter les liquidations judiciaires de biotechs en faillite pour récupérer des dossiers réglementaires détaillés, des stratégies de fabrication et des données de sécurité, des informations habituellement gardées confidentielles en tant que secrets commerciaux. En rachetant ces archives lors des procédures de faillite, il deviendrait possible de constituer des corpus de données autrement inaccessibles.

Cette approche illustre un problème plus large auquel se heurtent les acteurs de l'IA appliquée aux sciences de la vie : les données utiles existent bel et bien, mais elles sont enfermées dans des silos commerciaux ou juridiques. Le financement par OpenAI de la création de nouvelles données biologiques suggère une stratégie où l'entreprise ne se contente plus d'agréger des sources publiques, mais investit activement dans la production ou l'acquisition de matériaux jusqu'ici hors de portée.

Si les détails précis du programme d'OpenAI restent encore flous à ce stade, cette initiative s'inscrit dans une tendance plus générale des grands laboratoires d'IA à chercher des sources de données propriétaires dans des domaines spécialisés, à mesure que les réserves de texte générique s'épuisent. Pour le secteur biotech, cela pourrait aussi ouvrir un débat sur la valorisation et la propriété de données jusqu'ici considérées comme des actifs sans usage après la faillite d'une entreprise.

Tags
openaibiologybiotechdatalife-sciencesdrug-discovery

À lire aussi

OpenAI investit dans la production de données biologiques pour entraîner ses modèles · nAIvigate