EN DIRECT
Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|Des modifications d'architecture permettraient de casser les lois d'échelle classiques16/09/26|OpenAI publie un cadre pour signaler les cas de désalignement de ses modèles16/09/26 · OpenAI|NVIDIA dévoile les premiers résultats MLPerf de sa plateforme Vera Rubin NVL7216/09/26 · NVIDIA|OpenAI élargit la publicité dans ChatGPT avec des « Sponsored Agents »16/09/26 · OpenAI|OpenAI se lance dans la publicité avec des « Sponsored Agents »16/09/26 · OpenAI|Google DeepMind lance Gemini 3.8 Live et sa variante à raisonnement étendu15/09/26 · Google DeepMind|L'investissement massif dans les infrastructures IA fait-il courir un risque de bulle ?15/09/26|Une faille dans la surveillance du raisonnement des modèles de langage14/09/26|Stellar Colosseum : un système multi-agents pour la recherche mathématique de long terme14/09/26|Le code d'Apple suggère que Siri pourrait céder la place à ChatGPT ou Claude14/09/26 · Apple|Anthropic dit avoir détecté un usage de Claude Code par les Houthis pour du guidage de missiles13/09/26 · Anthropic|Yoshua Bengio analyse pourquoi les agents IA mentent, trichent et se coordonnent13/09/26|
Recherche

ComPO : une méthode d'alignement des préférences sans gradient direct

Des chercheurs proposent ComPO, une méthode d'alignement basée sur des oracles de comparaison plutôt que sur l'optimisation directe d'une perte différentiable, avec des résultats prometteurs sur plusieurs familles de modèles open source.

16 septembre 20263 min de lecturePublié pararXiv

Les méthodes d'alignement direct des préférences, comme DPO, sont largement utilisées pour ajuster les grands modèles de langage aux préférences humaines en raison de leur efficacité computationnelle. Mais elles souffrent d'un problème connu appelé « déplacement de vraisemblance » : lorsque les marges entre réponses préférées et rejetées sont faibles, l'optimisation peut dégrader la qualité globale du modèle au lieu de l'améliorer.

Pour contourner ce problème, les auteurs proposent ComPO (Comparison-based Preference Optimization), une approche d'ordre zéro qui n'optimise pas directement une fonction de perte différentiable sur les paires de préférences. À la place, la méthode extrait une information directionnelle à partir d'oracles de comparaison, une stratégie qui s'apparente aux techniques d'optimisation sans gradient explicite. Les auteurs établissent des garanties théoriques de convergence pour un schéma de base hors ligne, sous des hypothèses de régularité, de parcimonie du gradient et de compatibilité entre l'oracle et un objectif latent.

Une variante en ligne, online ComPO, est également introduite. Elle conserve le mécanisme de comparaison hors ligne tout en exploitant des générations non étiquetées de la politique courante pour contrôler la divergence KL inverse par rapport à une politique de référence. Une garantie de performance est également établie pour un schéma contraint de base, sous des conditions de couverture locale et de précision de la récompense par paire dans la distribution.

Les expériences menées sur des modèles Mistral, Llama, Gemma-2, Qwen3 et Gemma-3 montrent des améliorations par rapport aux méthodes d'alignement direct existantes, notamment sur les taux de victoire contrôlés en longueur. Des diagnostics au niveau des paires suggèrent que la méthode atténue effectivement le phénomène de déplacement de vraisemblance. Il s'agit d'une contribution technique qui s'inscrit dans un effort continu de la recherche pour affiner les techniques de RLHF au-delà de DPO, sans pour autant constituer un changement de paradigme immédiat pour les pratiques industrielles.

Tags
preference-alignmentrlhfzeroth-order-optimizationllm-trainingbenchmark

À lire aussi

ComPO : une méthode d'alignement des préférences sans gradient direct · nAIvigate