À mesure que les modèles linguistiques gagnent en complexité et sont de plus en plus utilisés, le besoin de mécanismes permettant à ces modèles d’apprendre à se comporter de manière utile, sécurisée et éthiquement alignée augmente également.
C’est dans ce contexte que Deepseek, jeune entreprise chinoise fondée en 2023, a franchi une étape audacieuse et prometteuse avec le développement de Deepseek-GRM-27B : un modèle de récompense de nouvelle génération qui pourrait redéfinir l’apprentissage par renforcement dans les systèmes d’IA.
Cet article explore en profondeur l’approche innovante de Deepseek, ses techniques clés, ainsi que son impact technique et stratégique potentiel.
Que sont les modèles de récompense et pourquoi sont-ils importants ?
Dans le domaine de l’apprentissage par renforcement (RL), un modèle de récompense est le composant qui détermine quelles actions sont souhaitables pour un agent d’IA.
Cet agent interagit avec un environnement, prend des décisions et, selon le modèle de récompense, reçoit des signaux positifs (récompenses) ou négatifs (punitions), lui permettant d’apprendre à se comporter de manière optimale dans le temps.
Par exemple, un robot peut apprendre à ramasser des objets avec précision en recevant des points à chaque fois qu’il le fait correctement. Dans les applications plus sophistiquées, telles que les assistants conversationnels, les récompenses sont basées sur des critères tels que l’utilité, la clarté ou la satisfaction des utilisateurs.
Le problème est que les préférences humaines sont subtiles, changeantes et souvent subjectives. Les méthodes traditionnelles, telles que l’apprentissage par renforcement avec feedback humain (RLHF), tentent de capturer ces préférences en évaluant manuellement les réponses.
Bien que cela ait été utile (des modèles comme ChatGPT et Claude utilisent RLHF), il s’agit également d’un processus coûteux, lent et non évolutif.
L’approche disruptive de Deepseek
Deepseek propose une nouvelle architecture pour les modèles de récompense qui cherche à éliminer la dépendance excessive à l’égard de la surveillance humaine sans sacrifier l’alignement sur les valeurs humaines. Ceci est réalisé grâce à trois piliers techniques clés :
Modélisation de récompense générative (GRM)
GRM est une technique par laquelle le modèle apprend à générer ses propres principes de rétroaction. Au lieu de s’appuyer exclusivement sur des données étiquetées par l’homme, le modèle peut analyser différentes réponses à une tâche et en déduire, par lui-même, laquelle est la plus appropriée.
Par exemple, si un système est invité à répondre à une question médicale, GRM peut générer plusieurs options, les évaluer en interne et déterminer celle qui répond le mieux à des critères tels que la clarté, l’exactitude et l’utilité. Ainsi, le modèle agit comme son propre juge, apprenant de manière plus autonome et plus efficace.
Réglage critique auto-principé (SPCT)
SPCT complète GRM avec un mécanisme d’autocritique. Cela permet au modèle d’ajuster dynamiquement ses propres principes d’évaluation. Si les réponses évaluées comme « bonnes » s’avèrent inadéquates en pratique, le modèle détecte ces incohérences et améliore ses critères de récompense.
Cela améliore non seulement l’adaptabilité du système à de nouveaux contextes, mais réduit également le besoin d’ajustements manuels, obtenant ainsi un système plus résilient et évolutif.
Mise à l’échelle au moment de l’inférence
Une innovation moins courante mais très significative dans la proposition Deepseek est l’approche de mise à l’échelle du temps d’inférence dont nous avons parlé précédemment dans « Avancement de l’IA : une voie de plus en plus difficile et coûteuse ?
Au lieu de concentrer toutes les ressources informatiques pendant la phase d’entraînement, Deepseek propose de les allouer également pendant la phase d’utilisation (d’inférence).
Cela permet au modèle de générer des réponses plus précises et contextualisées sans nécessiter de recyclage. Cette technique est particulièrement utile pour les tâches qui nécessitent une adaptabilité en temps réel, comme la modération de contenu ou le support technique.
Deepseek-GRM-27B : Résultats et performances
Le modèle Deepseek-GRM-27B, avec 27 milliards de paramètres, représente l’aboutissement de ces innovations. Selon l’article technique publié sur arXiv sous le titre « Inference-Time Scaling for Generalist Reward Modeling » (arXiv :2504.02495), ce modèle surpasse plusieurs concurrents clés.
- Dans les tests avec décodage gourmand, il a obtenu un score de 69,9, surpassant le modèle LLM-as-a-Judge (67,0).
- Lors du vote@32 avec MetaRM, il a atteint 72,8, contre 69,0 pour Deepseek-PairRM-27B.
- Dans les tâches de généralisation telles que RMB BoN, la différence entre les différents types d’entrées était inférieure à 1 %, ce qui montre sa polyvalence.
De plus, par rapport aux modèles de haut niveau tels que GPT-4o (version 2024-08-06), Deepseek-GRM-27B a montré une capacité légèrement supérieure à transférer les principes de récompense vers de nouvelles tâches, ce qui le positionne comme un modèle hautement réutilisable et adaptable.
Une double stratégie : Web, open source et communautaire
Deepseek se concentre non seulement sur l’innovation technique, mais également sur l’accessibilité et la collaboration.
La société a annoncé que les fonctionnalités GRM et SPCT sont progressivement intégrées à sa version Web, ce qui permettra aux utilisateurs et aux entreprises d’accéder à des modèles de récompense avancés sans nécessiter leur propre infrastructure.
De plus, Deepseek prévoit de publier les composants clés de son modèle en open source. Cette décision ouvre la porte aux chercheurs, laboratoires académiques et startups pour étudier, modifier et tirer parti de ces technologies dans leurs propres projets.
Dans un environnement dominé par les initiatives propriétaires des grandes entreprises technologiques, cet engagement en faveur de l’open source représente une bouffée d’air frais pour la communauté scientifique.
Implications pour l’avenir de l’IA
Le travail de Deepseek n’est pas seulement une avancée technique : c’est une redéfinition de la façon dont nous formons et évaluons les systèmes d’IA. Parmi ses implications les plus pertinentes figurent :
- Réduction de la dépendance humaine : En automatisant le feedback, les ressources sont libérées et la formation de modèles plus importants est facilitée.
- Démocratisation de l’accès à l’IA avancée : Grâce à son approche open-source et web, ces avancées seront accessibles à des acteurs extérieurs aux grands pôles de puissance technologique.
- Sécurité et alignement accrus : Les modèles capables de se critiquer et de s’ajuster réduisent les risques associés aux biais, aux erreurs ou aux comportements inattendus.
- Accélération de la recherche scientifique : Avec des systèmes plus alignés et adaptables, des tâches telles que l’analyse des données ou la formulation d’hypothèses pourraient en bénéficier de manière significative.
Grâce à des techniques telles que GRM, SPCT et son approche innovante de l’inférence, l’entreprise a non seulement surpassé ses concurrents dans les benchmarks, mais a également jeté les bases d’une IA plus alignée, autonome et accessible.
En intégrant ces capacités dans sa plateforme Web et en misant sur l’open source, Deepseek cherche non seulement à devenir un leader technique, mais également à favoriser une communauté mondiale plus collaborative et inclusive dans le développement de l’intelligence artificielle.
This post is also available in: