View a markdown version of this page

Réglage fin des renforts (RFT) - Amazon Nova

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Réglage fin des renforts (RFT)

Le renforcement Fine-Tuning (RFT) est une technique qui améliore les performances du modèle grâce à des signaux de feedback (des scores mesurables ou des récompenses indiquant la qualité des réponses) plutôt qu'à une supervision directe avec des réponses exactes et correctes. Contrairement à la SFT qui apprend à partir de paires d'entrées-sorties, la RFT utilise des fonctions de récompense pour évaluer les réponses du modèle et optimise le modèle de manière itérative pour maximiser ces récompenses. Le RFT prend en charge à la fois l'entraînement en un tour et en plusieurs tours :

  • Single-turn RFT  : le modèle génère une réponse unique à une invite, et une fonction de récompense note cette réponse. Idéal pour les tâches comportant des indicateurs de qualité clairs par réponse, tels que les mathématiques, la génération de code et le raisonnement structuré.

  • Multi-turn RFT  : Le modèle engage des interactions en plusieurs étapes (par exemple, des flux de travail agentiques avec utilisation d'outils), et une fonction de récompense évalue la trajectoire globale. Idéal pour les tâches complexes nécessitant une prise de décision séquentielle, telles que la résolution de problèmes en plusieurs étapes, l'orchestration d'outils et les agents conversationnels.

Quand utiliser la technologie RFT

Utilisez la RFT lorsque vous pouvez définir des critères de réussite clairs et mesurables, mais que vous avez du mal à fournir des résultats exacts et corrects pour la formation. La technologie RFT est idéale lorsque :

  • Vous disposez d'une fonction de récompense fiable qui peut évaluer les résultats du modèle par programmation

  • Vous devez aligner le comportement du modèle sur des préférences ou des contraintes spécifiques

  • La collecte d'exemples étiquetés de haute qualité est coûteuse ou peu pratique

  • Plusieurs solutions valables existent mais certaines sont clairement meilleures que d'autres (écriture créative, optimisation du code, raisonnement complexe)

La RFT excelle dans les domaines où la qualité de sortie peut être mesurée de manière objective : résolution de problèmes mathématiques, génération de code, raisonnement scientifique, analyse de données structurées, raisonnement en plusieurs étapes, utilisation d'outils et flux de travail complexes soumis à des contraintes spécifiques.

Modèles pris en charge

Single-turn et RFT multitours sont disponibles pour les modèles Amazon Nova suivants :

  • Nouvelle version 2.0 (version allégée)

Quand utiliser Single-turn RFT ou Multi-turn RFT

Choisissez Single-turn RFT lorsque la tâche est un échange ponctuel : le modèle reçoit une invite et produit une réponse unique qui peut être évaluée seul, sans appel d'outil intermédiaire ni état de l'environnement à suivre. Cela convient à des cas d'utilisation tels que la classification, l'extraction, les questions-réponses spécifiques à un domaine, la synthèse, la modération du contenu ou toute tâche avec une réponse vérifiable (correspondance exacte, F1, validation de schéma, base de règles ou LLM-judge vérification du résultat final). Il est plus simple, moins coûteux et plus rapide à exécuter, car chaque déploiement concerne une seule génération et la récompense est calculée une fois à la fin.

Choisissez Multi-turn RFT lorsque la tâche nécessite que le modèle agisse en tant qu'agent en plusieurs étapes (appel d'outils, lecture et état de mutation, adaptation à ce qui revient) avant que le résultat ne puisse être jugé. Cela convient aux flux de travail agentiques tels que les séquences d'utilisation d'outils, le dépannage en plusieurs étapes, les assistants conversationnels ou toute tâche dont le succès dépend de la trajectoire (l'ordre et l'exactitude des actions à tour de rôle), et pas seulement d'une réponse finale.

Règle générale : si votre tâche peut être notée à partir d'une sortie de modèle unique sans appel d'outil ni état évolutif, utilisez la Single-turn RFT ; si le succès dépend d'une séquence d'actions contre des outils ou d'un environnement dynamique, utilisez Multi-turn la RFT.

Quand utiliser Nova 1.0 par rapport à Nova 2.0

RFT n'est disponible que sur Nova 2.0 Lite. Pour les modèles Nova 1.0, utilisez l'optimisation des préférences directes (DPO) ou l'optimisation des politiques proximales (PPO) comme techniques d'alignement alternatives.

Mode de raisonnement

Amazon Nova 2.0 prend en charge le mode raisonnement pendant l'entraînement RFT. Les modes suivants sont disponibles :

  • aucun  : aucun raisonnement (omettez le champ reasoning_effort)

  • faible  : frais de raisonnement minimaux

  • élevé  : capacité de raisonnement maximale (par défaut lorsque reasoning_effort est spécifié)

Note

Il n'existe pas d'option moyenne pour RFT. Si le champ reasoning_effort est absent de votre configuration, le raisonnement est désactivé.