View a markdown version of this page

Configuration des fonctions de récompense pour les modèles Amazon Nova - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Configuration des fonctions de récompense pour les modèles Amazon Nova

Les fonctions de récompense évaluent la qualité des réponses et fournissent des signaux de rétroaction pour l'entraînement des modèles. Vous pouvez configurer des fonctions de récompense à l'aide de fonctions Lambda personnalisées ou de modèles Amazon Bedrock-hosted Foundation en tant que juges. Des modèles guidés sont disponibles pour simplifier la création de fonctions de récompense pour des tâches courantes telles que le suivi des instructions et la validation du format. Choisissez l'approche qui correspond aux exigences de votre tâche.

Apprentissage par renforcement grâce à des récompenses vérifiables (RLVR)

Le RLVR optimise les modèles pour des tâches objectives telles que la génération de code ou le raisonnement mathématique à l'aide d'évaluateurs vérifiables basés sur des règles ou de modèles prêts à l'emploi.

Vous avez deux options pour le RLVR (code personnalisé) :

La console Amazon Bedrock fournit des exemples de modèles pour les fonctions Lambda des évaluateurs :

  • Raisonnement mathématique avec vérification de la véracité du terrain

  • Validation du format et vérification des contraintes

  • Modèle Lambda d'évaluateur générique avec code standard

Suivez les instructions du modèle fourni sur la page de création d'une tâche RFT dans la console Amazon Bedrock.

Créez des fonctions de récompense personnalisées à l'aide de votre propre ARN Lambda pour une logique complexe, des API externes, des calculs en plusieurs étapes ou la combinaison de plusieurs critères d'évaluation.

Note

Si vous apportez votre propre fonction Lambda, gardez les points suivants à l'esprit :

  • Augmentez le délai Lambda de 3 secondes par défaut à 15 minutes maximum pour les évaluations complexes.

  • Le rôle d'exécution Lambda nécessite des autorisations pour invoquer des modèles, comme décrit dans. Accès et sécurité pour les modèles Amazon Nova

Apprentissage par renforcement grâce à la rétroaction de l'IA (RLAIF)

Le RLAIF optimise les modèles pour des tâches subjectives telles que le suivi des instructions ou les interactions avec les chatbots en utilisant des AI-based juges dotés de modèles prêts à l'emploi.

Pour le RLAIF (modèle en tant que juge) :

  • Sélectionnez un modèle de base hébergé par Amazon Bedrock en tant que juge

  • Configuration des instructions pour l'évaluation

  • Définir les critères d'évaluation et les directives de notation

Modèles d' LLM-as-Judge invite disponibles dans la console Amazon Bedrock :

  • Instructions suivantes (formation modèle pour les juges)

  • Récapitulatif (Multi-turn boîtes de dialogue)

  • Évaluation du raisonnement (CoT pour les domaines spécialisés)

  • Fidélité RAG (questions-réponses) Context-grounded

Note

L'option Model as Judge de la console convertit automatiquement votre configuration en fonction Lambda pendant l'entraînement.

Détails de l'implémentation de la fonction Lambda

Lorsque vous implémentez des fonctions de récompense Lambda personnalisées, votre fonction doit accepter et renvoyer des données au format suivant.

Input structure
[{ "id": "123", "messages": [ { "role": "user", "content": "Do you have a dedicated security team?" }, { "role": "assistant", "content": "As an AI developed by Amazon, I don not have a dedicated security team..." } ], "metadata": { "reference_answer": { "compliant": "No", "explanation": "As an AI developed by Company, I do not have a traditional security team..." }, "my_key": "sample-001" } }]
Output structure
[{ "id": "123", "aggregate_reward_score": 0.85, "metrics_list": [ { "name": "accuracy", "value": 0.9, "type": "Reward" }, { "name": "policy_compliance", "value": 0.8, "type": "Metric" } ] }]

Directives de conception

  • Classez les réponses — Attribuez une note nettement plus élevée à la meilleure réponse

  • Utilisez des contrôles cohérents  : évaluez l'achèvement des tâches, le respect du format, la sécurité et la longueur raisonnable

  • Maintenir une échelle stable — Maintenir les scores normalisés et non exploitables