Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Configuración de las funciones de recompensa para los modelos Amazon Nova
Las funciones de recompensa evalúan la calidad de la respuesta y proporcionan señales de retroalimentación para el entrenamiento de modelos. Puede configurar las funciones de recompensa utilizando funciones de Lambda personalizadas o modelos de Amazon Bedrock-hosted Foundation como jueces. Hay plantillas guiadas disponibles para simplificar la creación de funciones de recompensa para tareas comunes, como el seguimiento de instrucciones y la validación de formatos. Elija el enfoque que mejor se adapte a los requisitos de sus tareas.
Aprendizaje reforzado mediante recompensas verificables (RLVR)
El RLVR optimiza los modelos para tareas objetivas, como la generación de código o el razonamiento matemático, utilizando calificadores verificables basados en reglas o plantillas listas para usar.
Tiene dos opciones para el RLVR (código personalizado):
La consola Amazon Bedrock proporciona plantillas de muestra para las funciones de Lambda de Grader:
-
Razonamiento matemático con verificación básica de la verdad
-
Validación de formatos y verificación de restricciones
-
Plantilla Lambda de niveladora genérica con código repetitivo
Siga las instrucciones de la plantilla proporcionada en la página Crear un trabajo de RFT de la consola de Amazon Bedrock. https://console.aws.amazon.com/bedrock
Cree funciones de recompensa personalizadas con su propio ARN de Lambda para lógica compleja, API externas, cálculos de varios pasos o para combinar varios criterios de evaluación.
nota
Si usas tu propia función de Lambda, ten en cuenta lo siguiente:
-
Aumente el tiempo de espera de Lambda de 3 segundos por defecto a un máximo de 15 minutos para las evaluaciones complejas.
-
La función de ejecución de Lambda necesita permisos para invocar modelos, tal como se describe en. Acceso y seguridad para los modelos Amazon Nova
Aprendizaje reforzado mediante la retroalimentación de la IA (RLAIF)
El RLAIF optimiza los modelos para tareas subjetivas, como el seguimiento de instrucciones o las interacciones con un chatbot, utilizando jueces con plantillas listas para usar. AI-based
Para el RLAIF (modelo como juez):
-
Seleccione un modelo base alojado en Amazon Bedrock como juez
-
Configure las instrucciones para la evaluación
-
Defina los criterios de evaluación y las pautas de puntuación
Plantillas LLM-as-Judge de mensajes disponibles en la consola de Amazon Bedrock:
-
Seguimiento de instrucciones (entrenamiento modelo para jueces)
-
Resumen (Multi-turn diálogos)
-
Evaluación del razonamiento (CoT para dominios especializados)
-
Fidelidad en la RAG (Preguntas y respuestas) Context-grounded
nota
La opción Model as Judge de la consola convierte automáticamente la configuración en una función de Lambda durante el entrenamiento.
Detalles de implementación de la función Lambda
Al implementar funciones de recompensa personalizadas de Lambda, su función debe aceptar y devolver datos en el siguiente formato.
Pautas de diseño
Clasifica las respuestas: otorga a la mejor respuesta una puntuación claramente más alta
Realice comprobaciones consistentes: evalúe la finalización de las tareas, el cumplimiento del formato, la seguridad y la longitud razonable
Mantenga una escala estable: mantenga las puntuaciones normalizadas y que no sean explotables