

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

# Configuración de las funciones de recompensa para los modelos Amazon Nova
<a name="reward-functions"></a>

Las funciones de recompensa evalúan la calidad de la respuesta y proporcionan señales de retroalimentación para el entrenamiento de modelos. Puede configurar las funciones de recompensa utilizando funciones de Lambda personalizadas o modelos de Amazon Bedrock-hosted Foundation como jueces. Hay plantillas guiadas disponibles para simplificar la creación de funciones de recompensa para tareas comunes, como el seguimiento de instrucciones y la validación de formatos. Elija el enfoque que mejor se adapte a los requisitos de sus tareas.

## Aprendizaje reforzado mediante recompensas verificables (RLVR)
<a name="rft-rlvr"></a>

El RLVR optimiza los modelos para tareas objetivas, como la generación de código o el razonamiento matemático, utilizando calificadores verificables basados en reglas o plantillas listas para usar.

Tiene dos opciones para el RLVR (código personalizado):

### Opción 1: usar plantillas proporcionadas por la consola
<a name="w2aac17c25c17c17b5b7b1"></a>

La consola Amazon Bedrock proporciona plantillas de muestra para las funciones de Lambda de Grader:
+ Razonamiento matemático con verificación básica de la verdad
+ Validación de formatos y verificación de restricciones
+ Plantilla Lambda de niveladora genérica con código repetitivo

Siga las instrucciones de la plantilla proporcionada en la ** página ** Crear un trabajo de RFT de la consola de Amazon Bedrock. [https://console.aws.amazon.com/bedrock](https://console.aws.amazon.com/bedrock)

### Opción 2: Traiga su propia función de Lambda
<a name="w2aac17c25c17c17b5b7b3"></a>

Cree funciones de recompensa personalizadas con su propio ARN de Lambda para lógica compleja, API externas, cálculos de varios pasos o para combinar varios criterios de evaluación.

**nota**  
Si usas tu propia función de Lambda, ten en cuenta lo siguiente:  
Aumente el tiempo de espera de Lambda de 3 segundos por defecto a un máximo de 15 minutos para las evaluaciones complejas.
La función de ejecución de Lambda necesita permisos para invocar modelos, tal como se describe en. [Acceso y seguridad para los modelos Amazon Nova](rft-access-security.md)

## Aprendizaje reforzado mediante la retroalimentación de la IA (RLAIF)
<a name="rft-rlaif"></a>

El RLAIF optimiza los modelos para tareas subjetivas, como el seguimiento de instrucciones o las interacciones con un chatbot, utilizando jueces con plantillas listas para usar. AI-based 

**Para el RLAIF (modelo como juez): **
+ Seleccione un modelo base alojado en Amazon Bedrock como juez
+ Configure las instrucciones para la evaluación
+ Defina los criterios de evaluación y las pautas de puntuación

Plantillas LLM-as-Judge de mensajes disponibles en la consola de Amazon Bedrock:
+ Seguimiento de instrucciones (entrenamiento modelo para jueces)
+ Resumen (Multi-turn diálogos)
+ Evaluación del razonamiento (CoT para dominios especializados)
+ Fidelidad en la RAG (Preguntas y respuestas) Context-grounded 

**nota**  
La ** opción ** Model as Judge de la consola convierte automáticamente la configuración en una función de Lambda durante el entrenamiento.

## Detalles de implementación de la función Lambda
<a name="rft-lambda-implementation"></a>

Al implementar funciones de recompensa personalizadas de Lambda, su función debe aceptar y devolver datos en el siguiente formato.

------
#### [ Input structure ]

```
[{
  "id": "123",
  "messages": [
    {
      "role": "user",
      "content": "Do you have a dedicated security team?"
    },
    {
      "role": "assistant",
      "content": "As an AI developed by Amazon, I don not have a dedicated security team..."
    }
  ],
  "metadata": {
    "reference_answer": {
      "compliant": "No",
      "explanation": "As an AI developed by Company, I do not have a traditional security team..."
    },
    "my_key": "sample-001"
  }
}]
```

------
#### [ Output structure ]

```
[{
  "id": "123",
  "aggregate_reward_score": 0.85,
  "metrics_list": [
    {
      "name": "accuracy",
      "value": 0.9,
      "type": "Reward"
    },
    {
      "name": "policy_compliance",
      "value": 0.8,
      "type": "Metric"
    }
  ]
}]
```

------

**Pautas de diseño **
+ **Clasifica las respuestas**: otorga a la mejor respuesta una puntuación claramente más alta
+ **Realice comprobaciones consistentes**: evalúe la finalización de las tareas, el cumplimiento del formato, la seguridad y la longitud razonable
+ **Mantenga una escala estable**: mantenga las puntuaciones normalizadas y que no sean explotables