Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Multi-turn aprendizaje por refuerzo
Multi-turn el aprendizaje por refuerzo (RL) capacita a un agente para que tome buenas decisiones en una secuencia de pasos, no solo en un momento. El agente observa su entorno, realiza una acción, recibe una recompensa y pasa a un nuevo estado, repitiendo este proceso durante muchos pasos de tiempo. El objetivo es aprender una política (comportamiento modelo) que maximice la recompensa acumulada a lo largo de toda la secuencia, en lugar de optimizarla para cada paso de forma aislada. Este enfoque se utiliza cada vez más para capacitar a los modelos lingüísticos en tareas de tipo agencial y de razonamiento en varios pasos, en las que el modelo realiza acciones como llamadas a herramientas, ejecución de código o búsquedas en la web en varios turnos y se recompensa en función de toda la secuencia. Esto es diferente del turno único RLHF/RLAIF, en el que se asigna una recompensa a una salida a la vez.
Una analogía sencilla
Imagina que eres un agente de servicio al cliente que gestiona un ticket de soporte. No lo resuelves en un solo mensaje. Haces preguntas aclaratorias, buscas la cuenta del cliente, intentas una solución, compruebas si ha funcionado y haces un seguimiento si no es así. Al final, el cliente se va satisfecho o no. Con el tiempo, podrás reconocer mejor qué secuencia de pasos tiende a conducir a una buena resolución.
Multi-turn RL entrena el modelo de la misma manera. En lugar de calificar el modelo en función de una sola respuesta, permite que el modelo realice una tarea en varios pasos y lo recompensa en función de toda la secuencia. El modelo aprende qué decisiones fueron realmente importantes al principio de la conversación.
Terminología clave
-
Agente: la entidad que toma las decisiones en el sistema. Observa la situación actual, decide qué medidas tomar y aprende con el tiempo a mejorar su estrategia. En la práctica, el agente funciona con un modelo de IA, pero ambos no son lo mismo. El modelo es la red neuronal subyacente; el agente es el sistema más amplio que lo utiliza para percibir, decidir y actuar. En términos simples: el representante de servicio al cliente que gestiona el billete.
-
Environment/Agentic Aplicación: todo con lo que interactúa el agente, incluido el historial de conversaciones, los detalles de la cuenta del cliente y cualquier herramienta que pueda utilizar el agente. En términos simples: la plataforma de soporte, el cliente y toda la información disponible para el representante.
-
Estado: una instantánea de la situación actual que el agente observa antes de decidir qué hacer a continuación. En pocas palabras: lo que el representante sabe ahora mismo, como el problema del cliente, lo que ya se ha probado y la última respuesta.
-
Acción: qué hace el agente en cada paso, como hacer una pregunta aclaratoria, recurrir a una herramienta o enviar una respuesta. En términos simples: el siguiente movimiento del representante, ya sea hacer una pregunta, buscar algo o enviar una solución.
-
Recompensa: la señal de retroalimentación que recibe el agente, ya sea en cada paso o al final de la tarea, que indica qué tan bien han ido las cosas. En pocas palabras: ¿el cliente se fue satisfecho? Ese resultado es la recompensa.
-
Política: la estrategia que el agente ha aprendido. Asigna un estado dado a la acción que tiene más probabilidades de conducir a un buen resultado. En términos simples: el conocimiento del representante se basa en la experiencia, es decir, sabe qué es lo que suele funcionar en una situación determinada.
-
Episodio: una ejecución completa de una tarea de principio a fin. En pocas palabras: una conversación de soporte completa, desde el primer mensaje del cliente hasta la resolución.
-
Turno: un intercambio único dentro de un episodio, normalmente una acción realizada por el agente y la respuesta que recibe del entorno. En una conversación, se trata de un mensaje y su respuesta. En términos simples: un paso en la conversación de soporte, como el agente que hace una pregunta y el cliente responde.
-
Trayectoria: la secuencia completa de estados, acciones y recompensas registrada a lo largo de un episodio completo. Es el registro completo de lo que hizo el agente y lo que ocurrió como consecuencia de ello, que se utiliza para calcular la recompensa y actualizar la política. En pocas palabras: la transcripción completa de la conversación de apoyo de principio a fin, incluidas todas las decisiones que tomó el agente y cómo se desarrollaron las cosas.
-
Recompensa acumulada: la recompensa total acumulada en todos los pasos de un episodio, que es lo que el agente intenta maximizar en última instancia. En términos simples: no solo si un paso salió bien, sino si toda la conversación salió bien en general.
Casos de uso para el aprendizaje por refuerzo en varios turnos
Multi-turn El RL es el enfoque correcto cuando una sola respuesta no es suficiente para completar bien una tarea. Si su caso de uso implica una secuencia de pasos y las decisiones dependen de las decisiones anteriores, vale la pena considerar la RL de varios turnos.
Estas son algunas señales que apuntan a ello:
-
Su tarea requiere una interacción de ida y vuelta: el modelo debe hacer preguntas, recopilar información y adaptarse en función de lo que vaya aprendiendo a lo largo del camino. Un único ciclo de respuesta rápida no es suficiente. Ejemplo: un agente de soporte que diagnostica un problema haciendo preguntas de seguimiento antes de sugerir una solución.
-
La calidad del resultado depende de una secuencia de acciones: obtener la respuesta correcta al final requiere hacer los movimientos correctos en todo momento. Recompensar solo el resultado final no es suficiente si el camino para llegar allí es importante. Ejemplo: un asistente de codificación que planifica, escribe, ejecuta y depura el código en varios pasos.
-
El modelo debe utilizar herramientas en varios pasos: el modelo utiliza herramientas externas, como la búsqueda, las API o la ejecución de código, y los resultados de una llamada a una herramienta influyen en las siguientes acciones. Ejemplo: un asistente de investigación que busca información, evalúa los resultados y afina su consulta antes de elaborar un resumen.
-
Los errores que se cometan a mitad de una tarea deberían poder recuperarse: es mejor que el modelo reconozca cuando algo no funciona y corrija el rumbo, en lugar de seguir un mal camino desde el principio. Ejemplo: un agente que intenta una solución, comprueba si ha funcionado e intenta un enfoque diferente si no lo ha hecho.
-
Se observa un buen rendimiento en un solo turno, pero la finalización de las tareas de principio a fin es deficiente: si el modelo gestiona bien los pasos individuales, pero se esfuerza por unirlos para lograr un resultado coherente y exitoso, el RL de varios turnos puede ayudar a cerrar esa brecha.
Modelos, precios y regiones compatibles
Modelos compatibles
| Modelo | Region |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1), PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1), PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27B | PDX (us-west-2) |
Precios
Para obtener información completa sobre los precios, consulta la página pública
-
Relleno previo: el coste de procesar las fichas de entrada introducidas en el modelo al inicio de cada paso de formación. Esto incluye el mensaje, el historial de conversaciones y cualquier contexto que reciba el modelo antes de generar una respuesta.
-
Ejemplo: el costo de los tokens que el modelo genera durante la implementación de la capacitación. Aquí es donde el modelo produce sus respuestas, que luego se evalúan y se utilizan para calcular la señal de recompensa.
-
Tren: el coste del pase hacia atrás, en el que los pesos del modelo se actualizan en función de la señal de recompensa. Este es el paso fundamental de aprendizaje en el proceso de RL.