¿Qué ocurrió?

Amazon Web Services (AWS) publicó el 14 de agosto de 2026 una entrada de blog técnica sobre el diseño de funciones de recompensa personalizadas para el aprendizaje por refuerzo multivuelta (multi-turn reinforcement learning, RL) en la plataforma Amazon Nova Forge. El artículo funciona como una guía para desarrolladores que buscan personalizar los modelos Amazon Nova mediante ajuste fino por refuerzo (reinforcement fine-tuning, RFT).

Nova Forge, a través de una función llamada Bring Your Own Orchestration (BYOO), permite a los desarrolladores ejecutar la lógica de recompensa en su propio entorno, por ejemplo en Amazon Elastic Container Service (Amazon ECS). La plataforma también ofrece una opción de RL multivuelta sin servidor (serverless), ahora de disponibilidad general, para los equipos que prefieren no gestionar esta infraestructura.

¿Por qué es importante?

En tareas multivuelta —procesos basados en agentes que incluyen pasos como llamadas a herramientas, ejecución de código o recuperación tras errores— diseñar correctamente la función de recompensa determina directamente lo que aprende el modelo. Según AWS, una recompensa levemente mal calibrada puede enseñar al modelo un comportamiento incorrecto, incluso si las curvas de entrenamiento parecen saludables.

Por ello, las funciones de recompensa basadas en AWS Lambda, usadas en tareas de un solo turno, resultan insuficientes en tareas multivuelta, ya que las conversaciones prolongadas y los procesos de puntuación pueden superar el límite de 15 minutos por invocación de Lambda. Nova Forge resuelve este problema con BYOO, delegando cada repetición (rollout) al entorno del cliente y recopilando los episodios completados para el entrenamiento.

¿Cómo funciona la función de recompensa?

Según la información compartida por AWS, el sistema utiliza el algoritmo Group Relative Policy Optimization (GRPO). En este método, se muestrean varias finalizaciones (rollouts) del modelo para cada conversación y se clasifican mediante la función de recompensa; las finalizaciones con mayor puntuación se usan para actualizar los pesos del modelo.

  • Recompensas por resultado (a nivel de episodio): miden si la salida final cumple el objetivo, por ejemplo, si se superan las pruebas unitarias.
  • Recompensas conductuales (a nivel de turno): evalúan comportamientos intermedios, como que el modelo pregunte antes de actuar o llame a la herramienta correcta.
  • Penalizaciones: desalientan patrones de fallo como adivinar, repetirse o detenerse.

AWS señala que el uso conjunto de estos tres componentes permite que el modelo aprenda tanto el comportamiento correcto como el resultado correcto, ya que, de lo contrario, un componente podría eclipsar al otro.

¿Qué sigue?

La entrada de blog se presenta como la segunda parte de una serie de AWS sobre este tema; la primera parte abordó la infraestructura de Amazon SageMaker HyperPod y Nova Forge, así como la configuración del entrenamiento. AWS anunció que ha compartido ejemplos de código en el repositorio aws-samples/sample-nova-multi-turn-rl-infra y que abordará ejemplos de diseños de recompensa fallidos, extraídos de un entrenamiento real, en las próximas entregas.