本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
为亚马逊 Nova 模型设置奖励功能
奖励函数评估响应质量并为模型训练提供反馈信号。您可以使用自定义 Lambda 函数或亚马逊 Bedrock-hosted 基金会模型作为评委来设置奖励函数。指导模板可用于简化常见任务(例如指令遵循和格式验证)的奖励功能创建。选择与您的任务要求相匹配的方法。
通过可验证的奖励 (RLVR) 进行强化学习
RLVR 使用可验证的基于规则的评分器或即用型模板为目标任务优化模型,例如代码生成或数学推理。
RLVR(自定义代码)有两个选项:
亚马逊 Bedrock 控制台为评分者 Lambda 函数提供示例模板:
-
通过实证验证进行数学推理
-
格式验证和约束检查
-
带有样板代码的通用评分器 Lambda 模板
使用您自己的 Lambda ARN 创建自定义奖励函数,用于复杂逻辑、外部 API、多步计算或组合多个评估标准。
注意
如果您自带 Lambda 函数,请记住以下几点:
-
对于复杂的评估,将 Lambda 超时时间从默认 3 秒增加到最多 15 分钟。
-
Lambda 执行角色需要权限才能调用模型,如中所述。Amazon Nova 机型的访问和安全
通过 AI 反馈进行强化学习 (RLAIF)
RLAIF 使用带有即用型模板的 AI-based 裁判来优化主观任务模型,例如遵循指令或聊天机器人互动。
对于 RLAIF(模特担任法官):
-
选择亚马逊 Bedrock 托管的基础模型作为 Judge
-
配置评估说明
-
定义评估标准和评分准则
亚马逊 Bedrock 控制台中可用的 LLM-as-Judge 提示模板:
-
以下指令(裁判模型训练)
-
摘要(Multi-turn 对话框)
-
推理评估(专业领域的 CoT)
-
RAG 忠诚度(Context-grounded 问与答)
注意
在训练期间,控制台的 “模型即判断” 选项会自动将您的配置转换为 Lambda 函数。
Lambda 函数实现细节
在实现自定义 Lambda 奖励函数时,您的函数必须接受并返回以下格式的数据。
设计指南
排名回复 — 给最佳答案一个明显更高的分数
使用一致的检查 — 评估任务完成情况、格式遵守情况、安全性和合理时长
保持稳定的扩展 — 保持分数正常化且不可利用