
在AI领域,尤其是大语言模型(LLM)的训练过程中,有一个既核心又棘手的问题:我们该如何教会AI完成那些没有标准答案的复杂任务?
在训练AI时,打分与反馈机制是其学习的核心驱动力。对于如数学计算、编程这类任务,解决方案相对明确:我们可以借助“可验证的奖励”(Verifiable Rewards)——例如运行单元测试,代码通过就给奖励,否则不给。这类反馈机制清晰、客观、有效。
但现实世界远比这复杂。当AI被要求生成医疗建议、法律分析,或撰写营销文案时,“正确”与“错误”往往不再泾渭分明,而是由多种主观标准共同决定。这类任务没有统一答案,难以用传统的可验证奖励来指导学习。
为此,业界主流做法是基于人类偏好反馈的强化学习(RLHF)。其基本逻辑是:模型生成两个回答,由人类标注者从中选出更优者,进而训练出一个奖励模型,以模拟人类的偏好判断。
不过,RLHF也面临三大挑战:
1. 奖励模型是“黑箱”:它本质上是一个神经网络,我们难以确切了解它是依据内容质量还是形式特征(如用词更礼貌或篇幅更长)来打分。
2. 奖励作弊(Reward Hacking):模型会学会“迎合”奖励模型的偏好,以博取高分,但这未必意味着能力提升。
3. 成本高昂:依赖大量人工标注,既耗时又昂贵,难以大规模推广。
那么,有没有一种方式,既像单元测试那样明确、可解释,又能应对现实世界任务的复杂性与模糊性?
这正是我们今天关注的研究——Scale AI提出的《Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains》所尝试解决的问题。他们提出了一个新框架:Rubrics as Rewards(RaR,标准即奖励),旨在为AI训练提供一种更透明、更稳健、更可控的新范式。
RaR的核心思想其实非常符合我们的直觉。想象一下,老师在批改一篇复杂的论述题作文时,会怎么做?他不会简单地给出一个模糊的好或坏,而是会拿出一张详细的评分标准卡(Grading Rubric),从论点是否明确、论据是否充分、结构是否清晰、语言是否流畅等多个维度进行打分。

RaR框架正是将这种评分卡机制引入了AI的训练过程。它不再依赖一个模糊的奖励模型,而是将对一个复杂回答的评估,分解成一系列结构化的、可量化的、可解释的评估标准(Rubrics)。
这篇论文的主要贡献可以归结为以下几点:
RaR-Medical-20k和RaR-Science-20k这两个包含问题和对应评估标准的新数据集,为社区的后续研究提供了宝贵资源。
简而言之,RaR试图用工程化的、结构化的方法,去解决一个原本依赖于感觉和品味的对齐问题。
RaR框架的实现主要分为两个核心阶段:评估标准生成 和 基于标准的强化学习训练。
这是整个框架的基石。如何为每一个复杂问题,都量身定制一张高质量的评分卡呢?研究者们设计了一套精妙的自动化流程。
1️⃣流程设定:
gpt-4o等模型)来扮演出题老师的角色。2️⃣设计原则:这位出题老师在设计评分卡时,会遵循四个黄金准则:
有了评分卡,训练过程就变得清晰起来。这个过程是一个在线学习循环:
1️⃣角色分配:
Qwen2.5-7B。gpt-4o-mini。
2️⃣训练循环:
一个有趣的技术细节:如何计算最终奖励?
论文探索了两种不同的打分聚合方式:

这种方式的优点是完全透明,但可能有些僵化。

这种方式赋予了裁判模型根据上下文动态权衡各项标准的能力。实验结果也表明,隐式聚合的效果通常更好,这是一个非常耐人寻味的发现。
研究者们在医学和科学推理这两个公认的硬核领域,对RaR框架进行了严格的测试。
实验设置:
Qwen2.5-7B作为被训练的策略模型。Simple-Likert:让裁判模型直接给回答打1-10分,不提供任何评分卡。Reference-Likert:让裁判模型将回答与专家写的“标准答案”对比后,再打1-10分。这是一个非常强的基线。
关键实验结论:
1. RaR效果拔群,全面超越基线:
从论文的表1可以看出,RaR方法,特别是RaR-Implicit,在两个领域都取得了最佳性能。在HealthBench-1k上,RaR-Implicit的得分比Simple-Likert基线相对提升了高达28%,并且也超过了强大的Reference-Likert基线。这证明了使用结构化的评分卡作为奖励信号,远比模糊的打分或简单的答案比对更有效。

表1的数据清晰地显示,无论是医学还是科学领域,RaR-Implicit方法(橙色高亮)的得分均名列前茅,一致性地超越了所有基线方法。
2. “专家指导”是成功的关键:
光有评分卡还不够,评分卡的质量至关重要。论文的表3和图2揭示了一个核心事实:使用“参考答案”作为指导生成的评分卡,其效果远胜于让AI凭空生成的评分卡。 在HealthBench上的实验显示,有参考答案指导的RaR模型得分(0.359),显著高于没有参考答案的版本(0.320)。这说明,RaR框架的成功,离不开高质量的“专家知识”作为锚点。

3. 隐式聚合的智慧:灵活性优于僵化:
实验一致表明,让裁判LLM进行“隐式”的整体评估,效果要优于“显式”的机械加权。这或许说明,对于复杂的评估任务,一个灵活、能感知上下文的判断机制,比一套固定的规则更为强大。它允许裁判在“必须满足的核心要求”和“锦上添花的加分项”之间做出更智能的权衡。

4. 评分卡的设计细节决定成败:
论文中的消融研究(表2)进一步证明了评分卡设计的精妙之处。使用一套通用的、非定制化的评分卡效果很差;而只包含“必需”标准、缺乏丰富维度的评分卡,效果也会打折扣。这证明了RaR成功的秘诀,正在于其为每个问题量身定制一套丰富、全面、有层次的评估标准。

RaR框架的提出,为我们打开了一扇新的大门。它带来的启示是深远的:
1. 可解释性与信任:
RaR最大的魅力在于它的透明度。当模型表现不佳时,我们可以直接追溯到是评分卡上的哪一条标准没有满足。这种可追溯性对于调试模型、建立用户信任至关重要,尤其是在医疗、金融等高风险领域。
2. 通用性与可扩展性:
“评分卡”的思想具备极强的通用性。未来,我们可以为更多类型的任务设计评估标准,比如评估AI生成的图像是否符合艺术风格、多模态输出的内容是否协调,甚至可以用来评估一个复杂的AI代理(Agent)任务流是否每一步都执行到位。
3. 未来的研究方向:
总而言之,Scale AI的这项研究工作,不仅仅是提出了一种新的训练技术,更是倡导了一种全新的AI对齐哲学:从追求模糊的“拟人化”,转向构建清晰的、可度量的、值得信赖的“专业化”标准。这或许正是我们通往更强大、更可靠的通用人工智能的必经之路。
参考文献
论文名称: Rubrics as Rewards:Reinforcement Learning Beyond Verifiable Domains
第一作者: Scale AI
论文链接: https://arxiv.org/abs/2507.17746
发表日期: 2025年7月23日
GitHub:无
你好,我是唐国梁Tommy,专注于分享AI前沿技术。