首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Scale AI用“AI评分卡”重新定义强化学习,让模型对齐更透明

Scale AI用“AI评分卡”重新定义强化学习,让模型对齐更透明

作者头像
唐国梁Tommy
发布2026-06-25 20:54:24
发布2026-06-25 20:54:24
3330
举报

在AI领域,尤其是大语言模型(LLM)的训练过程中,有一个既核心又棘手的问题:我们该如何教会AI完成那些没有标准答案的复杂任务?

在训练AI时,打分与反馈机制是其学习的核心驱动力。对于如数学计算、编程这类任务,解决方案相对明确:我们可以借助“可验证的奖励”(Verifiable Rewards)——例如运行单元测试,代码通过就给奖励,否则不给。这类反馈机制清晰、客观、有效。

但现实世界远比这复杂。当AI被要求生成医疗建议、法律分析,或撰写营销文案时,“正确”与“错误”往往不再泾渭分明,而是由多种主观标准共同决定。这类任务没有统一答案,难以用传统的可验证奖励来指导学习。

为此,业界主流做法是基于人类偏好反馈的强化学习(RLHF)。其基本逻辑是:模型生成两个回答,由人类标注者从中选出更优者,进而训练出一个奖励模型,以模拟人类的偏好判断。

不过,RLHF也面临三大挑战:

1. 奖励模型是“黑箱”:它本质上是一个神经网络,我们难以确切了解它是依据内容质量还是形式特征(如用词更礼貌或篇幅更长)来打分。

2. 奖励作弊(Reward Hacking):模型会学会“迎合”奖励模型的偏好,以博取高分,但这未必意味着能力提升。

3. 成本高昂:依赖大量人工标注,既耗时又昂贵,难以大规模推广。

那么,有没有一种方式,既像单元测试那样明确、可解释,又能应对现实世界任务的复杂性与模糊性?

这正是我们今天关注的研究——Scale AI提出的《Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains》所尝试解决的问题。他们提出了一个新框架:Rubrics as Rewards(RaR,标准即奖励),旨在为AI训练提供一种更透明、更稳健、更可控的新范式。

告别模糊的感觉,拥抱清晰的评分卡

RaR的核心思想其实非常符合我们的直觉。想象一下,老师在批改一篇复杂的论述题作文时,会怎么做?他不会简单地给出一个模糊的好或坏,而是会拿出一张详细的评分标准卡(Grading Rubric),从论点是否明确、论据是否充分、结构是否清晰、语言是否流畅等多个维度进行打分。

RaR框架正是将这种评分卡机制引入了AI的训练过程。它不再依赖一个模糊的奖励模型,而是将对一个复杂回答的评估,分解成一系列结构化的、可量化的、可解释的评估标准(Rubrics)

这篇论文的主要贡献可以归结为以下几点:

  • 提出了RaR框架:一个新颖、透明且模块化的LLM训练框架,用清晰的标准取代了模糊的偏好。
  • 实现了评估标准的自动生成:开发了一种可扩展的方法,利用一个强大的专家LLM作为代理,为海量问题自动生成高质量的评估标准卡,极大地降低了人工成本。
  • 验证了卓越的性能:通过在医学和科学推理这两个极具挑战性的领域进行实验,证明了RaR框架不仅有效,而且其性能显著优于传统方法。
  • 开源了宝贵的数据集:发布了RaR-Medical-20kRaR-Science-20k这两个包含问题和对应评估标准的新数据集,为社区的后续研究提供了宝贵资源。

简而言之,RaR试图用工程化的、结构化的方法,去解决一个原本依赖于感觉和品味的对齐问题。

如何打造并使用这张“AI评分卡?

RaR框架的实现主要分为两个核心阶段:评估标准生成基于标准的强化学习训练

第一阶段:评估标准生成——精心设计评分卡

这是整个框架的基石。如何为每一个复杂问题,都量身定制一张高质量的评分卡呢?研究者们设计了一套精妙的自动化流程。

1️⃣流程设定:

  • 输入:一个具体的问题(Prompt)和一个由人类专家或更强大的LLM撰写的高质量参考答案。
  • 执行者:一个能力极强的专家LLM(在论文中,他们使用了OpenAI的gpt-4o等模型)来扮演出题老师的角色。
  • 目标:生成一份包含7到20条评估标准的清单。

2️⃣设计原则:这位出题老师在设计评分卡时,会遵循四个黄金准则:

  • grounded in Expert-guidance(基于专家指导):评分标准必须牢牢扎根于参考答案提供的核心事实和逻辑。确保抓住了问题的关键。
  • comprehensive coverage(全面的覆盖范围):评分卡需要覆盖事实准确性、逻辑完整性、表达风格等多个维度。最有趣的是,它还包含陷阱(Pitfall)标准,专门用来识别和惩罚那些常见的错误。
  • semantic weighting(语义化加权):每条标准都被赋予一个类别,以体现其重要性:
    • Essential(必需的):这是回答的底线,如果缺失,整个回答无效。
    • Important(重要的):极大地影响回答的质量,是得分的关键。
    • Optional(可选的):锦上添花的加分项,能体现回答的深度。
    • Pitfall(陷阱):负分项,如果踩中,奖励将被扣除。
  • self-contained evaluation(自包含评估):每条标准都必须是独立的、清晰的,让评估者(无论是人还是AI)无需查阅外部资料就能做出“是/否”的判断。
第二阶段:GRPO训练——用评分卡指导AI进化

有了评分卡,训练过程就变得清晰起来。这个过程是一个在线学习循环:

1️⃣角色分配

  • 策略模型:我们想要训练的主角,比如论文中使用的Qwen2.5-7B
  • 裁判模型:负责使用评分卡来打分的AI裁判,比如gpt-4o-mini

2️⃣训练循环

  • 生成回答:策略模型针对一个问题,生成自己的回答。
  • 进行评估:裁判模型拿到问题、策略模型的回答、以及我们预先生成好的评分卡
  • 计算奖励:裁判模型根据评分卡给回答打分,并输出一个最终的奖励分数。
  • 更新策略:这个清晰的、量化的奖励分数被输入到GRPO算法中,用于指导策略模型的参数更新,让它朝着能拿更高分的方向进化。

一个有趣的技术细节:如何计算最终奖励?

论文探索了两种不同的打分聚合方式:

  • 显式聚合(Explicit Aggregation):这种方式非常直接。裁判模型对评分卡上的每一条标准进行独立的“是/否”(1/0)打分,然后根据预设的权重(Essential=1.0, Important=0.7等)进行加权求和。其数学公式为:

这种方式的优点是完全透明,但可能有些僵化

  • 隐式聚合(Implicit Aggregation):这种方式更灵活。我们把问题、回答和整张评分卡(包括所有标准的描述和权重类别)一次性都交给裁判模型,然后让它给出一个整体的、综合性的评分(例如1到10分)。

这种方式赋予了裁判模型根据上下文动态权衡各项标准的能力。实验结果也表明,隐式聚合的效果通常更好,这是一个非常耐人寻味的发现。

实验结果分析:RaR框架的真实战力

研究者们在医学和科学推理这两个公认的硬核领域,对RaR框架进行了严格的测试。

实验设置

  • 任务领域:医学(HealthBench-1k基准)和科学(GPQA_Diamond基准)。
  • 基础模型:使用Qwen2.5-7B作为被训练的策略模型。
  • 对比基线
    • Simple-Likert:让裁判模型直接给回答打1-10分,不提供任何评分卡。
    • Reference-Likert:让裁判模型将回答与专家写的“标准答案”对比后,再打1-10分。这是一个非常强的基线。

关键实验结论

1. RaR效果拔群,全面超越基线

从论文的表1可以看出,RaR方法,特别是RaR-Implicit,在两个领域都取得了最佳性能。在HealthBench-1k上,RaR-Implicit的得分比Simple-Likert基线相对提升了高达28%,并且也超过了强大的Reference-Likert基线。这证明了使用结构化的评分卡作为奖励信号,远比模糊的打分或简单的答案比对更有效。

表1的数据清晰地显示,无论是医学还是科学领域,RaR-Implicit方法(橙色高亮)的得分均名列前茅,一致性地超越了所有基线方法。

2. “专家指导”是成功的关键

光有评分卡还不够,评分卡的质量至关重要。论文的表3图2揭示了一个核心事实:使用“参考答案”作为指导生成的评分卡,其效果远胜于让AI凭空生成的评分卡。 在HealthBench上的实验显示,有参考答案指导的RaR模型得分(0.359),显著高于没有参考答案的版本(0.320)。这说明,RaR框架的成功,离不开高质量的“专家知识”作为锚点。

3. 隐式聚合的智慧:灵活性优于僵化

实验一致表明,让裁判LLM进行“隐式”的整体评估,效果要优于“显式”的机械加权。这或许说明,对于复杂的评估任务,一个灵活、能感知上下文的判断机制,比一套固定的规则更为强大。它允许裁判在“必须满足的核心要求”和“锦上添花的加分项”之间做出更智能的权衡。

4. 评分卡的设计细节决定成败

论文中的消融研究(表2)进一步证明了评分卡设计的精妙之处。使用一套通用的、非定制化的评分卡效果很差;而只包含“必需”标准、缺乏丰富维度的评分卡,效果也会打折扣。这证明了RaR成功的秘诀,正在于其为每个问题量身定制一套丰富、全面、有层次的评估标准

启示与未来展望

RaR框架的提出,为我们打开了一扇新的大门。它带来的启示是深远的:

1. 可解释性与信任

RaR最大的魅力在于它的透明度。当模型表现不佳时,我们可以直接追溯到是评分卡上的哪一条标准没有满足。这种可追溯性对于调试模型、建立用户信任至关重要,尤其是在医疗、金融等高风险领域。

2. 通用性与可扩展性

“评分卡”的思想具备极强的通用性。未来,我们可以为更多类型的任务设计评估标准,比如评估AI生成的图像是否符合艺术风格、多模态输出的内容是否协调,甚至可以用来评估一个复杂的AI代理(Agent)任务流是否每一步都执行到位。

3. 未来的研究方向

  • 可以探索更智能的动态权重方案,让评分卡中各项标准的权重可以根据训练阶段或任务难度自适应调整。
  • 可以将RaR应用于更复杂的多步推理和工具使用场景,为AI代理的每一步行动提供清晰的奖励信号。
  • 可以设计对抗性的评估机制,训练一个模型专门去寻找当前评分卡的漏洞,从而迭代地增强评分卡的鲁棒性。

总而言之,Scale AI的这项研究工作,不仅仅是提出了一种新的训练技术,更是倡导了一种全新的AI对齐哲学:从追求模糊的“拟人化”,转向构建清晰的、可度量的、值得信赖的“专业化”标准。这或许正是我们通往更强大、更可靠的通用人工智能的必经之路。

参考文献

论文名称: Rubrics as Rewards:Reinforcement Learning Beyond Verifiable Domains

第一作者: Scale AI

论文链接: https://arxiv.org/abs/2507.17746

发表日期: 2025年7月23日

GitHub:无


你好,我是唐国梁Tommy,专注于分享AI前沿技术。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-07-26,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 告别模糊的感觉,拥抱清晰的评分卡
  • 如何打造并使用这张“AI评分卡?
    • 第一阶段:评估标准生成——精心设计评分卡
    • 第二阶段:GRPO训练——用评分卡指导AI进化
  • 实验结果分析:RaR框架的真实战力
  • 启示与未来展望
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档