首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >如何用更强大的模型自动生成直接偏好优化所需的偏好对?

如何用更强大的模型自动生成直接偏好优化所需的偏好对?

词条归属:直接偏好优化

1. 模型评判生成偏好

  • 用能力更强的模型(如更大规模或更强对齐的模型)对较小模型的多条输出打分或排序,自动产出 chosen / rejected 对
  • 这种方式可大幅减少人工标注成本,同时保持数据质量

2. 合成数据的工作流

  • 先由待对齐模型对同一提示采样多条候选,再交由强模型判定优劣并构建偏好对,最后用 DPO 微调原模型
  • 该流程使团队能针对特定失败模式快速迭代对齐修正,在数小时内完成一轮纠偏微调

3. 质量与偏差控制

  • 合成偏好需防范强模型的系统性偏差(如偏好更长回答)被放大;应通过多样化提示、质量筛选与长度控制保证数据真实反映人类偏好
相关文章
AI训练策略:SFT、DPO与GRPO技术演进全解析
SFT是让一个已经通过海量数据预训练的大模型(它只是学会了语言的统计规律,像个只会接龙的“初学者”)学习如何理解和执行人类的具体指令。
索旭东
2026-03-04
2.2K0
破解AI绘画调参噩梦!10分钟完美对齐人类审美,真实感效率暴涨3倍!| 腾讯&港中文&清华
文章链接:https://arxiv.org/pdf/2509.06942 Git链接:https://github.com/Tencent-Hunyuan/SRPO 项目链接:https://tencent.github.io/srpo-project-page/ Huggingface: https://huggingface.co/tencent/SRPO
AI生成未来
2025-11-17
8380
RLHF中的「RL」是必需的吗?有人用二进制交叉熵直接微调LLM,效果更好
近来,在大型数据集上训练的无监督语言模型已经获得了令人惊讶的能力。然而,这些模型是在具有各种目标、优先事项和技能集的人类生成的数据上训练的,其中一些目标和技能设定未必希望被模仿。
机器之心
2023-08-04
1.1K0
强化学习 | 优化策略 Roadmap 介绍
强化学习(Reinforcement Learning)是大模型后训练的重要一环,其主要是研究智能体和环境的交互问题,其中涉及多种强化学习策略和优化方案。本节围绕强化学习,梳理主要策略的方式和它们之间的演进路线,主要包括:
AI老马
2026-01-13
6680
RLHF(人类反馈强化学习,Reinforcement Learning from Human Feedback)已死?RLHF 2.0用多智能体协同AI对齐
在人工智能的发展史上,2022年11月30日是一个分水岭。OpenAI发布的ChatGPT,凭借其惊人的语言理解和生成能力,瞬间引爆了全球对通用人工智能(AGI)的无限遐想。然而,在惊叹于其博学多才的同时,一个根本性的问题浮出水面:一个知识渊博但口无遮拦、甚至可能输出有害信息的模型,真的有用吗?
jack.yang
2026-05-02
7580
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券