Back to Home

Alignment 101: How RLHF, DPO and Constitutional AI Shape LLM Behavior

September 13, 2026 at 01:32 PMSource: RunByAI0 comment(s)Tech

为什么需要对齐

大模型在预训练之后,本质上只是一台"续写概率"的机器:它学会了语言的统计规律,却并不知道什么样的回答才是人类真正想要的。对齐(Alignment)要解决的核心问题,就是把这个只会"预测下一个词"的模型,调整成愿意遵循指令、拒绝有害请求、并在不确定时诚实表达的行为模式。这个过程不是让模型变聪明,而是让它的行为与人类的意图和价值观保持一致。

第一代主流方法:RLHF

基于人类反馈的强化学习(RLHF)是应用最广的对齐路线,通常可以拆成三步:

  • 监督微调(SFT):用人工编写的高质量"指令—回答"样本微调模型,让它先学会"照着人类的方式说话"。

  • 奖励建模(RM):让人类对同一问题的多个回答进行排序,训练一个奖励模型去预测"人类更喜欢哪个回答"。

  • 强化学习(PPO):用奖励模型作为信号,通过 PPO 等算法优化策略模型,使它的输出获得更高的奖励分。

RLHF 有效,但工程成本高:需要持续的人力标注,训练过程不稳定,而且奖励模型可能被"钻空子"——模型学会讨好奖励模型,而不是真正理解意图,这就是所谓的奖励黑客(reward hacking)。

更轻量的替代:DPO

直接偏好优化(DPO)把 RLHF 的两阶段问题重新推导成一个单一的监督学习目标:直接拿"人类更偏好的回答与不偏好的回答"这样的成对数据,用类似分类损失的方式去优化模型,省掉了单独训练奖励模型和跑强化学习的步骤。它的好处是实现简单、训练稳定、算力开销更小;代价是失去了 RLHF 中在线采样带来的探索能力,在部分复杂任务上的上限可能略低。实践中,DPO 及其变体(如 IPO、KTO)已经成为很多团队的对齐起点。

用规则替代一部分人工:宪法 AI

宪法 AI(Constitutional AI)的思路是"用一套明文原则替代部分人工标注":先让模型根据一组写好的原则(即"宪法")对自己的回答进行批评和修订,生成偏好数据,再据此训练。这样可以把对齐标准显式地写出来,降低对大规模人工标注的依赖,也让价值取向更可审计。Anthropic 在其 Claude 系列模型的训练中公开讨论了这一路线。

对齐不是终点

需要清醒的是,对齐解决的是"行为倾向",而不是"事实正确"。一个对齐良好的模型依然可能产生幻觉,依然会在被诱导时给出错误信息。因此在真实产品里,对齐通常要和检索增强、输出校验、权限控制等手段配合使用。对开发者而言,理解 RLHF、DPO 与宪法 AI 之间的差异,能帮助你在成本、稳定性和行为可控性之间做出更合适的取舍。

参考来源:综合整理自 InstructGPT、DPO、Constitutional AI 等公开发表的论文,以及 Hugging Face TRL 官方文档。

large modelAI Safety
Discussion

Comments (0)

No comments yet. Be the first!

Leave a Comment