Alignment 101: How RLHF, DPO and Constitutional AI Shape LLM Behavior
为什么需要对齐大模型在预训练之后,本质上只是一台"续写概率"的机器:它学会了语言的统计规律,却并不知道什么样的回答才是人类真正想要的。对齐(Alignment)要解决的核心问题,就是把这个只会"预测下一个词"的模型,调整成愿意遵循指令、拒绝有害请求、并在不确定时诚实表达的行为模式。这个过程不是让模型变聪明,而是让它的行为与人类的意图和价值观保持一致。第一代主流方法:RLHF基于人类反馈的强化学习(