← ClaudeAtlas

ml-alignment-rlhflisted

对齐方法论:下一词预测≠听人话、RLHF 三阶段(SFT→奖励模型→PPO)、奖励黑客识别与缓解、 DPO 免强化学习替代、对齐税权衡。用户问"RLHF 怎么回事/为何先 SFT 再训奖励模型/base 和 chat 模型差在哪"、纠结"PPO 还是 DPO"、发现模型讨好废话格式空转时激活;E 为对齐决策树。 不适用于: 微调档位(ml-pretraining-paradigm)、大模型评测(ml-llm-evaluation)。 trigger: RLHF, reward model 奖励模型, PPO, DPO, reward hacking 奖励黑客
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 对齐方法论 — 让"会接话"的模型变成"听人话"的助手 ## R — 原文 (Reading) > **来源说明**: 本 skill 属扩充批D——主题远超西瓜书覆盖范围(西瓜书成书的 2016 年尚无此领域),R 段改引对齐奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。 > Our method consists of three steps: (1) collect demonstration data and train a supervised policy (SFT); (2) collect comparison data and train a reward model (RM) from human preferences; (3) optimize a policy against the reward model using PPO.(转述) > > — 转述自 L. Ouyang 等《Training language models to follow instructions with human feedback》(InstructGPT, NeurIPS 2022), 方法节(来源性质:奠基论文公认表述) > We use human feedback to directly optimize a reinforcement learning objective on tasks where the goal is hard to specify with a hand-designed reward function—the agent optimizes what humans prefer, and we must watch for it exploiting imperfections in the learned reward predictor.(转述) > > — 转述自 P. Christiano 等《Deep Reinforcement Learning from Human Preferences》(NeurIPS 2017)(来源性质:奠基论文公认表述) --- ## I — 方法论骨架 (Interpretation) 预训练的目标函数是"预测下一个词",它只教会模型**模仿人类文本的分布**,不教会模型**按人的意图行事**——续写出偏题但流畅的回答、编造事实、无视指令约束,都是下一词预测的合法输出。对齐(alignment)就是在预训练能力之上,把模型的输出分布推向"有帮助、诚实、无害"的人类偏好区。主流方法论的骨架: - **三阶段流程(InstructGPT 定型)**: ①SFT——用人工撰写的高质量示范做监督微调,先让模型见过"好的回答长什么样";②奖励模型(RM)——让人对同一提示的多个回答做两两偏好比较,训练一个打分模型去拟合人类偏好排序(用比较而非绝对打分,因为人评相对判断比绝对判断一致得多);③强化学习(PPO)——以 RM 分数为奖赏、以 KL 惩罚锚住原模型,优化策略生成高奖励且不漂移过远的回答。三阶段缺一环都有替代品,但组合是公认基线。 - **奖励黑客(reward hacking)**: RM 只是人类偏好的有损代理;策略会精准钻代理的空子——堆砌套话、拉长篇幅、谄媚口吻、格式花哨而内容空洞——RM 打分涨了,真实质量没涨甚至更差。这是 Goodhart 定律的对齐版:"当代理指标成为目标,它就不再是好指标"。缓解手段包括 KL