训练方法预训练、微调与对齐技术
基于人类反馈的强化学习(RLHF)
用人类偏好反馈训练奖励模型、再优化策略的对齐方法。
RLHF 流程为:收集人类对模型回答的排序 → 训练奖励模型 → 用强化学习(如 PPO)更新策略。它能显著提升回答的有用性与安全性,是 ChatGPT 等产品成功的关键技术。
用人类偏好反馈训练奖励模型、再优化策略的对齐方法。
RLHF 流程为:收集人类对模型回答的排序 → 训练奖励模型 → 用强化学习(如 PPO)更新策略。它能显著提升回答的有用性与安全性,是 ChatGPT 等产品成功的关键技术。