基础概念理解 AI 与大模型必备的基础术语

对齐

让模型行为符合人类意图、价值观与安全要求的训练过程。

预训练模型只会「续写」,对齐使其学会听从指令、拒绝有害请求并保持诚实。主流方法包括 RLHF、DPO 等,是对模型安全与可用性的关键保障。

相关术语