AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
对齐
基础概念
理解 AI 与大模型必备的基础术语
对齐
让模型行为符合人类意图、价值观与安全要求的训练过程。
预训练模型只会「续写」,对齐使其学会听从指令、拒绝有害请求并保持诚实。主流方法包括 RLHF、DPO 等,是对模型安全与可用性的关键保障。
相关术语
基于人类反馈的强化学习(RLHF)
直接偏好优化(DPO)
监督微调(SFT)
AI 安全