AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
监督微调(SFT)
训练方法
预训练、微调与对齐技术
监督微调(SFT)
用人工标注的「指令-回答」数据训练模型学会遵循指令。
监督微调(SFT)是让预训练模型「开口说话」的关键一步:通过高质量对话数据教会模型回答格式与任务行为,是 RLHF 之前的基础对齐手段。
相关术语
指令微调
基于人类反馈的强化学习(RLHF)
对齐
训练数据