有监督微调(SFT)
数据: 输入与期望输出的样例
教会一项稳定的任务、回复结构、风格或工具调用范式。
注意: 模型可能照搬示范中的错误和偏见,无关行为也可能退化。
把两个决定分开来做:哪种学习目标匹配你的数据,以及更新模型的多大一部分。没有任何方法能在所有模型、任务和硬件上都胜出。
数据: 输入与期望输出的样例
教会一项稳定的任务、回复结构、风格或工具调用范式。
注意: 模型可能照搬示范中的错误和偏见,无关行为也可能退化。
数据: 更受偏好与不受偏好的回复,或等效反馈
当质量更容易比较、而难以写成唯一理想答案时,用它来调整选择倾向。
注意: 标注规范、标注者一致性和保留集评估,和算法本身同样重要。
数据: 提示词,加上可靠的评分器或奖励信号
优化那些能在生成轨迹上一致打分的结果。
注意: 奖励攻击、评分器偏差、不稳定和更高的运维复杂度,都需要额外的控制手段。
更新基座权重,灵活度最高,但在显存、存储和回滚上的负担也最大。
只有当适配器方法达不到实测目标,且基础设施和数据都足以支撑时才考虑。
冻结基座模型,只训练较小的更新模块。产物体积小,多个适配器可以共用一个基座。
对许多 Transformer 工作负载来说,这是合理的首个实验;秩和目标模块仍需通过实验确定。
通过量化后的冻结基座反向传播到 LoRA 适配器,降低基座权重的显存占用,但可能牺牲兼容性和吞吐量。
当显存是主要瓶颈时很有用;请验证量化支持情况和最终的服务质量。
DoRA、AdaLoRA、LoRA+ 等变体改变的是参数化方式、容量分配或优化过程。只有当其实现支持你的模型,并且能解决更简单基线的某个实测短板时,才值得一试。
QAT 针对的是低精度部署之后的质量,这与 QLoRA 不同:后者主要用量化后的冻结基座来降低训练显存。请在目标运行时上验证导出的格式。