微调指南
微调中心
在明确权衡与防护措施的前提下,规划、训练、评估并运维模型适配。
微调会改变什么
微调使用任务样例或偏好反馈,更新预训练模型的部分或全部参数。它可以改善某项可度量的行为,例如输出结构、语气或任务准确率,但不会自动补充新知识,不会消除幻觉,也不会让模型变得安全。
值得一试的理由
- • 稳定且反复出现的行为,仅靠调整提示词无法解决
- • 你已有具代表性的样例和可信的评估集
- • 更短的提示词或更小的模型可能改善服务成本
- • 选定的检查点和产物可以部署并纳入治理
改用其他方案的理由
- • 知识会变化或需要给出出处时,使用检索或工具
- • 目标行为能用清晰指令表达时,先改进提示词
- • 模型缺少必要上下文时,修复产品或数据管道
- • 数据权利、质量或评估尚未落实时,推迟训练
面向发布的工作流
- 1写清产品目标、验收标准和可接受的失败额度。
- 2用贴近生产的成功、失败与安全用例,构建一份封存的保留集。
- 3测量仅用提示词、少样本、检索和工具调用这几条基线。
- 4选择许可条款合适的基座模型,以及实际可行的最小适配方法。
- 5运行一次简短且可复现的试点,检查学习曲线和输出样例。
- 6比较质量、退化、延迟、吞吐量和服务总成本。
- 7以灰度方式发布胜出的候选,并配好监控与经过验证的回滚路径。
最少要有的对比报告
在同一份保留集上比较基座检查点、提示词、检索和微调后的候选
带样本数量的分片结果,而不只有一个汇总分数
安全与基础能力的退化情况,以及书面的发布阈值
训练配置、随机种子、代码版本、数据版本和产物哈希
在目标服务栈上实测的延迟、吞吐量、显存和成本
明确的负责人、灰度计划、监控信号和回滚流程