能力退化
目标行为变好,可能让无关能力、置信度校准或安全行为变差。
控制措施: 保留一套冻结的基座模型回归测试集,并用它比较每一个候选。
微调是一次实验,不是有保证的升级。真正该问的是:候选模型能否在不带来无法接受的退化、泄漏、成本或运维风险的前提下,改进一项已定义的工作负载。
目标行为变好,可能让无关能力、置信度校准或安全行为变差。
控制措施: 保留一套冻结的基座模型回归测试集,并用它比较每一个候选。
敏感、重复或可唯一识别的记录,可能被学到并复现出来。
控制措施: 最小化并去重数据、记录来源、扫描密钥和个人数据,并做抽取测试。
不可信或审核不足的样例,可能教会模型不该有的行为或后门。
控制措施: 限制写入权限、保留血缘、审查异常,并在推进上线前测试类似触发词的输入。
当训练样例与测试用例重叠,或用单一指标替代产品目标时,模型会显得更好。
控制措施: 跨划分去重、保留一份封存的保留集,并把任务指标与人工评审和安全评审结合起来。
离线取得的收益,未必能在真实输入、变化的策略或不同的服务模板下保持。
控制措施: 用贴近生产的流量做测试,监控分片和拒答比例,并定义回滚阈值。
某些厂商或框架不支持导出适配器、优化器状态或可部署的检查点。
控制措施: 在训练之前先确认产物归属、导出格式、留存、删除、区域和回滚支持。
这些资料提供方法和证据,但没有一份能确立放之四海而皆准的生产结论。