· liyu · ai
我训练出了一个「人工智障」:中文 LLaMA2 (204M) SFT 微调翻车实录与深度复盘
在上一篇完成 Kaggle GPU 上的 LoRA SFT 微调后,满心欢喜地启动推理测试,结果却令人哭笑不得:基座模型还能头头是道地接龙,微调后却退化成了无限复读机与胡言乱语的"人工智障"。本文结合欠拟合、重复惩罚缺失与 LoRA 容量等硬核成因进行深度诊断,给出针对性重构方案。
在上一篇完成 Kaggle GPU 上的 LoRA SFT 微调后,满心欢喜地启动推理测试,结果却令人哭笑不得:基座模型还能头头是道地接龙,微调后却退化成了无限复读机与胡言乱语的"人工智障"。本文结合欠拟合、重复惩罚缺失与 LoRA 容量等硬核成因进行深度诊断,给出针对性重构方案。