· liyu · ai
我训练出了一个「人工智障」:中文 LLaMA2 (204M) SFT 微调翻车实录与深度复盘
在上一篇完成 Kaggle GPU 上的 LoRA SFT 微调后,满心欢喜地启动推理测试,结果却令人哭笑不得:基座模型还能头头是道地接龙,微调后却退化成了无限复读机与胡言乱语的"人工智障"。本文结合欠拟合、重复惩罚缺失与 LoRA 容量等硬核成因进行深度诊断,给出针对性重构方案。
在上一篇完成 Kaggle GPU 上的 LoRA SFT 微调后,满心欢喜地启动推理测试,结果却令人哭笑不得:基座模型还能头头是道地接龙,微调后却退化成了无限复读机与胡言乱语的"人工智障"。本文结合欠拟合、重复惩罚缺失与 LoRA 容量等硬核成因进行深度诊断,给出针对性重构方案。
完整记录中文 LLaMA2(204M 参数)从预训练向 SFT 指令微调演进的全流程。深入剖析 Loss Masking 数据管道、原生手写 LoRA/QLoRA 模块实现,并深度复盘 Kaggle 云端 GPU 迁移中的只读文件系统、Git LFS 假死、GPU 架构兼容与跨设备张量对齐四大经典工程踩坑。文末联动 AstrBot Agent 微信机器人实现 GPU 训练定时看护。