Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

量子位 2026-07-25 15:32
ILP团队 投稿 
量子位 | 公众号 QbitAI

大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的LLM落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用SFT做领域适配。

但一个尴尬的事实是:大家都默认SFT“训练完就是学完了”。直到腾讯混元团队对Qwen、LLaMA、OLMo2等多个模型家族(1.8B–14B)和10个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss也降下去了,但回头重测就是答不对。平均比例高达15.3%

这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)——SFT训练的系统性盲区。

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图1

发表:ACL 2026主会长文(Long Paper,Pages 30186–30213)

背景

场景与痛点

SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:

但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。

与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4等都有专门的数据质量研究),但SFT阶段几乎没人追问“模型到底学会了什么、没学会什么”。

论文做了什么

这篇论文完成了四项工作:

ILP现象:训练loss收敛后仍有大量样本无法正确复现:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图2
不完全学习现象示意图——SFT后训练集回测,部分样本在训练过程中并未被有效学习

四步诊断框架一图胜千言:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图3
三段式诊断框架——检测→归因→干预,覆盖ILP全生命周期

技术方案——四步诊断框架

整个框架分为四个阶段:

Detect(检测)→Attribute(归因)→Intervene(干预)→Verify(验证)

Step 1:检测(Detect)——怎么知道模型“没学会”?

这是最复杂的一步。难点在于:怎么区分“大致理解”和“真正学会”?

SFT通常生成自由文本,这种形式的“答对”太模糊。论文的做法是:

MC转换(Multiple-Choice Conversion):

案例:原始数据是“What is the capital of France?→Paris”,转换成:

Q:What is the capital of France?
A. London B. Paris C. Berlin D. Madrid

pass@k指标(k=5):

这里k=5不是随便取的:温度变化可能带来回答的随机性,pass@5=给了5次机会,比top-1更公允。

三重验证(Triple Validation):

为避免误判,论文做了三层交叉验证:

检测流程图:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图4
MC转换方案——将监督响应转化为选择题格式,消除自由文本评估噪声

Step 2:归因(Attribute)——为什么没学会?

这是全文最核心的贡献。论文提出了一个2×2归因矩阵,纵轴是“基模型是否已掌握该知识”(预训练阶段),横轴是“SFT标签是否正确”(标注质量)

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图5

两步快速定位:

最终锁定五大根因:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图6

2×2归因矩阵:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图7
2×2归因框架——横轴「基模型是否已知该知识」,纵轴「SFT标签是否正确」

关键发现:ILP与标注质量无关。即使SFT标签正确率超过98%,ILP仍然存在。说明这不是“数据错了”的问题,而是SFT训练机制本身的系统性不足。

另一个惊人发现:ILP与模型规模弱相关。从Qwen-1.8B换到Qwen-14B,ILP仅降低2.1个百分点。也就是说,更大规模的模型并不能显著解决“学不会”的问题——这指向SFT优化机制,而不是模型容量。

Step 3:干预(Intervene)——怎么让模型学会?

论文根据五种根因,设计了对症的五类干预:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图8

最惊人的对比实验:

CPT(2倍训练量)→ILP降12.5%
加epochs(10倍训练量)→ILP仅降2%

这意味着:拼命加SFT训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT本身存在物理上限,它只能“重新组织”已有知识,无法凭空创造新知识。

Step 4:验证(Verify)——干预真的有效吗?

干预后重新走一遍检测流程,对比干预前后的ILP率:

实验结果

ILP现象确实存在

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图9

数据集中ILP分布:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图10
CPT引入后医疗、法律、金融等知识密集型领域的准确率持续增长

ILP与模型规模关系极弱

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图11

从1.8B到14B,参数量翻了近8倍,ILP仅降了2.1个百分点。ILP是SFT机制层面的问题,不是模型不够大。

干预效果:CPT>>加Epochs

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图12

10倍算力换来2%vs2倍算力换来12.5%。该把钱花在预训练,而不是无限堆SFT epoch。

物理溯源验证

将ILP样本中涉及的知识点在Dolma 5T语料库中检索:

消融与溯源结果:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图13
CPT前后各模型准确率对比——提升在跨模型规模和领域中保持稳定

模型家族对比:

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本图14
应用各项优化策略后各基线模型的性能提升对比

项目价值

学术价值

实践指导意义

作者团队

腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。

该工作入选ACL 2026主会Long Paper,是SFT诊断方向第一篇系统性研究。

论文(arXiv):https://arxiv.org/abs/2604.10079
论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/
代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
拆解
more
不炫技术只聊落地!知乎现身WAIC现场,拆解AI“最后一公里”难题
3360亿晶体管!性能怪兽-英伟达 Rubin GPU 架构全面拆解分析
5.8 元芯片能撑起2000元的玩具车?"上帝的左手"内部有什么秘密?拆解背后的行业真相
为iPhone而生的红点奖单品!深度拆解安克25W Qi2.2三合一折叠无线充
一个螺丝孔竟是天线?拆解360胎压传感器的巧妙之作!
鸿蒙为何选中一家世界模型「狂想者」?拆解极顶数创的AI 3D底牌
200块捡漏的欧姆龙PLC,拆解看看接口电路设计和外壳结构设计!
10元定时器拆解惊现STM32:是良心用料还是翻新芯片?
拆解报告:白牌100W 2C1A智显屏氮化镓快充
拆解报告:MOVA-AEFD灵动Ultra 70W双口充电器
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号