亚马逊团队 投稿
量子位 | 公众号QbitAI
大模型做一道数学题,往往需要生成数千个token的推理过程。
直觉上,如果希望通过后训练提升模型的推理能力,必须在大量token上施加训练信号,再通过整条推理轨迹上的密集更新,让模型逐渐变强。
但来自亚马逊和杜克大学的研究团队一项最新研究发现:一条包含数千个token的推理轨迹,有时只训练其中一个token,就已经足以明显提升模型的推理能力。甚至能够反超对整条轨迹所有token进行训练的效果。

这项工作重新思考了一个长期被忽视的问题:大模型的后训练,真的需要如此密集的学习信号吗?

从On-Policy Distillation开始
这项研究的起点是On-Policy Distillation(OPD,在线策略蒸馏)。传统知识蒸馏通常让学生模型学习教师生成的数据,而OPD有一个重要区别:推理轨迹由学生模型自己生成,再由教师模型对学生实际走过的每一步提供反馈。
假设学生模型生成了一条4000个token的数学推理轨迹,标准OPD可以在这4000个token上逐个比较教师模型和学生模型对当前token的概率。如果教师认为某个token应该更可能出现,就提高它的概率;反之则降低。
因此,一条trajectory可以产生数千个训练信号。这种密集的token-level信号通常被认为是OPD的重要优势之一,研究团队由此提出了一个很简单的问题:如果把这些训练信号一个一个删掉,会发生什么?
99.95%的信号都删掉呢?
研究团队首先做了一个非常极端的实验。对于学生模型生成的每一条推理轨迹,只随机选择一个token参与损失函数的计算和反向传播。也就是说,模型仍然完整生成一道题的推理过程,但真正产生训练信号的,只有其中一个随机位置。如果一条回答有2000个token,那么真正参与训练的比例只有约0.05%。
按照通常的直觉,如此极端稀疏的信号应该会让训练基本失效。但结果恰恰相反:随机监督一个token仍然能够稳定提升学生模型的数学推理能力。而且,这并不是只出现在某一个特殊teacher或student上的偶发现象。研究团队在Qwen3系列上构造了9组不同的teacher–student配置,覆盖:
更大参数量的教师模型→更小参数量的学生模型;
同规模的教师模型和学生模型;
更小参数量的教师模型→更大参数量的学生模型。
在这些不同设置中,每条轨迹随机训练一个token,都能够一致地观察到推理能力的提升。
更奇怪的是:一个token有时比所有token更好
随机一个token已经很反直觉,但接下来的结果更加出人意料。在OPD中,可以衡量教师模型和学生模型在每个token上的分歧程度。有些token上,教师模型比学生模型更加认可当前生成结果;另一些token上,教师模型则明显认为学生不应该这样生成。于是,研究团队尝试只保留这些最“极端”的token。例如,每条轨迹只选择:教师最希望学生增加概率的一个token,或者教师最希望学生降低概率的一个token。
结果发现,仅仅监督这样的1–2个token,在很多实验中就已经可以匹配,甚至超过标准full-token OPD。换句话说,标准OPD可能训练几千个token,而极端稀疏的OPD只训练一个token,后者却不一定更差。
在一个代表性的Qwen3实验中,选择单个极端token得到的学生模型不仅超过了标准OPD得到的学生,甚至超过了提供监督的教师模型本身。这说明,这里发生的事情可能并不像“把teacher完整复制给student”那么简单。

学生模型变强,并不一定意味着它变得更像教师模型
OPD的数学目标,本质上是缩小教师模型和学生模型之间的分布差异。因此,一个很自然的解释是:稀疏OPD之所以有效,也许只是因为少量token已经足以让student更接近teacher。
但实验并不完全支持这个解释。研究团队发现,一些推理性能最好的稀疏OPD模型,reverse KL并没有变得更小,甚至可能变得更大。也就是说:student的推理能力提高了,但它并不一定在整体分布上更加像teacher。因此稀疏OPD带来的推理性能提升,并不只是来自单纯的模仿。
为什么一个token可能有用?
目前尚没有一个完整的理论解释。但一个重要的直觉是:一个token的监督,并不等于模型只学习了一个token。它更像是在一个特定context下,对整个模型参数施加了一次方向明确的推动。如果这种推动足够准确,即可通过少量关键更新,推动模型进入一个更好的参数区域。
这也让人联想到人类的学习过程,老师通常不会把学生解答过程中的每一步都逐字纠正。很多时候,老师只是指出几个关键错误、学生修改自己的理解,再重新尝试。真正有效的学习,也许并不需要micro-level correction。
这只是OPD的特殊现象吗?
为了回答这个问题,研究团队又把实验扩展到了其他的实验环境。结果显示,类似的极端稀疏监督现象并不仅仅存在于最初的Qwen3+数学推理+OPD这一实验环境中。它还可以扩展到:
coding reasoning;
Llama系列模型;
以及基于PPO的RLVR。
特别有趣的是,在PPO实验中,即使密集token训练无法明显提升推理性能,极端稀疏的token更新仍然可能产生有效提升。这意味着,这一现象可能并不只是OPD的一个特殊性质。它指向了一个更普遍的问题:人们是不是高估了大模型后训练真正需要的token-level优化数量?
后训练一定是Token-Intensive的吗?
今天的大模型训练天然以token为单位思考计算量。一次大规模后训练通常会涉及海量token。更多数据、更多rollout、更长trajectory、更密集的监督信号,往往也被默认意味着更多、更充分的优化信号。因此,一个很自然的假设是:想让模型学得更多,就需要让更多token参与训练。但这项工作的实验并不是在说明“大量token没有用”,也不是在声称未来训练大模型只需要一个token。
真正值得注意的是:
推理性能的提升和监督信号的密度之间,并不是一个简单的“越多越好”的关系。
在消融实验中,研究团队观察到了一个明显的非单调关系:当逐渐减少参与训练的token时,性能可能先下降;但当监督信号极端稀疏到只剩下少数token时,性能反而重新上升,并可能超过稠密信号带来的性能提升。
这意味着,未来值得追问的问题或许不应该只是怎样获得更多训练tokens?而应该进一步问:模型真正需要哪些学习信号?一条trajectory里,到底有多少token真正在驱动学习?如果几千个token的推理轨迹中,只有极少数更新就足以推动模型变强,那么这不仅有助于理解后训练背后的机制,也可能进一步启发更加token-efficient、memory-efficient的训练方法。
有时候,模型可能并不需要被逐字逐句地教。也许,只需要在正确的地方推它一下。
论文:Extremely Sparse Supervision Incentivizes Reasoning Ability
作者:Zhishuai Liu, Xingzi Xu, Mehmet Saygin Seyfioglu, Pan Xu, Karim Bouyarmane
链接:https://arxiv.org/abs/2609.04565
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟