CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!

3D视觉工坊 2026-07-24 07:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

星球内有20多门3D视觉系统课程、3DGS独家系列视频教程、顶会论文最新解读、海量3D视觉行业源码、项目承接、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎加入!CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图1

论文信息

标题:ViT^3: Unlocking Test-Time Training in Vision

作者:Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构:Tsinghua University、Alibaba Group

原文链接:https://arxiv.org/abs/2512.01643

代码链接:http://github.com/LeapLabTHU/ViTTT

导读

测试时训练方法最近被证明是实现高效序列建模的一种很有前景的技术。该方法将注意力机制重新定义为一种在线学习问题,能够在测试时利用键值对来构建一个简洁的内部模型。这种设计方式不仅使得模型结构更加灵活多变,而且计算复杂度也保持在了线性水平。不过,要设计出高效的视觉序列建模方案仍然具有挑战性:对于内部模型的构建方式以及训练过程,目前还缺乏系统的理解和实用的指导原则。为了弥补这一不足,本文对视觉序列建模中的测试时训练方法进行了系统的实证研究。通过一系列实验和分析,我们得出了六项重要的设计原则,这些原则有助于我们设计出更有效的视觉序列建模方案,同时也为未来的改进方向指明了方向。这些研究成果最终形成了“视觉测试时训练”技术。这种模型采用了纯粹的TTT架构,能够实现线性复杂度,并且支持并行计算。我们对ViT进行了评估。在包括图像分类、图像生成、物体检测和语义分割在内的多种视觉任务中,实验结果表明,ViT的表现十分出色。其性能始终能与那些先进的线性复杂度模型相媲美,甚至更胜一筹(比如Mamba模型以及各种基于线性注意力机制的模型)。此外,它还有效缩小了与那些经过高度优化的视觉Transformer模型之间的差距。我们希望这项研究以及所提出的ViT模型能带来积极的成果。该基准测试结果有助于未来在视觉TTS模型方面的研究工作。

效果展示

Softmax 注意力、线性注意力和测试时训练模块的示意图。(a) Softmax 注意力可以看作构建了一个双层MLP,直接使用未压缩的键K和值V,其中隐藏层宽度等于序列长度N,非线性函数为Softmax。虽然有效,但这种N宽度的MLP在处理查询Q ∈R^{N×d}时会导致O(N^2)的计算成本。(b) 线性注意力通过矩阵乘法K^⊤V将K, V ∈ R^{N×d}压缩为d×d的线性层权重,实现了O(N)复杂度。然而,d×d的线性状态容量有限,且简单的K^⊤V压缩可能丢弃重要信息,常常导致性能较差。(c) TTT将内部模型推广为任意模块F_W(·): R^d → R^d,并通过几步自监督在线训练将K, V ∈ R^{N×d}压缩为模块权重W。输出使用更新后的权重W^*计算。当F_W(·)实现为线性复杂度模块(例如隐藏维度为4d的双层MLP)时,TTT能够提供强大的O(N)序列建模能力。

CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图2

引言

视觉Transformer已成为现代计算机视觉的基石,在图像分类、生成、目标检测和分割方面推动了最先进的结果。然而,其根本局限在于Softmax注意力相对于序列长度的二次复杂度O(N^2)。这一缩放瓶颈使得处理长视觉序列的成本高得令人望而却步。

为了突破这一二次壁垒,研究界探索了线性复杂度O(N)的替代方案。一种代表性方法是线性注意力,它用线性核替换Softmax。这使得计算顺序从(QK^T)V重新排列为Q(K^T V),从而实现所需的O(N)效率。尽管如此,先前的工作表明线性注意力存在表达能力有限的缺陷,使其在许多应用中不实用。

测试时训练模型是一种近期设计,提供了一条有前景的新路径。具体来说,TTT将整个注意力操作重新构想为一个在线学习过程:在每个上下文中,一个紧凑的内部模型从键值对中训练或构建出来,然后应用于每个查询。如图1所示,从这个角度看,Softmax注意力可以解释为构建一个隐藏维度为N且激活函数为Softmax的双层MLP,而线性注意力对应于通过矩阵乘法K^⊤V构建一个d×d的线性层。与这些固定设计不同,TTT允许内部模型是任意模块F_W(·): R^d → R^d。它将键值对视为一个“小数据集”,并在测试时执行几步自监督在线训练来学习(更新)该内部模型的参数W。这种方法开辟了一个更丰富、更强大的线性复杂度设计空间,在各种场景中产生了令人印象深刻的O(N)序列建模结果。

然而,TTT的灵活性本身也引入了一个关键瓶颈:一个庞大且探索不足的设计空间。关于内部训练过程和内部模型架构的关键选择,现有工作中缺乏系统性的理解,这阻碍了设计强大的视觉TTT模型。这一差距引出了我们的核心研究问题:可以建立哪些设计原则来构建高效且具有表达能力的测试时训练模块,以及如何促进未来的改进?

为了回答这个问题,我们系统地探索了视觉中测试时训练模型的新设计空间。我们关注两个基本方面:内部训练设置(损失函数、学习率、批量大小、迭代次数)和内部模型设计(架构和模型大小)。通过一系列实验,我们将经验观察总结为六个实用见解:1) 使得∂²L/∂V∂V̂ 为零的损失函数L不适用于TTT;2) 单次全批量(批量梯度)内部训练在视觉任务中效果良好;3) 较大的内部学习率(我们使用1.0)是有效的;4) 增加内部模型容量能持续提升性能;5) 在当前TTT设置下,深层内部模型存在优化困难;6) 卷积架构特别适合作为视觉任务的内部模型。

在这些发现的指导下,我们提出了视觉测试时训练模型,这是一种简单、可并行化、专为视觉序列建模设计的纯TTT架构。我们在广泛的任务上评估了ViT³,包括图像分类、生成、目标检测和语义分割。ViT³始终匹配或超越先进的O(N)模型(如Mamba和线性注意力变体),同时有效缩小了与高度优化的O(N²)视觉Transformer之间的性能差距。这些结果证实了我们提出的ViT³具有出色的效率和容量,展示了测试时训练方法在视觉任务上的潜力。

主要贡献

我们的主要贡献和要点如下:

• 我们对视觉领域的测试时训练设计进行了系统的实证研究,涵盖了内部训练机制(损失函数、学习率、批量大小、迭代轮数)和内部模型设计(架构和模型大小)。

• 我们为构建有效且高效的TTT模块提供了六个实用见解,并对TTT设计空间进行了详细分析。我们的分析还揭示了TTT模型未来几个有价值的研究方向。

• 我们构建了视觉测试时训练模型,这是一种实现上述见解的简单TTT架构。ViT³具有O(N)复杂度,在图像分类、图像生成、目标检测和语义分割上取得了有竞争力的结果,为未来视觉TTT模型的研究提供了一个强基线。

我们展示了一项关于视觉TTT的受控研究,提炼出六个实用见解,为有效的设计和潜在的未来工作提供指导。基于这些发现,我们介绍视觉测试时训练模型,这是一个具有线性复杂度的纯TTT基线,用于在不同视觉任务上对TTT方法进行基准测试。

方法

具体来说,对于内部训练,我们使用单次全批量梯度下降,学习率为1.0,优化点积损失。这种简单的配置对于视觉TTT既高效又有效。内部模型包含我们的两个有用的模块:一个简化的门控线性单元F₁ = FC(x) ⊙ SiLU(FC(x))和一个深度卷积F₂ = DWConv(x)。门控线性单元将朴素d×d线性状态的容量加倍,同时易于优化,而深度卷积提供了局部和全局信息的自然整合。在每个TTT块内,我们在单个注意力头中使用F₂,并在其余头中实例化F₁。由此产生的设计可以无缝替代标准注意力块,并集成到各种视觉Transformer骨干网络中。我们实际构建了两个模型系列:ViT³(非层次化)和H-ViT³(层次化4阶段),分别遵循经典视觉Transformer和现代4阶段架构的设计理念。我们进一步将我们的方法适配到扩散图像Transformer以用于生成任务,构建了DiT³模型。

CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图3

实验结果

CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图4
CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图5
CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图6

总结 & 未来工作

设计高效且具有表达能力的序列建模范式仍然是计算机视觉的一个关键追求。在本文中,我们系统研究了测试时训练的设计空间,这是一种构建具有线性复杂度的可扩展模型的有前途的新方法。通过一系列实验,我们将观察结果提炼为六个实用见解,为有效视觉TTT的设计原则和可能的未来方向提供了一些启示。我们的发现和分析最终形成了视觉测试时训练模型,这是一种用于视觉序列建模的纯TTT架构。ViT³在多个任务上取得了有竞争力的结果,为线性复杂度方法提供了一个强基线。我们希望我们的发现和分析能够激发对视觉TTT模型的进一步研究。

对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~

本文仅做学术分享,如有侵权,请联系删文。

CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图7CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图8CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图9CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!图10

添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。

声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。 
开源 检测 测试
more
脑机开源 | 一款免费开源工具让设计脑机接口比搭建乐高还要简单
当「变大」不再是唯一的路,又一国产模型开源了
在数学上把稀疏注意力做对!腾讯Hy开源HiLS-Attention: 计算更少效果更好, 外推512倍
openEuler 亮相 LEAP East 2026,共探 AI 与开源未来
像聊天一样做CAD建模!浙大开源智能体让建模变打字,已登国际CAD顶刊
FPGA上的自由空间加速器:EPFL开源FSA项目探索下一代可重构计算架构
2.8万亿参数,Kimi开源大模型破纪录了!
一台计算器,为什么要自己设计CPU?这个开源FPGA项目把"从零开始"做到了极致
CVPR'26最佳论文候选 | 清华开源ViT3:解锁视觉测试时训练,目标检测、语义分割、分类、生成全面SOTA!
清华系200亿独角兽杀入具身智能!攻破记忆难题,底牌都彻底开源
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号