浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破

AI科技大本营 2025-10-14 16:17

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图1

近日,浙江大学范鹤鹤、杨易、吴飞与新加坡国立大学 Mohan Kankanhalli 教授提出新型深度神经网络基础操作 Translution,通过融合 Self-Attention 的自适应建模优势与 Convolution 的相对位置建模能力,灵活捕获只与数据本身内在结构相关的、与绝对位置无关的表征,实现了两种操作的统一。

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图2
图 1浙江大学、新加坡国立大学联合提出Translution

实验结果显示,基于 Translution 构建的神经网络在 ViT 和 GPT 两大主流架构下均获得了性能提升,展现出广阔的应用前景。

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图3
图 2基于Translution构建的ViT在ImageNet数据集上取得明显优于Self-attention
浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图4
图 3基于Translution构建的GPT在自然语言建模的任务上也取得了超过Self-attention

目前,基于Self-Attention 的 Transformer 凭借强大的建模能力和优异的 Scaling Law 特性,成为深度学习的主流架构,推动了大模型浪潮的兴起。然而,随着模型规模不断扩张,业界发现单纯增加网络参数和训练数据已难以带来性能提升,Scaling Law 的红利似乎正逐渐触顶。因此,探索新型神经网络,持续推动深度学习的繁荣,已成为人工智能领域的重要任务。

浙大提出的 Translution 正是对这一挑战的有力回应。其核心思想是将卷积操作中的“固定权重核”转变为由自注意力机制动态生成的“自适应核”。

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图5
图 4 Self-attention和Convolution合二为一的性能怪兽Translution
然而,作为融合 Slef-attention 和 Convolution 两种操作优势的“性能怪兽”,Translution 在取得性能突破的同时,也对算力——特别是 GPU 显存——提出了更高要求,这在一定程度上或将进一步加剧人工智能领域的“贫富差距”。
论文:Translution: Unifying Self-attention and Convolution for Adaptive and Relative Modeling
论文链接:https://arxiv.org/pdf/2510.10060
代码链接:https://github.com/hehefan/Translution(投稿或寻求报道:zhanghy@csdn.net)
浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破图6

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
AI“股神”婚礼前夕爆仓:杠杆狂欢后的至暗时刻
超半数老板后悔靠AI裁员?职场招聘风向彻底反转!
“苹果搞错了”——OpenAI 正式反击苹果窃密诉讼!
让企业客户愿意掏钱的 AI 到底长什么样?
存储巨头提前锁定2027产能,AI需求挤压消费电子配额
AI 工厂:智能时代的新型基础设施
8位工程师花一年、耗资近千万的工作,这个开源AI系统7天搞定了
吃饺子送算力?海淀一餐馆跨界AI营销引热议
2026上半年移动互联网格局:微信抖音双雄领跑,AI原生应用崭露头角
自动驾驶系统安全强制性国标发布,DeepSeek登顶全球AI模型调用量榜单,PC大厂开始用长鑫产品,欧盟AI新规生效,这就是今天的其他大新闻!
Copyright © 2025 成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号