
智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。
随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。
基于此,英伟达提出了SOL-ExecBench基准套件。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。

与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。
英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。
具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。

为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。
此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。
该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。
该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。
根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。
长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。
工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。
稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。
系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。
这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。

▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)




