华为昇腾攻克RL训推一致性难题,实测对数概率差值归零

科技区角 2026-08-06 16:01

【区角快讯】8月6日,华为方面传来技术突破消息,其昇腾平台正式宣布支持强化学习(RL)领域的训推一致性。在针对通义千问3-30B-A3B混合专家模型的实测中,系统不仅将对数概率差值(logdiff)稳定控制在0,更在即时执行(Eager)模式下实现了20%至60%的性能跃升。这一进展对于大模型后训练阶段的基础设施稳定性而言,无疑是一剂强心针。

所谓训推一致性,核心在于消除推理引擎与训练引擎之间的数值偏差。即便使用相同的权重参数,面对同一输入,两者计算出的对数概率往往存在细微差异,这种差异即由logdiff指标衡量。当该指标归零,意味着两端实现了完全一致。当前,强化学习已是大模型后训练的主流范式,推理与训练过程深度耦合。若基础设施存在差异,极易放大不确定性,严重时甚至引发训练崩溃。

究其根本,训推不一致的症结在于底层计算累加不保序。随着模型参数量激增,张量并行、专家并行等切分策略愈发复杂,任何环节的对齐失误都会阻碍真正的在线策略训练。为此,昇腾在算子层面采用自研Ascend C语言,对关键链路进行系统性约束:统一注意力掩码语义、锁定规约累加顺序、对齐分块与精度,并辅以闪速注意力(FA)算子优化,确保训练和推理走同一条数值路径。

框架层面的对齐同样关键。由于相同语义的模型层在训练时多由小算子拼接,而推理时则依赖融合算子,二者精度难免存在细微差别。通过替换无法保证一致性的算子并补齐两端差距,最终实现了逻辑闭环。验证数据显示,开启该功能后奖励曲线正常上升,logdiff始终为0。目前,相关基础设施代码已开源至verl-ascend-recipe仓库,覆盖GRPO、DAPO等主流算法,开发者可直接上手试用。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
华为
more
华为的摊子,已经大到一场发布会装不下了。。。
尚界Z7系列交付破两万,华为智驾赋能掀背轿跑市场突围
5999元起!华为折叠电脑、全球最轻本,10400mAh平板齐发...太炸裂
399 元起!华为刚发布这些新品,看完我是真想买啊
余承东发布会口误引热议,华为MateBook Fold非凡大师起售价确认为24999元
华为nova 16 SE官宣:8500mAh电池+红枫影像下放,中端机卷出新高度
华为科学家警告:英伟达将遭遇瓶颈
华为电力模块5.0发布,以“稳”破局AI算力基建新挑战
浙江宣传发声力挺华为:穿越嘈杂,一往无前
岚图追光S预售启动,华为乾崑智驾加持定义“科技FUV”新标杆
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号