智谱GLM-5.3-Flash两周适配十万国产芯,AI代理初现“自我优化”雏形

科技区角 2026-09-17 20:32

【科技纵览】当大模型开始动手调试承载自身的底层硬件,这不仅是工程效率的提升,更隐约指向了人工智能向递归自我改进(RSI)迈出的试探性一步。智谱AI首席科学家唐杰近日在社交平台披露,其最新推理系统GLM-5.3-Flash从首次跑通国产加速器到全面承接生产流量,仅耗时两周。在此期间,端到端吞吐能力跃升3.2倍,而这一奇迹背后的关键推手,竟是一个由GLM-5.3驱动的Infra Agent——一个专门用于优化服务自身的智能体。

此次部署规模堪称庞大,涉及超过10万颗国产AI加速器组成的集群。对于缺乏成熟参考经验的团队而言,挑战不仅来自硬件层面如显存容量与互联带宽的限制,还涵盖新架构适配、百万Token长上下文支持及多模态请求处理等复杂系统工程。加之国产芯片软件生态尚处早期,部分Kernel支持不足,工程团队不得不自行摸索大量资料。正是在这种高压环境下,Infra Agent介入其中,协助分析性能瓶颈、提出方案甚至直接修改代码,在算力、内存、通信与调度之间寻找新的平衡点。

技术细节上,智谱团队采用了一系列组合拳:利用ReplaySSM以计算换内存空间,通过节点内张量并行缓解显存压力,引入INT8、FP8、BF16混合精度缓存提升利用率,并部署Encode-Prefill-Decode(EPD)分离式架构以实现灵活调度。最终,GLM-5.3-Flash的服务性能较初始版本提升约3倍,硬件利用率与单Token成本已逼近主流NVIDIA GPU平台水平。该模型曾以匿名身份Ox-Alpha在OpenCode和OpenRouter平台运行,一周内跻身使用量前列,六天处理超62万亿Token,验证了其真实环境下的稳定性。

然而,真正的变革不在于让AI写代码,而在于赋予其理解复杂系统性能波动的能力。唐杰指出,传统Agent往往能生成代码,却难以判断结果变差的原因。为此,智谱引入了“dense feedback”机制,将资深工程师的经验转化为AI可调用的反馈信号。例如,当需要确认计算正确性或分析性能下降时,Agent能获得对应的正确性反馈或时间消耗数据,并通过客观实验验证假设,从而避免被海量日志淹没。

在这一机制加持下,Infra Agent成功定位并解决了多个隐蔽问题。在KDA上下文并行路径中,它发现TF32计算产生的舍入误差随序列长度累积导致偏差,相关修复已合并至Flash Linear Attention项目;在KV Transfer与DeepEP调度间,它识别出因Python GIL未及时释放导致的传输开销过高问题,经调整后开销从30%降至1%以下;此外,它还通过重组计算结构,消除了Decode Kernel中的重复归一化计算,带来1.71倍的性能提升。这些优化思路源自Agent对SGLang等现有项目的学习,提炼出“optimization skeleton”并结合当前场景验证。

尽管距离真正的递归自我改进仍有距离,但唐杰认为,一个最小规模的闭环已然形成:模型优化系统,系统反哺模型。人类工程师的角色正从解决具体问题转向设计反馈系统,而这些基于真实基础设施任务的可验证反馈,或许将成为训练下一代模型的重要基石。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
中科大少年班95后造“AI科学家”,融资近5000万
助力中小企业AI化!华为坤灵双管齐下:一站式场景方案+高密度服务网
智谱唐杰突发长文曝RSI进展:Agent优化10万卡集群吞吐暴涨200%,AI造AI还远吗?
刚刚,首个千万级AI创作大赛开启!一个人一部片,独拿200万
豆包座舱助手发布,华为专营店将调整问界售卖方式,苹果自研AI服务器芯片,抖音声音侵权举报入口上线,这就是今天的其他大新闻!
新架构・芯产品 | 苏州睿芯高光D35:全球领先的RISC‑V数据流物理AI量产芯片
车企自研电池“去宁德化”,宁王豪掷百亿布局AI算力寻新锚点
从记忆到主动智能:OPPO 押注了 AI 手机一个被低估的问题
开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一
AI原生赋能基层医疗 openEuler驱动医疗数智化创新
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号