【科技纵览】当大模型开始动手调试承载自身的底层硬件,这不仅是工程效率的提升,更隐约指向了人工智能向递归自我改进(RSI)迈出的试探性一步。智谱AI首席科学家唐杰近日在社交平台披露,其最新推理系统GLM-5.3-Flash从首次跑通国产加速器到全面承接生产流量,仅耗时两周。在此期间,端到端吞吐能力跃升3.2倍,而这一奇迹背后的关键推手,竟是一个由GLM-5.3驱动的Infra Agent——一个专门用于优化服务自身的智能体。
此次部署规模堪称庞大,涉及超过10万颗国产AI加速器组成的集群。对于缺乏成熟参考经验的团队而言,挑战不仅来自硬件层面如显存容量与互联带宽的限制,还涵盖新架构适配、百万Token长上下文支持及多模态请求处理等复杂系统工程。加之国产芯片软件生态尚处早期,部分Kernel支持不足,工程团队不得不自行摸索大量资料。正是在这种高压环境下,Infra Agent介入其中,协助分析性能瓶颈、提出方案甚至直接修改代码,在算力、内存、通信与调度之间寻找新的平衡点。
技术细节上,智谱团队采用了一系列组合拳:利用ReplaySSM以计算换内存空间,通过节点内张量并行缓解显存压力,引入INT8、FP8、BF16混合精度缓存提升利用率,并部署Encode-Prefill-Decode(EPD)分离式架构以实现灵活调度。最终,GLM-5.3-Flash的服务性能较初始版本提升约3倍,硬件利用率与单Token成本已逼近主流NVIDIA GPU平台水平。该模型曾以匿名身份Ox-Alpha在OpenCode和OpenRouter平台运行,一周内跻身使用量前列,六天处理超62万亿Token,验证了其真实环境下的稳定性。
然而,真正的变革不在于让AI写代码,而在于赋予其理解复杂系统性能波动的能力。唐杰指出,传统Agent往往能生成代码,却难以判断结果变差的原因。为此,智谱引入了“dense feedback”机制,将资深工程师的经验转化为AI可调用的反馈信号。例如,当需要确认计算正确性或分析性能下降时,Agent能获得对应的正确性反馈或时间消耗数据,并通过客观实验验证假设,从而避免被海量日志淹没。
在这一机制加持下,Infra Agent成功定位并解决了多个隐蔽问题。在KDA上下文并行路径中,它发现TF32计算产生的舍入误差随序列长度累积导致偏差,相关修复已合并至Flash Linear Attention项目;在KV Transfer与DeepEP调度间,它识别出因Python GIL未及时释放导致的传输开销过高问题,经调整后开销从30%降至1%以下;此外,它还通过重组计算结构,消除了Decode Kernel中的重复归一化计算,带来1.71倍的性能提升。这些优化思路源自Agent对SGLang等现有项目的学习,提炼出“optimization skeleton”并结合当前场景验证。
尽管距离真正的递归自我改进仍有距离,但唐杰认为,一个最小规模的闭环已然形成:模型优化系统,系统反哺模型。人类工程师的角色正从解决具体问题转向设计反馈系统,而这些基于真实基础设施任务的可验证反馈,或许将成为训练下一代模型的重要基石。
智谱GLM-5.3-Flash两周适配十万国产芯,AI代理初现“自我优化”雏形
科技区角
2026-09-17 20:32
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。