
作者|连冉
一个工程师写完数据处理代码,点下提交,然后去喝了杯咖啡。十几分钟甚至几十分钟之后,他才回到屏幕前看结果、改代码、再提交。这条「等待—反馈」的空隙,过去一直是数据平台默认的节奏。
Agent 没有这个空隙。它拿到一次结果,立刻验证,紧接着并发地去试第二种、第三种方案,飞快拿到反馈,再发起下一轮调用。
人用平台,发过来的是一个相对确定的任务,算完、给结果、走人;Agent 用平台,会不停地换着法子去完成你交代的那个目标。压力就这样被放大了——管控的压力和隐形计算的压力,会十倍、百倍地往上翻。
这正在成为 2026 年云计算需要面对的一种新负载。
AI 正在深入「把模型用起来」的阶段。模型一旦长成 Agent,它就不再是一个躺在那里等你调用的接口,而更像一个会自己找数据、自己拆任务、自己并发试错、自己一直跑下去的数字员工。它制造出来的负载,和过去十几年云平台习惯承载的那种负载,完全是两回事。
阿里云智能集团首席技术官李飞飞在云栖大会上把智能体落地拆成三个词:Model 决定智能的上限,Context 决定 Agent 读不读得懂你的业务,Harness 决定它能不能真正调起工具、把事做完、并且一直跑下去。想同时喂饱这三样,光把一个模型做大做强,远远不够。
数据流动起来产生智能,智能以 Agent 的形态落进业务,业务跑起来又产生新的数据和新负载,回过头再推着整个系统往前走。飞轮转得快不快,取决于三件事——模型生产的效率、智能落地的效率、系统自我进化的效率。
今年云栖大会上,阿里云做的事,就是沿着这三个效率,把从数据入湖、训练集生产、模型训练、推理服务,一直到系统自己优化自己的整条链路,一次性升级了一遍。
贯穿这些升级的,是阿里云所强调的「芯云模一体」:让芯片、云平台与模型逐渐走向协同设计,打通从原始数据到业务决策的全栈。
当模型走进真实世界,
数据先成了瓶颈
AI 进入物理世界之后,数据首先发生了变化。
过去的大模型主要处理文本和代码。自动驾驶、具身智能和科学计算面对的却是视频、点云、运动轨迹和传感信号。原始数据很容易积累,真正困难的是把这些数据清洗、质检、标注并转换成模型可以使用的训练集。
穹彻智能首席科学家吕峻在接受采访时提到,具身智能的数据以视频和点云为主,从采集完成到进入训练,中间可能经过几十道处理。一次数据版本迭代,短则两周,长则一个月。存储、数据处理和模型训练之间只要有一个环节衔接不畅,整个实验周期都会被拉长。
从长期看,具身智能可用的数据规模可能仍有两到三个数量级的缺口。但吕峻认为,现阶段更直接的问题已经转向数据质量:哪些数据真正有效,怎样完成精细标注和前后质检,以及算法能否把这些数据转化成模型能力。
数据生产方式也在随之变化。传统人工标注需要组建和培训团队,规则改变后还要重新调整流程;模型辅助标注可以更快迭代,并将人力集中到质检和高难度样本上。对于具身智能公司来说,这种变化影响的不只是成本,还决定了模型实验能否足够频繁地进行。
阿里云对 MaxCompute 和 EMR 的升级,针对的正是这条数据生产链。MaxCompute 将 CPU、GPU 和大模型 Token 纳入统一调度,MaxFrame 和 SQL AI Function 可以直接调用模型处理图片、文本等全模态数据。面向自动驾驶和具身智能等场景,行业 Skill 则将数据管线进一步封装,让开发者通过自然语言组织处理任务。
EMR Serverless Spark 支持 Spark、Ray、Daft 等全模态引擎,并与 Paimon、Iceberg 等开放湖表格式连接。按照阿里云公布的数据,这套方案可以让具身智能数据处理耗时减少 40%,PB 级原始数据能够直接生成 LeRobot、RLDS 格式的训练集。
数据准备完成后,问题来到了训练端。PAI-DLC 3.0 引入 Xfuse,对算力底座、训练框架和任务运行状态进行联合分析,自动定位通信、数据读取、算子和资源调度中的问题。阿里云公布的测试结果显示,多模态模型端到端训练速度提升了 2.4 倍。
这类优化越来越依赖芯片、云平台和模型之间的协同。
阿里云智能集团研发副总裁、计算平台事业部负责人汪军华则在接受采访时举例称,一种模型架构即便效果足够好,如果与芯片缓存、通信方式和推理框架不匹配,落到真实硬件上仍可能付出很高的成本。AI 基础设施由此进入一个更强调联合设计的阶段:模型架构需要理解硬件,计算平台也需要理解模型的工作方式。

对于企业而言,模型能力的形成已经是一条连续生产线。原始数据处理得有多快,训练问题能否及时定位,算力能否随任务灵活调度,都会影响模型迭代的最终速度。
智能到应用,
Agent 改变了平台的使用方式
模型训练完成,只解决了智能从哪里来的问题。Agent 进入企业,还要先学会如何使用数据。
企业数据通常分散在数据湖、数仓、搜索和实时计算系统中。不同部门对同一个指标可能有不同口径,字段背后还隐藏着大量业务规则。Agent 即使找到了数据,也不一定知道这些数据意味着什么,更不能在生产环境中随意执行修改和删除操作。
这便是 Agent 与传统数据工具的差别。过去,工程师理解数据结构,也知道一次操作可能带来的影响;Agent 依赖上下文、语义和权限系统作出判断。一旦这些信息缺失,它越自动化,潜在风险反而越大。
阿里云此次提出让 OpenLake 进一步走向 Agentic Lake。开放湖仓继续承载统一、实时的全模态数据,湖上的计算引擎则通过 Skill、MCP 和调用接口向 Agent 开放。DataWorks 提供跨引擎语义层、数据治理与任务编排,让 Agent 可以围绕业务目标组织数据处理流程。
新发布的 AI 原生大数据服务 ADA,则进一步采用多智能体协同。用户从一个自然语言入口提出问题,系统再调动离线计算、实时分析、搜索和 AI 训推等不同引擎,完成数据分析、工程、治理和运维任务。
自然语言降低了数据使用门槛,也把安全治理推到了更重要的位置。阿里云资深产品解决方案总监、大数据和人工智能平台解决方案负责人魏博文在接受采访时提到,Agent 可以拥有较高的自主性,但涉及数据增、删、改、查等高风险操作时,需要在一个可控制、可回滚、可审计的数据沙箱中运行。

这意味着企业的数据权限体系需要继续细化。未来需要管理的不只是某个员工能否访问一张表,还包括 Agent 能在什么任务下调用哪些数据、可以执行到哪一步,以及出现异常后由谁接管。
Agent 的运行方式同样在改变推理基础设施。它可能围绕一个任务工作数小时,连续调用多个模型和工具,请求量也会随任务阶段剧烈波动。企业关注的指标因此从单次 Token 生成速度,扩展到冷启动、缓存、扩缩容、服务稳定性和整体成本。
PAI-InferX 通过智能路由、Cache 感知调度、KV Cache 存储和模型预热等能力,处理 Agent 的持续推理负载;PAI-RLS 则提供托管式强化学习服务,让企业可以利用真实任务轨迹继续训练专属模型。
在直播、风控等实时场景中,数据与行动之间的距离还要进一步缩短。Flink Streaming Agent 支持视频、音频和事件流的实时接入与理解,并提供动态编排和长中短期记忆。央视体育的实时 AI 解说就是一个例子:Agent 需要同步理解画面、声音和赛事事件,再生成与比赛进程对应的解说。
当数据语义、权限治理、推理服务和实时计算被连在一起,Agent 才具备进入真实业务流程的基本条件。
从应用到进化,
当运行反馈成为基础设施的新燃料
Agent 进入应用后,会持续制造新的数据、任务轨迹和计算负载。接下来的问题是,当系统复杂度不断上升,基础设施自身能否跟上变化。
大规模训练和数据查询的优化,过去高度依赖专家。工程师要查看任务状态,定位数据读取、通信、算子或者查询计划中的瓶颈,再修改参数并重新运行。这种方式适合相对稳定的工作负载,但 Agent 发起的任务更频繁,组合也更复杂,人工调优很难覆盖所有变化。
汪军华描述了一种新的优化过程:Agent 可以主动在训练任务中插入 Profiling,分析性能瓶颈;发现问题后,再调用训练框架提供的 Skill,生成新的优化任务;任务完成后比较结果,并形成分析报告。整个过程逐渐从一次人工诊断,变成可以反复执行的反馈闭环。
PAI-CrystalLLM 体现了类似思路。
万卡训练中的许多通信和配置问题,往往只有达到足够规模才会暴露,直接使用真实集群试错代价很高。CrystalLLM 使用不到 1% 的 GPU 资源,模拟万卡集群的训练效果,相当于为大模型训练提供一个「风洞」。根据阿里云的内部实践,它为训练任务带来了 2% 至 10% 的 MFU 绝对提升。
在数据查询侧,Hologres 的自进化查询优化器会分析真实 Workload,提炼候选优化方案,通过正确性和性能门禁完成验证,再将有效经验沉淀回系统。阿里云公布的数据显示,它在四个月内自主发现并完成 28 项优化,优化器性能提升 100%,湖上查询性能提升 38%。
这些能力的共同点,是让应用产生的负载成为系统优化的输入。系统可以观察任务怎样运行、哪里出现瓶颈、哪种方案更加有效,再把经过验证的经验用于下一轮任务。
穹彻智能的实践提供了一个更接近业务的结果。其基于 MaxCompute、Hologres、DataWorks 和 PAI 搭建云上的 Data+AI Pipeline。按照阿里云公布的数据,数据处理吞吐提升超过十倍,模型训练效率提升约 50%。对于仍处在快速试验阶段的具身智能公司来说,基础设施最大的价值,就是把原本以周为单位的数据和模型迭代进一步压缩。
不过,基础设施的自我优化仍有明确边界。
在 AI for Science 场景中,无尽前延 CTO 张林峰认为,偏计算型的学科更容易被 AI 改造,因为数据、模型和结果都可以在数字系统内流转。一旦进入生物实验、科学仪器和物理世界操作,问题就会复杂得多:科学软件效率不高、接口老旧,实验设备也未必支持自动控制。Agent 即使能够设计任务,也很难独立完成从计算到实验验证的完整闭环。
这恰好说明,Agent 基础设施的价值并不等于替企业完成所有创新。它可以降低数据处理和模型试错的成本,缩短应用反馈进入下一轮训练的距离,但数据质量、算法路线、行业软件和物理设备,仍然决定智能最终能走多远。
从数据产生智能,到智能进入应用,再到应用推动系统优化,阿里云试图搭建起一条持续转动的反馈链。Agent 时代基础设施竞争的关键,也正从承载多少模型,转向能否让数据、模型和系统一起更快进化。



