GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题

机智流 2026-09-01 21:00

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图1

一边是任务排队,一边是 GPU 闲置;国产加速卡接入集群后,调度粒度仍然粗;训练、推理和开发任务一混跑,资源争抢与碎片化随之出现;推理副本扩展到数百个,瓶颈又从单机引擎转向路由、缓存与异构硬件协同。

这些问题说明,AI 基础设施进入生产后,难点已经从“有没有算力”转向“能不能把算力持续、高效地组织起来”。

9 月 6 日,「不卷算力,卷效率」HAMi Meetup 上海站 Incubating 特别活动将围绕这些真实问题展开。本次活动由 HAMi 社区与密瓜智能(Dynamia)联合主办,是双方共同发起的第四场 Meetup,也是 HAMi 进入 CNCF Incubating 后的首场线下技术分享活动。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图2

这一次,我们不想做一场围绕单一厂商方案展开的技术宣讲。CNCF、HAMi Maintainer、国产 GPU 厂商、云平台、终端用户与企业级开源软件厂商,将从同一条 AI Infra 技术链的不同位置,共同回答一个问题:算力怎样才能真正进入生产?对 HAMi 社区而言,更重要的是把开源能力放回真实生产场景中,讨论它如何与芯片、云平台、调度系统和应用研发协同。密瓜智能作为 HAMi 的发起方与长期推动者,也将与社区共同呈现这些实践与思考。

这次值得重点关注什么?

  • • CNCF × PyTorch:从行业全局理解 AI 研发基座如何走向云原生与产业落地。
  • • HAMi 2.10 与远程 GPU:看分散在不同节点和机房的设备如何形成可访问、可调度的算力池。
  • • llm-d 生产级 Benchmark:看 KV-cache 感知路由、P/D 分离等机制如何带来多模态异构部署的 2.4—2.8 倍吞吐提升参考。
  • • 国产 GPU 与大规模集群实践:看细粒度隔离、拓扑调度、Volcano 与 HAMi-core 如何解决共享、混部和资源碎片问题。
  • • 从 GPU 资源池到 AI 研发环境:看资源抽象、算法镜像、开发工具与 GPU 虚拟化如何打通,让算力真正转化为开发者可直接使用的生产力。

6场技术分享,分别回答什么?

开场演讲(Opening Speech)|AI 研发走向产业落地,云原生基座为什么必须跟上?

模型框架解决模型如何开发和运行,云原生体系决定资源与工作负载能否规模化管理。本环节将从 CNCF 生态与 PyTorch 的结合切入,梳理 AI 基础设施的演进路线,以及研发体系进入生产后必须补齐的能力。

适合:正在规划 AI 平台、评估云原生技术路线,或希望理解行业全局的技术负责人。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图3

技术分享 01|本地 GPU 告急,下一步只能继续买卡吗?

本地 GPU 紧张,并不意味着整个集群没有闲置。真正难点是如何把分散在不同节点和机房的设备变成可访问、可调度、可治理的远程算力池。本环节将拆解远程 GPU 的关键设计、适用场景与技术边界,并带来 HAMi 2.10 的新能力。

适合:正在处理跨节点资源利用、异构设备接入、远程算力调用或算力池化问题的团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图4

技术分享 02|推理规模化后,瓶颈为什么从“引擎”转向“系统”?

当 LLM 推理从单个实例扩展到数百个副本,单个引擎再快,也无法独自解决长短请求差异、多模态阶段拆分、多厂商硬件混部和跨平台运行。本环节将围绕 KV-cache 感知路由、Prefill/Decode 分离、前缀缓存卸载与可扩展调度,解释 llm-d 如何形成集群级推理平面,并分享多模态异构部署带来的 2.4—2.8 倍吞吐提升参考。

适合:正在建设大模型推理平台,关注多模态、长上下文、多副本服务与集群吞吐的团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图5

技术分享 03|国产 GPU 进入规模化集群,调度精度跟得上吗?

国产 GPU 能够运行模型,只是进入生产的第一步。调度粒度粗、资源难共享、多实例混部争抢,都会让可用算力在规模化集群中被快速消耗。本环节将结合 HAMi 对国产加速卡的适配实践,拆解细粒度资源隔离、拓扑调度和流量编排等关键优化。

适合:正在推进国产算力平台建设、多芯片统一管理或推理集群效率优化的团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图6

技术分享 04|训练、推理、开发混跑,为什么默认调度不够?

训练、推理、开发和 ETL 同时运行时,平台既要处理队列、优先级与批量作业调度,也要解决 GPU/NPU 的显存和算力切分。现场将结合科大讯飞大规模 AI 集群实践,讲清 Volcano 的队列、Gang 调度、Binpack 与流水线编排,如何与 HAMi-core 的细粒度切分和硬隔离形成完整底座。

适合:正在做 Kubernetes AI 平台选型、集群调优、多租户治理或存量任务迁移的团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图7

技术分享 05|GPU 交给平台后,为什么开发者仍然觉得“不好用”?

GPU 被纳入资源池,只完成了基础设施工作的第一步。资源如何抽象、算法镜像如何管理、开发工具如何注入、GPU 虚拟化如何衔接,决定了算力最终交付给开发者的是一块“资源”,还是一套真正可工作的研发环境。本环节将从智算平台工程实践出发,拆解这条链路中最容易被忽略的环节。

适合:云平台、AI 平台产品、研发效能和基础设施工程团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图8

圆桌|进入 Incubating 后,HAMi 如何继续向前?

进入 Incubating 后,HAMi 面临的问题将从“技术能力够不够”进一步走向“社区如何共同决策、贡献者如何成长、企业需求如何沉淀为公共能力”。圆桌将围绕 Issue 与 Review 效率、Maintainer 与 Approver 的成长路径、企业需求与社区路线的平衡,以及跨公司协作如何真正发生展开。

适合:希望参与 HAMi、推动企业开源协作,或关注开源项目治理的开发者与团队。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图9

如果这些问题正在发生,这场活动就是为你准备的

  • • GPU 明明还有空闲,任务却持续排队;
  • • 国产 GPU 或多种加速卡接入后,难以统一调度和治理;
  • • 训练、推理、开发任务混跑,带来资源碎片与租户争抢;
  • • 推理规模扩大后,路由、缓存和多副本调度成为新的性能瓶颈。

为什么值得到现场?

  • • 同一条技术链上的不同答案:基金会、开源社区、GPU 厂商、云平台与终端用户从各自位置交叉验证。
  • • 从架构判断下沉到工程细节:既有 HAMi 2.10 新能力,也有 Benchmark、集群调度与平台建设实践。
  • • 把问题带到现场:在技术分享和社区圆桌中,与 Maintainer、Approver 及一线工程实践者直接交流。

报名信息

活动:「不卷算力,卷效率」HAMi Meetup 上海站 Incubating 特别活动
时间:2026 年 9 月 6 日 14:00-17:50(13:30开始签到)
地点:上海·五角场创新创业学院

如果这些问题已经出现在你的技术规划或生产环境里,欢迎把真实场景和疑问带到现场,与社区 Maintainer、Approver 和一线实践者直接交流。

9 月 6 日,我们上海见。

GPU 不够用只是表象:6场分享,直面生产级 AI Infra 的真实难题图10
活动免费报名入口



如需转载,请保留全文;如需改写,请先通过微信 HAMi_community 联系我们。


关于HAMi

HAMi 是由李孟轩与张潇共同发起的异构算力虚拟化与统一调度开源项目,现为 CNCF Incubating 项目,以“让异构算力因开源而好用”为目标,致力于提升异构算力利用率,并为异构 GPU 提供统一的复用接口。目前,HAMi 已支持 NVIDIA、AMD、昇腾、寒武纪、海光、天数智芯、摩尔线程、沐曦、燧原、昆仑芯、壁仞、AWS Neuron、瀚博半导体等多种异构算力,与 Volcano、Kueue、Koordinator、vLLM、KAI Scheduler 等项目广泛集成,吸引了来自全球 20 多个国家和地区的 500 余名贡献者参与,并已在数百家企业实现生产落地。


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI GPU
more
砸3.37万亿元!英伟达拉上华尔街六大金主,把GPU炒成硬通货
从GPU到光互联:AI超节点为何重写光模块的产业位置
Agent正在改写CPU:GPU配比
燧原科技敲定科创板发行价,“国产GPU四小龙”即将全员上市
AMD重磅首购:全新AI推理芯片——模型权重直刻硅片!1.7万token/秒,48倍优势吊打英伟达GPU!
GPU开始金融化!黄仁勋拉上华尔街搞5000亿美元融资,回应“循环投资”
三星推出aHBM,不再依赖GPU进行计算
别只盯GPU,ASIC将成为半导体下一风口
Windows 11任务管理器迎AI监控升级,NPU/GPU负载一目了然
CH37系列AI SoC:6核NPU+4核GPGPU异构协同,赋能边端AI算力
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号