
一边是任务排队,一边是 GPU 闲置;国产加速卡接入集群后,调度粒度仍然粗;训练、推理和开发任务一混跑,资源争抢与碎片化随之出现;推理副本扩展到数百个,瓶颈又从单机引擎转向路由、缓存与异构硬件协同。
这些问题说明,AI 基础设施进入生产后,难点已经从“有没有算力”转向“能不能把算力持续、高效地组织起来”。
9 月 6 日,「不卷算力,卷效率」HAMi Meetup 上海站 Incubating 特别活动将围绕这些真实问题展开。本次活动由 HAMi 社区与密瓜智能(Dynamia)联合主办,是双方共同发起的第四场 Meetup,也是 HAMi 进入 CNCF Incubating 后的首场线下技术分享活动。

这一次,我们不想做一场围绕单一厂商方案展开的技术宣讲。CNCF、HAMi Maintainer、国产 GPU 厂商、云平台、终端用户与企业级开源软件厂商,将从同一条 AI Infra 技术链的不同位置,共同回答一个问题:算力怎样才能真正进入生产?对 HAMi 社区而言,更重要的是把开源能力放回真实生产场景中,讨论它如何与芯片、云平台、调度系统和应用研发协同。密瓜智能作为 HAMi 的发起方与长期推动者,也将与社区共同呈现这些实践与思考。
这次值得重点关注什么?
• CNCF × PyTorch:从行业全局理解 AI 研发基座如何走向云原生与产业落地。 • HAMi 2.10 与远程 GPU:看分散在不同节点和机房的设备如何形成可访问、可调度的算力池。 • llm-d 生产级 Benchmark:看 KV-cache 感知路由、P/D 分离等机制如何带来多模态异构部署的 2.4—2.8 倍吞吐提升参考。 • 国产 GPU 与大规模集群实践:看细粒度隔离、拓扑调度、Volcano 与 HAMi-core 如何解决共享、混部和资源碎片问题。 • 从 GPU 资源池到 AI 研发环境:看资源抽象、算法镜像、开发工具与 GPU 虚拟化如何打通,让算力真正转化为开发者可直接使用的生产力。
6场技术分享,分别回答什么?
开场演讲(Opening Speech)|AI 研发走向产业落地,云原生基座为什么必须跟上?
模型框架解决模型如何开发和运行,云原生体系决定资源与工作负载能否规模化管理。本环节将从 CNCF 生态与 PyTorch 的结合切入,梳理 AI 基础设施的演进路线,以及研发体系进入生产后必须补齐的能力。
适合:正在规划 AI 平台、评估云原生技术路线,或希望理解行业全局的技术负责人。

技术分享 01|本地 GPU 告急,下一步只能继续买卡吗?
本地 GPU 紧张,并不意味着整个集群没有闲置。真正难点是如何把分散在不同节点和机房的设备变成可访问、可调度、可治理的远程算力池。本环节将拆解远程 GPU 的关键设计、适用场景与技术边界,并带来 HAMi 2.10 的新能力。
适合:正在处理跨节点资源利用、异构设备接入、远程算力调用或算力池化问题的团队。

技术分享 02|推理规模化后,瓶颈为什么从“引擎”转向“系统”?
当 LLM 推理从单个实例扩展到数百个副本,单个引擎再快,也无法独自解决长短请求差异、多模态阶段拆分、多厂商硬件混部和跨平台运行。本环节将围绕 KV-cache 感知路由、Prefill/Decode 分离、前缀缓存卸载与可扩展调度,解释 llm-d 如何形成集群级推理平面,并分享多模态异构部署带来的 2.4—2.8 倍吞吐提升参考。
适合:正在建设大模型推理平台,关注多模态、长上下文、多副本服务与集群吞吐的团队。

技术分享 03|国产 GPU 进入规模化集群,调度精度跟得上吗?
国产 GPU 能够运行模型,只是进入生产的第一步。调度粒度粗、资源难共享、多实例混部争抢,都会让可用算力在规模化集群中被快速消耗。本环节将结合 HAMi 对国产加速卡的适配实践,拆解细粒度资源隔离、拓扑调度和流量编排等关键优化。
适合:正在推进国产算力平台建设、多芯片统一管理或推理集群效率优化的团队。

技术分享 04|训练、推理、开发混跑,为什么默认调度不够?
训练、推理、开发和 ETL 同时运行时,平台既要处理队列、优先级与批量作业调度,也要解决 GPU/NPU 的显存和算力切分。现场将结合科大讯飞大规模 AI 集群实践,讲清 Volcano 的队列、Gang 调度、Binpack 与流水线编排,如何与 HAMi-core 的细粒度切分和硬隔离形成完整底座。
适合:正在做 Kubernetes AI 平台选型、集群调优、多租户治理或存量任务迁移的团队。

技术分享 05|GPU 交给平台后,为什么开发者仍然觉得“不好用”?
GPU 被纳入资源池,只完成了基础设施工作的第一步。资源如何抽象、算法镜像如何管理、开发工具如何注入、GPU 虚拟化如何衔接,决定了算力最终交付给开发者的是一块“资源”,还是一套真正可工作的研发环境。本环节将从智算平台工程实践出发,拆解这条链路中最容易被忽略的环节。
适合:云平台、AI 平台产品、研发效能和基础设施工程团队。

圆桌|进入 Incubating 后,HAMi 如何继续向前?
进入 Incubating 后,HAMi 面临的问题将从“技术能力够不够”进一步走向“社区如何共同决策、贡献者如何成长、企业需求如何沉淀为公共能力”。圆桌将围绕 Issue 与 Review 效率、Maintainer 与 Approver 的成长路径、企业需求与社区路线的平衡,以及跨公司协作如何真正发生展开。
适合:希望参与 HAMi、推动企业开源协作,或关注开源项目治理的开发者与团队。

如果这些问题正在发生,这场活动就是为你准备的
• GPU 明明还有空闲,任务却持续排队; • 国产 GPU 或多种加速卡接入后,难以统一调度和治理; • 训练、推理、开发任务混跑,带来资源碎片与租户争抢; • 推理规模扩大后,路由、缓存和多副本调度成为新的性能瓶颈。
为什么值得到现场?
• 同一条技术链上的不同答案:基金会、开源社区、GPU 厂商、云平台与终端用户从各自位置交叉验证。 • 从架构判断下沉到工程细节:既有 HAMi 2.10 新能力,也有 Benchmark、集群调度与平台建设实践。 • 把问题带到现场:在技术分享和社区圆桌中,与 Maintainer、Approver 及一线工程实践者直接交流。
报名信息
活动:「不卷算力,卷效率」HAMi Meetup 上海站 Incubating 特别活动
时间:2026 年 9 月 6 日 14:00-17:50(13:30开始签到)
地点:上海·五角场创新创业学院
如果这些问题已经出现在你的技术规划或生产环境里,欢迎把真实场景和疑问带到现场,与社区 Maintainer、Approver 和一线实践者直接交流。
9 月 6 日,我们上海见。

如需转载,请保留全文;如需改写,请先通过微信 HAMi_community 联系我们。
关于HAMi
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群