16台DGX Spark集群实测Kimi-K3,峰值生成速度达38 t/s

科技区角 2026-09-05 12:00

【区角快讯】当本地AI算力不再局限于单点突破,而是通过集群化部署实现性能跃迁时,我们看到了边缘计算新的可能性。近日,英伟达开发者论坛用户ciprianveg披露了一项颇具实验性质的本地AI算力测试成果。他通过将16台原本面向桌面级开发的英伟达DGX Spark设备组建为运算集群,成功在本地环境中完整运行了Kimi-K3大模型。

值得注意的是,随着Qwen、DeepSeek等千亿参数模型的广泛普及,单机设备的显存与计算资源往往捉襟见肘。该项目另辟蹊径,通过横向扩展计算节点,将应用场景从单机调试推向多机并行。为了应对16台设备协同工作时产生的海量数据吞吐压力,网络架构成为关键瓶颈。系统特意配置了一台MikroTik CRS804-4DDQ核心交换机进行调度,并辅以4根400G转4×100G的高速分支线缆,将所有GB10节点紧密串联,确保了低延迟的数据交互。

在基于Inferact/Kimi-K3-DSpark环境的分布式启动中,基准测试数据揭示了该集群的性能边界。在4000上下文深度下,预填充吞吐量录得654.89 t/s,首次响应耗时约8.3秒,生成速度为21.71 t/s。而当上下文深度激增至16000时,尽管首次响应等待时间延长至约21.5秒,但预填充吞吐量反而提升至758.78 t/s,生成速度也攀升至25.39 t/s,峰值更是触及38.00 t/s。

发帖人坦言,这仅是未经充分调优的初步测试结果,后续仍有优化空间。他计划近期将运行镜像及使用说明上传至GitHub,供社区参考。这一尝试不仅验证了DGX Spark集群化的可行性,也为本地部署超大模型提供了新的技术路径参考。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR
more
IJRR 2026 港科大重磅开源:退化LiDAR配准新范式,精度提升50%、加速高达116倍
AR波导量产线敲定设备,释放出两大信号
特朗普家族资本加持,Polymarket获3亿美元注资引发监管博弈
XREAL a01体验报告:当“随身巨幕”遇上散热尴尬,AR眼镜的观影悖论
视频生成的算力破局者:SmarCo GC3如何让像素在数据流中奔涌
微信支付AI专属卡扩容,DeepSeek Harness与OpenClaw正式接入
拆解报告:闪极Shargeek 300 24000mAh移动电源
荣耀Magic9系列细节再曝,内置风扇+双2亿ARRI联名影像
如何搭建嵌入式软件工程师的专属Harness?
华硕ProArt GR1X迷你主机亮相:掌中AI算力怪兽,集成RTX Spark平台
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号