【区角快讯】当本地AI算力不再局限于单点突破,而是通过集群化部署实现性能跃迁时,我们看到了边缘计算新的可能性。近日,英伟达开发者论坛用户ciprianveg披露了一项颇具实验性质的本地AI算力测试成果。他通过将16台原本面向桌面级开发的英伟达DGX Spark设备组建为运算集群,成功在本地环境中完整运行了Kimi-K3大模型。
值得注意的是,随着Qwen、DeepSeek等千亿参数模型的广泛普及,单机设备的显存与计算资源往往捉襟见肘。该项目另辟蹊径,通过横向扩展计算节点,将应用场景从单机调试推向多机并行。为了应对16台设备协同工作时产生的海量数据吞吐压力,网络架构成为关键瓶颈。系统特意配置了一台MikroTik CRS804-4DDQ核心交换机进行调度,并辅以4根400G转4×100G的高速分支线缆,将所有GB10节点紧密串联,确保了低延迟的数据交互。
在基于Inferact/Kimi-K3-DSpark环境的分布式启动中,基准测试数据揭示了该集群的性能边界。在4000上下文深度下,预填充吞吐量录得654.89 t/s,首次响应耗时约8.3秒,生成速度为21.71 t/s。而当上下文深度激增至16000时,尽管首次响应等待时间延长至约21.5秒,但预填充吞吐量反而提升至758.78 t/s,生成速度也攀升至25.39 t/s,峰值更是触及38.00 t/s。
发帖人坦言,这仅是未经充分调优的初步测试结果,后续仍有优化空间。他计划近期将运行镜像及使用说明上传至GitHub,供社区参考。这一尝试不仅验证了DGX Spark集群化的可行性,也为本地部署超大模型提供了新的技术路径参考。
16台DGX Spark集群实测Kimi-K3,峰值生成速度达38 t/s
科技区角
2026-09-05 12:00
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。