单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!

机器之心 2026-08-22 18:38
单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图1
编辑 | 泽南

这个结果太疯狂了。


本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。


单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图2


Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。


单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图3


来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。并列一作杨硕(Shuo Yang)是伯克利 EECS 博士生,范晓泽(Xiaoze Fan)在 UT Austin,两人本科均毕业于上海交通大学。FreeToken 的作者还包括 Ion Stoica、Matei Zaharia、Kurt Keutzer、韩松等顶尖学者。


该系统专门针对 MoE(混合专家)大模型在消费级硬件上的本地部署进行了全栈协同设计,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛。


单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图4



FreeToken 现在已经提供了 Windows / Linux 桌面 App(带 GUI),CLI 一行 uv pip install "freetoken [accel]" 即可载入。


消费级硬件能跑什么?


传统的 CPU-GPU 权重卸载(Offloading)方案往往因为 PCIe 带宽瓶颈导致推理速度极慢(每秒几 token 甚至卡顿),而 FreeToken 实现了「交互级实用速度」的本地推理


单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图5


除了每秒 Token 速度,在处理长 Prompt(如 4-16k 上下文)时,传统 Offloading 方案因逐层从系统内存拉取 Expert 导致严重 I/O 阻塞。FreeToken 将首 Token 延迟(TTFT)降低了 42-58%


针对如今常见的 Agent 工具,如 Claude Code、OpenClaw 等循环交互、逐步追加上下文的场景,在多次工具调用与思维链(CoT)迭代中,由于 FreeToken 引入的 Token 边界轻量级检查点与状态复用,后续多轮交互的 TTFT 减少了 65-80%


论文在不同 PCIe 规格(PCIe 3.0 x8、PCIe 4.0 x16、PCIe 5.0 x16)及不同 CPU(如 Intel i7、AMD Ryzen 9、Threadripper)下进行了测试,当系统后台有其他高 I/O 任务抢占总线时,算法可以自动提升 CPU 端分流计算比例;当总线空闲时则提升 GPU 载入比例。


也就是说,无论处于何种总线带宽受限环境,系统均能稳定收敛至该硬件拓扑下的理论最大吞吐上限


论文作者还做了压力测试,模拟用户在后台开启 3D 渲染、游戏导致可用显存骤降 4-8GB 的场景。传统方案会直接触发 CUDA Out of Memory (OOM) 崩溃退出,FreeToken 可以在 0 停机开销下无缝收缩 GPU 驻留的 LRU Cache 大小,将更多未命中 Expert 转交 CPU 计算,保证推理服务平滑降级而不中断。


可以说,现在跑大模型不需要死磕模型 100% 上显存了。


对于 MoE 这类稀疏激活架构,只要通过软硬件协同的「动态带宽感知 + 双缓冲数据流 + 状态复用」,完全可以利用 PC 上较为常见的 DDR5 大内存 + PCIe 高带宽通道 + 消费级单卡,以极高性价比获得可以日常个人使用的体验。


当然这意味着显存不够,内存来凑。比如 DeepSeek V4 Flash 的专家池约 140GB,就需要 32GB 显存(RTX 5090)加上最好有 192GB 的内存来跑才比较稳。


为什么 FreeToken 能做到?


如今,大模型开放权重解决的是谁能拿到模型,没解决「谁能跑得起模型」。 Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 的能力已经逼近闭源第一梯队,但跑它们仍然默认要数据中心。结果就是能力的差距在快速收窄,可及性的差距还是很大。


如果以游戏平台 Steam 观之,大家的电脑约 72% 有 N 卡,其中最常见的单卡是笔记本版的 RTX 4060,如果大模型能把它们用起来情况就会大不一样。那么就需要一个能把 GPU、CPU、主机内存、互连当成一个统一平台来调度的服务系统。


MoE 恰好给了我们这个机会,以目前最火的 DeepSeek-V4-Flash 为例,它有 284B 总参数、43 层、每层 256 个路由专家选 6 个,单 token 只激活 13B。在部署精度下,活跃参数量塞得进 RTX 5090 的 32GB。


但稀疏只减少了计算,没有等比例减少内存,完整专家池仍然远超显存。当前的瓶颈在于,Prefill 会摧毁 MoE 的稀疏性:单个 token 只走 k 个专家,但一个长 prompt 里所有 token 路由的并集,几乎覆盖每层的全部专家。于是每次 prefill 都要把接近完整的专家池流过 PCIe 一遍。


在 DeepSeek-V4-Flash 的部署上,FP4 部署要搬约 140GB 专家权重,RTX 5090 需要额外的两秒钟,按需取专家的引擎,会把这整段暴露成 GPU 空转。


雪上加霜的是 Agent 每轮工具调用都会改上下文。而 Qwen3.6-35B 用 gated DeltaNet、Kimi-K3 用 KDA 这类循环层,会把整段前缀压成一个演化状态,不能局部复用,只能靠 checkpoint。一个 checkpoint 占的内存相当于几百 token 的 KV,所以引擎只能存少量。上下文一改,改动点之后的 checkpoint 全部失效,只能回退到上一个有效点,重算几千 token。而 RTX 5090 的 dense BF16 吞吐只有 H100 的约 1/5、B200 的约 1/10,扛不住这种重复劳动。


FreeToken 的解法是重新定义了端侧异构硬件的协同调度逻辑:



单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图6


其中面向 Agent 的机制非常有趣,这么做可以说是真的是瞄准如今热门的 Agent 任务在优化了。


结语


FreeToken 证明了让大模型走向普及的关键,不仅在于开源模型权重,更在于端侧调度软件系统的工程设计与算法重构。


通过将个人电脑的 CPU、系统内存、PCIe 总线与 GPU 作为一个统一的弹性计算平台,开发者和个人用户今后完全可以在本地笔记本或游戏 PC 上跑起顶尖 MoE Agent,极大降低了本地部署高智能模型的成本。


好了,现在就差个传说中的 Qwen3.8-A3B 了。


单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!图7



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
刚刚,阿里开源2.4万亿参数大模型!性能比肩Fable 5
DeepSeek Harness开源,突破4万星/iPhone或全线涨价100美元/ChatGPT大更新,记住你在电脑上干过什么
刚刚 DeepSeek-Harness 桌面版开源 win/mac
刚刚,小红书开源dots3-note!IMO 42分满分同系列模型来了
资料全开源!为了满足儿子的卡丁车梦,我DIY了一个卡丁车控制器!
Meta重返开源!30B本地Agent塞进24GB显存,LeCun火速力挺
刚刚,阿里Qwen3.8-27B开源!家用显卡可跑,能看图看视频
刚刚,GLM-5.3来了!拿下多个开源SOTA,我用它“魔改”DeepSeek Harness
编程能力最强开源模型!智谱GLM-5.3登场,国产AI又一猛将
极佳视界发布GigaBrain-0.7,开源第一!颠覆性首创System-3+双塔体系
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号