一块 430 块的 FPGA,让我看清了算力的未来

FPGA技术江湖 2026-08-24 08:35

 

一块 430 块的 FPGA,让我看清了算力的未来

先从那块 7020 说起

前段时间本公众号发了两篇文章,《》和《》,讲的是学生在 ZYNQ-7020 上跑通字符级 nanoGPT 的经过。反响比我预想的热闹,后台不少朋友在问细节,也有人问"这玩意除了教学还能干嘛"。后来我又指导学生继续优化,这篇算是既交作业,也回答那个问题。

先交作业。这块 2012 年发布的老芯片只有 220 个 DSP、不到 5 MB 片上内存,10 MB 的 INT8 权重放不下,只能扔在 DDR 里,每生成一个 token 都要把权重从头到尾流一遍。这一轮优化把四路 64 位总线全开,DSP 用到 212 个,时序裕量最后只剩 0.537 纳秒。学生一度想把推测解码从三路验证扩到四路,算了一下要 244 个 DSP,超出芯片上限,只好作罢。最终板子跑到 194.82 token/s,整板功耗两三瓦。以下是郭孟彬同学的汇报视频:


跑通之后,我反而被另一件事绊住了。看串口的数据流:进去的是几十字节的提示词,出来的是每秒几百字节的 token,那 10 MB 权重和 KV cache 从头到尾没离开过板子。也就是说,用智能的设备和存放智能的硬件之间,只需要一条很细的链路,WiFi 都绰绰有余。

那能不能干脆把算力从设备里拿出来,做成一个人人都能接入的资源平台?设备不必自带算力,走到哪,像连 WiFi 一样把算力接上。

这张网要打穿两个瓶颈

第一个是通信。数据中心好比发电厂,骨干网好比特高压,这两层都不缺,缺的是配电入户的最后一跳。云端 GPU 再多,隔着 50 到 100 毫秒的广域网往返,很多事情就是做不了。

第二个是标准。电器不关心电是水电还是火电,因为有 220V/50Hz 这个统一接口。算力这边没有:CPU、GPU、FPGA、NPU 各说各话,跨芯片、跨操作系统的调用至今没有统一形态。

供给侧还有一个问题,电网早就想明白、算力这边才刚开始想:负载是分档的,供给也得分档。

国家在建的算力网络,现在是怎么干活的

说到这里得先看看现实里已经动工的部分。"东数西算"工程 2022 年启动,"十五五"规划里写的是"构建多层次算力设施体系和全国一体化算力网"。这张国家级的网目前大致分四步干活:先是感知,在算力节点装探针、在网络节点装代理,实时采集 CPU、GPU 利用率和链路的带宽、时延、丢包,拼出一张全局资源视图;然后是通告,算力节点周期性把自己的算力摘要广播出去,网络设备把算力信息并进路由计算,生成"算网联合路由表",选路时不光看路近不近,还看那头的机器忙不忙;接着是编排调度,运营商的编排器(中国移动叫"算网大脑")按时延、成本、负载多目标权衡,把任务派到合适的节点,现在已经做到每日亿级调度,骨干网上还规划了 1 毫秒、5 毫秒、20 毫秒的三级时延圈;最后是运营,包装成"算力即服务"按需开通、按量结算。

这套机制已经能把大颗粒的任务在数据中心之间搬来搬去,但对照本文的愿景,还有两个明显没铺到的地方。一个是毛细血管:官方口径里边缘算力"尚处于起步阶段",三级时延圈里最快的 1 毫秒指的是枢纽城市之间的骨干网,不是你家路由器到板子的那一跳,更够不着机器人的反射环。另一个恰好是前面说的插座问题:行业公认的头号卡点就是算力度量标准缺失,CPU、GPU、FPGA 这些异构芯片没法用一把尺子量,跨节点的调度和互联就悬在半空。国家的网在解决"电厂到城市",这篇文章聊的是"进楼入户",两头得接上才算通。

后台问得最多的一个问题

国家要建算力网,让大家像用水用电一样用算力,听着很美。可后台常有朋友追问:将来算力按度收费,能便宜到哪里去?大模型背后的电费账摆在那儿,这个价恐怕低不了。再者,总有一些信息你并不想交给云端大模型,想留在本地处理;可这点需求,又远不到自建一个小型私有机房的程度。

夹在"云端不放心"和"机房建不起"之间的这道缝,恰好放得下前面那块实验板卡。它比一只鼠标还小,某宝上售价不到 500 块,整板功耗两三瓦,全年通电电费也就十几块钱。权重 10 MB 的 GPT 已经在上面稳定跑着,往后几十 MB 量级的模型也装得下,板上的 DDR 还空着大半。


一块 430 块的 FPGA,让我看清了算力的未来图1

▲ 板卡和一只普通鼠标同框,贴上散热片,这就是全部的"机房"

▲ 实验同款 ZYNQ-7020 最小系统板,网上在售,430 元

更要紧的是账单逻辑变了。水电是按量计费的,这块板子是买断制:几百块钱一次付清,数据不出家门,7×24 开着也不心疼。它跟那张大网也不冲突,倒像大网铺到户之前每家先装的一块太阳能板:并网之前,自家先能发电。

顺着这个思路还可以再往前想一步:一块不到巴掌大的板子就有这样的产出,那十块呢?一千块呢?真要组起网来,时延、组网、调度这些账当然得一笔笔算,后面会提到的 ASAP'25 多终端共享一块 FPGA 的工作就是在算这笔账。但这个想象空间里,数量还只是表面,更值钱的是每个节点的成色:一千个 GPU 节点,是同一种算力复制一千份;一千个 FPGA 节点,可以是一千种不同的算力——软件可以换,数据通路也可以换,谁的负载接进来,节点就长成谁要的样子。别的算力芯片出厂那天形状就定死了,只有这种节点能跟着网络里的需求一起生长。

当然,一块 7020 顶不了所有的活。它到底能顶哪一档,得先把算力的档位排出来看。

从幼儿园到科学家

不同任务要的智能水平差得很远。把算力资源按"学历"排个队,大概是这样:

  • • 幼儿园:MCU 加 TinyML,干唤醒词、异常检测这类活,毫瓦级;
  • • 小学生:边缘 FPGA,我们那块 7020 就在这一档,跑小模型和专用算子,瓦级;
  • • 中学生:边缘 GPU 工作站,带得动 40B 模型和实时视觉,百瓦级;
  • • 大学生:数据中心推理集群,伺候百亿到千亿参数的开源模型,千瓦级;
  • • 科学家:超节点集群。刚开源的 Kimi K3,2.8 万亿参数,MXFP4 权重 1.56 TB,vLLM 官方要求至少 8 张 GB300 才能起跑。

这个梯队两头都有故事。顶端在通胀:K3 的权重是开放的,可部署门槛是一个中型机房,到了 2026 年,"开源"和"人人可用"已经是两回事。底下呢,绝大多数日常任务根本用不着科学家。让 K3 做关键词唤醒,等于请院士教幼儿园,又贵又慢。

一块 430 块的 FPGA,让我看清了算力的未来图2

▲ 算力的学历梯队:左侧是功耗量级,右侧是取算力的延迟半径

所以平台的合理形态是按任务需求就近分配合适的档位。这两年,支持这个判断的证据已经陆续摆出来了。

一块 430 块的 FPGA,让我看清了算力的未来图3

▲ 开源模型体积与设备内存的剪刀差:2026 年已差约 65 倍

证据已经摆了四块

最早的一块在 2018 年。INFOCOM 上有个组把华为 Mate 9 经 802.11n 连到小米路由器,路由器后面挂一块 ZC706(和我们的 7020 同家族),手写识别、人脸检测、物体识别三个 App 的后端全部卸载过去[1]。响应时间比卸载到云端快约 3 倍,快的部分全是省下的广域网往返:他们测到最优 EC2 实例平均 74 毫秒,WiFi 一跳只要几毫秒。物体识别的执行时间比云端 CPU 快 14.5 倍,手机那头最多省电 29.5%。链路能不能通,八年前就有了答案。

去年 ASAP 上有人把形态升级成多台终端共享一块 ZCU104,配一个卸载管理器,对每个到达的任务实时权衡负载、能耗和截止时间,决定本地跑还是发出去[2]。调度的问题,也有人接了。

还有更细的玩法。ISVLSI'23 的 ExpOL 把一个 CNN 从中间切开,前半在终端的小 FPGA、后半在边缘的大 FPGA,中间只传特征图,再叠上剪枝和早退一起搜索,能效最高翻倍[3]。端和边可以合伙算同一件事。

把这条路走得最远的,是港科大孟子立团队今年在 HotMobile 演示的 WiCi[4]。他们的判断很干脆:受供电和重量限制,移动设备和服务器 GPU 的算力差距在百倍量级,设备端追不上,那就不追了,把 GPU 留在原地,把接入做到极致。做法是在客户端用 LD_PRELOAD 劫持 NVIDIA 用户态驱动,把 CUDA 调用连同参数经 UDP 打包,发到 GPU 服务器上执行。应用完全无感,以为自己在调本地显卡。实测两台树莓派 5 经 WiFi 共享一台 4090D,跑 40B 模型,能拿到原生速度的 65% 以上。

WiCi 顺带把另一件事也坐实了:实时性要求高的边缘智能,从云端是取不到算力的,必须就近拿。这一条解开了不少研究的死结,最典型的是机器人。人形机器人的平衡控制环跑 1 kHz,每个周期只有 1 毫秒预算,云端往返差着两个数量级,怎么优化都无解。但换成"WiFi 一跳的边缘算力,加本地毫秒级反射",架构就成立了:平衡和避障留在本地 FPGA,理解和规划放到就近的边缘 GPU,前沿大模型在云端做离线的学习进化。三层用三个档位,各拿各的。

一块 430 块的 FPGA,让我看清了算力的未来图4

▲ 机器人的三层智能:反射留在本地,认知就近取,进化放云端

该说 FPGA 了

铺垫完了,该进正题了:在这样一张算力网里,FPGA 可能是最灵活的那种形态。我给它归了三个用途。

头一个用途是补差。很多任务离跑起来就差一点点算力:差一个加密流水线,差一个 GEMV 引擎,差一路实时预处理。为这点缺口上一块 GPU,功耗、成本、体积都不合适;FPGA 恰好可以按需变形成缺的那一小块,差多少补多少,补完还能改行干别的。我们在 7020 上给预填充和解码配了两套数据通路,ASAP'25 按到达的负载换部分重构位流,走的都是这个路子。放在电网里,这叫调峰。

第二个用途是守住最后一毫秒。分档供给里有一层是网络永远替代不了的:毫秒级确定延迟的反射层。GPU 有调度抖动,CPU 背着操作系统,只有 FPGA 能给出微秒级、零抖动、传感器直连的响应。机器人的平衡环、工业保护、实时基带,这一层没有对手。

第三个用途要往十年后看。现在整个算力体系围着 Transformer 的矩阵乘转:GPU 为它特化,它也因 GPU 而胜出。这个自增强的圈有个学名叫硬件彩票,Sara Hooker 在 2020 年提出[5]:一个架构赢了,未必因为它离智能的本质更近,可能只是更适配当时的硬件。可负载正在漂移,长推理链让解码越来越吃带宽,SSM 那一路想干掉 KV cache,存算一体想干掉权重搬运。我学生在 7020 上撞的墙,每个 token 搬 10 MB 权重、带宽利用率只有两成多,跟 H100 跑 K3 撞的是同一堵。这堵墙在人脑里不存在,突触权重就长在计算发生的地方。真到范式转移那天,GPU 和 ASIC 的存量硅片押错了注就是废铁,FPGA 是唯一不用重新流片就能换数据通路的衬底。

当然也得说清 FPGA 干不了什么。别把它当通用算力池,30 GOPS 的 7020 打不过三百块钱的 N100 小主机;差一个数量级的算力缺口它也补不动,那是 GPU 的活。它的位置很窄:瓦级功耗,确定延迟,按需变形,差一点补一点。但每一档供给旁边,都缺这么一块。

我的判断是:在大模型边缘芯片的硬件架构和模型定下来之前,FPGA 的地位还是无可撼动的。算力该怎么传输、以什么样的形态传输、要传输什么内容,不同背景的人理解不尽相同;但毋庸置疑,FPGA 在探索这些答案的过程中必将发挥重要的作用。

这也解释了我为什么把这件事出成课程大作业。学生在 7020 上撞过的每一堵墙,权重搬运、带宽利用率、时序收敛、数据通路取舍,恰好都是上面这些开放问题的缩影。一块几百块钱的板子,摸到的却是算力体系最前沿的痛处。

接下来能做的事,也都顺着这条线。近的,把 token 服务挂上局域网,让零算力终端直接调用,验证"进楼入户"的最小闭环;再远一点,在这块小芯片上试三值权重、试存算一体式的数据通路,看看权重搬运那堵墙能不能先凿开一个小洞;等边缘机器人的课题立起来,1 毫秒的反射层就用它来做。课程还会继续迭代,题目会换,芯片可能也会换,但要练的能力始终是同一个:看清负载的形状,再给它塑一条合身的数据通路。下一代算力芯片长什么样,现在谁也说不准,可动手探过路的人总比等答案的人先看见。

FPGA 可能是打开未来算力芯片大门的钥匙!

冷水还是要泼的

回到标准那个瓶颈,得承认它只解决了一半。好的一半:数学上 Transformer 把 AI 归约成了矩阵乘,软件上 GGUF、ONNX 这些格式已经做到一份权重多种芯片跑,接口的雏形是有的。难的一半:性能不可移植。同一个模型在不同芯片上效率差一个数量级,因为高效恰恰来自专用。我们那块 7020 能用 3 瓦跑 GPT,就因为那条数据通路除了 INT8 乘加什么都不会。

所以这张网大概率不会由一种芯片包打天下。它需要统一的接入协议(WiCi 那类无感劫持是雏形),需要从 MCU 到超节点的分档算力池,也需要 FPGA 这类填缝的材料。三样凑齐才接得起来。

几条带得走的

  1. 1. 算力平台要同时打穿通信和标准两个瓶颈,光堆数据中心,解决不了最后一跳,也解决不了最后一毫秒。
  2. 2. 按任务分配刚刚好的智能。从 MCU 到 K3 超节点分五档,请院士教幼儿园是这个时代最贵的浪费。
  3. 3. 高实时的边缘智能必须就近取算力。WiCi 用树莓派证明 WiFi 一跳能拿到原生 GPU 六成五的速度,而云端往返对 1 毫秒控制环无解。
  4. 4. FPGA 的位置是补差、守最后一毫秒、对冲硬件彩票。位置不宽,但每张算力网都缺它不可。
  5. 5. 部署可移植已经实现,性能可移植违背物理,异构分档会一直存在下去。
  6. 6. 云端按量计费和本地隐私之间有一道缝,一块几百块买断、瓦级功耗的板子正好塞得进去。

未来最稀缺的,可能不是更强的芯片,而是一张能把手边算力接起来的网。

我们下一步打算给这块 7020 加一层 lwIP TCP 服务,把 token 生成暴露成局域网 API,让一块墨水屏终端零算力调用,在 3 瓦这一档试试这张网的最小样子。没看过前两篇的朋友可以补票:《把大模型塞进FPGA,被我出成了课程大作业》《"把大模型塞进FPGA"后续来了!》。文中提到的论文都列在文末参考文献里,方便按图索骥。也留个问题:你觉得未来家里的算力,会像宽带一样按月订阅,像充电宝一样按次租借,还是像那块 430 块的板子一样一次买断?评论区聊。

参考文献

[1] S. Jiang, D. He, C. Yang, C. Xu, G. Luo, Y. Chen, Y. Liu, J. Jiang. Accelerating Mobile Applications at the Network Edge with Software-Programmable FPGAs. IEEE INFOCOM 2018, pp. 55–62. DOI: 10.1109/INFOCOM.2018.8485850

[2] Z. Zhang, B. Madabhushi, S. Kundu, R. Tessier. Managing Computation Offloading from Edge Devices to a Reconfigurable Edge Cloud. IEEE ASAP 2025, pp. 123–130. DOI: 10.1109/ASAP65064.2025.00029

[3] G. Korol, M. G. Jordan, M. B. Rutzig, J. Castrillón, A. C. S. Beck. Design Space Exploration for CNN Offloading to FPGAs at the Edge (ExpOL). IEEE ISVLSI 2023, pp. 1–6. DOI: 10.1109/ISVLSI59464.2023.10238644

[4] W. Li, Y. Shen, Z. Meng. Demo: WiCi: Wireless Computing Infrastructure. ACM HotMobile 2026. DOI: 10.1145/3789514.3796248

[5] S. Hooker. The Hardware Lottery. arXiv:2009.06489, 2020(后发表于 Communications of the ACM, 2021)

 


- -THE END- -


往期精选 

一块 430 块的 FPGA,让我看清了算力的未来图5 
一块 430 块的 FPGA,让我看清了算力的未来图6 

一块 430 块的 FPGA,让我看清了算力的未来图7
一块 430 块的 FPGA,让我看清了算力的未来图8

FPGA技术江湖广发江湖帖

无广告纯净模式,给技术交流一片净土,从初学小白到行业精英业界大佬等,从军工领域到民用企业等,从通信、图像处理到人工智能等各个方向应有尽有,QQ微信双选,FPGA技术江湖打造最纯净最专业的技术交流学习平台。


FPGA技术江湖微信交流群

一块 430 块的 FPGA,让我看清了算力的未来图9

加群主微信,备注姓名+学校/公司+专业/岗位进群


FPGA技术江湖QQ交流群

一块 430 块的 FPGA,让我看清了算力的未来图10

备注姓名+学校/公司+专业/岗位进群

一块 430 块的 FPGA,让我看清了算力的未来图11

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
FPGA
more
算力替代“MCU+FPGA”方案!极海半导体打通机器人“感知-控制-驱动”全链路
AMD 嵌入式计算峰会--自适应SoC|FPGA|边缘 AI|NPU|DSP|x86 嵌入式 等
牛!FPGA + 双 AD9288,轻松玩转便携式示波器
直播预约 | “5人60天 vs 2人3天”:当FPGA开发遇上AI智能体,效率革命真的来了!
AI 重塑 FPGA:当协作颗粒度从"周"降到"分钟",一个人能做什么
基于FPGA的分布式视频处理平台
FPGA-5G通信算法的基本套路
AEC-Q100+ASIL D双认证,安路科技车规FPGA护航智能座舱
国产FPGA闯出新速度,HME-PV为AI视觉注入新动能
一台计算器,为什么要自己设计CPU?这个开源FPGA项目把"从零开始"做到了极致
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号