「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来

硅星人Pro 2026-09-12 09:45
「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图1
作者王兆洋
微信Geisterspiele

一个 27B 参数的模型,原生存在于你的电脑里,关掉 Wi-Fi,它照样可以读取本地文件、翻数据库、处理 Excel、写 PPT,连续跑一个过去通常需要调用云端大模型的复杂任务。公司的财务数据不用上传,自己的知识经验留在本地,跑得再多,也不用盯着一个随着 Agent 工作时间不断上涨的 Token 账单。

电脑买了,电费交了,剩下的 Token 随便用。

这简直完美。

这个想法并不新奇,但过去端侧 AI 唯一麻烦的地方就是,模型不太行。

把 1B、3B 的模型装进手机已经不稀奇,修图、总结文字、陪人聊天都能做;可一旦让它读几千条银行流水,自己找文件、写脚本、调工具、检查结果,最后交出一份能用的报告,小模型很快就会露馅。最近一年,这个边界开始往前推。

一个北大背景的创业公司就正在死磕这个方向,并且已经取得了一些进展。

9 月 3 日,北大系背景的元空智能和惠普一起公布了一套端侧 AI 方案。元空发布了Boxer 系列模型,以及AI Work、AI Science 两套 Agent,这些一起进入惠普的机器,从笔记本、基于 NVIDIA GB10 的桌面算力盒子,再到工作站,模型和 Agent 直接预装,并一起推动后面的企业部署和服务。

发布会现场demo环节,展示者做的第一件事就是关掉机器的Wi-Fi 。随后,元空 AI Work 在完全离线的情况下扫描本地文件夹里的几十张发票,完成解析、分类和归档,最后生成 Excel;另一个demo则是在离线情况下读完数千条银行流水,寻找短时间资金快进快出这样的异常特征。从模型推理到文件处理,数据没有离开本地。

过去我们习惯于这些任务由一个存在于几千公里外的数据中心里的AI解决,现在电脑不再只负责打开一个网页,而是可以直接本地处理这些任务。

这是元空想要让大家“改变”的认知。

1

很多人第一次知道元空,是因为 ChatExcel。

2023 年 2 月 28 日,ChatExcel 测试版上线。用户把 Excel 扔进去,不用记函数,也不用自己写公式,直接告诉它“把销售额按地区汇总”或者“找出异常数据”,它替你操作表格。半个月后,公测网页日活峰值已经达到 15 万,累计独立 IP 访问超过千万。那时豆包和 Kimi 都还没有出现,国内甚至没有多少人想清楚一个“大模型应用”到底应该长什么样。

最早做这件事的是北京大学的宁鲲鹏和姚佳雨。两人在 ChatGPT 爆火之前就研究 AI 处理 Excel 和数据,后来在导师袁粒指导下用 Transformer 重做技术路线,逄大嵬随后加入团队,把实验室里的项目往产品和商业化上推。今天元空的正式员工依然只有十人左右,它连着北大的实验室、学生和实习生;团队过去几年却从语言、视觉一路做到多模态和不同尺寸的模型。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图2

ChatExcel 后来也没有一直停在 Excel。从表格扩到数据库、数据清洗和分析,再往后变成完整的 Data Agent。元空自己披露,目前产品已经积累了数百万用户。发布会交流时逄大嵬还开玩笑,大厂们一直声量很高,他们则在“偷偷地赚钱”。

这几年留下来的东西,不只是一批用户。一个人处理 Excel 时先找哪张表,看到异常之后往哪里查,一项工作中间调用多少次工具,什么时候会失败,最后交付什么结果,这些真实的操作轨迹全留了下来。以前它们更像产品日志,但现在当Agent 开始真正替人干活以后,这批数据的意义完全变了。模型公司现在最缺的,恰恰就是这些互联网上找不到的工作过程。

当这些数据资源和元空团队过往一直积累的模型经验开始结合,元空的Boxer系列模型就诞生了。

2

过去几年,端侧 AI 长期卡在一个很尴尬的位置:小模型装得进去,重活干不了;大模型足够聪明,本地又装不下。

元空的模型则在中间这一层。这次发布的 Boxer 包括 27B 稠密模型和 35B-A3B 稀疏模型,团队给自己划出的范围大约在 20B 到 100B。按照逄大嵬的说法,3B 以下适合 Chatbot,写东西、陪聊天已经不错,但长链路生产力任务对上下文理解、Planning 和工具调用的要求很快会把它压垮;千亿参数以上的大模型能力更强,放到个人设备上的成本又太高。几十 B 参数刚好开始进入一个“能干活,也装得下”的区域。

元空内部很喜欢用“智能密度”解释这种变化。同样几十 B 参数,今天能装进去的能力比一年前多得多。他们判断,目前 35B 这一档已经能够覆盖不少一年前还要交给更大云端模型的生产力任务。这个趋势当然不只属于元空:模型架构、MoE、量化、算子优化不断往下压,PC 这一头的 GPU、NPU、内存带宽继续往上长,两条曲线今天开始交汇。

这次 Boxer 已经可以从十几 GB 内存的个人电脑,一路部署到桌面算力盒子和工作站。官方披露的工程数据里,经过针对硬件的优化后,Prefill 达到数百 Token/s,Decode 达到数十 Token/s,交互延迟压到了百毫秒乃至更低。这些数字没有 Frontier Model 跑 Benchmark 那么性感,但它决定了另一件很实际的事:一个几十 B 的模型坐在桌边,已经不会因为慢到无法忍受而失去使用意义。

而生产力任务对模型提出的要求,还远不止“聪明”。一个 Agent 连续工作两小时,中间断掉了怎么办?昨天做到一半的任务,今天回来还能不能接着做?调用十几个工具以后出了错,能不能知道应该从哪里退回去?元空 AI Work 为此做了一套 Harness 和长期 Memory,把执行过程结构化保存下来,任务可以从检查点恢复。姚佳雨在发布会上形容它有点像版本控制,他们保存的是一项工作真正走过的轨迹。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图3

这也是元空为什么没有急着去和手机里的小模型抢聊天、修图。3B 模型写一首诗已经足够好了,让它替财务部门干一个下午,那完全是另一种任务和技术路线。

3

模型终于能装进去以后,端侧 AI 可以很清楚的算清楚成本的账。

过去几年,我们逐渐习惯了一种很奇怪的计算机消费方式:电脑已经买了,真正干活的算力还得按 Token 付钱。Chatbot 时代这笔钱没那么扎眼,一个人每天问几十个问题,订阅费也就几十美元;Agent 一来,账本迅速变厚。一次任务可能连续跑几个小时,反复读取文件、搜索、调用模型、写代码、验证结果,用户越愿意把工作交给 AI,Token 就烧得越快。

“组织是永远在算账的。”逄大嵬说。惠普和元空给出的办法也很传统,把原来持续发生的 OPEX,重新换成一次 CAPEX。

企业先买机器,模型以后都跑在自己的 CPU、GPU 和 NPU 上,本地推理增加一次任务,除了电费,几乎不会再产生一张新的 API 账单。

这笔账当然不适合所有人。普通用户一天聊几十轮,直接用云端模型仍然最方便;真正敏感的是投行、律所、药企、制造企业和科研机构,因为它们通常同时满足两个条件:AI 用得足够多,手里的数据又足够贵。审计底稿、律师文件、实验数据、公司财务和工厂工艺参数,有一些甚至从制度上就不能进入公有云。

本地模型刚好同时处理这两件事。算力买断,数据留下。但这也带来另一个老问题:谁来把模型装进每家公司?元空正式员工十人左右,如果每卖一套产品都要工程师飞过去调机器,这家公司很快就不用训模型了,天天交付就行。所以,他们的最重要合作伙伴,就是惠普这样的设备厂商。据了解,双方已经合作两年,惠普有现成的工作站产品、企业销售体系、FDE 和全球渠道,元空只需要继续把模型和 Agent 做好。

软件公司不用自己卖电脑,电脑公司也终于多了一个理由,让企业再买一台性能更好的电脑。

4

在这次发布前后我们有机会和元空的团队深入交流,而在交流中,你会发现这支十来人的团队,其实多少有一点今天所谓Neo Lab 的味道。

他们当然会谈推理速度、硬件适配和客户,但聊到后半程,真正兴奋的话题却总会回到模型上。

今天模型公司到底还缺什么?他们的答案是数据,它们已经很难再从互联网里找。

Wikipedia、书籍、网页、论坛、GitHub,这些过去几十年人类公开留下来的知识,已经被一轮又一轮模型抓下来训练。预训练当然远没有消失,但继续从公开互联网里多找一些文本,已经越来越难带来过去那种能力跃迁。

他们认为下一阶段最贵的那批数据,大量存在于人真实工作的过程里。

一个分析师看到一份财报,为什么突然去查另一张表;一个老师傅听见机器声音不对,下一步会看哪个参数;一个实验员做完上一轮反应,为什么把下一次的试剂从 3ml 改成 2.7ml。这些知识很少有人专门写进网页,很多时候当事人自己都不会觉得这是“数据”。但它们恰好记录了人怎么完成复杂任务,而越来越多的新模型能力,正在从这种过程里长出来。

而这和过去一年模型训练方法的变化也撞在了一起。

预训练先让模型获得语言、知识和继续学习的能力,之后的 Coding、Computer Use、长链路 Agent,则越来越依赖后训练:给模型一个可以行动的地方,让它尝试,然后告诉它事情有没有做对。代码环境很简单,一段程序写完,跑十个 Test Case,过几个就拿几分;网络安全也可以做成环境,放一台服务器进去,攻破就是成功;到了实验室,模型调整实验参数,仪器跑完以后把真实结果送回来,反馈同样成立。

元空认为围棋是最好理解的例子。棋盘没有十万亿 Token,只有一套规则、每一步落子和最后的输赢;有了这样一个可以不断尝试、不断获得反馈的环境,模型就能自己生成几乎无穷的数据。沿着这个逻辑看今天的办公室和实验室,Excel 是环境,浏览器是环境,ERP 是环境,机械臂、显微镜和离心机也是环境。一个 Agent 真正在这些设备上工作,会自然留下一整条 trajectory:它看了什么、做了什么、哪里失败、怎样修正,最后事情有没有完成。互联网上最难获得的那批数据,在这里每天都有人免费生产。

在当天的分享里,最让我关注的也是这一个判断:“设备即环境”。

元空一直强调 Model、Agent 和 Device 要放在一起看,都和这个判断有关。模型负责理解和决策,Agent 提供 Memory、工具调用以及维持长任务的 Harness,设备则把前两者接进真实工作。现实里的任务很少像 Chatbot 一样,以一次 Prompt 开始、几十秒以后结束:财务工作可能持续几天,科研项目持续几个月,工厂甚至永远不会停。Context Window 再长,也装不下这样一条无限往前走的时间线,所以 Agent 必须记住之前发生过什么,再回到设备上继续操作。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图4

这也解释了为什么元空很在意“原生端侧模型”。他们并不满足于把云端模型量化、压小,再搬进 PC。在他们看来,模型如果最终要在设备上处理长期、复杂、真实的任务,训练时就应该接触这样的环境。“首先要有一个端侧环境,才能训出原生的端侧模型。”他们在交流里反复强调这一点。

这条路线最有意思的地方,在于它和模型变小的趋势刚好会合。

Frontier Model 仍然可以留在规模巨大的数据中心里,用昂贵算力继续探索能力边界;可一旦某种能力被证明可行,对应的环境、反馈机制和训练方法成熟,它就会不断向更小的模型迁移。一年前需要大模型才能完成的任务,今年几十 B 开始能做,再过一代还可能继续往下走。小模型进入设备之后,又拿到了云端模型最缺的真实任务环境和轨迹数据,于是下一轮后训练可以继续发生。

今天各个模型团队都在四处寻找新的“环境”数据:Coding、金融、安全、科研,每一类任务都得有人搭出一套能够反复尝试并且给出可靠反馈的世界。而在元空的选择里,像惠普这样的设备就是最好的环境。

过去二十年,PC 和手机把几十亿人接进互联网。人类在这些设备上搜索、聊天、工作、写代码,最后留下的数据喂出了今天的大模型。现在 AI 开始反过来住进设备里,它第一次可以长期看到人怎么工作,也可以自己动手、犯错、拿到真实结果,再继续下一次。

这些都是元空想要让大家知道的,他们的“赌注”:省掉 Token 和数据不出本地,都已经足以卖一台电脑;但如果智能密度继续以今天的速度提升,而模型训练真正稀缺的数据又越来越多地来自现实环境,设备就不只是一台更便宜的推理机器。它会成为模型下一轮学习的地方。而谁先在这里“扎下根”,谁自然就有更大机会拥有AI往前走的下一个未来。

「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图5
「设备即环境」:这个北大系公司想告诉所有人,端侧模型才是未来图6
点个爱心,再走

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
MLED情报站:事关聚飞光电、维信诺、AOC和创维光显等
最新出席终端及需求公布 TCL、卡西欧、海尔、创维、松下电器、万家乐等40+品牌终端确认出席丨2025第六届新材料供应链大会
充电早报:安克Nano 45W氮化镓屏显充电器拆解;创维205W自带线快充移动电源拆解;真我 GT8 Pro四款原厂系充电器实测
8月6日走进创维面对面交流 10+找材料/工艺需求限时征集供应商
东风日产、中国移动、OPPO、vivo、海尔、创维等40+品牌终端确认出席丨2025第六届新材料供应链大会最新出席终端及需求公布
20+品牌终端出席 中国移动、海尔、创维、vivo、五粮液、施耐德、均胜群英、苏泊尔、花西子 新材料供需对接大会精准对接促合作
创维“腾笼换鸟”:家电退场、光伏登台,黄宏生押注新能源再启千亿征途
股价单日暴涨34.41%!创维IFA发布的新品到底有何魔力?
创维集团上半年营收创历史新高
拆解报告:创维140W 3C1A氮化镓智显充电器
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号