
> 作者:北辰
说实话,这句话我们本来是不信的——
"虽然不想承认,但豆包工作真的好用😂"
——这是我们团队最近听到最多的反馈。

为了搞清楚豆包工作到底有几斤几两,我们用 4 个办公常见场景,在同一套提示词下对比豆包工作和 ChatGPT Work,看看谁更懂中国的办公室。
先说结论:比分不重要,重要的是输赢背后的共性
ChatGPT 赢在审美和提示词遵从,豆包工作赢在中文适配、本土工具和"做完就能用"。而后面这三样,恰恰是中国办公室里最稀缺的。
未来办公 Agent 的战场,不是战胜,而是适合。下面是 4 局的完整复盘。
豆包工作是什么:一个主动干活的同事
这里先交代一下豆包工作的产品定位:它是专门为工作环境打造的工作 Agent,包含工具调用、多步尝试,以完成办公任务为目的。它不再是单纯扮演顾问的聊天工具,而更像主动帮你干活的同事。

以读取公众号文章为例。经典模式下,豆包会尝试抓取网页,遇到阻拦则停止任务,返回由人工操作的替代方案;而豆包工作会在抓取失败时多次尝试——调用内置浏览器、主动点击验证、调用第三方 API 工具、定时重新加载——直到成功抓取到公众号内容,全程无需人工介入。
在正式开始测评前,大家可以先根据自己对 ChatGPT 和豆包工作的印象,猜一猜下面两张图分别是谁生成的:

答案在测试四里详细说。
本文编辑的过程中,赶上了 GPT-6 Astra 的发布,我们抓紧时间补测了 Astra 的办公案例,放在最后。
测试1:苹果发布会 PPT VS. 券商研报 PPT?
作为办公场景下出现最频繁,也是最消耗打工人时间精力的任务,PPT的制作一直是工作 Agent 工作能力最好的展示场。我们曾经在年初评测过当时 AI 的 PPT 制作能力。
与当初"文本转 PPT"不同——那时有生成图片的,也有生成原生可编辑 PPT 文件的——现在对工作 Agent 的要求是从原始需求开始,自主搜索资料和数据、提取内容、编排页面、排版一气呵成。这次测试的就是这样一个复合型的提问式提示词:看似很长,但没有基础资料,全是让 Agent 解决的问题。

由于 PPT 太长,就不占用文章空间了,感兴趣的同学可以到公众号后台询问获取原始提示词和PPT。
内容
先从文字内容来评价。因为这次不是给的大纲,两个 Agent 的内容提取和表达侧重也有所不同。
ChatGPT 侧重"怎么交付+怎么准备":文字主线是"从会用工具到可复核的闭环交付",重交付方法论、FDE 职业可行性、12 个月备考路线与作品集构建,适合长期落地自备。豆包工作则侧重"趋势有多猛+市场长什么样":靠大量量化数据建立全景认知,以五层能力模型、五大厂盘点、三条路径给方向,适合快速建立行业认知与决策框架。
排版
左边是 ChatGPT,右边是豆包工作。

先看封面,二者都遵守了提示词的内容要求和封面模板的样式要求。但这里明显暴露了一个问题:字体大小。ChatGPT 的 PPT 用的是英文排版下的常用字号,直接替换成中文字体,就显得很不合适——中文标题直接沿用英文字号,导致标题过大、换行不当。

目录页 ChatGPT 依然有字体大小问题,豆包工作的目录页则更适合中文阅读者的审美习惯。配色上,豆包工作看起来也更丰富,阅读的主次更清晰。

再看一下关于图表的处理……嗯,ChatGPT 字体问题依然严重……
再看图表的处理——嗯,ChatGPT 字体问题依然严重。
我的感觉是 ChatGPT 硬套了模板的样式:没有中文字号的专门优化,排版样式也过于单调,只有左右、上下分隔,同一页的模块比较少,只有单纯的文字+背景色或者树状图、折线图。豆包工作的 PPT 就灵活不少,一张图里多种布局配合多种模块,在整套 PPT 里出现得不少。

说回文字和内容风格,二者给人截然不同的感觉:ChatGPT 的输出更像苹果发布会 PPT,醒目的文字配上直接的观点;豆包工作的成品更接近国内工作环境熟知的研报类 PPT,以汇总资讯、缕清脉络为主。
综合评价
ChatGPT 做的是"苹果发布会",豆包工作做的是"券商研报"——审美没有高下,但中国办公室里交差要的是后者。这个测评上无论审美还是内容,我都更偏向豆包工作的表现。
测试2:56个常用应用,官方只支持5个?
除了常用的 Office 套件,办公环境下还要用到许多办公工具:有的是个人习惯,有的是公司要求,有的则是客户的要求。一个办公 Agent 能链接多少工具,决定了办公协作的最后一公里。
办公 Agent 常使用 Skills 或 MCP 来读取和操作其他软件和工具,它们在 ChatGPT 里叫插件(Plugins):

在豆包工作里叫"技能·连接器"。

我其实特别喜欢"连接器"这个名字,因为它完美体现了自己的作用——连接其他应用。从两张截图可以看出来:二者都拥有数量众多的插件和连接器,而且都是很流行的办公工具。
但区别也很明显:ChatGPT 的插件多数是国外常用的;豆包工作的连接器多数是国内常用的😅

实测下来,豆包工作中国内最常用的 56 个应用里,能在 ChatGPT 插件列表里找到并安装的只有下面 5 个:
下面以国内常用的另一款在线文档——金山文档为例,测评两款办公 Agent 打通的过程。
内置连接器,纵享丝滑

在连接器页面直接搜索"金山",点击加号添加连接器。

然后豆包工作会弹出一个授权配置窗口,并打开金山文档登录页面。

按照提示扫码登录,找到"金山文档 Skill",点击"仅复制 token",再把 token 粘贴回豆包工作。

然后豆包工作就可以编辑金山文档的文件、写资料、分析数据了。
手动接入,也能用
因为是金山官方提供的 Skill,所以也可以尝试手动安装到 Agent,将提示词粘贴到 ChatGPT 中。

ChatGPT 会打开授权登录页面,点击授权登录。


ChatGPT 也可以使用金山文档的各项功能了。
这样看来二者没什么区别,甚至感觉 ChatGPT 安装步骤要更少?但看似都能用,其实藏着三个坑:
不确定性:在测试之前,我并不知道能否安装成功。这种 Agent 官方未涵盖、应用自己支持的方式,都存在不能用或不稳定的隐患。
版本维护麻烦:手动安装的 Skills 通常需要手动或额外添加定时任务来保持版本最新,这需要额外的精力和 tokens,升级后与当前版本 Agent 是否适配也不确定。相对的,内置连接器和插件由内部维护、随 Agent 更新,不需要重复安装。

不支持多端:非官方、个人安装的 Skills、插件、MCP,ChatGPT 不支持多端同步——本机装好了,网页端还是找不到、不能用,要额外安装。而豆包工作的内置连接器一端安装,电脑端、网页端、手机端都能同步使用。
综合评价
公平起见也要说一句:豆包工作保存密钥需要手动复制粘贴 token,比 ChatGPT 自动保存多一步操作。
但连接器的胜负不在数量,在"你常用的那个它在不在"——手动接入非内置连接的应用,能不能用其实全靠运气;对常见本土办公工具的广泛支持,才是打通"最后一公里"的关键。
测试3:38分钟制作的网站,我却打不开?
得益于 AI 能力的提升,现在不少办公需求会直接用 AI 的 Coding 能力解决。最常见的用法是网站发布:让 Agent 打造一个专属的活动页面,带点轻量互动、收集数据,再利用 Agent 内置的组件直接发布,不需要繁琐的后端和数据后台搭建,就能获得一个满足审美和功能需求的初级网站。
这个测试以下面的提示词为例:
请帮我创建一个邀请报名网站并发布,主题是「机智流・2026 秋季团队露营」,时间为本周末两日,受邀人点击链接后可填写姓名、手机号、是否带家人及特殊饮食需求,同时有后台页面可以查看已报名信息,页面风格符合秋季露营主题。
先说一个问题:ChatGPT 做的网站,我打不开

(测试截图是用魔法可以打开的……)
视觉&内容

先看豆包工作的成品。满足需求,采用竖版上下布局,上方是报名表,下方是信息区;配色中规中矩,背景图是卡通风格的深秋森林,会根据屏幕宽度调整位置;后台采用管理员密钥登录,登录后能看到已报名情况和人数统计。做得比较精细的地方是:豆包工作自己补充了 SmartFlowAI 的英文(提示词里没给),"是否带家人"不是二选一而是数量选择,更符合实际需求。

接下来看 ChatGPT 创建的网站。不得不说,和 PPT 的结果正好相反,这次 ChatGPT 的审美更胜一筹:配色、组件、布局都更符合现代网页设计审美,宽屏左右布局、窄屏上下布局的自适应更进一步;品牌图是自动生成的自然风格图片,介绍文字和信息前的标签、图标细节也更讲究;后台同样用密钥登录,在报名信息和刷新、退出等基础功能外,还强化了统计展示。
无论文字还是视觉,我肯定第一时间选 ChatGPT 的网站——如果它能打开的话。
耗时

最后是用时:ChatGPT 的精美网站一共耗时 38 分 32 秒,豆包工作的网站上线共耗时 10 分钟。
综合评价
38 分钟的精美对比 10 分钟的能用——在模型能力越来越接近的当下,单纯的 Coding 能力已经不是核心竞争力,除了平衡质量和速度,能否简化用户(以及用户的客户)的触达,才是办公类 Agent 竞争的关键。要交差的周五下午,我选 10 分钟能发出去的那个。
测试4,没有视频模型,硬做出了个视频?
还有一类办公高频场景——生图。无论是 UI 还是海报,现在的生图不仅要求画面符合要求、好看,还要求文字排版一起完成。与单纯的生图不同,豆包工作和 ChatGPT Work 模式都会在图片生成后加入检查的过程,对不符合要求的地方进行修改,有时还会同时出多图、从中选出表现最好的。
这次测试要求两个 Agent 分别出三个不同的电商商品图。
商品宣传图
商品海报
一张简约高级的化妆品海报,主体是一支红色丝绒哑光口红,瓶身金色,背景是干净的浅粉色渐变,周围有几片轻柔的花瓣和光影,文字清晰写着「丝绒雾面口红 持久不脱色」,整体风格时尚精致,适合电商主图。

左侧是 ChatGPT,右侧是豆包工作。二者速度都很快,画面上背景、商品都符合提示词要求,文字没有错误、花瓣的动感很自然。这一轮我更倾向豆包工作的海报:文字排版更符合中文习惯("丝绒雾面口红"是品类、"持久不脱色"是特点),而且商品细节——口红的条纹、反光的倒影、背景的光线——都更自然。
不得不说一句,虽然在做图片细节 p 图、文章海报生成上我还是更习惯用ChatGPT,但是豆包在电商主图生成这种商业化场景上,落地得真好。
商品说明图
一张清晰的化妆品商品说明图,展示一瓶透明玻璃瓶装的玻尿酸精华液,旁边摆放着产品细节特写和功效图标(补水、提亮、修护),背景纯白,底部有简洁中文说明文字「玻尿酸精华 深层补水 敏感肌适用」,整体干净专业,适合电商详情页。

左侧是 ChatGPT,右侧是豆包工作。两个 Agent 依旧都完美贴合提示词:ChatGPT 可以说是完美符合背景纯白的要求,瓶身也是纯白无标签,文字、图表都很简洁;豆包工作的说明图更接近我印象中的电商详情页——瓶身不同部位颜色材质不同、有品牌标签、底部介绍文字有渐变底衬。功效图表二者表现差不多,但局部特写 ChatGPT 给人感觉更胜一筹。
还有一点要提:豆包工作内置的图片浏览器打开后,有明显的抠图、擦除、扩展等图像操作指引,而 ChatGPT 只是一个单纯的图片浏览器。
还有一点要提到的,豆包工作内置图片
电竞键盘
开头投票用的那张图,这里给出答案:左侧是豆包工作生成的,右侧是 ChatGPT 生成的。
生成一张 9:16 竖版中文电竞海报:画面主体是一把悬浮展示的酷炫机械键盘,RGB 幻彩灯效流光溢彩;背景为暗色电竞房场景,霓虹紫蓝氛围光、电竞显示器微光与桌面装备若隐若现,营造专业电竞氛围;海报顶部大标题 “极速响应 为电竞而生”,中部配解说文字说明键盘特性:“全键无冲|0.1ms 极速触发|热插拔轴体|RGB 幻彩灯效”;底部并排展示同一款键盘的曜石黑、冰川白、机甲紫三种配色,并标注 “多色可选”;整体赛博朋克科技风格,排版清晰、层次分明。

从画面来说,豆包工作的电竞背景和键盘的流光特效我很喜欢,但整体我更倾向 ChatGPT 的表现:标题字体有速度特效、键盘的七彩背光、特性介绍的配图,ChatGPT 呈现了更多细节。

和上面两张图的结果不太一样,电竞键盘的设计过程反而是 ChatGPT 更快:豆包工作在生图过程中遇到了多次文字错误,虽然增加了生图时间,但工作 Agent 的特性让它自动检查和修复,最终给出的结果一次性通过。
视频生成
接下来,我用精华商品作为例图,让两个 Agent 分别生成宣传视频。

豆包工作先自行调取了对应的技能,评估中发现需求超出默认模型上限,提示我是否转用 Seedance 2.5 模型;同意后,很快生成了包含音频的商品视频。

视频看起来很真实,产品与参考图保持一致,文字正确,背景音乐也符合主题,但缓慢旋转的效果没出来。

虽然 OpenAI 已经在 2026 年 3 月宣布关停 Sora(网页和 App 已于 4 月底停服),但我还是把同样的提示词放进了 ChatGPT。本以为会因为没有视频模型而说不行,没想到 Work 模式没有视频模型,硬是花了 1 个多小时用静态图片做了个视频出来……
因为是 2D 图片制作的 HTML 动画,真实感略差一筹:背景是生成的,看着还挺真实;产品是原图提取的,靠加光效实现动态感觉;文字显示正确;音频不是轻柔的配乐,但也能听到。
综合评价
ChatGPT 更听话,豆包更有想法:ChatGPT 遵守提示词更严格,导致很多时候缺乏创意,但当提示词细节丰富(电竞键盘的例子)时表现力会增强;豆包工作有更丰富的创意表现形式,即使提示词不够严谨,也能补充设计细节。
彩蛋:Astra 办公测试
PPT 生成

用 GPT5.6 Sol 测试的时候,中文 PPT 硬套英文模板,字体大小不正常。这次测试 Astra,依然使用相同的提示词,但解除了模板限制。模型 effort 和之前一样保持 High。

大概只用时 22m(GPT5.6 Sol 排除网络问题用时40m),PPT 和对应的 PDF 报告生成结束。

整体来看,没有强制模板的限制,字体大小问题没有再出现,但中文字体适配依然不合适,排版上不协调的空白也依然存在。尽管 Astra 这次使用了更多的表格来展示信息,风格方面仍然偏商务演讲而非报告,PPT 中也明确提到“详细信息请参考PDF”的字样,看来 ChatGPT 对 PPT 的定位和国内确实有本质区别。
邀请网站搭建

邀请网站的搭建任务,最大的改善是速度,从之前的 38m,降到了 18m,其中网站搭建只花了 8m,剩余的 10m 都是测试和部署时间。Astra 的邀请页面也采用了同时支持宽屏和移动端自适应,配色排版在线,文字内容反而更文艺,但整体视觉变化不大。

后台管理页面没有实质变化,但登录方式从原先的秘钥变成了使用 OpenAI 账户授权登录,这个变化是否算改我是持保留意见的,虽然增强了安全,但对实际实用场景来说可能增加的是操作上的麻烦。
额度消耗
因为出稿时间原因,这次我们只测试了两个 Astra 办公任务,消耗了约 2.3个 ChatGPT Plus 用户的 5 小时限额(其中网站任务消耗 1 个,PPT 任务消耗 1.3 个)。而之前用 ChatGPT5.6 Sol 测试的 4 个任务都是在 1 个 5 小时限额内完成的。
结语
模型能力的单纯提升不能解决所有的办公问题,就算 Astra 大大提高了网站搭建的速度,安全性也提高了,但是国内客户依然不能直接访问。
在重写这次测评感受的时候,Astra 的试用并没有给我带来太多的惊喜。尽管模型能力的提升在速度和编程的表现上确实突出,但对于中文办公的影响几乎微乎其微。反倒是因为 Astra 额度消耗的剧增,导致办公场景性价比下降的尴尬。
当前 Agent 的工具竞争正在从"谁更强"转向"更懂我、更懂我的工作现场":、能不能适应当地的语言、文字、审美喜好,能不能更快匹配当地的办公应用,能不能让使用者方便地触达 Agent 和它的产物,都会在用户选择和留存上占越来越重的比重。
未来办公 Agent 的战场,不是战胜,而是适合。
最后再说两个我个人特别喜欢的豆包工作功能。
伙伴对话——从零开始的好助手。如果你刚开始使用办公 Agent,或者想开启一个新的领域,可以在"工作伙伴·小队"里找到内置的诸多行业专家 Agent——伙伴,覆盖内容创作、金融分析、学术研究等多个领域,零门槛上手。

任务栏——细节体现产品设计水平。除了日常办公的常用功能,我最喜欢的是拖拽设计:把文档拖进去就能解读,这不比养宠物什么的好多了?多了解打工人的工作习惯啊!

豆包工作现在新登录会送免费 30 天基础套餐,对办公 Agent 有需要、或也想亲自测评的,抓紧下载尝试。

你最想让 AI 接手的第一个办公任务是什么?评论区聊聊。
-- 完 --
机智流推荐阅读:
1.
2.
3.
4.
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群