

作者丨Rhea

三家三条路线,但没人帮你背锅

把同一份工作交给三家办公Agent
测试方法与边界
测试于 2026 年 9 月 13 日完成,涉及三个 macOS 构建:
WorkBuddy AI 5.5.2
千问办公(QwenWork)1.0.5,build 26090806
豆包工作(Doubao Work)2.29.7
把一份脏销售流水处理成 Excel、PPT 和文字摘要; 核查五项近期公开信息,区分事件时间、报道时间和证据强度; 读取一份实际不存在的内部文件,观察缺少核心输入时会发生什么。
第一份脏活:同一份销售流水,三家算出了三个总额







千问走的是工程师路线。它会给自己做测试、做最小复现,甚至抓回了一次“误删正常订单、漏掉 78 万异常单”的严重错误。 WorkBuddy 走的是团队路线:先让子 Agent 处理表格,再由主 Agent 独立复算,前后修正了 9 处错误。 豆包走的是直出路线:不调用子 Agent,直接用脚本生成三份文件,最后重点检查它们的数字是否一致。

第二份要“落地”的报告:三家给了三个答案,但没有一个能写进汇报
接口必须统一,因为中央有明确的跨区域协同要求 厂商不必统一,每个省市各自采购、各自实现

WorkBuddy 将其定为“确有此事,置信度中”; 千问办公写“未能确认,置信度中”; 豆包工作写“部分确认,置信度中”。



第三份不存在的文件处理:确实没瞎编但把球踢回给了你




拆开安装包:沙箱、虚拟机和浏览器

这轮逆向采用的是静态取证:我们只读检查安装包中的签名、权限、配置与随包资源,没有运行程序、登录账号或发起网络请求。因此,它能告诉我们三家为 Agent 准备了什么样的执行环境,不能证明实测任务一定经过了对应路径,也不能证明实际读取、上传了什么,更不能由此给出安全排名。

腾讯和阿里的办公 Agent,内核都是自家的编程 Agent 改的(CodeBuddy / Qoder)。之前有媒体测评过说“千问慢但更愿意标风险”的观察是血统导致的。编程 Agent 天生带验证习惯。 千问把承认不确定做成了一个可以关掉的开关。它预置了四种人格预设,其中只有「深思熟虑」要求区分事实与判断,「果断执行」反过来明确要求“有把握的事情断言,不加‘可能’、‘也许’”。 千问把“不用你的数据训练模型”做成了付费档位特权(包内原文:Upgrade your plan to customize data sharing preferences.)。 WorkBuddy 是唯一能花钱的,内置了 weixinpay 插件。但实测用美团下不了外卖订单,只能买核销券,并且必须要选择对应的助手,体验并不是很好。 workbuddy 深度接入了微信。分别有分享、解码、通知、支付等内置组件和插件,以及 MCP 千问办公内置了 SOUL.md 、AGENTS.md、HEARTBEAT.md 这套 openclaw 的组织方式,但不是它的套壳。
147.0.7727.149),并往里塞了字节的整条端侧技术栈:



AI 可以接走执行
但判断、核对、责任仍然在人

2026-09-11
2026-09-09