114.26 美元买下一台平板,266.15 美元才拿回删除里面软件的权利,这真是什么离谱操作?网友 Eric Pardee 的平板电脑 Fire HD 10 用了几年后开始频繁自动关机,最后发现是几个删不掉的 Amazon 系统软件在作怪。想彻底解决,只能拿到这台平板的系统最高权限,也就是所谓的 root。Pardee 于是找来 Claude、Kimi K3、GLM-5.2 和 GLM-5.3 接力研究。大家可以先猜一下,最终是哪个模型成功拿到权限了?买得到平板,删不动软件Pardee 在 2022 年 11 月从 eBay 买下这台全新未拆封的 Fire HD 10。他把它当作常年接电的 Home Assistant 智能家居面板。去年 11 月,它开始彻底关机。有时甚至一天两次。系统日志留下了 Software_Shutdown。设备里某个拥有相应权限的软件发出了关机请求。Pardee 有信息安全背景。他与 Claude 逐项排查,禁用了 5 个持有 REBOOT 或 SHUTDOWN 权限的 Amazon 服务。问题消失了几个月,后来再次出现。还有 3 个相关软件包留在系统里。它们被标记为受保护组件,机主无法禁用。其中包括负责系统更新的 com.amazon.device.software.ota。永久移除这些组件需要 root。但是这台机器根本没有公开可用的获取root权限的方法!Pardee开始和他的agent一起,智斗厂商!4 个 AI,接了一场很长的夜班Claude 先承担了前面数月的诊断。项目进入内核漏洞利用后,它的安全机制开始拦截相关请求。后来,连总结旧会话也会触发限制。说实话,claude的安全限制真的很严格,APPSO第一次看到这条资讯时,第一反应就是,Claude 估计会被A社的安全治理规则拦截安全相关的命令。8 月 13 日晚,Pardee 把设备接到电脑,换上 Kimi K3,对Kimi说的第一句话是:「It’s my device。」Pardee估计在内心呐喊:这是我的设备!我有使用它的权利!!!Kimi 先判断了设备归属和请求性质。随后,它检查了这台平板对应的固件与内核。论坛上的老方法都已失效。Kimi 把已知的 Mali GPU 漏洞逐一对照实际二进制,最后选中了 CVE-2022-38181。这是一个 GPU 驱动的内存漏洞,成功利用后,普通用户有机会一路提权到 root。这个漏洞早在 2022 年就已披露。2023 年,它进入美国 CISA 的已知被利用漏洞目录。Pardee 的设备仍运行 Fire OS 7.3.2.6。作者核对固件后确认,这一版没有包含后来版本里的修复。没准有戏!Kimi 用约 30 小时和 621 条消息搭出一套利用工具,费用为 164.25 美元。利用程序跑起来以后,平板很快进入了一种近乎机械的循环:开机,尝试利用;内核崩溃;重启;再来一次。每次启动最多试 6 次。几十轮过去,屏幕一次次黑下去,又一次次亮起来。到第 46 次重启时,Pardee 已经开始问 Kimi:我们真的走对了吗?Kimi 仍然认为方向成立,于是继续试。最后,平板重启了 500 多次,root 却一次都没有出现。(悲)预算烧完后,Pardee 用全大写通知 Kimi:必须交班给 GLM-5.2。Kimi 随即整理了一份 HANDOFF 文档。里面写着已经验证的部分、失败路径和待解决问题。GLM-5.2 花了 21.90 美元。它先叫停重复尝试,修掉两处足以让前面所有实验失败的问题。它随后判断,CPU 与 GPU 的缓存一致性构成硬件障碍。项目可能已经撞墙。戏剧性的事发生了——这个判断后来又被 GLM-5.3 推翻了!8 月 16 日早上,刚发布不久的 GLM-5.3 接过同一份交接文档。它发现,设备上的内核构建与此前使用的固件镜像存在固定地址偏移。MediaTek 采用的页表格式也和参考源码不同。前面的 GPU 写入一直瞄错位置了。从接手到拿到 root,用了 8 小时 5 分钟。GLM-5.3 随后冷重启设备,又在 4 分钟内完成一次 root。GLM5.3做到了!GLM-5.3 使用的月度订阅是 80 美元。3 笔新增支出合计 266.15 美元。Claude Max plan 则是 Pardee 原本就在支付的服务,没有计入这张账单。模型能力之外,还有使用权限作者最后在博客中说,他创建这个博客的初衷是分享他的平板电脑故事,并引发人们讨论他提出的四个问题。APPSO大概总结了作者提出的这四个问题,供大家讨论:1.买下设备,不等于真正拥有设备。 厂商依然能通过系统权限、预装软件和更新机制控制用户已经购买的硬件。2.模型能力和用户能调用到的能力并不是一回事。 美国前沿模型在漏洞利用等安全问题上限制很严,即使是研究自己的设备,也可能被拦下来。 3.不同模型在复杂技术任务上的差距很明显。 在 Pardee 这次实践里,GLM-5.3 最终解决了 Kimi K3 和 GLM-5.2 没能解决的问题。4.AI 能降低专业门槛,但别把模型的答案当成最终答案。模型会卡住,也会判断错。继续验证、换模型和调整方向,本身也是使用 AI 的一部分。故事讲到这里,其实我们可以借此和读者朋友们对比一下闭源模型和开源模型。这次的事件又一次反映了,模型之间的比拼,更有意思的不是仅仅是谁更强了,普通用户到底能用到多少也引起了一系列微妙的竞争。Claude 并不是不会做漏洞研究。相反,它非常会做这类工作。今年展示 Mythos Preview 的时候,Anthropic 已经让模型自己寻找零日漏洞、编写利用代码。它甚至曾在 FreeBSD 上发现一个存在了 17 年的漏洞,从未认证用户一路拿到 root。但这类能力并没有直接交给普通用户。后续的 Mythos 5 一开始只向少量经过审核的合作伙伴开放,Anthropic 还专门建立了 Project Glasswing 来控制这类网络安全能力的使用范围。面向普通用户的则是加入了更多安全限制的 Fable 5。Pardee 遇到的问题大概围绕这个现象:模型会做,但产品不一定允许你继续做。闭源模型交到用户手里时,外面还套着一层产品。安全策略、账号权限和风险判断,这些日常使用中,我们懒得看的东西,都会决定一次请求能不能真正到达模型。不过也不代表说Claude的安全策略就不好, Pardee 研究的是自己的平板,但机主研究设备和攻击他人设备,可能会涉及相似的漏洞利用技术。Claude 在安全和性能之间选择了更安全罢了。Kimi K3 走的是另一条路。Moonshot 已经公开完整模型权重,许可证允许用户运行、部署和修改模型。它有 2.8 万亿总参数、1040 亿激活参数,普通用户自己部署依然不现实,但至少模型的使用方式不再完全由一家平台决定。GLM-5.3 的情况更特别。Pardee 使用它时,权重其实还没有公开。Z.ai 在 8 月 14 日发布 GLM-5.3 时表示,要经过两周的安全评估后才开放权重。所以Pardee 用的是官方在线服务,只是这项服务允许他把漏洞研究继续做下去。它本身的安全能力也不弱。Z.ai 公布的测试中,GLM-5.3 在 CyberGym 上得到 84.5%,Opus 4.8 为 78.1%;ExploitBench 上分别是 54.4% 和 40.0%。所以这次接力里,Claude、Kimi 和 GLM 的区别不只是模型能力。还要看这些能力,有多少真正交到了用户手里。每个人都在带出自己的 Agent看完了 Pardee 这段解锁平板的经历,我突然想到科幻作品《流浪地球 2》里的一个情节:《流浪地球 2》里,中国驻地球联合政府大使周喆直,在所有人都准备放弃的时候,仍然要求点火。故事里被传承下去的,不只是这个决定,而是一种面对不确定和失败时,仍然愿意继续往前走的精神。我用 Agent 越久,越觉得这种「传承」也会发生在人和 Agent 之间。你习惯继续追问,它就会继续往下挖。你习惯验证,它就不会轻易把第一版答案当成结论。你愿意在失败之后再试一次,这也会变成整个工作流的一部分。我们交给 Agent 的,不只是任务,也有我们处理任务的方式——同一个模型交到不同人手里,最后走出来的路径可能完全不同。Pardee 做的其实也是这件事。500 多次失败没有让他的agent停下来,GLM-5.2 的「可能撞上硬件障碍」也没有成为最后答案。他这次能把事情做完,当然有 GLM-5.3 的能力。但如果他在 Kimi 失败 500 多次之后停下,或者接受 GLM-5.2可能是硬件障碍的判断,这个故事也就结束在那里了。相反,他把这些一次又一次失败的经历总结好交给下一个模型。Kimi 留下失败记录,GLM-5.2 留下新的判断,GLM-5.3 再在这些工作的基础上,继续向前推进...到最后,被传下去的已经不只是一个 root 方案。最后希望大家也能像 GLM-5.3 最后留下的那句话一样,在各自的领域实现 ——「You own the device.」我们正在招募伙伴📮 简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)