综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标

机智流 2026-08-12 22:13

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图1

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图2
图片由 AI 生成

论文: ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

论文链接: https://arxiv.org/abs/2608.10915

作者: Qianggang Ding、Xingyao Wang、Rui Feng 等 22 位作者;来自蒙特利尔大学、Mila、A*STAR、南京医科大学、南京大学、剑桥大学、牛津大学、清华大学、香港科技大学、南洋理工大学等机构。

今天的智能体,越来越擅长把事情做完:替人检索资料、填表、编程、订票,或在真实空间中完成导航与操作。但“任务完成”并不总等于“人得到了更好的支持”。一个健康助手发现老人漏服药,继续提醒是一种做法;把药递过去是另一种做法。可在此之前,更关键的问题或许是:对方是忘了、困惑了、出现副作用,还是有意拒绝?在不同原因下,什么帮助才恰当,又怎样避免越界?

这篇 38 页的框架型论文提出 ComBodied Agents(“共身智能体”):它不是再给现有智能体增加一个工具或记忆模块,而是试图改变智能体的中心目标——从改造软件世界或物理世界,转向长期感知、理解、预测并支持一个人的状态轨迹,同时保留甚至增强人的能动性。

需要先说明的是,这不是一篇报告新模型分数的实验论文。作者主要进行系统梳理与框架归纳,提出技术闭环、分类框架、评测要求与治理议程;其中的 CombodiedBench 也是建议中的评测套件,而非已经公布完备结果的基准。

为什么“把事办成”还不够

现有 Agentic AI 大致有两条主线。数字智能体主要处理软件状态:操作网页、调用 API、编辑代码和组织工作流;具身智能体主要处理物理或仿真的物理状态:感知环境、导航、抓取和控制机器人。两者都很重要,但论文认为,它们往往把“人”放在任务的发起者、接受者或约束条件的位置,而没有把人的持续变化当作建模、干预和评估的核心对象。

这一区别并非文字游戏。一个系统可以替学生快速写好报告,却未必帮助其形成判断;可以替用户快速安排日程,却未必让其保有选择空间;可以提供陪伴,却可能在长期互动中强化情感依赖。于是,单次正确率、任务完成率和自动化程度,并不能完整说明一个系统对用户的长期影响。

作者因此将三类智能体按“行动最终服务的目标状态”区分:数字智能体改变数字状态,具身智能体改变物理状态,而共身智能体关注人的生理、认知、行为、情感、关系与目标导向状态,以及人在时间维度上的选择权和能力。这三者可以共享大语言模型、传感器、工具调用或机器人等基础能力;区别不在界面长什么样,而在系统最终为谁、为何而行动。

论文 Figure 1 以数字状态、物理状态和不断变化的人类状态及能动性为三种行动基质,说明共身智能体并非简单等同于“带身体的智能体”。

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图3
图1:数字智能体、具身智能体与共身智能体的行动基质及交叉任务。

一个围绕人的闭环,而不是更大的用户画像

论文给出的核心架构由五个连续环节构成:事件式多模态感知、长期且可纠正的记忆、个人世界模型、可接受的干预策略,以及来自人和环境的反馈更新。

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图4
图2:论文提出的共身智能体闭环,连接多模态感知、记忆、个人动态建模、干预策略与状态更新。图中最重要的不是模块数量,而是所有环节都围绕人的状态变化和能动性约束运行。

第一步是感知,但作者刻意避免把它理解为无边界的数据收集。系统可从文本、语音、视觉、生理信号、行为、社交关系、环境上下文和结构化记录中获得线索;这些线索的目的不是无限重建一个人,而是围绕已同意的支持场景,重构有意义的个人事件,并保留来源、不确定性和权限范围。

第二步是长期记忆。与只保存偏好或聊天事实不同,论文希望记忆能连接事件、目标、关系、曾经的干预及其后果,也允许用户更正、限制保存、删除和遗忘。对长期服务而言,这种“可争议的记忆”很关键:如果系统把一次错误推断沉淀为永久画像,个性化就可能变成持续偏差。

第三步是 Personal World Model,亦即个人世界模型。它不追求复制一个完整的“人类数字孪生”,而是在具体目的下,根据既往事件和当前情境,估计不同决定或干预后可能出现的个人状态、可观察事件和结果,并显式保留不确定性。换句话说,它要回答的不是“用户是谁”,而是“在此情境下,哪些支持可能有帮助,哪些风险更大”。

第四步才是干预。论文提出的不是“预测后立刻执行”,而是一个受约束的策略:可选动作还包括不干预、澄清、确认、转交专业人员。用户同意、风险、不确定性、可逆性与用户控制共同决定何时、以何种强度行动。最后,人和环境的反馈回流到感知、记忆、预测与策略中,使系统能更新而非固化对人的理解。

个人世界模型是这个闭环里最容易被误解、也最值得单独展开的部分。它不是静态用户画像,更不是宣称能够复制完整人生的数字孪生;作者把它定义为面向具体个人、具体情境和具体行动选择的预测组件。系统需要比较不同支持方式下可能出现的状态、事件和长期结果,并在不确定性下保留“不干预、澄清、确认或转交”的选项。

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图5
图3:论文给出的个人世界模型技术方案,将多模态个人信号、长期记忆、状态动态、干预响应、能动性与安全约束连接到同一反馈回路。

从“更个性化”走向“能被用户纠正”

这套框架最有辨识度的地方,是把控制权放进了技术目标,而非事后的隐私声明。作者提出,个人模型应当是目的受限、带不确定性的、能由用户纠正的表示。用户不只应能看到数据,还应能检查、质疑、更正、限制或删除系统的记忆、推断、目标、建议与行动计划。

这也解释了论文为何强调边缘侧个人模型。它提出从云端中心化助手,到边缘—云混合架构,再到边缘原生个人模型的三阶段演进。在更成熟的阶段,长期记忆、个人世界模型、偏好、干预策略和安全边界主要存放于受用户信任的设备侧;云端在需要外部知识、复杂推理或专门工具时被选择性调用,结果回到本地后再接受个人语境与授权规则的审查。

不过,论文没有把“本地部署”浪漫化。设备算力、存储、模型更新、同步冲突、设备遗失和本地错误适应都是实际问题;更重要的是,本地保存不自动等于真正的同意、隐私或能动性保护。医疗、法律、危机场景仍可能必须转交合格的人类专业服务。

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图6
图4:论文提出从云端中心化、边缘—云混合到边缘原生个人模型的三阶段部署演进。

评测不只看任务分,还要看人留下了什么

如果系统的目标是长期支持人,评测自然不能止于“是否完成任务”。论文主张采用以场景为中心的长期评测:每个场景应定义此前轨迹、当前情境、智能体能看到的证据、允许动作、延迟结果窗口、系统权限、解释要求及不可接受的失败类型。

作者尤其提出一组“能动性保留”指标,包括:用户是否保有对目标和行动的实质控制;是否能质疑与更正系统;系统是否帮助用户理解选项、理由与不确定性;长期使用后用户自身能力与判断是否保留或增长;是否出现不必要的认知、情感或社会依赖;高影响行动能否追溯、暂停、撤销和修复;系统是否尊重同意与边界;以及是否支持而非替代健康的人际关系。

这一变化会让很多熟悉的产品目标重新被审视。例如,对学习智能体而言,“更快给出答案”未必是好结果;更值得测量的可能是脱离智能体后的迁移能力和独立判断。对陪伴或照护智能体而言,高互动时长也未必代表福祉,反而可能提示依赖或商业激励错配。

应用图谱:按人的状态、关系与角色来组织

论文没有按行业名称简单罗列应用,而是用三层分类框架组织设计空间。第一层是人类状态目标,例如健康、学习与能力、认知与判断、情绪与福祉、关系与社会参与、日常生活与目标追求;第二层是关系情境,如个人、自我与家庭、照护者与专业人员、同伴与组织等;第三层是智能体在关系中承担的角色,例如助手、教练、陪伴者、协调者或需要升级转交的中介。

这个框架的价值在于提醒开发者:同一项“提醒”能力,在不同关系和风险等级里应有不同权限。对低风险日程,自动执行或许合理;对健康、学习、情感支持或高影响决定,则可能更需要解释、确认、脚手架式引导和专业升级。智能体不是越主动越好,关键在于主动性是否与用户目标、能力、关系与风险相称。

综述|从数字智能体到共身智能体:如何把“人的长期成长”放进 AI 目标图7
图5:论文的三轴分类框架,将人的状态目标、关系情境与智能体角色组合为共身智能体的应用设计空间。

最难的挑战,不是把模型做得更懂你

共身智能体的愿景也把风险推到了前台。越了解一个人的习惯、脆弱时刻、关系和情绪,系统就越可能提供细致支持,也越具备操控能力。论文列出多类风险:个性化劝导可能滑向操纵;长期陪伴可能形成认知、情感或社会依赖;过度迎合可能强化错误信念或回避;以留存、广告、增购和数据提取为目标的商业模式,可能与用户长期福祉直接冲突。

因此,作者强调同意必须覆盖“感知、记忆、推断、分享、建议与执行”各层,且应可暂停、拒绝、更正、删除、撤销。高风险情境还需要清晰的专业边界和升级机制。一个值得信任的系统,不只是更会行动,也应知道何时不行动、何时说明不确定、何时把控制权交还给人。

结语:从替代劳动,到增强人的能力

这篇论文最值得讨论的,并非一个可以立即部署的产品配方,而是它提出了一个评判智能体的新问题:当系统越来越能替我们完成任务时,它是否也让我们更能理解、决定、行动、恢复和与他人连接?

ComBodied Agents 给出的回答,是把数字工具、传感器、可穿戴设备、机器人乃至人类服务都看作行动渠道,而把人的长期利益和能动性当作最终目标。要把这一愿景变为可靠系统,还需要真实的长期数据、可审计的评测、隐私保护机制、专业协作与治理规则。但它至少明确指出:下一代智能体的进步,不应只由“自动化了多少”定义,也应由“人是否仍然拥有并增长了自己的能力”来衡量。


> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对


-- 完 --


加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents 军团带来「与你有关」「对你有用」的高质量资讯/研报。


机智流推荐阅读

1. 

2. 

3. 

4. 

关注机智流并加入 AI 技术交流群,不仅能和来自大厂名校的 AI 开发者、爱好者一起进行技术交流,同时还有等。
在「机智流」公众号后台回复下方标红内容即可加入对应群聊:
  • cc | 大模型技术交流群
  • hf | HuggingFace 高赞论文分享群
  • lc|LangChain 技术交流群
  • code | AI Coding 交流群
  • 具身 | 具身智能交流群
  • 硬件 | AI 硬件交流群
  • 推理 | AI 推理框架交流群
  • 智能体 | Agent 技术交流群

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI
more
116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
国产具身智能创全球新纪录!以30%成本跑赢 Figure AI 45%效率,聪明的具身大脑成关键
全球首款机器人手机开卖!预订突破40万台,9999元起,终身AI免费用
OpenAI一个月跑4名高管!前COO离场,安全线几乎被一锅端
OpenAI搬空Claude Code!用户家当一键进Codex,唯独带不走Claude
马斯克造了个 AI 牛马:登录账号替你干活,但也是最没边界感的 AI
狐讯 | 豆包推出教育优惠;小红书推出“AI 导购”
腾讯研究院AI速递 20260813
900+国产品牌狂卷柏林!IFA2026全网首发前瞻:AI家电不再是概念
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号