ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态

机器之心 2026-08-15 10:00
ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图1


当听到「把双手举过头顶,然后向前走」,人可以在脑中补出一整段动作;当看到一段无声的人体轨迹,也能判断人物是在行走、转身还是踉跄。连续运动既可以被语言描述,也可以作为生成、预测和编辑的条件。


今天的多模态大模型已经能够理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。动作从单帧延伸到数秒后,模型还需处理顺序、速度、方向、重心转移与全身协调。


北京大学、东华大学与华南理工大学的研究团队提出 UniMotion,将连续运动纳入统一多模态模型(Unified Multimodal Model,UMM),在同一框架中连接 Motion、Text 与 RGB。论文已被 ECCV 2026 录用。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图2

图 1|UniMotion 在同一框架中覆盖运动理解、生成、预测与编辑等七项任务。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图3



统一多模态建模中的运动模态缺口


人体运动领域,「单帧」Pose 描述某一帧的人体构型,「多帧」Motion 则记录身体结构怎样随时间演化。逐帧姿态看起来合理,不代表连成序列后依然自然:脚掌落地后继续平移会形成脚滑,关节角度跳变会产生抖动,动作阶段顺序错误则会破坏完整语义。


现有 Motion–Text 方法多将轨迹量化为离散 token,便于接入语言模型,却可能损失细粒度变化和时间连续性;视觉大模型的人体建模又主要围绕静态 Pose 展开。UniMotion 则让连续运动以完整模态进入统一理解与生成过程。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图4

表 1|代表性方法的任务覆盖与运动表示。UniMotion 是表中唯一覆盖七项任务的方法。


连续运动接口与跨模态对齐


UniMotion 建立在 Show-o2 1.5B 上。Text、Motion 和 RGB 进入共享 LLM backbone;文本继续使用离散 token 与自回归生成,Motion 和 RGB 则编码为连续 latent,并由各自的 flow head 完成生成。统一发生在语义与推理主干,模态专属接口仍被保留。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图5

图 2|Motion 与 RGB 通过平行连续通路进入共享骨干,Text 保留自回归接口。


运动 latent 经过语义与生成双路径嵌入器:前者概括动作含义与阶段,后者保留局部关节和时间位置;Hybrid Attention 与按模态路由的 LoRA 负责协调连续信号和文本的不同建模需求。


Cross-Modal Aligned Motion VAE(CMA-VAE)把运动编码为连续 latent。训练时,DPA 将带图像语义的后验对齐到只读取运动的 Motion Encoder;推理时视觉融合编码器被移除,纯运动任务无需额外图片。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图6

图 3|CMA-VAE 通过训练期视觉后验对齐连续运动表示,两条编码通路共用 Motion Decoder。


连续表示建立后,新运动通路仍需预校准。LRA 使用 motion latent 作为稠密条件,让 flow head 从噪声重建目标 latent,共同校准嵌入器、主干适配分支和生成头。Motion-to-Motion 只提供预训练信号,简单但清晰地提升下游任务上的能力。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图7

图 4|LRA 以 Motion-to-Motion 自监督任务预校准运动生成通路。


理解、生成与编辑能力


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图8

图 5|文本生成连续动作:左侧为「a person throws something then moves forward」,右侧为「a man jumps and brings both arms above his head as he spread his legs and then moves them back into the original position」。


Text-to-Motion 需要把语言展开为完整时序,Motion-to-Text 则从连续轨迹中概括动作含义和阶段顺序。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图9

图 6|UniMotion 根据连续动作生成英文描述。


Motion Editing 同时接收源运动与文本指令。下图中,源动作「挥手」被改为「喝咖啡」,动作语义发生变化,轨迹仍保持连续。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图10

图 7|源动作在「not waving drink coffee」指令下被编辑为喝咖啡。


Motion Prediction 则根据已观察前缀延续未来轨迹。样例提供 1.05 秒动作,模型继续预测随后 4.35 秒的变化。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图11

图 8|模型根据 1.05 秒动作前缀预测后续 4.35 秒轨迹。


同一接口还支持从图像恢复人体姿态、为图像或视频生成描述,并让参考运动参与人物图像编辑。运动由此可以充当输入、输出和跨模态生成条件。


实验结果


实验覆盖 HumanML3D、MotionFix、Human3.6M、MoVid 等数据集。雷达图显示,UniMotion 是对比方法中唯一覆盖全部任务方向的模型。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图12

图 9|七项任务的跨任务结果概览


论文在 Text-to-Motion、Motion-to-Text、动作预测、动作编辑和视觉人体恢复等任务上分别报告了有竞争力的结果;其中 Text-to-Motion 的分布指标并非全部最优,专用人体恢复模型也仍有更低误差。Text-to-Motion 的完整定量比较见论文表 3。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图13

表 2|HumanML3D 上的 Text-to-Motion 结果。


项目页还给出了同一复杂提示下的定性比较。在「a person stomps up some stairs」案例中,动作需要连续抬腿、转移重心并表现踏步力度;UniMotion 对这些阶段的执行更完整。


ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态图14

图 10|MoMask、MotionGPT 与 UniMotion 在同一英文提示下的生成结果。


UniMotion 展示了统一多模态大模型接入连续、结构化非原生模态的一种方式:共享语义与推理能力,同时保留专属表示和生成接口。这一思路可服务于通用人体行为理解、数字人和内容创作,也为其他连续信号提供设计参照。


作者介绍


王梓懿、王鑫舜,北京大学深圳研究生院在读博士,研究方向为多模态大模型与人类运动;陈爽,东华大学在读本科生,研究方向为世界模型;丛杨,华南理工大学教授,研究领域为机器人自主操作、端侧智能与学习等等;刘梦源,北京大学深圳研究生院博导,研究领域为人类行为理解与机器人技能学习。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
AI成本焦虑下的破局:Writer发布Palmyra X6,以“架构优化”对抗大模型通胀
阿里拟对千问大模型商业化用户收取分成,开源免费时代或迎变局
全行业都在卷大模型,他们却用不确定微分几何给机器人做了个大脑
开源、开放权重、闭源 大模型之争
小白玩转大模型开发(1):从环境搭建到API调用
DeepSeek V4 Flash 之后,大模型开始卷「智效比」了
李开复直言:中国开源大模型正引发美国业界深层焦虑
某大厂大模型一号位想赴美创业,被挽留开发秘密AI项目;某巨头心虚,万亿参数模型延期至明年;智驾大佬创业,要求VC连投三轮丨AI情报局
AI浪潮下的就业悖论:科技巨头一边豪赌大模型,一边挥刀裁员
小白玩转大模型开发(2):从 API Key 到第一次模型调用
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号