
图生视频已经越来越会“动”了,但怎样让画面中的某个物体按用户指定的位置移动?英特尔AI解决方案工程与创新部门的项目Search2Motion,探索一种无需重新训练模型的物体级运动控制方法。
最近你用图生视频了吗?上传一张图片、输入一句提示词,AI可以生成一段效果不错的视频。人物会走动,汽车会驶过街道,天空中的飞鸟也能展开翅膀。让静态画面“动起来”,已经不再是难事。
但如果把要求说得更具体一些,挑战就出现了:不是简单地让画面动起来,而是希望图中的某个物体移动到指定位置,同时尽量保持背景稳定。比如,让小狗跑到树下,让汽车开到指定车位,或者让直升机飞到天空中的某个区域。
这时,AI需要理解用户想移动的是哪个物体、它应该出现在什么位置,以及从第一帧到最后一帧之间该如何自然过渡。这正是英特尔AI解决方案工程与创新部门的Search2Motion项目关注的问题。
简单来说,Search2Motion希望在无需重新训练模型的情况下,把用户对“物体应该移动到哪里”的直观指令,转化为图像转视频模型可以理解和利用的首尾帧约束。

从“画路径”到“定位置”
Search2Motion是一种面向图像转视频生成的物体级运动编辑框架。与一些需要用户提供运动轨迹、边界框或掩码的方法不同,它采用“目标帧控制”的思路:用户从一张图片出发,指定目标物体希望移动到的位置,系统就会构建一张“目标尾帧”,再让预训练的视频生成模型补全中间运动。
换句话说,它不是让用户逐帧“画路径”,而是先确定“最后应该到哪里”。这样既降低了交互门槛,也避免为了这类控制任务重新训练视频生成模型。

三步完成物体运动控制
第一步,找到合理位置。系统会理解画面语义,并为用户提供适合放置目标物体的可交互区域。例如,直升机更适合出现在天空,棕熊更适合走在山路上。

第二步,生成目标尾帧。用户把物体放到目标位置后,系统会完成物体分割、背景修补和重新插入,生成一张与原图场景尽量一致、但目标物体已经移动到新位置的最后一帧。

第三步,补全运动过程。系统将原图作为第一帧、目标尾帧作为最后一帧,交给预训练的首尾帧视频生成模型,由模型推断中间的自然运动过程。


提前挑出更靠谱的“种子”
同样的输入,生成式AI也可能因为随机种子不同而得到不同结果:有的更自然,有的则可能出现物体变形、运动不稳定或没有准确到达目标位置的问题。
为此,Search2Motion提出了ACE-Seed,即一种基于早期注意力共识的种子筛选方法。研究人员发现,在视频生成的早期阶段,模型的自注意力图已经能反映物体和相机运动的趋势,因此可以提前判断哪些种子更可能生成稳定、合理的结果。
可以把它理解成一次轻量级的“预选”:系统不用等所有候选视频都生成完再比较,而是在早期就筛掉不太可靠的种子,从而在不依赖完整候选视频预览或外部评估模型的情况下,提升运动保真度。

如何判断“动得准不准”?
要判断一个模型是否真的把物体“按用户意图移动到了合适位置”,评估方式也很重要。Search2Motion研究团队还设计了面向稳定相机、仅物体运动场景的测试集和指标,尽量把评估焦点从相机运动、背景变化中剥离出来,并避免依赖真实运动轨迹标注,从而更清楚地观察模型的物体级运动控制能力。


从“动起来”到“按意图动起来”
随着AI视频生成在真实感与连贯性上不断进步,一个重要方向,是让生成结果更准确地响应用户意图。Search2Motion尝试用无需重新训练的方式,让用户更直观地控制图像中某个物体移动到哪里。
这类研究也体现了英特尔在多模态AI、生成式AI和高效推理方法上的持续探索:不仅关注模型能否生成高质量内容,也关注AI能否更好理解并执行用户的创作意图。对普通用户来说,这类探索意味着,未来AI视频工具或许不仅能把照片变成视频,还能更接近我们心中“想让画面怎么动”的那一步。
如您想了解完整研究,欢迎访问:https://arxiv.org/abs/2603.16711。
©英特尔公司,英特尔、英特尔logo及其它英特尔标识,是英特尔公司或其分支机构的商标。文中涉及的其它名称及品牌属于各自所有者资产。
相关资讯
/转载请注明出处/
