3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26

量子位 2026-08-13 15:37
ReLER 团队 投稿 
量子位 | 公众号 QbitAI

图像编辑常有这种需求:一排物体摆在桌上,需要把最后方的物体移动到最前方。

这对人类来说是自然的视觉透视,但对AI而言,却是一连串复杂的几何难题。

物体靠近后尺寸要放大,遮挡关系需要重新计算,原位置不能留残影,外观和纹理还得保持原样——任何一个环节出错,画面就会立刻穿帮。

每一步都关乎三维空间的物理常识,而这恰恰是当前图像编辑模型最容易翻车的地方——语义指令它听懂了,但生成出来的三维状态,却常常错得离谱。

针对这一问题,浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导DiT图像编辑,让模型更准确地处理物体远近、尺度、遮挡和多物体操作。论文已被ACM MM 2026接收。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图1
3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图2
PhyEdit与Nano Banana Pro对比

一句话概括:让几何模块负责“搬”,让生成模型负责“画”

PhyEdit的核心流程可以拆成四步:

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图3
PhyEdit方法总览

preview并不需要看起来像一张完整照片。它只要清楚表达“物体应该在哪里、应该多大、应该挡住谁”,生成模型就可以从源图中恢复纹理和身份,把粗糙几何修成自然结果。

因此,PhyEdit避开了两个极端:既不是让大模型完全靠prompt猜三维空间,也不是把点云投影直接当成最终图像。

再补一层深度监督

模型生成的画面“看着像”并不代表目标深度正确。PhyEdit在基础flow-matching loss之外,加入像素级SILog depth loss:先从预测velocity恢复编辑图,再比较编辑图和目标图的深度。

消融结果很直接:不使用深度监督:DIoU 62.37、Chamfer 24.52;latent-to-depth:DIoU 64.19、Chamfer 20.87;pixel-level方案:DIoU 65.33、Chamfer 18.93。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图4
深度监督结果

训练数据从哪里来?RealManip-40K

团队构建了RealManip-40K,包含41154对真实场景图像,提供深度、物体mask和代表性三维坐标。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图5
RealManip-40K数据样例

为了保证图像对中的变化主要来自物体而非相机,数据管线利用3D foundation model的camera token进行聚类,筛选相机近似静止的视频片段。之后再完成目标检测、跟踪、分割、深度估计和三维位移筛选。

RealManip-40K重点覆盖三类难题:明显的远近变化、复杂遮挡,以及多个对象同时操作。

专门造了个3D编辑考场:ManipEval

现有图像编辑benchmark经常只看画质、文本一致性或二维位置。PhyEdit团队进一步构建ManipEval:共200对图像、约320个物体,其中一半为单物体操作,另一半为多物体操作。

它从五个层面考察模型:

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图6
ManipEval定量结果

PhyEdit的主要成绩为:DIoU 65.33、Mask IoU 27.20、Chamfer 18.93、RA-DINO 36.91、Phys-VLM 93.72。

与Nano Banana Pro对比,DIoU提升5.36,Chamfer距离降低6.40,RA-DINO提升2.14。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图7
ManipEval定性结果

从结果图看,商业模型常见的问题包括:物体仍留在源位置、只操作了多物体指令中的一部分、把目标放到错误深度,或在遮挡区域改变物体身份。PhyEdit在大幅移动、小尺寸物体以及多人操作等场景中更稳定。

还能把一次编辑变成连续动作

给出一条三维轨迹后,PhyEdit会在轨迹上的多个位置生成关键状态,再由视频模型插值出中间帧。

下面这只机械臂没有出现在训练分布中,仍能沿曲线把红笔移动到纸张左下方。实线边框是PhyEdit直接生成的关键帧,虚线边框是插值帧。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图8
连续物体初始状态
3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图9
连续物体操作

只会搬东西?普通编辑能力也保住了

研究者还测试了改变颜色、材质、图案和添加局部元素等任务。PhyEdit需要一次生成同时完成外观编辑与三维操作,综合成功率为87.5%;Qwen-Image-Edit单独完成普通编辑时为88.8%

两者只差1.3个百分点,但PhyEdit的三维精度明显更高,说明加入几何控制没有让基础编辑能力大幅退化。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图10
3D操作与附加编辑

GUI也一起开源

PhyEdit提供交互式前端。上传图片后,用户可以轻松分割并选择多个物体,在三维点云中调整平移和旋转,再生成最终图片。

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26图11
PhyEditGUI

不是物理引擎,但向“可交互世界模型”迈了一步

团队对PhyEdit的定位比较克制:它不是完整physics simulator,不会显式计算受力、碰撞和动力学。透明反光物体、极端近景移动以及严重的深度或分割错误仍可能导致失败。

PhyEdit解决的是更具体的问题:当动作已经由用户指定时,如何把一个明确的三维操作渲染成几何合理的视觉状态。这种“显式几何+生成渲染”的组合,为机器人视觉规划、交互式内容和图像状态预测提供了一个可复现的开源起点。

论文链接:https://arxiv.org/abs/2604.07230
项目主页:https://nenhang.github.io/PhyEdit
代码:https://github.com/nenhang/PhyEdit
模型:https://huggingface.co/ruihangxu/PhyEdit
数据集:https://huggingface.co/datasets/ruihangxu/RealManip-40K

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 开源
more
阿里拟对千问大模型商业化用户收取分成,开源免费时代或迎变局
白宫拟扩围AI监管,开源模型或纳入安全测试框架
重磅开源GeoStereo:双目几何大一统,视差+表面法线+点云重建三位一体,破解反光、透明、弱纹理场景,实现高精度3D几何恢复!
浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚
GitHub开源工具引爆CMP 170HX矿卡行情,显存解锁至80GB引发价格狂飙
GLM-5.2能力逼近GPT-5.5却“零拒绝”恶意指令,开源模型的安全悖论再引激辩
Meta重返开源!30B本地Agent塞进24GB显存,LeCun火速力挺
实时视频版「Nano Banana」来了!160亿参数重磅开源
京东开源JoyAI-Video-Edit:视频“边播边改”成现实,流式编辑性能全球领跑
刚刚,蚂蚁站在Kimi肩膀上开源了一款新模型
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号