点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
来源:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
太长不看版:Meshy T2 用流匹配并行生成顶点、边连接和面绕序,端到端图生网格不到 10 秒;用户在解码前指定顶点槽数量,就能直接控制预期面数,无需事后减面。
论文信息
论文标题:Meshy T2: Fast Native Mesh Generation with Flow Matching
作者:Jiale Xu, Rendong Liang, Yuhao Long, Siyuan Shen, Zangyueyang Xian, Zeyi Xu, Yuanming Hu
机构:Meshy AI
论文链接:https://arxiv.org/abs/2607.28675
代码链接:https://github.com/meshy-dev/meshy-t2
导读
多边形网格是现代三维流水线的标准表面表示;对电影、游戏和交互式三维应用而言,生成具有艺术家风格拓扑的高质量网格至关重要。主流方法把网格序列化成词元序列,再用自回归方式解码;这不仅推理慢,还容易累积误差,因此不适合交互式资产创作。
作者提出 Meshy T2,一个基于流匹配的快速原生网格生成框架。其核心是顶点集合网格 VAE:它把网格编码为每个顶点一个连续潜在词元,并在一次前向中解码顶点、边连接和面的绕序;无需顶点量化或焊接,就能保留高精度几何与艺术家创作的拓扑。
生成采用从粗到细的两级流匹配级联:图像条件体素流先把整体形状勾勒成粗占用支架,网格流再以图像、支架和用户要求的顶点预算为条件,用逐顶点潜在词元填充支架。
这套设计带来三项实用能力。第一,生成在潜在顶点词元上并行进行,端到端图生网格可在 10 秒内完成。第二,用户在解码前设定顶点预算,就能直接控制生成网格的复杂度,而不需要事后简化。第三,网格 VAE 近乎无损:顶点坐标保持连续,重合顶点不会被错误焊接,艺术家创作的连接关系可以被精确保留。
因此,生成网格不仅能保留高精度几何细节与艺术家风格拓扑,还会自然分解为多个连通分量;多部件资产无需单独逐部件生成,也无需额外拼接。实验中,Meshy T2 达到最先进几何保真度,端到端图像到网格生成中位时间为 6 秒,比自回归基线快一个数量级以上。

效果展示

引言
多边形网格支撑着几乎所有实时三维应用:游戏引擎、AR/VR 系统、机器人模拟器与数字内容流水线,都依赖顶点、边和面来完成渲染、碰撞、编辑、存储和传输。然而,并非所有网格都同样适合这些应用。可投入生产的资产必须在尽量少用几何基元的同时准确表达目标形状,并保留锐利边缘、细薄结构和具有语义意义的部件边界。冗余面会增加带宽、内存占用、光栅化成本与编辑工作量;过度简化又会牺牲几何保真度。如今,这类高质量网格仍主要依赖人工制作,由熟练美术逐个基元建模或重拓扑,过程缓慢且昂贵,跟不上三维内容需求的增长。因此,自动生成紧凑、有效且可直接使用的网格,是规模化三维内容创作的核心挑战。
近期多数高质量三维生成系统并不直接生成这类网格。它们先学习隐式或体积式几何表示,再通过后处理提取显式表面。3DShape2VecSet、TRELLIS 和 LATTICE 等代表性方法把几何建模为由向量集合或稀疏体素潜变量解码的神经场,再通过等值面提取得到网格,通常使用 Marching Cubes 及其变体。这种设计很有吸引力,因为隐式场连续,而且容易以图像或三维监督优化。但提取出的网格远非开箱即用:等值面提取按网格分辨率而不是几何结构进行剖分,所得网格通常包含数十万近乎均匀的三角形,对渲染、编辑和动画流水线都过于稠密。简化算法可以减少面数,但作为纯几何后处理,它们会产生不规则三角剖分,难以尊重锐利特征和部件结构,仍远未达到生产资产所需的干净、艺术家风格拓扑。
因此,另一类工作转向直接生成网格,把网格生成视为序列建模问题。MeshGPT 开创了这一范式:它把面序列化为离散坐标序列,再以自回归 Transformer 建模,直接生成紧凑、类似艺术家创作的拓扑;相比等值面提取,它能更好保留锐利特征。由于词元流极长,后续研究主要集中在压缩序列化:EdgeRunner、TreeMeshGPT 与 Mesh-Silksong设计拓扑感知遍历来最大化边复用,BPT 和 DeepMesh则通过分块索引压缩坐标;另有工作通过形状条件和更大架构扩展这一范式。但更好的压缩并未解决更深层的不匹配:网格本来是无序整体,顶点和面通过邻接关系耦合,却没有规范的一维顺序,把它铺平为一维词元序列从根本上并不自然。结果是,推理仍然天然串行,计算量会随面预算增长;网格有效性也只是长采样序列中涌现出的性质,一个局部采样错误就可能传播成表面不完整、面绕序不一致或相邻区域开裂。
扩散和流方法正是对这种不匹配的自然回应:它们并行生成所有几何基元,而不强加遍历顺序,因此更符合网格的无序结构,让推理成本与网格规模解耦,并避免串行误差累积。现有方法主要区别在于去噪所用的网格潜在表示。MeshCraft和 MeshFlow使用面级词元,会在相邻面之间重复共享顶点,并让跨面一致性自行从采样中涌现。TriFlow、LATO和 LATO.2把网格编码到稀疏体素潜变量中,解码时再从体积特征重新推导网格基元。MeshFlow 与 Nexus 采用逐顶点词元,这是最接近网格本身的粒度,但 Nexus 仍在彼此分离的阶段生成几何和拓扑。尽管如此,仍有两个空白。第一,网格表示很少为精确重建而设计:顶点量化和启发式面重建——例如把预测边图中的三节点团恢复为三角形——会引入伪影,原始网格的细节与拓扑无法通过潜在空间得到忠实保留,解码资产通常还需后处理来修复无效连接、重叠面或非流形边。第二,这些方法大多以从已有表面采样的点云为条件,本质上是在做重拓扑;而图像到网格生成在推理时没有稠密几何,其额外挑战尚未被系统研究。
作者提出 Meshy T2,一个同时填补这两个空白的流式框架:它在 SpaceMesh 基础上构建精心设计、近乎无损的顶点集合网格表示,并直接面向图像到网格生成,以交互式速度产生紧凑且可直接使用的网格。给定参考图像,方法先预测捕获物体全局布局的粗体素支架,再同时以图像和支架为条件,联合生成顶点、边连接和面的绕序。该设计带来三项实用能力。第一,生成在潜在顶点词元上并行执行,端到端图像到网格生成可在 10 秒内完成。第二,用户可在解码前设定顶点预算,直接控制生成网格复杂度,而不依赖事后简化。最后,网格 VAE 近乎无损:顶点位置保持连续,重合顶点绝不会被焊接,艺术家设计的连接关系被精确保留。因此,生成网格能保留高精度几何细节和忠实的艺术家风格拓扑,并自然分解为连通分量;多部件资产可直接生成,不需要单独逐部件生成或拼接。
本报告贡献如下:
作者在 SpaceMesh 上扩展出近乎无损的顶点集合网格 VAE:坐标从不量化,重合顶点从不焊接,顶点、边连接与面绕序在一次解码中联合恢复,从而忠实保留源网格的几何、艺术家拓扑和部件结构。 作者构建用于直接图像到网格生成的两阶段流匹配流水线:图像条件体素流先勾勒粗占用支架,网格流再以最优传输分配的位置编码,用逐顶点潜在词元填充该支架,端到端生成可在 10 秒内完成。 作者通过在解码前采样指定数量的顶点槽,实现强面数控制;该数量直接决定预期面预算,无需事后简化。 实验表明,Meshy T2 在重拓扑和图像到网格任务上都取得最先进的几何保真度,同时比自回归基线快一个数量级以上。
主要贡献
作者在 SpaceMesh 上扩展出近乎无损的顶点集合网格 VAE:坐标从不量化,重合顶点从不焊接,顶点、边连接与面绕序在一次解码中联合恢复,从而忠实保留源网格的几何、艺术家拓扑和部件结构。 作者构建用于直接图像到网格生成的两阶段流匹配流水线:图像条件体素流先勾勒粗占用支架,网格流再以最优传输分配的位置编码,用逐顶点潜在词元填充该支架,端到端生成可在 10 秒内完成。 作者通过在解码前采样指定数量的顶点槽,实现强面数控制;该数量直接决定预期面预算,无需事后简化。 实验表明,Meshy T2 在重拓扑和图像到网格任务上都取得最先进的几何保真度,同时比自回归基线快一个数量级以上。
方法
Meshy-T2 把“长什么样”和“网格怎么连”拆成先后两道题:粗体素先锁定全局体量,顶点—边—半边表示再恢复真正拓扑。这个顺序很关键——如果一开始就逐面生成,长序列会拖慢复杂模型;如果只生成隐式表面,又难以精确控制最终面数。两阶段恰好把全局稳定性、拓扑质量和预算控制接了起来。
第一部分是顶点集合网格 VAE。编码器为每个真实顶点构造一个潜在词元,把表面采样得到的体素上下文、顶点查询与真实网格边上的图注意力结合起来;解码器在一次前向中重建连续顶点坐标、无向边和局部半边排列,再根据预测边与半边后继映射组装最终网格。该表示不量化坐标、不焊接重合顶点,并直接编码训练网格中的连接。

第一生成阶段以图像为条件预测粗体素占用支架。64³ 占用网格由体素 VAE 压缩为 16³、8 通道的空间潜变量;冻结 VAE 后,流匹配 Transformer 在 DINOv3 图像条件下生成 4096 个空间词元,再解码并阈值化为二值占用。


第二阶段联合以图像和体素支架为条件生成网格潜在集合。单流 DiT 同时处理潜变量、图像、体素、时间步和数量条件;由于顶点词元无序,方法从 Sobol 序列取得空间位置候选,再通过最优传输把位置编码分配给潜在词元。用户指定的顶点槽数量作为条件控制几何基元预算,利用三角网格欧拉关系 F≈2V 使预期面数可预测。

实验结果
实验同时评估高模重拓扑与单图图生网格。重拓扑中,真实几何为 Meshy 6 高分辨率网格减面到 10 万三角形,Meshy T2 与 MeshFlow 输出约 4,000 面的艺术家网格;图生网格中使用固定正面相机渲染与输入照片计算 Fréchet Distance。运行时间为成功样本的端到端中位数,成功率要求 20 分钟内无 CUDA 错误完成且至少包含一个三角形。
位置编码消融表明,完整 Sobol OT 在 Chamfer、Hausdorff 和非流形边比例上都优于索引位置编码与 Morton 顺序配对。总体实验显示,Meshy T2 在重拓扑和图生网格两项任务上都达到最先进几何保真度,而且端到端生成小于 10 秒,相比自回归路线快一个数量级以上。联合生成连接还使多部件资产天然分解为连通分量,无需额外拆分、逐件生成或拼接。


总结 & 未来工作
作者提出 Meshy T2,一个面向紧凑网格资产的快速网格生成框架。Meshy T2 的重点不只是“直接生成网格”,更在于联合建模顶点与连接所带来的实用能力。系统能在 10 秒内生成网格;通过解码前采样指定数量的顶点槽,提供强面数控制;并利用三角网格欧拉关系 F≈2V,让最终面预算具备可预测性。
由于系统直接编码训练网格中观察到的连接,生成的顶点—边图会自然分解成连通分量。因此,模型无需额外逐部件生成、拆分或拼接阶段,就能产生多组件资产。未来工作将进一步改善高度不规则源网格上的拓扑稳健性,把框架扩展到更丰富的材质与部件级控制,并研究在共享全局预算下生成多个紧凑网格的场景级生成。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。