点击下方卡片,关注【Xbotics具身智能实验室】
你想要的这里都有~~
供稿 / 忆生科技
编辑 / 卡布
论文题目:Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision
作者:齐大成、王晨宇、马毅、高盛华等人
机构:香港大学 、忆生科技、深圳河套研究院、莫纳什大学、加州大学伯克利分校
arXiv:2606.29301
GitHub:Snitro/Pointer-CAD-v2
对机器人工程师来说,一个“看起来像杯子”的mesh还不够,一个“杯口直径80mm、壁厚2mm”的CAD更有价值。
过去两年,文本生成3D模型的热潮席卷而来,但绝大多数产物停留在“视觉相似”层面——没有真实尺度、没有参数结构,导入物理引擎后,碰撞体要重做、质量属性要手填、尺寸要人工核对。
而香港大学联合忆生科技提出的Pointer-CAD v2,把CAD生成直接推进到参数级精度:15亿参数的模型,在顶点、边、面三级几何精度上全面超越GPT-5.2、Gemini 3 Pro等顶尖通用大模型,平均领先超过21%。该工作已入选ECCV 2026,代码即将开源。
一篇CAD论文,为什么值得机器人圈认真读一遍?我们先从这个问题说起。
一、机器人圈为什么该关注一篇CAD论文
先说清楚:Pointer-CAD v2是一项CAD生成研究,论文本身并未涉及机器人实验。但从机器人系统工程的角度看,这项工作踩中的正是当前具身智能流水线里一块绕不开的短板——精确几何资产的供给。
仿真训练:无论是操作策略学习还是强化学习,都依赖海量3D资产。视觉上逼真的生成mesh无法保证度量尺度,而在物理仿真中,尺度错了,一切基于尺度的动力学——重力、惯量、接触——全都跟着错; 数字孪生与抓取规划:碰撞检测、抓取位姿计算、装配验证,吃的是毫米级几何。0.3cm的偏差在渲染里无人在意,在夹爪闭合的瞬间就是导致夹空或发生的差别; 结构化的世界表示:当社区讨论世界模型时,一个绕不开的问题是:模型内部用什么表示物理世界?纯像素、纯mesh,还是带参数、可编辑、带语义的结构化表示?CAD恰恰是后者——它被称作“物理世界的源代码”并非夸张。
换句话说,AI如果能可靠地生成尺寸正确的参数化CAD,机器人仿真资产的生产方式可能被改写。而Pointer-CAD v2正是朝这个方向迈出的扎实一步。
二、CAD生成的“最后一毫米”难题
CAD是现代工业制造的基础环节,仿真与加工流程对精度的要求近乎零公差。近年来基于大语言模型的CAD生成取得了可观进展,但一个关键矛盾始终悬而未决:现有方法和评测协议只强调视觉相似度,却忽视了精确的几何参数与正确的度量尺度。
论文中给出了一个直观的例子:用户要求生成长方体(1cm×1cm底面、高0.7cm)上叠放一个边长0.3cm的正方体。当前主流的命令序列方法为了简化自回归预测,需要把连续的数值参数量化到有限的离散数值集合中;论文以2-bit量化为例做说明(量化粒度可按需选择,2-bit仅为本例的示意设定):数值只剩0.33、0.67等选项,0.7cm的真实高度只能被“量化”成0.67。形状上看几乎一样,但在工业与仿真语境下,这种偏差足以让零件报废、让仿真失真。
更棘手的是,现有评测指标还会进一步掩盖这一问题。Chamfer Distance(CD)和IoU等形状级指标在归一化后计算,对毫米级数值偏差并不敏感——两个尺寸存在细微差异的模型,IoU可能都高达0.96。方法在“将就”,指标也在“将就”,CAD生成距离真正的工业可用始终差着最后一毫米。

三、两条路线,各有各的坎
当前LLM驱动的CAD生成大致分为两条路线:
命令序列表示:用专门的token词表描述参数化操作(sketch-extrude对、倒角、圆角等),token效率高,但参数与操作共享同一tokenized空间,连续几何量必须量化进有限词表,参数保真度先天受损; 代码表示:在CadQuery、FreeCAD等脚本环境中生成可执行代码,天然支持高精度参数,但生成单个模型的token开销约为命令序列的4倍,训练与推理效率大打折扣。
该团队此前的Pointer-CAD(v1,CVPR 2026)通过指针机制支持对中间B-rep几何实体的显式引用,扩展了命令序列的表示能力,但精确的尺寸控制仍未解决——在其他不受约束的几何配置中,小的数值偏差依然会出现。

四、Plan-Then-Construct:先把参数想清楚,再动手建模
Pointer-CAD v2的核心思路,是把数值推理和几何构建这两个认知负荷完全不同的任务拆开,各交给最合适的表示空间。
维度感知的设计计划
在每个生成步骤中,模型首先在文本域产出一份结构化设计计划。所有几何参数以符号形式书写:长度标记为L、角度标记为A,每个参数绑定明确单位(如<L2=5mm>、<A1=30deg>),支持算术运算与对先前定义参数的引用(如<L3=2*L2>)。这种表示在度量尺度上准确、无量化,为后续构建提供了显式约束。

参数字典与指针检索
计划中的参数被抽取出来,按长度、角度分为两个参数字典,统一单位后经保符号对数归一化、指数递增频率带的傅里叶编码、门控MLP投影并施加RoPE位置编码,形成参数嵌入集合。
在构建阶段生成命令序列时,每当需要一个数值参数,模型不再从量化词表中“猜”一个离散值,而是预测一个共享嵌入空间中的查询向量,与参数嵌入计算余弦相似度,直接“指”向字典中的某个参数并原样取用——数值经过多少次生成都不再失真,维度一致性由此得到保证。
三头解码架构
在自回归解码端,Pointer-CAD v2将v1的单头联合解码拆分为三个专用头:Label Head负责预测命令标签token,Value Head负责数值参数嵌入的检索,Pointer Head负责对既有B-rep中面、边等几何实体的引用。计划token与命令token在同一次前向中由两个模态专用解码头顺序生成,一个控制token分隔两种模态,既协同又解耦。
五、新数据集+新标尺:让精度可测、可比
要训练和检验参数级精度,光有方法不够,还需要对的数据和对的尺子。
数据方面,团队基于Recap-OmniCAD与Recap-OmniCAD+(后者额外包含倒角与圆角操作),用Qwen3为每个CAD模型标注结构化设计计划,经语法纠错、程序化参数完整性校验与人工抽检后,构建了OmniCAD-Plan(20.2万个有效模型)与OmniCAD-Plan+(20.9万个有效模型)两个计划级监督数据集。

评测方面,团队提出三级几何精度指标,将评价从粗粒度结构相似推向细粒度参数对齐:
顶点精度(Vertex Accuracy):预测顶点与GT最近点的欧氏距离在容差内才算匹配; 边精度(Edge Accuracy):不仅端点要定位正确,底层几何参数(圆弧的圆心与半径、圆的法向等)也须在容差内对齐; 面精度(Face Accuracy):所有边界边被正确识别,且原始体类型(平面/圆柱/圆锥/球/圆环)与GT一致。 容差设定为GT包围盒最小边长的千分之一,且所有模型在原始位置与尺度下评测、不做归一化——这就迫使模型必须真正理解文本指令中的度量尺度。 此外还引入了可修复模型率RMR@3:错误面不超过3个(约对应一次sketch或extrude的小失误)的模型占比,衡量生成结果在真实CAD工作流中的可用性。这个指标对仿真资产生产尤其有意义——它度量的不是完美率,而是能用率。
六、实验:小模型的大胜仗
对比专用CAD生成方法
在OmniCAD-Plan测试集上,1.5B规模的Pointer-CAD v2全面领先两类专用基线:

相比CADmium-1.5B,Pointer-CAD v2三级指标平均提升13.49%。差距最悬殊的是圆弧精度:CADmium-1.5B仅5.61%,Pointer-CAD v2达到68.53%——代码方法虽然数值自由,却常出现结构错误(漏建、错建部件);v1形状合理但尺寸有偏差;v2则兼得结构完整与尺寸精确。
在包含倒角、圆角的更复杂数据集 OmniCAD-Plan+ 上优势进一步拉大;且随着模型规模从 0.5B 增至 7B,领先幅度从 13.12% 扩大到 15.36%,7B 模型的 RMR@3 达到 95.23%——这意味着几乎所有生成结果仅需经过简单修改,即可直接进入实际 CAD 工作流,并进一步用于制造或仿真。

对比通用大模型
团队从测试集抽样2000个模型,让各通用大模型直接生成CadQuery代码评测:

通用模型中表现最好的Gemini 3 Pro,三级指标平均仍落后Pointer-CAD v2-1.5B达21.30%(OmniCAD-Plan+上为21.54%)。模型规模并不占优,精度却实现了反超——在CAD这类对度量尺度高度敏感的任务上,表示方法与任务结构的契合度,比堆参数更重要。平均CD同样说明问题:Pointer-CAD v2-1.5B为0.91,GPT-5.2为12.01。
消融实验
对指针机制的消融显示:将参数引用退化为直接回归+最近值匹配(w/o Ref.),平均精度骤降26.54%;去掉计划阶段、直接从原始提示抽取参数(w/o Plan),下降12.96%。而去掉频率编码和归一化仅分别带来1.15%和0.48%的小幅下降——说明指针检索机制本身对数值尺度变化相当鲁棒,真正关键的在于显式的参数推理+计划级的参数引用这一设计。
七、对机器人领域的三点启发
其一,参数化生成有望提高仿真资产的生产效率。RMR@3超过90%意味着生成结果多数无需推倒重来;更关键的是基于计划的模型编辑特性——由于所有几何参数显式定义在计划中,修改一个参数即可同步更新整个模型并保持相对比例。放到仿真语境里,这意味着"同一物体、不同尺寸"的资产变体可以批量生成,天然适配domain randomization中对几何扰动的需求。
其二,度量尺度应当成为具身任务的“一等公民”。Plan-Then-Construct把带单位的参数推理放进文本域、把几何构建放进序列域,各得其所。这个先显式推理数值、再执行动作的思路,对其他涉及度量与数量的具身任务(如遵循“抓起5厘米以上的方块”这类指令的操作)同样具有借鉴意义。
其三,小模型+对的结构,未必输给大模型硬扛。15亿参数反超通用模型逾21%,对于算力受限、追求边缘部署的机器人行业而言,这比任何benchmark刷榜都更有说服力:把任务的先验结构设计进表示里,往往比扩大参数规模更划算。
八、局限与展望
论文还给出了部分失败案例:模型在处理小孔、细长圆柱等精细特征时仍可能出现误差,计划阶段的参数错误也可能沿后续构建流程传递。这也是该范式的特点——计划的质量直接决定了构建的上限。未来工作将进一步借助大模型的通用语言理解与推理能力,优化 Plan-Then-Construct 的链式结构与信息传递机制,以提升规划阶段的准确性和整体构建的鲁棒性。
结语
Pointer-CAD v2的意义不止于又一篇SOTA:它同时刷新了CAD生成的表示方法(参数与构建解耦、全精度取值)、数据范式(计划级监督)与评价标准(三级参数保真度指标),把AI生成CAD从看图说话的相似度游戏,拉回到了工业制造真正在乎的参数与公差上。对机器人从业者来说,当仿真资产、数字孪生、世界模型的讨论越来越热,尺寸正确且可编辑的结构化几何生成,值得放进你的关注列表。
-END-
Ask Me Anything|提问箱
对文章有疑惑,或想聊更深?欢迎把你的问题丢给我们:技术方案、实操踩坑、课程与资料、项目合作、职业发展,都可以问。
怎么问:在评论区留言,或私信公众号
我们会做什么:每周集中整理高质量问题并公开回复,重点问题邀请作者或嘉宾深度解答;典型问题会加入知识库并持续更新。
提问小提示:尽量说明「你的目标—当前做法—期望产出」,附上必要信息(硬件/软件版本、数据规模等),能更快获得有用答案。
一起把问题变成知识,推动社区进步 🚀