结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981

3D视觉工坊 2026-10-03 00:00

点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达

来源:3D视觉工坊

3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图1

随着智能制造技术的快速发展,高精度三维测量已成为工业检测、机器人感知、质量控制、医学辅助与文化遗产数字化等领域的核心需求。基于结构光的测量方法虽然在一定程度上实现了物体的三维重建,但在相位解包裹环节仍然存在着依赖多频采集、鲁棒性不足、计算效率低等问题。针对上述挑战,本文以基于深度学习的相位解包裹技术为切入点,对结构光测量中的相位恢复与解包裹方法展开研究,针对不同的任务特性设计专门的网络架构并优化,以求达到精准、高效的相位解包裹效果。

主要研究工作如下:

(1)针对传统相位解包裹方法对多频采集的依赖以及在复杂场景下鲁棒性不足的问题,系统梳理了结构光三维测量的理论基础,深入分析了包裹相位、绝对相位与条纹阶次之间的物理关系,并从时域与空域两个维度对传统解包裹方法进行了原理剖析。

(2)针对相位恢复与条纹阶次识别在特征表达需求上存在本质差异,现有方法难以同时满足两个任务的优化需求,提出了基于DT-SDUNet的双分支解耦网络架构,通过异构编码器分别构建频率-空间细节模块和大核条带注意力模块,使两个任务在各自适配的特征空间中独立优化;设计了自适应融合瓶颈层实现深层语义协同,并通过异构解码器完成像素级预测。实验结果表明,该方法相比基线在阶次预测准确率上提升 ,绝对相位误差降低 ,有效应对了复杂几何表面。

(3)基于显式相位计算与阶次判断可能引入误差传递的问题,提出了端到端的相位解包裹方法。以U-Net为基线模型,针对其高层语义表达不足和跳跃连接特征冗余的问题,设计了瓶颈特征增强模块和多尺度空洞卷积注意力门控机制,前者通过差异化卷积分支强化全局语义特征,后者利用多空洞率并行分支来实现多尺度的上下文感知。采用复合损失函数,结合梯度一致性约束增强相位场结构连续性。实验表明该方法的MAE达到 ,RMSE为 ,相比基础U-Net分别降低  和 。

(4)为充分融合卷积神经网络的局部建模能力与Transformer的全局依赖捕获优势,提出了基于HF-TransNet的混合架构三维高度测量方法。通过设计PTU模块实现CNN与Transformer特征的高效融合,构建分层递进的HFBlock特征提取架构,并引入DSFF模块提供丰富的多尺度底层特征表示。该方法仅需单帧条纹图像即可完成高质量三维测量,为实时动态场景的三维形貌测量提供了有效解决方案。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图2

1 绪论

1.1 研究背景及意义

三维信息的获取和处理是人类认识与描述客观世界的重要手段,在现代科技中具有广泛而深远的影响。人类通过视觉系统可以获得三维世界的深度信息,与此同时大脑通过对视觉信息进行处理以实现空间推理和立体重建,再通过其他感官器官对三维信息的补充,从而形成完整的三维空间感知。随着智能制造与数字化转型的推进,产品从设计、加工到装配与监测的各环节都对三维几何信息提出了更高要求。一方面,现代工业零部件的形态结构日益复杂、精度要求不断提高,传统依赖人工抽检或接触式测量的方式在效率、覆盖率方面存在明显不足;另一方面,机器人操作、智能装配需要实时可靠的三维感知能力,用于位姿估计、路径规划、抓取定位与误差补偿。因此,高精度、非接触、快速的三维测量技术成为先进制造的重要支撑。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图3

随着工业现场对高精度三维信息需求的持续增长,传统接触式测量在效率、柔性等方面逐渐难以满足复杂工况要求。基于光学的三维测量方法因其速度快、精度高、对被测物无损等优势,成为当前研究与应用的热点方向。在众多光学三维测量技术中,结构光三维测量凭借较高的测量精度与较强的工程可实现性,被广泛应用于零件尺寸检测、表面缺陷识别、逆向工程与自动化装配等场景。结构光方法通常通过投影端向物体表面投射条纹,相机端采集变形后的条纹图像,通过相位恢复与几何标定实现从二维图像到深度的重建。然而,在实际操作中,由于条纹图案的变形受到物体表面形貌的影响,计算得到的初始相位是包裹相位,其值局限在  范围内。要得到连续的绝对相位并进一步完成三维重建,必须对包裹相位进行相位解包裹。这一过程是结构光三维测量流程中的关键步骤,也是影响最终三维精度与可靠性的要点之一。

在理想情况下,相位解包裹可以通过简单的相邻像素相位差累积来完成,但在实际测量中却面临多个挑战。首先,噪声干扰是一个主要问题,数据采集过程中光照变化、硬件抖动等因素可能引入噪声,从而导致解包裹错误的传播。其次,测量目标的表面特征复杂,如高频细节、边缘断裂或遮挡等,都会使相位梯度变得更加复杂,增加了解包裹的难度。此外,传统的解包裹方法在处理大规模高分辨率数据时,计算效率较低,难以满足实时应用的需求。尽管一些传统方法已取得了一定成果,但它们在复杂场景中的局限性仍然显著,尤其是在噪声和表面突变的情况下,容易引发错误累积,导致解包裹错误的严重问题。

在理想状态下,相位解包裹可借助相邻像素间相位差的逐步累积来实现,然而实际测量过程中却不可避免地面临诸多困难。一方面,光照波动、硬件抖动等采集端扰动因素极易引入噪声,进而诱发解包裹误差的连锁传播。另一方面,被测目标的表面形貌往往较为复杂,高频细节、边缘不连续及局部遮挡等特征均会使相位梯度分布复杂化,从而显著提升解包裹的实现难度。与此同时,面对大量高分辨率数据集,传统解包裹算法普遍存在计算效率不足的问题,难以契合实时处理的应用需求。尽管现有传统方法在特定条件下已展现出一定的适用性,但当场景中同时存在强噪声与表面相位突变时,误差极易发生累积效应,最终引发解包裹失败。

深度学习技术近年来在图像处理领域发展迅猛,于去噪、图像复原及边缘提取等核心任务上相继取得了突破性成果。通过构建非线性映射关系,深度学习能够直接从包裹相位预测解包裹后的绝对相位,面对复杂纹理与非线性噪声的双重干扰,该类方法所呈现出的抗干扰能力与跨场景适应性均明显优于传统手段。同时,神经网络的高效并行计算能力使其适合处理高分辨率数据。基于深度学习的相位解包裹方法不仅能突破传统算法的局限,解决路径依赖和噪声敏感等问题,还能提升三维测量系统的重建精度和运算效率,满足实时性要求。在复杂的工业和医疗环境中,这些方法能够增强系统的稳定性,适应多种干扰条件,推动技术创新。

基于以上背景,本课题提出了三种基于深度学习的相位解包裹与三维重建方法:第一种提出双分支解耦网络DT-SDUNet,通过异构编码器分别对相位恢复与条纹阶次识别进行独立优化,有效应对复杂几何表面下的解包裹难题;第二种提出端到端相位解包裹网络U-PhaseNet,改进U-Net结构并引入多尺度注意力门控机制,省去显式相位计算步骤,实现高精度直接相位预测;第三种提出混合架构三维形貌重建网络HF-TransNet,融合卷积神经网络的局部建模能力与Transformer的全局依赖捕获优势,仅需单幅条纹投影图像即可完成高度重建。

1.2 国内外研究现状

1.2.1 结构光三维测量研究现状

结构光三维测量技术凭借其非接触、高精度、全场测量等核心优势,自二十世纪八十年代起逐步发展为三维形貌获取领域的主流技术路线,并持续吸引国内外学者的广泛关注与深入研究。

在国外研究领域,早期具有奠基意义的学术贡献主要体现在测量原理的系统化构建与投影编码方式的多元化探索两个层面。1984年,Srinivasan等美国学者率先提出自动相位测量轮廓术,将多步正弦相移技术以系统性的方式引入三维面形测量领域,借助逐步累积相位差的运算机制实现了对复杂曲面的高精度重建。与此同时,Womack等人对基于载频调制的条纹分析方案展开了深入探讨,利用频谱分离原理从单幅条纹图中完成相位信息的提取。步入二十世纪九十年代,Huntley与Saldner于1993年提出了时间相位展开方法,通过在时间维度上依次投影多频条纹序列以逐步消解相位模糊现象,使可测量的相位动态范围得到了大幅拓展。2002年,Gorthi与Rastogi对结构光测量领域已有方法体系进行了较为全面的归纳梳理,从编码策略、相位提取与误差分析三个核心维度对相关研究加以系统分类,为后续学者的研究工作提供了具有参考价值的方法论框架。2021年,Susana Burnes等人提出了改进的条纹频率范围分析方法,使条纹图像序列能够通过连续小波变换等信号处理方法进行处理,有效降低了多频时域相位解包裹中的测量误差。R. Juarez-Salazar等在2025年概述了条纹投影轮廓术的基本原理,强调现代数字设备下的高速实现,并讨论了便携式、动态范围提升及自标定等传统优化方向。英国兰卡斯特大学团队在2025年提出将灰度正弦条纹划分为八幅二值条纹,采用差分方法抑制高动态范围表面干扰,显著降低对反射率波动的敏感性。

在国内研究层面,各高校及科研机构依托自身积累,在紧跟国际前沿的同时逐步形成了各具特色的研究方向。天津大学Su等人针对复杂曲面相位不连续问题,构建了空间载频调制与时间相移相结合的复合测量框架,在保证测量效率的同时有效提升了边缘区域的重建质量。南京理工大学左超课题组于2018年对条纹投影轮廓术的主流算法进行了系统比较与归纳,并对相移轮廓测量系统中相位测量的典型误差来源进行了回顾和讨论。2022年Tian等人尝试将单幅编码图案与三幅移相图像联合使用以实现相位展开,但整体采集耗时仍难以满足实时检测需求。Yan等人提出相位编码光学调制方案以提升投射帧率,然而序列化采集这一根本性约束并未得到突破。天津大学张福民团队提出基于彩色投影仪三通道光强自适应调制的测量方案,通过对RGB通道独立强度调控并结合像素级映射模型,实现了单次曝光下的高动态范围图像采集。相比之下,单帧相位恢复法仅需从单幅条纹图像中重建相位图,因而具有显著的吞吐量优势。Xu等人基于希尔伯特变换提出双帧相移轮廓术,利用两幅相移图案求绝对相位,但抗噪能力在工业环境中仍显不足。Wang等人提出基于正交复合光栅的单帧两步相移方案,然而表面反射率的非均匀分布会导致条纹对比度差异,进而影响相位提取精度。

近年来,深度学习技术在计算机视觉领域取得了突破性进展,为结构光三维重建带来了新的解决思路。越来越多的研究者尝试以神经网络模型替代传统算法流程中的相位提取、条纹分析乃至三维重建等关键模块。Feng等人将CNN模型应用于条纹相位提取,首次证明了深度学习在该领域的可行性。Wang等人概述了基于深度学习技术的空间相位解包裹技术的发展。Bai等人引入卷积神经网络解决单频相位图的展开问题,但研究发现光照条件对测量精度具有重要影响,过强光照会掩盖投影条纹图案,过弱光照则影响成像质量。为解决复杂相位提取问题,Yao等人设计了两个CNN网络用于获取包裹相位和条纹阶次,通过特殊的多码模式求解高级条纹顺序,然而模型计算复杂度较高。Lin等人针对噪声问题设计了Fringe Patterns Denoising Convolutional Neural Network (FPD-CNN),尽管能够有效去除散斑,但多阶段网络结构显著增加了训练成本。Liu等人引入了一种增强的UNet架构,该架构集成了复合条纹编码和阶梯相位编码,以解析高质量的绝对相位信息。Wang等人开发了UHRNet模型,该网络结合了多级卷积块和高分辨率融合块,以降低检测速度为代价,增强对多尺度条纹图案的特征提取能力。Kanami等人提出了基于深度学习的ResUNet模型来解决条纹图案衰减问题,尽管该模型存在参数量过多和推理时间过长的问题。清华大学李星辉团队提出了多路物理监督单帧绝对相位预测网络(MPS_XNet),将绝对相位的解算过程分解为多个并行子任务分支,显著提升了单帧条纹图相位解算的精度与模型泛化能力。

综合上述分析可以看出,结构光三维测量技术历经数十年的持续演进,在测量精度、响应速度与系统鲁棒性等性能指标上均取得了显著进展。然而,面对复杂曲面、强噪声干扰及动态大形变等极端应用条件,传统算法框架在适应性与泛化能力方面仍存在一定局限,这也促使越来越多的研究者将目光转向以深度学习为代表方法,以期突破现有技术体系的性能瓶颈,推动该领域向更高水平迈进。

1.2.2 传统相位解包裹方法研究现状

相位解包裹是条纹投影轮廓术中将包裹相位恢复为连续绝对相位的关键步骤,直接影响三维重建的精度与可靠性。根据所利用信息维度的差异,现有传统方法大体上可归纳为时间相位展开与空间相位展开两大类。

(1)空间相位展开

空间相位展开仅依赖单幅包裹相位图,通过利用相邻像素间的空间连续性假设逐步消除相位跳变,从而恢复绝对相位。

Goldstein等人于1988年提出了枝切法,通过识别相位残差点并在其间布置截断线来防止展开路径绕过不连续区域,成为空间相位展开领域被广泛引用的经典基准算法。Su与Chen于2004年系统综述了可靠性引导相位展开算法的发展历程,对梯度方差、调制度等多种质量度量准则及其路径引导策略进行了全面比较。Flynn于1997年提出以最小化加权不连续性为目标的二维相位展开方法,将展开问题纳入全局优化框架,在一定程度上克服了路径跟踪类方法对局部噪声过度敏感的缺陷。Ghiglia与Romero于1996年提出最小  范数相位展开方法,通过求解全局最优化问题来获取最光滑的展开结果,对噪声具有较强的鲁棒性,但耗费时间较长。Bioucas-Dias与Valadao于2007年提出了基于图割的相位展开方法(PUMA),将相位展开问题转化为图割优化问题并借助图论工具高效求解,在处理含噪声及不连续相位图方面取得了良好效果。2008年,Zappa与Busca对8种常用于傅里叶变换轮廓术的相位展开算法进行了系统性的定量比较,揭示了各算法在精度、速度及噪声鲁棒性方面的差异。Zhao等人在2011年则专门对质量图引导展开技术中不同质量度量准则与引导策略的性能进行了对比研究,为实际系统中质量图的选取提供了实验依据。

(2)时间相位展开

时间相位展开通过在时间维度上依次投射多组频率各异或经过特殊编码的条纹图案,利用不同图案所携带的互补约束信息逐像素独立判定条纹级次,从而无需依赖相邻像素的空间连续性即可恢复绝对相位。

Zhao等人于1994年提出了一种用于三维物体形貌测量的相位展开算法,利用多步相移与多频投射相结合的策略实现绝对相位的可靠恢复,进一步丰富了多频层级法的实现方案。Saldner等人于1997年将时间相位展开方法推广应用于不连续物体表面的轮廓测量,系统评估了该方法在处理深度突变场景时的性能与局限性。Sansoni等人于1999年进一步将格雷码与相移技术结合,深入分析了系统误差的成因并提出了相应补偿方案,有效提升了混合编码方案的综合测量精度。Zhong与Wang于1999年提出了基于查找表的相位展开方法,通过预计算的查找表结构实现了奇异点附近相位的快速判定,有效降低了数论法的在线计算复杂度。Burke等人则进一步探讨了条纹投影在逆向工程中的实际应用,并对数论相位展开在工业场景中的工程实现进行了系统讨论。左超等人于2016年对多频层级法、多波长外差法与数论法进行了系统性的比较综述,基于严格的随机噪声模型从理论与实践两个层面评估了各方法的展开可靠性,为实际系统中算法选型与参数优化提供了重要参考。

综合来看,空间相位展开以单帧处理为优势,计算流程简洁,但面对深度不连续或相位梯度较大的区域时,难以解决误差扩散问题;时间相位展开则以牺牲测量帧数为代价换取逐像素的绝对相位判定,在精度与鲁棒性上更具优势,却需要更长的测量时间。两类方法各有侧重,由此推动了后续研究者将深度学习引入相位解包裹任务,以期在保留传统方法物理可解释性的同时,进一步突破精度与效率之间的制约。

1.2.3 基于深度学习的相位解包裹研究现状

近年来,深度学习技术的快速发展为相位解包裹问题提供了全新的解决思路。相较于传统方法,神经网络具有强大的非线性建模能力,能够从数据中自适应地学习包裹相位到绝对相位的复杂映射关系,在噪声鲁棒性、处理速度及对非连续表面的适应能力等方面均展现出显著优势。

2019年Spoorthi等人提出了PhaseNet,将空间相位展开问题重新表述为基于语义分割的逐像素分类任务,通过全卷积编解码网络预测每个像素处包裹相位的条纹级次,实验表明其在抗噪性能上优于传统质量图引导方法。同年,Wang等人提出了一步式深度学习相位展开框架,设计了相应的训练数据生成方法,所训练的深度神经网络能够在单次前向推理中完成包裹相位到连续相位的直接映射。Zhang等人则基于DeepLabV3+架构提出了一种快速鲁棒的二维相位展开方法,通过语义分割获取包裹相位的分割结果后与原包裹相位结合以生成展开相位。此后,Spoorthi等人进一步提出了PhaseNet2.0,采用全卷积DenseNet架构并引入加权交叉熵损失以解决类别不平衡问题,在高动态范围相位图的处理上也取得了明显改进。Li等人提出一种针对闭合条纹图案的深度学习相位解包裹策略,对比了四种不同网络结构的解包裹效果,结果表明改进型全卷积网络(FCN)在精度与速度上表现最优。Yin等人于2019年提出了深度学习时间相位展开方法(DL-TPU),首次实验验证了利用单位频率辅助相位直接对64周期高频相位进行可靠展开的可能性,大幅拓展了可测量的相位动态范围。此后,基于深度学习的时间相位展开研究持续深入。研究者们进一步将深度学习框架推广至多频、多波长、数论等不同时间相位展开模态,发展出统一化的深度学习时间相位展开框架,以期通过单次训练实现对多种算法模态的兼容支持。然而,现有方法普遍存在泛化能力不足的问题——当测试场景的条纹空间频率或成像系统参数与训练时不一致时,展开精度往往大幅下降。针对这一挑战,Liu等人于2025年提出了融合物理先验的多模态自适应时间相位展开方法(MA-TPU),将时间相位展开的物理模型作为先验知识嵌入神经网络的学习过程,使单一模型能够同时适应多频、多波长和数论三种展开模态。

综合来看,深度学习为相位解包裹领域注入了新的活力,在噪声、鲁棒性和单帧处理效率方面带来了显著提升,但仍面临一些挑战:一是训练数据的获取成本较高,高质量真实数据集的构建复杂;二是模型泛化能力有限,当测量系统参数或场景条件发生变化时,性能可能出现明显退化;三是网络的可解释性相对不足,难以对预测结果的物理意义做出明确阐释。上述问题为进一步提升深度学习相位展开方法提供了新的方向。

1.3 主要研究内容

本文以基于深度学习的结构光三维测量中相位解包裹方法为研究对象,围绕相位解包裹精度不足、多频采集依赖以及计算效率低等核心问题展开研究。针对不同任务特性设计专门的网络架构,从任务解耦、端到端重建和混合架构三个层面逐步深入,实现高精度、高鲁棒性的相位解包裹。通过本文的主要研究内容,可以画出技术路线示意图,如图1.2所示。主要研究工作如下:

(1)结构光三维测量与深度学习理论研究:系统梳理结构光三维测量的基本原理,深入分析包裹相位、绝对相位与条纹阶次之间的物理关系,从时域与空域两个维度对传统相位解包裹方法进行原理剖析与局限性分析。同时介绍深度学习相关基础理论,为后续网络设计提供理论支撑。

(2)基于DT-SDUNet的双分支解耦相位解包裹方法研究:针对相位恢复与条纹阶次识别在特征表达需求上存在本质差异、现有方法难以同时满足两个任务优化需求的问题,提出双分支解耦的U-Net架构DT-SDUNet。通过异构编码器分别构建频率-空间细节模块和大核条带注意力模块,使两个任务在各自适配的特征空间中独立优化;设计自适应融合瓶颈层实现深层语义协同,并通过异构解码器完成像素级预测,有效应对复杂几何表面与退化测量条件。

(3)基于U-PhaseNet的端到端相位解包裹方法研究:针对显式相位计算与阶次判断可能引入误差传递的问题,提出端到端相位解包裹方法U-PhaseNet。以U-Net为基线,设计瓶颈特征增强模块通过差异化卷积分支强化全局语义特征,设计多尺度空洞卷积注意力门控机制实现多尺度上下文感知与特征自适应筛选,并采用掩膜约束复合损失函数结合梯度一致性约束增强相位场结构连续性。

(4)基于HF-TransNet的端到端高度重建方法研究:为充分融合卷积神经网络的局部建模能力与Transformer的全局依赖捕获优势,提出混合架构三维形貌重建方法HF-TransNet。通过PTU模块实现CNN与Transformer特征的高效融合,构建分层递进的HFBlock特征提取架构,并引入DSFF模块提供丰富的多尺度底层特征表示,仅需单帧条纹图像即可完成高质量三维测量。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图4

1.4 论文章节安排

本文围绕基于深度学习的结构光三维测量相位解包裹方法展开研究,共分为六个章节,各章节内容安排如下:

第一章为绪论,介绍结构光三维测量与相位解包裹技术的研究背景及意义,综述国内外研究现状,阐述本文的主要研究内容与章节安排。

第二章为结构光三维测量相关技术理论,介绍深度学习基本原理与卷积神经网络核心组件,系统阐述结构光三维测量原理,包括三角测量原理、正弦条纹投影与相移技术,并从时域与空域两个维度详细分析相位解包裹的基本原理与主要方法,为后续研究提供理论基础。

第三章为基于DT-SDUNet的结构光相位解包裹方法研究,介绍数据集构建与预处理策略,详细阐述DT-SDUNet双分支解耦网络架构的设计思路与各模块实现,并通过消融实验与对比实验验证方法的有效性。

第四章为基于U-PhaseNet的端到端相位解包裹方法研究,介绍U-PhaseNet网络结构及瓶颈特征增强模块、多尺度空洞卷积注意力门控等关键模块的设计,阐述损失函数与训练策略,并通过实验评估端到端解包裹方法的精度与鲁棒性。

第五章为基于HF-TransNet的结构光深度回归方法研究,介绍HF-TransNet混合架构的整体设计,重点阐述HFBlock、DSFF模块与PTU瓶颈层的结构与功能,并通过消融实验与对比实验验证所提方法在三维形貌重建任务中的优越性。

第六章为结论与展望,总结本文的主要研究成果,分析现有工作的不足之处,并对未来研究方向进行展望。

2 结构光三维测量相关技术理论

结构光三维测量通过相位解包裹实现物体形貌重建,而传统方法在复杂场景下面临诸多局限。本章将系统介绍深度学习基本原理、结构光测量系统组成与三角测量原理,以及相位解包裹的核心概念与传统方法,为后续深度学习方法的设计提供理论基础。

2.1 深度学习与卷积神经网络

2.1.1 深度学习基本原理

深度学习的训练范式可根据数据标注情况分为监督学习、无监督学习和强化学习等。本文研究的相位解包裹任务拥有明确的输入(条纹图)和输出(相位真值)数据,属于典型的监督学习问题。因此,本章重点介绍监督学习的相关理论和技术。

监督学习可描述为:从带标签的训练数据集  中学习一个最优映射函数 ,使得模型的预测值  尽可能地接近真实标签 。根据标签状态是离散还是连续的,可以分为分类和回归任务。

其中, 为输入样本, 为对应标签。

在相位解包裹任务中,监督学习提供了相比传统方法的显著优势。传统方法依赖人工设计的规则,难以应对噪声、不连续等复杂情况。而监督学习方法通过在大量数据上训练,使神经网络自动学习映射规则。虽然条纹到相位的映射关系复杂,但可通过仿真或实验获取充足的训练数据。在训练过程中,模型通过损失函数来衡量预测值与真实标签之间的误差,再通过优化算法对模型内部参数进行调整优化,最终能够达到较高的准确率。

(1)前向传播与反向传播

深度神经网络的训练核心包含前向传播和反向传播两个关键过程。其中,前向传播是模型从输入数据到输出预测结果的正向计算流程,核心逻辑是逐层传递数据并生成预测结果。

对于网络中的第L层,前向传播的计算可明确拆解为线性变换与非线性激活两个步骤,具体表达式如下:其计算包括线性变换、非线性激活两个步骤:

其中  和  为第L层的权重和偏置, 为激活函数。输入数据依次通过L层网络,最终得到预测输出 。

反向传播的本质是利用链式法则从输出层到输入层反向计算损失函数对各层参数的梯度,为参数更新提供量化依据。反向传播通过链式法则逐层递推误差与梯度。定义网络第  层的误差项为:

其中  为损失函数, 为第  层的净输入。参数更新阶段,基于梯度下降策略的更新公式为:

式中  为学习率,用于控制参数更新的步长,避免更新幅度过大或过小导致模型训练不稳定。

(2)损失函数

损失函数是定义在模型预测值  与真实标签  上的映射函数 ,其核心作用体现在两个维度:一是“误差量化”,通过函数输出值的大小直观反映预测结果与真实情况的偏离程度,输出值越小则预测精度越高;二是“优化导向”,为反向传播提供梯度计算的起点,引导模型参数沿“最小化损失”的方向迭代更新。训练的目标就是通过不断调整参数 ,使损失函数  最小化:

在相位预测任务中,损失函数的设计直接决定模型对条纹图与相位映射关系的学习效果,进而影响最终相位测量精度,因此是本研究的重点内容。

2.1.2 卷积神经网络

传统图像处理方法在复杂场景下的特征提取能力有限,难以应对多变的视觉环境。卷积神经网络(CNN)的出现从根本上改变了这一局面:通过端到端的深度特征学习,CNN能够自动从原始数据中发掘层次化的视觉表征,同时凭借局部感知与平移不变性等内在特性,在图像分类、目标检测等任务中展现出显著优势。随着计算能力的持续提升与大规模标注数据集的广泛构建,CNN逐渐发展为计算机视觉领域最具影响力的基础模型之一。

CNN是目前应用最为广泛的深度学习架构之一,其设计思想在一定程度上借鉴了生物视觉皮层的信息处理机制,基本结构如图2.1所示。局部连接与权值共享是CNN的两项核心设计策略。卷积操作通过滑动的小尺寸卷积核与输入特征图的局部区域进行响应计算,大幅减少了网络连接数量,有效降低了参数规模与计算开销;同一卷积核在空间上共享权重参数,进一步提升了参数利用效率,并赋予网络对平移变换的内在鲁棒性。通过交替堆叠卷积层、池化层与全连接层,CNN能够逐级提取从底层纹理到高层语义的多尺度抽象特征,从而完成图像识别、分割等多类视觉分析任务。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图5

(1)卷积层

卷积层的采样过程如图2.2所示。卷积核以滑动窗口的方式逐区域扫描输入特征图,对每个局部区域执行逐元素相乘后求和的运算,最终生成尺寸为  的输出特征图。输出特征图的空间尺寸可由式(2.8)计算得到:

其中, 为输入特征图的尺寸, 为卷积核的尺寸,P为填充大小,S表示滑动步长,N表示输出特征图的尺寸。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图6

(2)非线性激活层

非线性激活层通过激活函数对卷积输出进行非线性变换,赋予网络拟合复杂函数关系的能力。若缺乏非线性激活,多层网络的叠加在数学上等价于单层线性变换,无法有效捕捉数据中的非线性结构。激活函数同时承担将特征映射至特定输出空间的作用,使网络输出能够适配分类、回归等不同任务需求。常见的激活函数包括Sigmoid、ReLU(Rectified Linear Unit)、Tanh等。

1)Sigmoid函数的值域为[0,1],它对每个神经元的输出进行归一化,如式(2.9)所示。

2)Tanh函数是完全可微分的,而且能够保证连续的梯度信息,如式(2.10)所示。

3)ReLU函数在正值区间呈线性且不饱和,梯度恒为1,从而保证了误差信号在反向传播过程中的有效传递,如式(2.11)所示。

(3)池化层

池化层的主要作用是对特征图进行空间下采样,在压缩特征维度、减少参数量的同时提升计算效率,并赋予网络一定程度的空间不变性。池化操作的本质是在输入特征图的局部区域内进行统计聚合,以提取具有代表性的局部响应。最大池化与平均池化是两种最为常用的实现方式:前者取局部窗口内的最大响应值,侧重保留显著特征;后者计算窗口内的均值,对特征进行平滑整合,如图2.3所示。通过引入池化操作,卷积神经网络能够在降低特征图分辨率的同时保留关键语义信息,为后续分类、检测等任务提供更具判别力的特征表示。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图7

(4)全连接层

全连接层通常位于卷积特征提取模块之后,负责将前层提取的局部特征进行全局整合,生成更高层次的抽象表示。其输入为经过展平处理的特征向量,通过权重矩阵的线性变换与激活函数的非线性映射,将分散的局部响应融合为包含全局上下文信息的紧凑特征,为最终的分类或回归输出提供支撑。然而,全连接层的参数量随输入维度的增大而急剧增加,在训练样本有限的情况下容易引发过拟合问题。

2.2 结构光三维测量原理与方法

结构光三维测量技术的核心是通过光学编码、三角测量与相位计算的融合,实现对被测物体三维形貌的高精度重建。其系统主要由投影仪、相机、计算机及被测物体构成:通过向物体表面投射编码光学图案,采集被调制后的图案信号,反向推演物体表面的三维形貌。本节将系统分析测量系统的组成原理、关键参数及非理想因素,为后续引入深度学习方法优化测量性能提供理论基础与问题导向。

2.2.1 卷积神经网络结构光测量系统原理

反向推演物体表面的三维形貌。典型的结构光测量系统由投影设备、采集相机和计算单元组成。投影仪与相机之间的几何关系通过系统标定确定,用于后续的相位-深度映射。图2.4展示了典型的系统几何配置。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图8

结构光测量的核心在于:不同深度的物体表面点导致相机观察到的条纹产生不同的相位偏移,通过测量相位偏移并结合系统参数,可计算三维坐标。实际系统存在诸多非理想因素:环境光干扰降低条纹对比度;物体表面特性引起信号失真;几何不连续导致相位剧烈跳变;系统噪声影响测量精度。这些非理想因素增加了相位提取和解包裹的难度。

2.2.2 三角测量原理与相机模型

(1)针孔相机模型

理想的相机成像模型如图2.5,假设空间中有任意一个点 ,经过摄像机的线性成像,点  将成像在平面  上,且它经过摄像机的光心 ,系统坐标系关系如图2.5所示。

空间点  从世界坐标  到像素坐标  的转换过程如下:

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图9

从世界坐标系到相机坐标系:

其中, 是  旋转矩阵, 是  平移向量,二者构成相机的外参矩阵,通过系统标定获得。

根据针孔成像原理,相机坐标系下的点投影到图像平面的齐次坐标为:

其中, 为深度(尺度因子), 为相机内参数矩阵:

其中,, 为以像素为单位的焦距(, 为物理焦距, 为像元尺寸), 为主点坐标。

给定像素坐标 ,可以反解出对应的成像光线在相机坐标系下的方向向量:

归一化后得到单位方向向量 。空间点  位于以光心  为起点、 为方向的射线上:

其中深度  是待求的未知量。三角测量的本质就是通过第二个视角的约束来求解这个深度。如果能确定 ,就能恢复三维坐标(X,Y,Z)。这正是结构光测量的目标:通过相位信息确定深度 。

(2)三角测量原理

三角测量利用同一空间点在两个不同视角下的成像信息,通过几何约束求解该点的三维坐标。在结构光系统中,投影仪和相机构成了这对双目视角。经典的双目立体视觉使用两个相机从不同角度拍摄场景,通过匹配两幅图像中的对应点,利用视差(disparity)计算深度。视差  定义为同一空间点在左右图像中的水平坐标差:

对于平行配置的双目系统,深度与视差的关系为:

其中  为基线距离, 为焦距。从中可以看出:基线距离与视差的乘积决定了深度分辨能力。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图10

在结构光系统中,投影仪向场景投射已知图案,相当于为场景表面的每个点赋予了唯一的“编码标签”。可以将投影仪理解为一个逆向工作的相机这种对偶性使得投影仪可以用相同的针孔模型描述。投影仪也有自己的内参数矩阵  和相对于世界坐标系的外参数 。

2.2.3 正弦条纹投影与相移技术

结构光三维测量的核心是对物体表面进行光学编码,使不同空间位置对应唯一的编码信息。相位测量轮廓术(Phase Measuring Profilometry,PMP)采用正弦条纹作为编码载体,通过相位解调实现高精度三维重建。相比二值编码、Gray码等离散编码方式,正弦编码的连续相位信息能够实现亚像素级的测量分辨率。

(1)正弦编码原理

相位测量轮廓术利用正弦光强分布的连续相位作为编码信息,将空间坐标映射到相位域。理想情况下,投影仪沿水平方向投射的正弦条纹在物体表面产生的光强分布可表示为

其中  背景光强,由环境光照和物体表面反射率共同决定; 为调制幅度,反映了投影条纹的对比度; 为相位分布。对于投影平面,相位与投影坐标呈线性关系

其中, 为条纹周期, 为初始相位。这种线性编码方式使得相位差  能够精确反映投影坐标差 ,为后续的三角测量提供了几何对应关系。

此外,式(2.10)中相位  的提取仅依赖于余弦函数的相对形态,而与绝对光强A和调制幅度B无关。这意味着即使物体表面反射率不均匀,相位信息仍能保持稳定。这种光度不变性使得正弦编码在复杂光照条件下具有天然鲁棒性。

(2)N步相移法

单帧正弦条纹图像无法唯一确定相位。观察式(2.10),对于每个像素的光强测量值 ,存在三个未知量,需要额外的测量约束。N步相移法通过在时间维度引入冗余测量来构建超定方程组。

具体而言,标准N步相移法中,其光强分布函数为:

其中, 表示第  幅正弦模式的相移量,, 表示条纹图像的强度, 表示待求的包裹相位,, 分别表示相移条纹图像的背景光强和调制强度。

定义余弦分量和正弦分量 ,利用正交性可得:

则包裹相位为:

式(2.18)表明,C和S分别对应反正切函数的分母和分子,两者完整编码了包裹相位信息。

常用的相移步数N包括3步、4步和8步。以四步相移法为例,依次投影四幅相位相差  的条纹图像,并记录光强分布。通过消除背景光强A和调制强度B,可以计算得到包裹相位 。

包裹相位通过反正切函数计算:

观察可发现,背景光A在分子分母中自动抵消,无需单独估计环境光强度。这一性质使4步相移法对环境光波动具有天然鲁棒性。此外,4步相移所得包裹相位噪声低、连续性佳,为后续相位解缠提供良好基础,可适配实验室常规测量与工业在线检测等多场景需求,故4步相移在实际应用中最为广泛。

2.3 相位解包裹原理

结构光三维测量中提取的相位主值依赖于反正切函数,得到的初始相位是包裹相位,无法反映超出此范围的绝对相位。包裹相位无法直接反映待测物体表面超过  的相位变化,因此难以恢复真实的深度信息。将其转变为连续的相位值,才能反映待测物的真实表面三维数据,因此需要进行相位展开,即相位解包裹。

2.3.1 相位相关概念

计算包裹相位的主要方法有相位偏移法(Phase Shifting)和傅里叶变换法(Fourier Transform)。傅里叶变换法适用于单幅条纹图的情况,但精度较低。相位偏移法通过投射多幅具有固定相位差的光栅条纹,计算每个像素点的包裹相位,高精度,抗噪声能力强,但不适用于动态场景。

N步相移的光强分布函数(2.27)可以根据公式(2.28)通过最小二乘法进行求解:

相位解包裹的原理就是在存在相位跳变处基于相位主值加上或减去一个修正值,即  的整数倍,公式表示如下

式中, 为绝对相位, 为包裹相位, 为条纹级次。

2.3.2 空域相位解包裹

空域相位解包裹主要分为路径依赖法和全局优化法。路径依赖法的关键在于选取合理的解包裹路径以避开相位间断点及无效数据点,通过预设特定路径,逐点对包裹相位进行展开运算,依赖相邻像素的相位连续性完成求解。全局优化法则通过最小化描述折叠相位与真实相位之间误差优化函数,实现全域相位的精准展开,典型代表为最小范数法,采用该方法时需将相位解包裹问题转化为全局最优解的求解问题。

(1)路径依赖法

质量图引导法(Quality-Guided Phase Unwrapping)是空域相位展开中常用的路径依赖法之一。通过质量评价函数生成质量图,用于量化包裹相位图像中每个像素点的相位可靠性;随后按照质量图的灰度值从高到低(即相位可靠性)的顺序逐步解包裹,将高可靠性像素的解包裹结果作为基准,向低可靠性像素传递,最大限度地减少解包裹误差的累积,其流程如图2.7。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图11

质量图的构建是该方法的关键,其所采用的质量评价函数需能够准确区分高可靠性相位像素与低可靠性相位像素,直接决定了后续解包裹路径的合理性与解包裹结果的精度。相关系数(Pseudo-correlation)是应用最为广泛的评价指标之一,其定义为:

其中C、S为式(2.16)-(2.17)中计算的余弦和正弦分量,A为背景光强。质量图  的值越大,说明该像素的信号调制度越高,相位测量可靠性越强,解包裹优先级越高。

质量图引导法的解包裹过程本质是以高质量像素为基准,通过邻域递推的方式逐步完成整幅图像的解包裹。首先从种子点开始,按质量从高到低的顺序逐步展开,选取质量图  中数值最大的像素作为种子点 ,其绝对相位初始化为包裹相位值,即:

通过迭代完成全域解包裹,直至队列与候选矩阵无有效像素,迭代中取队列首像素  为当前解包裹像素,依托其父像素  绝对相位  计算二者包裹相位差:

由于包裹相位的周期性, 存在  的误差,修正后的相位差  为:

修正后的相位差  能够真实反映相邻像素间的连续相位变化,当前像素的绝对相位为:

(2)路径无关法

路径无关法是基于全局优化思想的解包裹算法,其解包裹过程与路径选取无关联,通过最小化预设目标函数实现全域绝对相位的恢复。与路径依赖的局部解包裹算法相比,该类方法从全局角度约束相位连续性,能够有效避免局部误差的逐点累积。

路径无关法通常以最小范数法(Minimum Norm Method)为理论基础,其中应用最广的是基于  范数的最小二乘法。将相位解包裹问题转化为全局优化问题,通过最小化绝对相位梯度与修正后包裹相位梯度之间的误差范数,实现绝对相位的恢复。

对式  两边分别求  方向与  方向的梯度,可得:

由于条纹阶次  为整数,其梯度  的取值为整数向量,因此修正后的包裹相位梯度为:

最小范数法的核心目标是:寻找最优的条纹阶次梯度 ,使得绝对相位梯度  的范数最小,即满足:

其中  表示  范数。

在实际计算中,为了简化运算,通常假设绝对相位梯度是连续光滑的,且相邻像素的绝对相位梯度变化较小,因此最小范数法的优化目标可进一步简化为:最小化修正后包裹相位梯度的  范数平方和,即:

其中 、 分别为修正后包裹相位在  方向的梯度。

为降低计算复杂度,通常将整数约束放宽为实数约束,转而求解连续域下的最小二乘解。此时,最小二乘相位解包裹问题可归结为在离散网格上求解具有Neumann边界条件的Poisson方程。设离散Laplace算子为 ,则对应的方程可表示为:

其中  由包裹相位在水平与垂直方向上的相位差计算得到。

为提高求解效率,通常采用离散余弦变换(DCT)对上述Poisson方程进行频域求解。在DCT域中,Poisson方程可转化为代数形式,其解析解可表示为:

其中  与  分别表示绝对相位与源项在DCT域中的系数,、 为离散Laplace算子的特征值。通过对  进行逆DCT变换,即可获得空间域内的绝对相位分布。该方法无需迭代计算,数值稳定性好,计算复杂度低,因而在最小二乘相位解包裹中得到广泛应用。

2.3.3 时域相位解包裹

时域相位解包裹是一类通过在时间维度引入多次投影或多种编码序列来恢复绝对相位的方法。与空域相位解包裹依赖空间邻域连续性不同,时域方法对每个像素点独立进行条纹阶次判定,从而避免了解包裹误差在空间上传播的问题。该类方法在处理表面存在几何不连续、遮挡或低信噪比区域时具有更高的鲁棒性,因此在复杂形貌测量和工业检测场景中得到广泛应用。

多频相位解包裹通过在时间维度投影不同空间频率(或周期)的正弦条纹图案,为同一像素获取多组包裹相位信息。其核心思想是利用不同频率相位之间的外差关系,逐级构造等效低频相位,从而实现相位展开。该方法兼具相移法的高相位精度和多频外差法的强解包裹能力,适用于复杂形貌和大高度变化场景。

基于四步相移法的相位提取原理,对每组条纹的4幅相移图像进行运算,可分别提取3组包裹相位 、、。通过包裹相位作差,生成等效的低频相位:

由于  是极低频率,其包裹相位  的空间变化范围极小,可直接视为无歧义的绝对相位,即:

通过多级外差运算,可以逐步构造出等效周期不断增大的相位,从而反向求解高频相位的条纹阶次,接着从低频到高频逐级解包裹,最终获得绝对相位

2.4 本章小结

本章系统阐述了结构光三维测量与深度学习的基础理论,为后续章节的方法设计提供了必要的理论支撑。为实现后续网络模型设计,本文首先介绍了深度学习基本原理,重点分析了回归任务常用损失函数,同时讲解了卷积神经网络核心组件,构建了所需的理论工具。在此基础上,本文从系统组成与三角测量原理入手,阐述了结构光三维测量的基本逻辑,包括正弦条纹投影、相移技术的应用,以及从多帧条纹图像计算包裹相位、通过相位-深度映射实现绝对相位到三维坐标转换的过程。随后,本文围绕相位解包裹技术展开系统分析,明确包裹相位、绝对相位与条纹阶次的关系,并分别探讨了时域与空域两类解包裹方法的原理、优劣及适用场景,为后续深度学习相位解包裹方法的理解与评估奠定了坚实基础。

3 基于DT-SDUNet的结构光解包裹方法研究

传统相位解包裹方法虽然在理想条件下精度较高,但依赖路径追踪和空间连续性假设,在噪声干扰、低调制度和复杂几何表面下容易失效。本章基于深度学习技术,提出一种基于双分支解码器的相位解包裹网络DT-SDUNet,通过分别预测余弦分量、正弦分量和条纹阶次,实现对包裹相位和绝对相位的准确重建。

3.1 数据集构建与预处理

3.1.1 数据集构建

SL3D-BF是一个专业工业三维检测设计的大规模结构光重建数据集,由清华大学和鹏城实验室联合开发。数据集包含2100组真实场景数据,涵盖金属工件、塑料制品和石膏雕像等多种材料,完整保存了从原始光栅图到最终三维点云的整个处理流程。每组数据都包含4种频率的12步相移光栅图、包裹相位图、绝对相位图、深度图和三维点云,总计超过10万张光栅图像,如表3.1。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图12

三维重建基于像素级标定技术实现。系统采用射线投影模型结合三次多项式拟合方法,建立相位与三维空间坐标的映射关系:

Y和Z坐标以类似方式计算。标定系数通过测量已知的标定板获得,存储为查找表供后续使用。这种像素级标定相比传统方法能更好地补偿光学畸变和系统非线性。

3.1.2 数据预处理与增强策略

训练阶段数据增强是提升模型泛化能力的重要手段。考虑到结构光测量中相位信息的敏感性和物理约束,本研究采用了有针对性的增强策略。

在几何变换方面,仅引入随机垂直翻转操作,该变换对条纹图案的相位编解码过程具有不变性。需要注意的是,对输入条纹图执行翻转时,所有对应标签(分子、分母、条纹级次及阴影掩码)须同步施加相同变换,以维持输入与标签之间的空间一致性。在光度变换方面,采用了亮度调整、对比度调整与高斯噪声添加三类策略,分别用于模拟实际测量场景中的光照波动与系统噪声。上述光度变换仅作用于输入条纹图像,标签数据保持不变,且变换后的像素值被强制截断至[0,1]范围内,以确保数据分布与原始测量数据保持一致。数据集划分采用固定随机种子的方式,按8:1:1的比例将全部样本随机划分为训练集、验证集与测试集,固定种子保证了实验的可重复性,便于不同条件下结果的横向比较。

3.2 DT-SDUNet网络架构设计

3.2.1 网络整体架构

相位解包裹本质上需要同时解决两个任务:连续相位的回归估计和离散条纹阶次的准确分类。前者对局部梯度变化高度敏感,而后者则依赖对条纹周期性结构的全局建模。两类任务在特征需求上的内在差异,使得单一特征表示难以同时兼顾二者的优化目标。为此,本研究设计了双分支解耦的U-Net架构(DT-SDUNet),使相位回归与条纹级次预测分别在各自适配的特征空间中独立优化,同时在深层瓶颈处进行语义融合,以实现特征解耦与高层互补的平衡。

DT-SDUNet由四个核心组件构成:相位编码器(PhaseEncoder)、条纹级次编码器(StripeOrderEncoder)、融合瓶颈层(FusionBottleneck)以及双路解码器(PhaseDecoder和OrderDecoder)。网络输入为单帧相移光栅图像,经过双分支编码器的并行处理,在瓶颈层进行特征融合后,通过双路解码器分别输出相位回归结果和条纹级次分类结果。具体而言,相位回归输出为分子余弦  和分母正弦  两个通道,条纹级次分类输出为logits图。整体采用对称塔型结构,如图3.1。

两个编码器在特征提取策略上存在明显差异。相位编码器浅层引入高效通道注意力(ECA)模块以增强通道间交互,深层则采用频率-空间细节模块(FSDM)在频域与空间域联合建模,兼顾相位场的整体连续性与边界锐化能力。条纹级次编码器侧重长程依赖建模,采用大核条带注意力(LKSA)模块,沿水平与垂直方向分别捕捉条纹的周期性跳变,较大的感受野使网络能够跨越多个条纹周期进行全局推断。上述异构设计的有效性将在后续消融实验中进一步验证。

在编码器顶层,双分支提取的特征通过FusionBottleneck进行融合。该模块通过批归一化和可学习缩放参数对两支特征进行权重平衡,再经过通道拼接、降维卷积和注意力增强,生成兼具两个任务语义信息的融合特征。

解码器端延续了双分支的异构设计。相位解码器采用轻量级结构,仅使用基础的上采样和卷积组合,避免过度处理破坏相位的连续性;条纹级次解码器则引入边界注意力和全局上下文建模,增强对跳变边界的检测能力和分类结果的空间一致性。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图13

预测头的设计同样体现了任务差异:相位回归头使用简单的卷积层配合Tanh激活约束输出范围,条纹级次预测头则采用多尺度特征聚合的ASPP结构,通过不同扩张率的空洞卷积捕获多尺度上下文。

3.2.2 编解码器设计

双编码器是DT-SDUNet的核心设计。相位恢复要求网络精确捕获局部梯度和边缘细节,对相位场的平滑连续性较为敏感;条纹阶次识别则需要跨越多个像素建立长程空间依赖,以准确定位周期性跳变边界。两类任务在特征需求上的差异,决定了两个编码器必须采用不同的特征提取策略。

为此,DT-SDUNet设计了两条并行的编码路径。相位编码器引入频率-空间细节模块(FSDM),结合多尺度空洞卷积与通道注意力机制,通过不同感受野的并行分支同时捕获相位的低频连续分量与高频跳变细节。条纹级次编码器则采用大核条带注意力模块(LKSA),利用  卷积核的条带分解在水平和垂直两个方向上显式建模条纹的周期性结构。两个分支在注意力机制设计上存在本质差异,但在基础卷积结构上保持一致:均以深度可分离卷积为特征提取基本单元,并采用组归一化进行特征标准化,整体结构如图3.2所示。

深度可分离卷积(Depthwise Separable Convolution)将标准卷积拆解为两个顺序操作:深度卷积对各通道独立进行空间特征提取,逐点卷积则通过  卷积完成跨通道信息的整合与映射。对于输入特征 ,该过程可表示为:

其中  表示深度卷积, 为逐点卷积。这种分解在保持特征提取能力的同时,显著减小了参数量。在归一化层的选择上,本研究采用组归一化(Group Normalization)替代常用的批归一化,将通道分为32组分别归一化。组归一化对批大小不敏感,更适合小批量训练场景,且通过组内特征的局部统计量进行标准化,能够有效保留通道间的局部相关性。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图14

(1)频率-空间细节模块(FSDM)

相位具有明显的多尺度特性:平滑区域的相位变化缓慢对应低频信息,而阶次跳变边界的相位剧烈变化对应高频信息。单一尺度的卷积核难以同时捕获这两种特性,为此FSDM设计了三个并行分支,分别采用不同的空洞率(Dilation Rate)扩大感受野,如图3.3。

空洞卷积通过在标准卷积核的元素间插入空洞,在不增加参数量的情况下指数级地扩大感受野。三个分支提取的特征在通道维度拼接后通过  卷积融合:

融合特征随后经过通道注意力机制进行自适应加权,通过全局平均池化压缩空间信息后生成通道权重:

最终输出通过残差连接与输入融合:

式中  为可学习的缩放参数,初始化为0,实现渐进式激活,保证了训练的稳定性。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图15

(2)大核注意力模块(LKSA)

条纹阶次的跳变通常沿着垂直于条纹方向的边界发生,这种跳变在空间上可能跨越数十个像素,远超常规  卷积的感受野。LKSA模块通过将  大卷积核分解为  水平条带卷积和  垂直条带卷积的串联,实现高效的长程依赖建模,如图3.4。这种分解策略源于条纹图案的方向性特征:水平方向编码条纹的相位变化,垂直方向对应条纹的空间延续性。两个分支的卷积操作分别表示为:

两个分支提取的特征通过逐元素相加进行融合并归一化:

融合特征通过  卷积和Sigmoid激活生成注意力权重 ,对原始输入特征进行门控加权:

这种设计使得注意力机制起到特征筛选作用:周期性特征显著的位置权重接近1,特征得以保留;反之权重接近0,特征被抑制。最终输出通过残差连接融合:

同样引入可学习缩放参数  实现渐进式激活,保证训练稳定性。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图16

3.2.3 解码器设计

解码器的任务是将编码器提取的高层抽象特征逐步恢复至原始分辨率,并生成最终的预测结果。延续编码器的设计思路,DT-SDUNet的解码器采用双分支设计:相位解码器追求像素级的恢复,条纹级次解码器则强调分类结果的全局一致性和边界清晰性,如图3.5。

每一级解码块采用双线性插值进行上采样,相比转置卷积能更好地保持空间连续性,避免棋盘效应伪影。对于输入特征图 ,双线性插值的上采样过程可表示为:

其中  为上采样后特征图中的浮点坐标, 为其在原特征图中最近的四个整数坐标点。上采样后的特征图尺寸变为 ,通道数保持不变。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图17

与相位解码器相比,条纹级次解码器在特征融合后引入边界注意力机制和全局上下文块。边界注意力模块通过深度卷积提取边缘特征,生成空间注意力权重

其中, 为深度卷积提取边缘特征, 为通道压缩卷积, 为Sigmoid激活。边界增强后的特征为:

其中, 为可学习的缩放参数,初始化为0.1, 表示逐元素乘法。

全局上下文块通过全局平均池化和最大化两条并行路径提取空间统计信息,生成通道权重对原始特征进行重标定。

其中, 和  分别表示全局平均池化和全局最大池化,输出 。实验观察表明,条纹级次通常呈现空间连贯的变化趋势,全局上下文信息能够有效抑制孤立的错误预测。

相位回归头采用轻量级的两层卷积结构,输出余弦和正弦两个通道,并通过Tanh激活函数降预测值约束在[-1,1]区间。条纹级次预测头采用ASPP结构实现多尺度特征聚合,包含五个并行分支:逐点卷积分支捕获局部细节,三个不同扩张率的空洞卷积分支捕获不同感受野的上下文信息,全局池化分支提供全局统计特征。空洞卷积在不引入额外参数的前提下有效扩大了感受野,使网络能够同时兼顾局部条纹细节与全局周期性结构。

在初始化策略上,ASPP采用分层权重缩放方案,对多尺度分支、投影层与分类层分别赋予递减的缩放系数。这一设计使得训练初期的输出幅度较小,一方面抑制了极端logits引发的梯度爆炸风险,另一方面使各类别的初始预测概率趋于均匀分布,有助于训练过程的稳定收敛。

3.3 损失函数与训练策略

损失函数的合理设计对多任务网络的训练效果具有关键影响,核心挑战在于如何协调回归与分类任务的学习进度,以及如何缓解类别不平衡带来的优化偏差。DT-SDUNet的输出包含余弦分量C、正弦分量S和条纹阶次k三个物理量,其性质存在本质差异,因而采用不同的损失函数分别监督。C和S的取值连续,范围为[-1,1],采用均方误差损失(MSE)进行监督:

其中  为真实值, 为预测值, 为有效像素数量。余弦和正弦分支的损失分别定义为:

条纹级次k为离散整数,属于分类任务,且存在明显的类别不平衡:主流级次占据超过  的像素,而边缘级次的样本量极少。为此,引入FocalLoss作为该分支的监督损失,通过动态调节各样本的损失权重,抑制易分类样本的梯度贡献,同时强化对难分类样本的关注:

其中  为真实类别的预测概率, 为类别权重, 为聚焦参数。

除三个分支的基础损失外,本文引入了绝对相位一致性损失作为辅助监督。通过预测的C和S计算包裹相位,利用阶次分支输出的概率分布计算软标签阶次:

其中  为第i类的预测概率。采用软标签而非硬标签,能提供平滑的梯度信号。将包裹相位和软标签阶次组合得预测的绝对相位,一致性损失定义为:

总损失函数为:

3.4 实验与结果分析

3.4.1 评价指标

DT-SDUNet的三个输出分支分别预测余弦分量、正弦分量和条纹阶次,这些中间物理量的预测精度直接决定了后续绝对相位计算的准确性。对于余弦与正弦分量,本文采用平均绝对误差(MAE)作为主要评价指标。给定预测值  与真值 ,其MAE定义为:

其中  为有效像素区域,排除了阴影、高光饱和等无效测量点, 为有效像素总数。相比均方根误差(RMSE),MAE对异常值的敏感性较低,能更稳定地反映算法在复杂纹理与光照条件下的整体性能。

对于条纹阶次  的预测,本文将其建模为像素级多分类任务。实验数据集中级次的物理范围对应64个离散类别。考虑到评价需同时兼顾分类正确性与数值偏差程度,因此采用像素级分类准确率与MAE双重指标。分类准确率定义为:

其中  为指示函数,该指标反映了模型对阶次的绝对判别能力。

网络输出的余弦、正弦和阶次并非测量系统的最终目标,其价值在于通过物理计算链重建包裹相位与绝对相位。包裹相位、绝对相位的MAE直接反映了DT-SDUNet在相位解包裹任务中的最终性能:

3.4.2 消融实验

为量化各设计模块对整体性能的贡献,本节设计了三组渐进式消融实验,通过逐步引入关键模块,观察网络性能的阶段性变化。

实验以对称双塔结构作为基线模型(Baseline)。该模型保留了双编码器—双解码器的基本框架,但各模块均采用统一的标准设计:编码器以深度可分离卷积为基本单元,不引入任何注意力机制;瓶颈层通过简单的通道拼接实现特征融合;解码器采用相同的上采样策略;预测头均以单层卷积直接输出。该对称基线仅保留双分支架构本身的特征解耦能力,为后续实验提供性能参照。

在此基础上,消融实验1(Baseline+A)在编码器层面引入异构设计。相位编码器部署频率-空间细节模块(FSDM)与通道注意力(ECA),通过多尺度空洞卷积同时捕获相位场的低频连续分量与高频跳变细节;条纹级次编码器引入大核条带注意力模块(LKSA),建立长程空间依赖,显式建模条纹的周期性结构。消融实验2(Baseline+B)在保留编码器异构设计的基础上,将瓶颈层升级为自适应融合模块(Fusion Bottleneck),通过可学习的缩放参数动态平衡双分支的特征权重。完整的DT-SDUNet模型进一步引入异构解码器与预测头设计:相位解码器采用轻量化结构以保持相位场的连续性,条纹级次解码器加入边界注意力与全局上下文建模,级次预测头采用ASPP结构聚合多尺度上下文信息。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图18

表3.2给出了消融实验的定量结果。基线模型的阶次准确率为 ,绝对相位误差为0.0231。引入异构编码器后(Baseline+A),FSDM和LKSA模块分别作用于相位和阶次预测,阶次误差降至0.298,准确率提升至 。在此基础上加入自适应融合模块(Baseline+B),双分支特征的互补整合使阶次误差进一步降至0.238,准确率达到  完整的DT-SDUNet模型最终实现  的准确率,同时阶次误差为0.188,相较基线提升 ,绝对相位误差下降 。

为验证模块的重建性能,从测试集中随机抽取带有条纹图案的图像作为测试样本,图3.6分别展现了该样本的重建效果。图中第一列为基线模型的预测结果,最后一列为Ground Truth,第二至四列依次对应引入各模块后的重建效果。

图3.7在图3.6的基础上进一步给出了各消融阶段的包裹相位与绝对相位对比结果。从图中可以看出,随着模块的逐步引入,绝对相位图中的模糊区域逐渐减少,边缘细节趋于清晰。然而,条纹级次预测在边缘区域仍存在一定误差,导致绝对相位中出现局部  跳变,最终的绝对相位图在这些区域仍存在不均匀误差,有待进一步改善。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图19
结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图20

3.4.3 对比实验

为验证深度学习方法相对传统算法的优势,本节选取2.3节介绍的三种传统相位解包裹方法作为对比基线:质量图引导法、最小二乘法和多频外差法。同时,为体现本文方法在深度学习解包裹方法中的先进性,还选取了三种近年来提出的基于深度学习的相位解包裹方法进行对比:TransUNet、hNet和VURNet。TransUNet采用Transformer编码器结合U-Net解码器的混合架构,通过自注意力机制捕获全局依赖关系;hNet通过分层特征融合增强多尺度表示能力;VURNet则专门针对相位解包裹任务设计了变分正则化损失函数。

表3.3展示了DT-SDUNet与六种对比方法在测试集上的整体性能对比。从绝对相位的平均绝对误差(MAE)来看,DT-SDUNet达到了  的精度。质量图引导法、最小二乘法和多频外差法的MAE分别为 、 和 ,DT-SDUNet的误差约为传统方法的1/2至1/3,体现了深度学习方法的显著优势。

在深度学习对比方法中,DT-SDUNet同样取得最优结果,这主要得益于双编码器的异构设计及针对性特征增强模块(FSDM与LKSA)的引入。TransUNet虽具备Transformer的全局建模能力,但其编码器对局部细节的捕获能力相对不足,在相位跳变边界处的预测精度较低。hNet的分层特征融合策略在一定程度上改善了多尺度表示,但缺乏对相位回归与级次分类两类任务差异的针对性设计。VURNet的变分正则化损失在平滑区域表现较好,但在复杂几何表面上容易出现过度平滑现象。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图21

图3.8展示了七种方法在同一测试样本上的相位解包裹结果对比。在相位跳变边界与高曲率区域,各方法的差异较为显著。传统方法中,质量图引导法在低质量区域的展开路径出现不连续,导致局部  跳变错误,在图中表现为边缘处明显的颜色突变;最小二乘法受全局平滑约束影响,边缘细节过度模糊;多频外差法则在凸起区域产生了条带状伪影。深度学习方法中,TransUNet在边缘区域存在明显模糊;hNet对高频细节的恢复能力不足;VURNet在复杂几何表面的边缘锐利度有所欠缺。相比之下,DT-SDUNet在整体平滑性与边缘锐利性之间取得了较好的平衡,样本边缘处的相位过渡更为自然,凸起区域的相位分布与真值最为接近。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图22

综合上述对比实验结果,深度学习方法相较于传统算法的优势主要体现在以下几个方面:DT-SDUNet仅需单帧包裹相位即可完成解包裹,无需依赖路径追踪或空间连续性假设,也避免了多频采集的额外成本;经大规模数据训练所获得的鲁棒性,使其在噪声干扰、低调制度等退化条件下仍能保持较高的预测精度;与其他深度学习对比方法相比,DT-SDUNet通过双编码器异构设计与针对性特征增强模块的协同作用,在保持全局相位一致性的同时实现了更精细的局部细节恢复。上述实验结果验证了DT-SDUNet在单帧包裹相位解包裹任务中的有效性。

3.5 本章小结

本章围绕基于DT-SDUNet的结构光相位解包裹方法展开研究。首先介绍了涵盖2100组真实场景数据的SL3D-BF数据集,并设计了针对性的数据预处理与增强策略,在保证数据质量的同时充分考虑相位信息的物理约束特性。

在网络架构设计方面,针对相位恢复与条纹级次识别在特征表达需求上的本质差异,提出了双分支解耦的U-Net架构(DT-SDUNet)。相位编码器通过频率-空间细节模块(FSDM)捕获多尺度相位变化特性,条纹级次编码器借助大核条带注意力模块(LKSA)建立长程空间依赖,双分支特征经瓶颈层自适应融合后由异构解码器完成像素级预测输出。该设计使两类任务能够在各自适配的特征空间中独立优化,同时在深层语义层面保持协同互补。消融实验表明,完整模型相较基线在级次预测准确率上提升 ,绝对相位误差降低 。对比实验进一步验证了本文方法在单帧相位解包裹任务中的竞争优势,所提方案能够有效应对复杂几何表面,为结构光三维测量提供了鲁棒且高精度的相位解包裹解决方案。

4 基于U-PhaseNet的端到端相位解包裹方法研究

4.1 U-Net网络结构

U-Net由Ronneberger等人于2015年提出,最初面向生物医学图像分割任务设计。网络整体呈对称的编码器-解码器结构,并通过跳跃连接将编码器各阶段的特征图直接拼接至解码器对应层,从而在上采样过程中补充被压缩的空间细节信息。这一设计使网络在标注数据有限的条件下仍能获得较好的像素级预测性能,此后被广泛迁移至语义分割等领域中。

U-Net编码器部分交替堆叠卷积层与池化层:卷积层负责特征的非线性变换,池化层在缩减空间分辨率的同时逐步扩大通道数。浅层特征保留了较多的边缘与纹理细节,深层特征则偏向于语义与结构层面的抽象表示。解码器通过上采样逐步还原特征图尺寸,结合跳跃连接引入的低层细节特征,经卷积细化后由  卷积映射至目标输出通道数,最终完成与输入同分辨率的像素级预测。

跳跃连接是U-Net区别于传统编码器—解码器架构的核心设计。常规编码器在逐层下采样过程中不可避免地损失空间细节信息,导致解码器难以精确恢复目标边界。U-Net通过在编码器与解码器的对应层之间建立直接连接,将编码器的高分辨率特征图沿通道维度拼接至解码器对应层,解码器第i层的特征融合过程可表示为:

其中  表示上采样操作, 表示在通道维度的拼接。通过这一机制,编码器各阶段保留的高分辨率浅层特征得以直接参与解码重建,有效补偿了下采样造成的细节损失。

从多尺度特征融合的角度来看,浅层特征空间分辨率高但语义表达能力有限,深层特征语义丰富但空间精度不足。跳跃连接使两类特征在不同尺度上实现互补,在保持空间定位精度的同时增强了语义一致性。

4.2 U-PhaseNet网络结构与关键模块

在上述基础架构之上,本文设计了面向相位解包裹任务的U-PhaseNet网络,以端到端方式直接从单幅条纹投影图像预测连续的绝对相位图,结构如图4.1。相较于传统流程,该网络省去了显式的包裹相位计算与条纹级次判断步骤,通过深度卷积网络的层级特征提取与融合能力,直接建立从光强调制信息到绝对相位的非线性映射。

然而,标准U-Net的感受野主要依赖卷积层的逐层堆叠扩大,实际有效感受野往往小于理论值。对于相位解包裹任务而言,绝对相位具有空间连续性约束与全局一致性特征,单纯依赖局部卷积难以充分建模复杂的相位分布,尤其是在跨越多个条纹周期的大范围结构处。针对上述局限,本文在网络的关键位置引入瓶颈特征增强模块与改进型注意力门控机制,分别从全局语义强化与跳跃连接特征筛选两个层面对基础U-Net架构加以改进。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图23

4.2.1 瓶颈特征增强模块

编码器完成逐层下采样后,所获得的高层特征具有较强的语义表达能力,但空间分辨率已大幅降低,局部结构信息在多次卷积与池化操作的累积作用下受到一定程度的压缩与弱化。若直接将该阶段特征送入解码器进行上采样重建,网络对细微结构变化的响应往往不够充分,影响最终相位重建的精度。为此,本文在编码器与解码器之间引入瓶颈特征增强模块(Bottleneck Feature Enhancement Module, BFEM),在保持语义稳定性的前提下对高层特征进行结构补偿与表达强化。

设编码器输出特征为 。首先通过  卷积对通道维度进行压缩,实现特征重组与参数控制:

其中  表示逐点卷积核。为捕获瓶颈层特征的多尺度信息,模块设计了两条差异化的并行特征提取分支,分别从局部细节与全局上下文两个维度建模,实现互补融合。其中一条分支采用标准  卷积,用于保留常规局部邻域的建模能力:

另一条分支采用深度可分离卷积形式,通过depthwise卷积强化通道独立的空间响应,再通过逐点卷积完成通道间信息融合:

与单一卷积形式相比,这种结构组合在计算量可控的前提下引入差异化空间响应模式,使特征对不同结构形态具有更灵活的表达能力。两分支输出进行逐元素叠加:

在此基础上,为抑制冗余通道响应并强化有效特征,引入通道重标定机制。首先通过全局平均池化提取整体统计信息:

随后利用两层逐点卷积构建非线性映射函数:

其中  为ReLU激活函数, 为Sigmoid函数。所得权重向量s对融合特征进行通道维度的自适应调节:

该过程使网络能够依据全局语义信息动态调整各通道贡献度,从而提高高层结构表达的一致性与判别能力。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图24

最后,通过  卷积恢复原始通道维度,并与输入特征构成残差连接:

残差连接保证了原始语义信息的稳定传递,避免增强操作对已有特征表达产生过度扰动。由于BFEM位于网络瓶颈层,其作用并非重建底层纹理细节,而是在全局语义框架下对高层结构响应进行适度强化,为解码阶段的特征恢复提供更加平衡稳定的输入。

4.2.2 多尺度空洞卷积注意力门控机制

跳跃连接在将编码器高分辨率特征传递至解码器的同时,也不可避免地引入了冗余的背景响应。若不加筛选地直接融合,这些噪声特征可能干扰解码阶段的重建过程。为此,本文引入注意力门控机制对跳跃连接特征进行自适应调节,抑制无关响应、强化任务相关的结构信息。

设解码器第1层的上采样特征为门控信号 ,编码器对应层的跳跃连接特征为 ,注意力门控的目标是生成空间注意力图 ,用于加权跳跃连接特征:

其中  表示逐元素相乘,通过广播机制作用于所有通道。

标准注意力门控采用固定感受野的卷积对门控信号与跳跃特征进行变换,这在一定程度上限制了模型对多尺度相位结构的建模能力。为此,本文设计了多尺度空洞卷积注意力门控模块(Multi-Scale Dilated GAG),通过引入不同空洞率的并行卷积分支,在不增加参数量的前提下扩展感受野,同时保留特征的空间细节。具体而言,门控信号和跳跃连接特征分别输入三个空洞率为  的卷积分支:

其中  表示空洞率为  的  分组卷积,,BN表示批归一化。为保持特征图尺寸不变,空洞卷积的填充大小设置为 ,其中  为卷积核尺寸。三个分支的输出在通道维度拼接,得到融合的多尺度特征:

随后通过逐元素相加和非线性激活进行特征交互:

最后,融合特征经过  卷积和Sigmoid激活生成注意力图:

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图25

这种设计使得注意力机制能够同时感知 、 和  三种有效感受野的上下文信息。在相位解包裹任务中,小感受野关注条纹的局部调制细节,中等感受野捕获相位的连续性约束,大感受野建模场景的全局几何结构。三者的协同作用显著提升了模型对复杂相位场的表达能力,特别是在处理相位跳变、遮挡边界和噪声干扰等困难情况时表现出更强的鲁棒性。

4.3 损失函数与训练策略

端到端相位解包裹的监督学习核心在于:训练信号应当同时反映“数值误差”与“结构一致性”,并且必须避免阴影/遮挡区域对参数更新产生误导。为此,本文引入掩膜约束的回归损失。数据集中阴影掩膜以二值形式给出,本文将掩膜值大于0.5的像素定义为有效区域,仅在有效区域内计算损失并进行归一化,从而使损失值不随有效像素数量变化而产生尺度漂移。

针对条纹图到高度场的回归任务,本文设计了一个多项式复合损失函数,并采用自适应学习率调整策略来优化模型性能。在基本误差项上,本文以  损失为主,并提供可选的MSE替换。相比MSE, 对异常点更鲁棒,适合条纹图在局部存在强噪声或标注误差时保持训练稳定。为进一步约束预测相位的结构特性,本文引入梯度一致性损失,通过比较预测相位与真实相位在水平与垂直方向的差分响应,促进边缘位置与相位突变处的重建一致性。梯度损失同样在掩膜的有效交集上计算,以避免遮挡边界处无效像素参与差分导致的错误惩罚。最终总损失可表示为

其中  损失用于保证预测值与真实值在数值上的接近程度,其定义为:

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图26

4.4 实验与结果分析

绝对误差(MAE)与均方根误差(RMSE):MAE衡量预测相位与真实相位之间的整体偏差水平,RMSE对局部跳变与异常点更为敏感,二者协同使用可较为全面地评估模型对复杂相位分布的拟合能力与鲁棒性。

本章实验所用数据集与第三章相同,按8:1:1的比例划分为训练集、验证集与测试集。数据集涵盖条纹密集区域、相位突变边界、局部遮挡等典型复杂场景,能够较为全面地检验模型在不同难度条件下的泛化性能。所有模型均基于PyTorch框架实现,训练采用AdamW优化器,同时引入早停策略以防止过拟合。

4.4.1 消融实验

消融实验的核心目的是量化分析本文所提出的两个关键改进模块:瓶颈特征增强模块(Bottleneck Feature Enhancement Module, BFEM)与多尺度空洞卷积注意力门控(Multi-Scale Dilated GAG)对网络性能的具体贡献,明确各模块的作用与协同效果。实验以基础U-Net网络为基准框架,通过逐步引入两个改进模块,构建四种不同的网络结构进行对比测试。四种结构分别为:基线模型U-Net、U-Net+A(仅引入BFEM模块)、U-Net+B(仅引入多尺度空洞卷积注意力门控)、U-Net+A+B(同时引入两个模块,即本文所提出的U-PhaseNet)。消融实验的具体结果如表4.1所示。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图27

从表4.1可以看出,基础U-Net在相位解包裹任务中已具备一定的预测能力,但在相位跳变区域与条纹密集区域仍存在明显的误差积累。引入BFEM模块后,MAE与RMSE分别下降  与 ,表明在瓶颈层对高层语义特征进行针对性增强,能够有效提升网络对相位连续结构的表达能力,为解码阶段提供更稳定的特征输入。

单独引入多尺度空洞卷积注意力门控机制,MAE和RMSE分别下降  和 。该机制通过三种不同空洞率的卷积分支,使模型同时获得 、 和  三种有效感受野,能够对跳跃连接特征进行自适应筛选,在抑制冗余信息的同时增强对关键相位结构的响应能力。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图28

当两个模块同时引入时,U-PhaseNet达到最优性能,MAE与RMSE相比基础U-Net分别下降  与 ,优于任一模块单独引入的结果。这表明两个模块在功能上具有互补性:BFEM侧重于改善瓶颈层的高层语义特征表达,多尺度注意力门控则优化跳跃连接中低层细节特征的传递与筛选,二者共同提升了相位预测的精度与稳定性。

从图4.4的可视化对比来看,U-PhaseNet在相位突变边界与遮挡区域的预测结果更为平滑,相位连续性明显改善。在复杂几何边界及相位梯度变化较大的区域,预测结果与真值的吻合程度显著优于基础U-Net,进一步验证了组合结构在复杂场景下的鲁棒性。

4.4.2 对比实验

为进一步验证U-PhaseNet的性能,本节将其与多种主流深度学习方法进行对比,包括TransUNet、Attention UNet、ResUNet、VURNet与hNet等代表性网络。上述方法分别涵盖了基于Transformer的混合架构、注意力增强的U-Net变体、残差学习框架以及多分辨率特征融合网络等不同技术路线,具有较好的代表性。对比结果如表4.2所示。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图29

从表4.2可以看出,U-PhaseNet在MAE与RMSE两项指标上均取得最优结果,相比基础U-Net分别下降  与 。值得关注的是,尽管TransUNet、Attention UNet等方法在医学图像分割等任务中表现出色,但在相位解包裹任务中的性能却不及基础U-Net,误差出现明显增大。这一现象说明相位解包裹任务与传统图像分割在特征表达需求上存在本质差异,针对分割任务设计的模块并不能直接迁移至相位预测场景。ResUNet通过残差学习在一定程度上改善了预测精度,但整体性能仍弱于U-PhaseNet,表明单纯依赖残差连接不足以有效应对相位解包裹中的难点。这表明若未针对相位连续性与周期性等物理特性进行适配设计,盲目引入注意力机制或残差结构不仅难以带来性能提升,甚至可能产生负面影响。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图30

从图4.5的可视化对比来看,基础U-Net在相位梯度较大的区域存在明显的模糊与不连续现象。TransUNet和VURNet的预测结果出现条纹状伪影与色块失真,反映出这两类方法在相位连续性约束建模方面存在较大不足。相比之下,U-PhaseNet的预测结果与真值高度吻合,相位分布平滑连续,在复杂边界及相位快速变化区域能够准确保留细节,未出现明显伪影或相位断裂。

综合来看,U-PhaseNet的性能优势主要源于针对相位解包裹任务特性的适配设计:BFEM通过差异化卷积分支与通道重标定机制强化了瓶颈层的高层语义特征表达,有助于全局相位结构的稳定建模;多尺度空洞卷积注意力门控则通过三种不同感受野的并行分支,实现了局部细节、中等尺度结构与全局上下文信息的整合,从而在多个尺度层面提升了相位预测的准确性与一致性。

4.5 本章小结

本章提出了基于U-PhaseNet的端到端相位解包裹方法。针对标准U-Net在相位重建任务中存在的高层语义表达不足与跳跃连接特征冗余两方面问题,分别设计了瓶颈特征增强模块(BFEM)与多尺度空洞卷积注意力门控机制。前者通过差异化卷积分支与通道重标定在瓶颈层强化全局语义特征表达,后者利用不同空洞率的并行分支实现多尺度上下文感知,对跳跃连接特征进行自适应筛选与抑制。训练策略上采用掩膜约束的复合损失函数,结合  损失与梯度一致性损失,在保证数值精度的同时强化了对相位连续性的结构约束。

消融实验验证了两个模块各自的有效性及其协同互补性。与多种主流深度学习方法的对比实验表明,U-PhaseNet在相位解包裹任务上取得了最优性能,相比基础U-Net在MAE与RMSE上均有显著提升。实验结果表明,面向相位物理特性的针对性模块设计能够有效提升端到端相位重建的精度与鲁棒性,为结构光三维测量提供了一种高效可靠的深度学习解决方案。

5 基于HF-TransNet的结构光三维形貌测量方法研究

5.1 数据集与实验设置

本章实验采用公开数据集SIDO 3D进行模型训练与性能评估。该数据集共包含1523组结构光条纹图像,每幅图像分辨率为  像素,按8:1:1的比例随机划分为训练集、验证集与测试集。图5.1展示了部分数据样本,其中第一行为输入条纹图像,第二行为对应的三维测量高度真值。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图31

数据集真值通过多频相移条纹投影法获取,对四个不同频率分别采用四步相移算法进行相位解包裹,保证了深度信息的测量精度。数据采集系统采用RVBUST RVC-X mini 3D相机,由双目摄像头与结构光投影仪构成三角测量配置。实验样本包含数十个小型石膏雕塑,涵盖不同几何复杂度与表面纹理类型。系统工作距离设定为约 ,以兼顾测量精度与视野范围。数据增强中所有增强操作仅施加于输入条纹图,高度图作为监督信号保持不变,确保学习目标始终对应同一物理高度场。

实验平台为配备Intel Core i9-9900K处理器、32 GB内存与NVIDIA GeForce RTX 2080 Ti显卡的计算平台,采用阶梯衰减策略,每20个epoch按系数0.8进行衰减,优化器选用Adam算法。

5.2 HF-TransNet网络结构

为了从单帧条纹图中实现精确的三维高度测量,本章提出了HF-TransNet,其结构如图2所示。HF-TransNet实现了卷积神经网络和Transformer机制的创新融合,为三维形貌测量提供了新的解决方案。该网络采用基于U-Net对称编码器-解码器架构,编码器部分利用增强残差(ER)块与下采样模块的组合来提取分层空间特征,并在网络瓶颈处集成Partial Transformer Unit,以捕获长距离依赖关系和全局上下文信息。其中,ER Block通过集成CBAM和DSFF module,显著增强了对条纹图案特征的提取能力。解码器路径采用转置卷积和上采样模块重建空间分辨率,同时利用  卷积实现跨跳跃连接的通道特征对齐。这种混合设计有效平衡了CNN的局部特征提取优势与Transformer的全局注意力机制,在保持计算效率的同时实现了精确的高度测量。

5.2.1 编码器设计

编码器的主要任务是从输入的单帧条纹图像中逐级提取多尺度特征表示,为后续的深度重建提供丰富的语义信息。HF-TransUNet的编码器采用渐进式下采样策略,通过四级编码块将特征通道从64逐步扩展至1024,空间分辨率相应降低至原始输入的1/16。每一级编码块由Enhanced Residual Block (ER Block)和下采样模块组成,前者负责特征提取和增强,后者实现空间降维和通道扩展。

(1)Hierarchical Fusion Block (HF Block)

针对传统UNet特征提取中多尺度融合能力不足和缺乏归一化处理等挑战,本研究设计了HFBlock,通过引入注意力机制和多分支并行结构,构建了分层递进的特征提取架构,同时引入了CBAM注意力架构,如图5.2所示。

HFBlock采用五分支并行架构(Branch 0-Branch 4),同时捕获从浅层细节到深层语义的多层次特征表示。Branch 0采用DSFF模块结合批量归一化和CBAM注意力机制,Branch 1通过  卷积、批量归一化和CBAM注意力机制实现特征提取,且两者聚焦于浅层特征学习。Branch 2-Branch 4通过逐层加深的卷积块设计实现深层语义特征学习,分别包含两层、三层和四层卷积块,每层均采用  卷积、批量归一化和LeakyReLU激活函数组合。

在特征处理阶段,采用通道分割策略(N/4)将输入特征均匀分配到各分支,降低计算负担。最终通过逐元素相加的融合方式,保持残差学习优势的同时实现多尺度、多层次特征的有机整合。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图32

2 Dynamic shift feature fusion module (DSFF module)

在HFBlock的Branch0中,本文提出的DSFF(Dynamic Shift Feature Fusion)模块采用多尺度并行处理机制,结构如图5.3所示。该模块主要由Conv、ShiftConv和Information Fusion三部分组成。

ShiftConv作为该模块的核心创新,通过将输入通道按1:1:1:1:1比例分为五组,分别执行左移、右移、上移、下移和恒等变换。这种设计的关键优势在于:无需增加任何可训练参数,仅通过空间位置移位操作即可有效捕获四个主要方向的空间依赖关系,实现轻量级且高效的空间特征建模。相比传统卷积操作,ShiftConv能够以更低的计算成本获得更广泛的空间感受野,特别适合处理具有方向性特征的图像内容。

DSFF模块采用不同尺度分支(、、)同时处理输入特征,其中scale  分支保持传统通道变换能力,scale  分支则利用ShiftConv进行空间特征提取。多尺度并行处理机制使得模块能够同时捕获局部细节和全局上下文信息,而ShiftConv的引入进一步增强了各尺度分支的空间建模能力。最后通过特征融合层对多尺度特征进行整合,消除信息冗余,提升特征表示质量。

这种设计特别适合部署在多分支网络的浅层,为复杂重建任务提供更丰富的多尺度底层特征表示,在保持计算效率的同时显著提升了网络的特征表达能力。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图33

DSFF模块将输入特征按不同尺度分支处理,其中scale  分支采用ShiftConv操作,通过对输入通道进行左、右、上、下和恒等五种空间位移,实现轻量级的方向性特征建模。各分支特征经拼接后通过卷积融合。

5.2.2 瓶颈层设计

与相位回归类似,高度图同样属于全局连续场,其预测误差除局部细节偏差外,更常表现为跨区域的低频漂移与全局一致性不足,尤其在弱纹理、遮挡边缘或多目标共存场景中更为明显。仅依赖卷积的局部感受野难以稳定捕获长距离依赖关系,从而限制了端到端深度回归的整体一致性。基于此,本章在保持卷积骨干不变的前提下,于瓶颈层引入PTU(Partial Transformer Unit)模块,利用自注意力机制显式建立跨空间位置的特征关联,以补足卷积网络对全局上下文建模能力的不足。

PTU采用并行的卷积分支与Transformer分支:卷积分支保留局部纹理与边缘细节的高效建模能力,Transformer分支由多头自注意力与门控非线性单元组成,用于增强全局依赖建模与特征选择能力。为控制计算量,本章采用部分通道参与Transformer计算的策略,即仅将比例为tcr的特征通道送入自注意力分支,其余通道仍由卷积分支处理,最终在通道维度进行融合并通过卷积映射回统一特征空间。通过这种方式,网络能够在计算开销可控的前提下引入全局一致性信息,从而更适配端到端深度回归任务对跨区域一致性的要求。

(1)PTU模块

在结构光三维形貌测量领域,卷积神经网络和Transformer架构分别在局部特征提取和全局依赖关系建模方面表现出显著的优势。然而,现有研究多采用单一架构设计,导致模型无法有效整合局部细粒度特征与全局语义信息。具体而言,传统CNN架构虽能高效提取局部空间特征并保持计算效率,但其感受野的局限性使其难以捕获长距离空间依赖关系;而Transformer架构在捕获全局特征方面具有显著优势,但在处理高分辨率特征图时会增加计算负担,同时对局部结构细节的感知能力相对不足。

为有效解决上述架构局限性问题,本研究引入了一种创新的Partial Transformer Unit(PTU),该单元通过精心设计的混合架构充分发挥CNN与Transformer的互补优势,结构如图5.4所示。PTU采用创新性的双分支并行处理机制,实现了局部特征与全局特征的高效融合与协同优化。其中,CRFBlock(CNN分支)专门负责局部特征提取任务,采用轻量级卷积操作精确捕获空间邻域相关性,为模型提供丰富的局部纹理信息和边缘结构细节。与此同时,MHSA-CGLU Block(Transformer分支)利用多头自注意力机制(Multi-Head Self-Attention)建立长距离特征依赖关系,实现全局语义信息的有效建模。

MHSA-CGLU Block采用了部分通道处理策略,仅对特征图的部分通道执行Transformer运算,这一设计降低了模型的计算复杂度。通过这种混合架构设计,PTU打破了单一网络架构在特征表示范围上的固有限制,使模型能够同时感知局部细节信息和全局语义上下文,从而提升模型在复杂三维形貌测量场景下的特征表达能力和重建精度。

在输入端,特征  被分为两部分,分别输入到CRFBlock和MHSA-CGLU Block分支中,表达式如下所示:

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图34

CRF Block分支采用串联卷积结构来减少计算复杂度并增强特征表达,其公式可以表示为:

其中,Bottleneck包含三个卷积层:一个  卷积用于降维,一个  卷积用于特征提取,以及一个  卷积用于升维。

MHSA-CGLU Block分支使用MHSA和CGLU模块进行特征处理:

在每个分支处理完后,将两个分支的输出特征进行拼接,然后通过一个卷积层进行融合:

PTB模块的引入旨在整合CNN与Transformer架构的优势,创新性地解决了局部与全局特征融合的局限问题,平衡了计算效率与模型性能。

(2)多头自注意力机制

多头自注意力机制(MHSA)是Transformer架构中的核心组件,旨在通过多个注意力头同时捕捉不同位置之间的依赖关系结构如图5.5所示。每个注意力头独立地计算注意力分数,并对输入特征进行加权求和,从而生成更丰富的特征表示。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图35

MHSA模块通过多头自注意力机制捕获长距离依赖关系。输入特征经过线性变换生成查询(Q)、键(K)和值(V),分割为h个注意力头分别独立计算注意力权重,各头输出经拼接后再经线性变换得到最终输出。

CGLU(Convolutional Gated Linear Unit)是一种融合卷积操作与门控机制的网络模块,主要由线性变换、深度卷积、激活函数与逐元素相乘等操作构成。该模块利用深度卷积提取的局部邻域特征作为门控信号,对通道响应进行自适应调制,从而在引入局部结构感知的同时实现轻量化的门控通道注意力,有效增强模型的特征选择能力。

5.3 实验与结果分析

在实验评估阶段,本章节采用均方根误差(RMSE)、结构相似性指数(SSIM)和平均绝对误差(MAE)等关键指标对模型的训练效果和三维形貌测量性能进行系统评估,其计算公式如下。此外,本章还引入模型规模和推理速度等指标来评估模型的计算效率。

在公式(5.7)中, 是样本数量, 表示预测值, 表示真实值。在公式(5.8)中, 为均值, 为方差, 和  为常数。在公式(5.9)中, 是第  个样本的真实值, 是第  个样本的预测值。

5.3.1 消融实验

为了验证HF-TransNet的性能提升,本章设置三组消融实验以充分验证不同模块对3D物体测量的影响。实验引入模块如下:PTUnit(模块A)、HFBlock不含CBAM(模块B)及HFBlock包含CBAM(模块C)。为定量评估三个模块在高度重建和预测方面的性能差异,本研究采用均方根误差(RMSE)、结构相似性指数(SSIM)和平均绝对误差(MAE)作为评价指标进行系统分析,具体结果见表5.1。这三项指标从不同维度反映了预测3D高度图的精度和结构保真度,为模型性能提供了全面的定量评估。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图36

由表5.1可见,嵌入模块A与模块B后,SSIM与RMSE均得到一定的改进;尽管模型参数量有所增加,但高度图的预测精度与视觉质量均显著改善。在此基础上引入模块C,SSIM与RMSE分别达到0.9991与0.0019,相较于基线模型SSIM提升0.9%,RMSE降低42.4%,性能达到最优。

为验证三个模块的性能,本章从测试集中随机抽取三幅带有条纹图案的图像作为测试样本,如图5.6所示,分别展现了不同动物雕塑的三维测量效果。图中第一列为输入的条纹图案及其对应的Ground Truth,第二至四列依次展示了引入三个模块的三维测量结果。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图37

从中可以看出,仅采用模块A时,网络能够恢复目标的整体几何轮廓,但对高频细节保持不变,导致局部形貌存在信息缺失的现象。引入模块B后,通过增强浅层特征的表达能力,细节保真度得以提升。然而,该配置在抑制噪声的同时引入了表面粗糙度上升的问题,且重建高度场与GroundTruth之间仍存在不可忽略的系统性偏差。进一步融合模块C后,模型在细粒度纹理与全局高度特征之间实现了更优的协同表征,有效恢复了细微结构,最终生成的三维形貌在数值误差与视觉感知层面均最接近真实值。

5.3.2 对比实验

本节通过系统实验评估所提出方法的鲁棒性。将HF-TransNet与7种主流算法在多个维度上进行比较,结果列于表5.2。在此基础上,以GroundTruth为基准,对各模型测量结果的量化指标进行了全面分析。

如表5.2所示,ResUNet参数量最高,UNet最低,因此后者推理速度最快。尽管UNet结构轻量,其SSIM与RMSE均非最优。Attention-UNet、UNet++、UHRNet与ResUNet虽在两项指标上优于UNet,但仍逊于本文方法。受更深的网络层级所限,本方法单帧推理时间略长于UNet、VURNet与hNet,却在精度上实现显著提升。实验结果显示,本方法的RMSE为0.0009,相较Attention-UNet、UNet++、UHRNet和ResUNet分别降低  与 。借助PTUnit与DSFF模块对多尺度特征的有效聚合,本方法SSIM进一步提升至0.9981。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图38

为评估不同模型在三维形貌测量任务中的性能表现,本章进行了多组对比实验,结果如图5.7所示。GroundTruth为真实原始图像,作为性能评估的基准,其余分别为HF-TransNet、UNet、TransUNet、Unet++以及ResUNet模型的输出图像。从视觉效果层面分析,HF-TransNet所得图像在物体形态、轮廓细节以及纹理一致性等方面,与GroundTruth的匹配度更高。例如,在石膏雕塑的三维形貌测量上,HF-TransNet能够精准还原其造型特征与表面纹理,视觉效果更为自然流畅。UNet测量图像虽能大致呈现目标物体形态,但在细节刻画上稍显粗糙,部分边缘过渡不够平滑。TransUNet与U-Net++的测量结果在整体结构上与真实图像较为接近,但在局部纹理的精细度表现上与本文提出的HF-TransNet存在一定差距,且其测量结果中引入了更多噪声干扰。而ResUnet的测量效果则明显欠佳,不仅目标物体的形态出现了较为严重的失真,背景纹理也产生了不规则的畸变,与真实图像的差异较为显著。综合来看,HF-TransNet在该测量任务中展现出更优的性能,能够更精准地还原图像的细节与整体特征,相较于其他对比模型具有明显优势。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图39

5.4 本章小结

本章提出一种基于HF-TransNet的结构光3D形状测量方法,以准确恢复被测对象的3D形貌。在HF-TransNet中,本章提出了PTU模块,充分结合CNN与Transformer的互补优势,实现局部特征与全局特征的高效融合。此外,本章设计了HF Block,通过引入注意力机制和多分支并行结构,构建了分层递进的特征提取架构。在HF Block中,本章提出了DSFF模块,为复杂三维形貌测量任务提供更丰富的多尺度底层特征表示,在保持计算效率的同时显著提升了网络的特征表达。

本章进行了大量对比和可视化实验来评估HF-TransNet模型,结果表明,HF-TransNet的SSIM和RMSE的显著改进,分别为  和0.0009,优于UNet、TransUNet、hNet和ResUNet等模型。本章方法的关键优势在于它能够使用单个条纹图案实现高质量的3D测量,使其在各种工业场景中具备实时和动态测量的应用潜力。

6 结论与展望

6.1 结论

随着智能制造与工业检测技术的持续发展,高精度三维测量已成为工业质检、逆向工程与机器人视觉等领域的核心需求。传统结构光三维测量方法精度较高,但在复杂表面、动态场景及噪声干扰等条件下,相位解包裹环节往往成为制约测量精度与效率的主要瓶颈。本文针对上述挑战,将深度学习技术引入结构光相位解包裹问题,分别从双任务分支网络、端到端网络与混合架构网络三个角度探讨基于神经网络的相位恢复方法,通过针对性的网络设计与模块优化,实现了高精度的相位解包裹。本研究的主要工作与成果如下:

(1)系统梳理了结构光三维测量的理论基础,深入分析了包裹相位、绝对相位与条纹级次之间的物理关系,并从时域与空域两个维度对传统相位解包裹方法的基本原理与局限性进行了系统归纳。在此基础上,针对深度学习模型的训练需求,设计了兼顾几何变换与光度变换的数据预处理与增强策略,在保障数据质量的同时充分考虑了相位信息的物理约束特性,为后续网络的训练与评估奠定了数据基础。

(2)针对相位恢复与条纹级次识别在特征表达需求上的本质差异,提出了基于DT-SDUNet的双分支解耦网络架构。通过构建异构双编码器,相位分支采用频率-空间细节模块(FSDM)捕获多尺度相位变化特性,条纹级次分支引入大核条带注意力模块(LKSA)建立长程空间依赖,使两类任务能够在各自适配的特征空间中独立优化。自适应融合瓶颈层实现深层语义的协同互补,异构解码器完成像素级预测输出。实验结果表明,该方法相比基线模型在级次预测准确率上提升 ,绝对相位误差降低 ,在复杂几何表面中表现出较强的鲁棒性。

(3)考虑到显式相位计算与级次判断引入误差传递的问题,提出了基于U-PhaseNet的端到端相位解包裹方法。针对标准U-Net在相位重建任务中高层语义表达不足与跳跃连接特征冗余两方面局限,设计了瓶颈特征增强模块(BFEM)与多尺度空洞卷积注意力门控机制。前者通过差异化卷积分支与通道重标定强化全局语义表达,后者利用多空洞率并行分支实现多尺度上下文感知与特征自适应筛选。训练采用掩膜约束的复合损失函数,并结合梯度一致性约束增强相位场的结构连续性。实验表明,该方法相比基础U-Net,MAE和RMSE分别降低  和 ,在相位跳变边界与遮挡区域的预测精度明显提升。

(4)为充分融合卷积神经网络的局部建模能力与Transformer的全局依赖捕获优势,提出了基于HF-TransNet的混合架构三维形貌测量方法。通过设计PTU模块实现CNN与Transformer特征的高效融合,构建分层递进的HFBlock特征提取架构,并引入DSFF模块提供丰富的多尺度底层特征表示。该方法仅需单帧条纹图像即可完成高质量三维形貌测量,SSIM达到 ,RMSE降至0.0009,显著优于现有对比方法,为动态场景下的三维形貌测量提供了一种有效解决方案。

6.2 展望

本文围绕基于深度学习的结构光相位解包裹方法开展了系统研究,在测量精度与鲁棒性方面取得了一定进展,但受研究时间与条件所限,仍存在以下不足,有待后续工作进一步完善:

(1)本文三种方法在静态场景下均表现良好,HF-TransNet已实现单帧条纹图的三维形貌测量,具备一定的动态测量潜力。但现有网络的推理速度尚未针对实时场景进行优化,在高速运动目标的连续帧测量中存在明显延迟。后续可对网络进行轻量化改进,并探索时序特征融合机制,利用相邻帧间的相位连续性约束提升动态场景下的解包裹稳定性。

(2)本文训练数据主要涵盖金属、塑料、石膏等常规材质,网络对半透明材质、强镜面反射及表面污染等极端条件的适应能力仍有待提升。究其原因,现有方法对条纹调制度的隐式建模能力不足,难以在信号退化区域保持可靠的相位预测。未来可考虑在网络输入端引入调制度图作为辅助信息,显式指导网络区分有效与无效测量区域;同时结合主动学习策略,优先筛选难样本进行针对性训练,从而提升模型在复杂表面条件下的泛化能力。

(3)本文从双分支任务设计、端到端相位重建与混合架构三个角度分别提出了独立的解包裹方法,三者在设计思路上具有一定互补性,但目前尚未形成统一框架。DT-SDUNet的双任务分支设计、U-PhaseNet的端到端映射能力与HF-TransNet的全局一局部特征融合机制,理论上可在统一架构下协同发挥作用。后续可探索将上述设计理念加以整合,构建兼顾相位恢复、级次识别与深度回归的多任务联合优化框架,进一步提升系统的整体性能与实用价值。

本文仅做学术分享,如有侵权,请联系删文。

3D视觉工坊中秋国庆双节专属课程福利重磅来袭!为回馈新老学员一路支持,本次活动特推出重磅折扣福利,所有课程统一享8折特惠,其中10余门课程加入知识星球可一次性全部购买学习(限时福利仅需279元)!

中秋国庆双节八折特惠

中秋国庆专属8折优惠结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图40微信扫码领取,限时三天内使用

3D视觉工坊所涉及课程的包括但不限于:工业3D视觉、自动驾驶、SLAM、具身智能、扩散模型、无人机、大模型和3D视觉基础等。

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图41

专属打包福利

上图中的:ROS2、相机标定、线结构光、3D缺陷检测、激光-视觉-IMU-GPS融合SLAM、VINS-Fusion、模型部署、3D目标检测、深度估计、多传感器融合这10门课程,除各自单独购买享8折外,也支持一次性全部购买,限时福利仅需279元,扫描下方二维码加入一次性全部解锁!

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图42
扫码加入3D视觉从入门到精通知识星球

活动咨询

结构光相位解包裹新突破:DT-SDUNet、U-PhaseNet、HF-TransNet三网络协同,绝对相位误差降39.2%,单帧重建SSIM 0.9981图43
▲长按扫码添加小助理,咨询更多

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
more
长鑫宣布,巨额投资
2026年中国康复医疗器械产业链图谱及投资布局分析
24.54亿元投资落地,颀中科技苏州先进封装项目正式启动
蚂蚁集团具身智能布局深化:从硬件投资到“通用大脑”的生态卡位
前投资人入局机器人七年,实现10亿级营收后,他只看三个指标
三星电机,创纪录投资
总投资30亿,安捷利美维广州南沙先进封装基板制造基地项目启动
量子软件公司获中国移动超亿元投资,国产全栈量子软件加速落地丨36氪首发
总投资超61亿,国内新增12英寸集成电路项目
总投资45亿!佰维存储扩产先进封测产能
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号