ECCV 2026 最佳论文提名 | 石溪大学提出Poppy:冻结RGB大模型,偏振引导单目法线估计MAE直降26%
原创 CV君 2026-09-17 23:04 江苏

偏振物理引导单目几何深度修正

在自然界中,蜜蜂与深海甲壳动物能凭借独特的“偏振视觉”,轻松看透水面波光与阴影伪装;而以 MoGe-2、Marigold 为代表的大模型,纵有海量 RGB 数据加持,面对强反光、纯色弱纹理和低反照率暗光表面时,依然如同“雾里看花”,频现几何塌陷与过平滑失真。
如何无需重新训练网络,就能为冻结的视觉大模型装上一双洞悉物理真实的“偏振之眼”?
近日,石溪大学团队在这一方向取得突破性进展,其成果 Poppy(Polarization-based Plug-and-Play Guidance)以完全免训练(Training-free)的测试时引导范式,破解了单目法线估计的物理盲区。
在完全冻结扩散、流匹配和前馈骨干网络的条件下,仅凭测试期单帧偏振观测,Poppy 便实现合成数据平均角误差(MAE)降低 23%–26%、真实场景降低 6%–16%,高精度阈值指标 提升高达 87%,实现真正即插即用的跨越式精度飞跃。
背景与动机:RGB 语义先验与偏振物理规律的互补契机
要理解 Poppy 的设计动机,需要回到偏振光的物理成像机制。

如上图 Fig. 1 所示:
偏振专用模型(a):完全依赖小样本偏振数据从头训练,跨场景泛化能力极其脆弱;
纯 RGB 单目估计器(b):具备通用几何先验,但在光滑弱纹理的兔子模型表面,法线被过度平滑,严重偏离真实表面;
Poppy 框架(c):将两者优势互补,在测试期引入单帧偏振观测,引导冻结的 RGB 骨干网络修正几何偏差。
从物理角度看,自然光照射到物体表面发生反射时,出射光会变成部分线偏振光,其偏振状态可通过斯托克斯向量(Stokes Vector) 紧凑描述。其中 为总光强(即标准灰度或 RGB 观测), 与 则刻画了正交与对角方向上的偏振强度差异。由此可导出表征偏振特征的两个核心物理量:线偏振度(Degree of Linear Polarization, DoLP, )与线偏振角(Angle of Linear Polarization, AoLP, ):
根据经典菲涅尔反射定律(Fresnel Equations),出射光的 DoLP 直接受表面法线与视线夹角(俯仰角 )和介质折射率 约束;而 AoLP 则与法线的方位角 直接相关。
但偏振视觉存在两个致命的内在模糊性:
方位角 模糊:AoLP 在旋转 180° 后保持对称,无法单独区分法线的正反朝向;
漫反射与镜面反射 模糊:漫反射成分的偏振角满足 ,而镜面反射由于菲涅尔相变满足 。混合反射下若无法精准解耦辐射分量,法线方向将出现 90° 的正交偏转。
这一物理特性与大规模 RGB 预训练模型构成了互补关系:RGB 骨干网络所蕴含的全局上下文理解能天然化解 方位角模糊;而偏振测量所携带的菲涅尔几何约束,恰好能够填补 RGB 信号在反光、暗光与无纹理表面的物理盲区。
方法详解:全流程即插即用测试时引导架构
Poppy 的核心思想是建立一个物理驱动的测试时优化回路。整个流程输入为偏振相机捕获的 4 个偏振通道测量值 ,输出为高保真的三维表面法线 。

1. 辐射分解与正向可微物理渲染
在物理空间中,物体表面反射的混合光强 可以解耦为漫反射分量 与镜面高光分量 (即 )。

如上图 Fig. 2 所示,Poppy 引入了可学习的像素级镜面反射辐射图 。利用预测法线和菲涅尔方程,系统能够分别导出漫反射偏振度 、镜面反射偏振度 及其对应的偏振角,进而正向渲染出预测的斯托克斯向量:
2. 双层引导参数:全局图像偏移与局部法线偏移
如果仅仅让优化器更新辐射度 ,当骨干网络初始法线出现严重失误时,优化过程极易陷入假性收敛(如下图 Fig. 4(a) 所示),导致 强行过拟合错误的几何。

为了从根源上纠正几何错误并保持骨干网络冻结,Poppy 在网络输入层和输出层外挂了两个像素级可学习偏移量:
输入图像偏移 :输入层微小的像素级扰动在穿透深度神经网络时,会通过全图感受野实现长程传播。Fig. 4(b) 展示了不同骨干网络在选定像素点上的雅可比矩阵(Jacobian)响应幅度,证实了单个像素的输入扰动能对输出法线产生大范围的全局调控效应。因此, 承担着驱动全局宏观几何转向的关键作用。
输出法线偏移 :预训练 RGB 模型受去噪和插值先验影响,易将微结构抹平。直接叠加在输出端的 承担高频几何微调职责,专门补偿细小沟槽、棱纹等局部细节。
3. 先全局后局部的分阶段优化机制
由于输出端的 对损失梯度极度敏感,若从初始阶段就参与更新,会导致局部噪声被放大。因此 Poppy 设计了清晰的调度时序:
阶段一( 步):仅优化镜面辐射 与输入偏移 。让骨干网络在大尺度几何上快速向物理斯托克斯向量靠拢,同时保证 的物理收敛;
阶段二( 步):激活法线偏移 ,三者联合优化至 步。
优化过程的目标函数为加权掩码下的 斯托克斯一致性损失:
其中有效性掩码 严格限定在具有有效信号()、未过曝饱和()以及满足偏振物理极限约束()的像素点上。最终法线通过归一化输出:
实验与结果:多架构即插即用,全面攻坚极端场景
评估覆盖了 7 大公开基准(SfPUEL、NeRSP、NeISF、DeepPol、PISR),包含 18 个合成物体与 14 个经高精度三维扫描的真实物体,全面涵盖了强反光、弱光照、高噪点和无纹理等严苛场景。
测试骨干网络涵盖了目前三类主流范式:扩散生成模型 Marigold、流匹配模型 Lotus-v2 以及前馈视觉 Transformer 模型 MoGe-2。

如上表 Table 1 所示,偏振物理引导带来了显著的指标跨越:
合成数据集:Poppy 让各骨干网络的平均角误差(MAE)降低了 23%–26%。在严苛的高精度容差指标 (角度误差低于 11.25° 的像素占比)上,Marigold 从 0.30 提升至 0.56(相对提升 86.7%),MoGe-2 达到了 0.70 的高水平,RMSE 降幅达 16%–18%。
真实世界数据集:即便面对现实传感器的环境杂散光与校准误差,Poppy 依然稳定将 MAE 降低了 6%–16%, 提升 7%–31%。

在真实极端场景的定性测试中(Fig. 7),无纹理且极低反照率的材质(PISR 场景)、暗光微弱照明(NeRSP 场景)以及强传感器噪声环境(SfPUEL 场景)下,未经引导的骨干模型普遍出现预测法线崩塌或细节抹除。接入 Poppy 之后,各骨干网络的逐场景 MAE 降低了 19%–41%,误差热力图明显转蓝(低误差区大幅扩展)。

在合成复杂模型(Fig. 6)的消融分析中可以清晰观察到“先全局后局部”分阶段优化的必要性:单独依靠输入偏移 能够矫正大体朝向,但类似贝壳棱纹、网格面、龙鳞等细致纹理仍显模糊;而联合激活 后,高频微几何被完整找回。


此外,针对物理反射属性的实验(Fig. 9)表明,强镜面反射下因偏振度显著,引导收益最为丰厚;针对偏振输入噪声的鲁棒性测试(Fig. 8)显示,当人工高斯噪声 持续增大时,模型预测平滑退化收敛至原始无引导状态,未发生噪声发散与误差放大。

在下游应用探索中,将 Poppy 优化后的法线输入基于视点一致性的三维高斯表面重建算法 VCR-GauS 时,重建网格的倒角距离(Chamfer Distance)相较使用原始法线获得了约 6% 的几何精度改善,有效抑制了反光表面的凹陷伪影。
在算力开销方面,实验在单张配备 95.6 GB 显存的 NVIDIA RTX PRO 6000 Blackwell GPU 上执行。768×768 分辨率下完成 100 步优化耗时约 57 秒(MoGe-2)至 173 秒(Lotus-v2)。值得注意的事实是,Poppy 自身引入的外挂可优化参数量极少(显存仅占用 21 MB),主要的显存开销(15–66 GB)来自于反向传播保留的骨干网络中间激活值以及物理斯托克斯损失所需的 fp32 精度切换。
写在最后
Poppy 的核心价值不仅在于攻克了高反光、暗光和弱纹理这三大单目视觉的传统盲区,更在于验证了一种优雅的模型协作范式:在大规模 RGB 基础模型已具备强大语义表征能力的今天,不必为引入新的物理模态而从头收集海量数据并重新训练巨型网络。
通过将严格的物理渲染方程构建为外部可微约束,利用测试时参数微调将先验“拉回”物理一致解,是低成本赋能视觉基础模型应对工业级严苛场景的可行路径。对于工业检测、高保真三维重建与具身机器人感知的从业者而言,这种结合经典光学成像与冻结前沿模型的思路,具有扎实的实用借鉴意义。

论文标题: Poppy: Polarization-based Plug-and-Play Guidance for Enhancing Monocular Normal Estimation
研究机构: 美国石溪大学

