入选CVPR 2026与ICML 2026:从关系不变到旋转不变,重塑视觉水印

· 2026-09-03 18:06 · 7 阅读

原创 让你更懂AI的 2026-09-03 18:06 北京

把水印锚定在不变量上

图片

两项工作沿着同一条研究主线展开:与其让水印网络穷举所有可能的攻击,不如找到变换前后仍然稳定的结构,并把内容身份锚定在这些不变量上。

当图像被改写,所有权证据还能留下吗?

生成式 AI 正在改变视觉内容的生产与传播方式。

一张图像可以被局部重绘、风格迁移、指令编辑,甚至整体再生成;一幅 360° 全景图像则会随着用户视点改变,在二维展开图上出现大范围、非线性的扭曲。

对于数字水印而言,这些变化带来的问题非常直接:如果水印依赖固定像素、局部纹理或有限攻击增强,一旦内容外观或几何姿态发生变化,认证线索就可能迅速失效。

来自中国科学院信息工程研究所、中国科学院大学和中国科学技术大学等单位的研究团队,从“变换不变量”这一共同视角出发,提出了两项互补的研究。

CVPR 2026 工作 Rel-Zero 从生成式编辑中发现稳定的图像块关系,构造无需改动原图的零水印。

论文标题:

Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editing

论文作者:

陈鹏桢, 刘延伟, 古晓艳, 陈小军, 刘武, 王伟平

收录会议:

CVPR 2026

论文地址:

https://arxiv.org/abs/2603.17531

ICML 2026 工作 TRIAD 则把全景图像建模为球面信号,通过三阶 SO(3) 表示耦合构造严格的旋转不变量。

论文标题:

Rotation-Invariant Spherical Watermarking via Third-Order SO(3) Representation Coupling

论文作者:

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Antonios Argyriou, Wu Liu, Weiping Wang

收录会议:

ICML 2026

代码地址:

https://github.com/Jerome-Chen7/TRIAD

论文地址:

待作者补充

前者回答“图像被 AI 改了怎么办”,后者回答“全景图像被任意旋转怎么办”。

核心主线:Rel-Zero 寻找编辑过程中的经验不变量;TRIAD 构造群表示空间中的代数不变量。两者都把鲁棒性从“攻击样本记忆”推进到“结构保持”。

Rel-Zero:不改原图,也能抵抗 AI 编辑

问题:嵌入式水印与零水印各有短板

传统嵌入式水印需要向图像写入额外信号。为了穿过扩散模型和指令编辑,这个信号往往必须足够强,从而在鲁棒性与视觉保真之间产生难以回避的权衡。

零水印提供了另一条路径:它不修改图像,而是从内容本身提取“指纹”,将指纹保存到外部数据库,验证时再与待检图像进行匹配。

问题在于,过去的零水印通常依赖全局特征或手工特征,这些绝对表征很容易被强语义编辑覆盖。

关键观察:绝对外观会变,相对关系仍可能稳定

Rel-Zero 的出发点来自一个直观但关键的发现:生成式编辑会显著改变单个图像块的像素或特征,但部分图像块之间的相对距离仍然保持稳定。

换句话说,如果两个区域在原图中差异很大,那么在局部编辑、全局编辑或再生成之后,它们往往仍然“彼此不同”。这种关系结构比任意一个局部外观更难被同时抹去。

 图1  不同生成式编辑前后,Rel-Zero 选出的稳定图像块对仍能被匹配。红线表示作为零水印的图像块关系。图源:Rel-Zero 论文。

论文进一步在 RGB 距离与 ViT 特征距离上进行验证。

对于 ControlNet-Inpainting、UltraEdit、确定性再生成、MagicBrush 和 Instruct-Pix2Pix 等编辑方式,编辑前后的图像块对距离呈现明显的线性相关,说明图像内部的关系几何在多类操作下具有可利用的稳定性。

方法:把稳定的图像块对变成内容指纹

Rel-Zero 的流程可以概括为三个步骤。

首先,研究者用冻结的 VAE 重建模拟生成式编辑带来的特征位移,从原图与重建图之间挖掘最稳定的图像块对,形成训练监督。

其次,冻结的 ViT 为每个图像块提取语义特征,并计算全连接的图像块对关系。

最后,一个轻量的关系预测器为所有候选图像块对打分,选取 Top-K 对的索引集作为零水印。

验证时,只需在待检图像中再次预测关系集合,并计算与登记集合的重合度。

 图2  Rel-Zero 框架:上半部分利用原图与 VAE 重建图挖掘稳定图像块对,下半部分学习从输入图像直接预测 Top-K 关系指纹。图源:Rel-Zero 论文。

为什么是“零”水印?因为原图像素完全不被修改。水印是从内容内部关系中提取并在外部登记的指纹,因此理论上不存在由嵌入操作带来的画质损失。

结果:五类 AI 编辑下,TPR 达到 85.13% 至 97.43%

在论文主表采用的固定 FPR=0.1% 设置下,Rel-Zero 在确定性再生成、Instruct-Pix2Pix、MagicBrush、UltraEdit 和 ControlNet-Inpainting 上分别取得 85.13%、89.65%、95.63%、96.55% 和 97.43% 的 TPR。

相比 ConZWNet 与 FGPCET 两种零水印基线,其对复杂生成式编辑的检测率提升非常明显;对于裁剪、缩放、对比度、亮度和高斯噪声等常规失真,TPR 也保持在 95.12% 至 98.57% 区间。

〓 图3  Rel-Zero 与零水印基线在五类 AI 编辑下的检测表现。指标为 TPR @ 0.1% FPR,数值取自论文主表。

更重要的是,这些鲁棒性并非来自向图像注入更强信号。

Rel-Zero 的 SSIM 为 1.000、LPIPS 为 0.000,因为它从头到尾都没有改动图像内容。这使其尤其适合医学影像、档案图像和高质量视觉资产等对原始像素敏感的场景。

TRIAD:把全景图像的旋转问题带回球面

问题:全景图像不是一张普通平面图

全景图像本质上定义在球面 S² 上。用户改变观看方向,对应的是三维旋转群 SO(3) 的作用。

常见的等距柱状投影(ERP)把球面摊平成矩形后,一个刚性的三维旋转会表现为纬度相关的非线性扭曲:物体可能跨越图像边界,极区被拉伸,局部纹理发生大范围位移。

依赖二维卷积或像素对齐的水印解码器很难覆盖这种连续且无限的变换空间。

〓 图4  同一幅全景图像经过不同 yaw、pitch 与 roll 旋转后,在 ERP 平面上呈现复杂非线性形变。图源:TRIAD 论文。

关键思路:从等变表示中构造严格不变量

TRIAD 首先用球谐变换把全景图像表示为不同阶数的球谐系数。旋转不会任意破坏这些系数,而是让同一阶表示按照 Wigner-D 矩阵做结构化变换,也就是保持 SO(3) 等变性。

简单使用零阶系数虽然可以得到旋转不变量,但它对应全局平均等低频信息,容量有限,修改后也容易带来明显亮度变化。

为此,TRIAD 把水印写入更高阶的不可约表示子空间,并在提取阶段对三个高阶表示进行张量耦合,再借助 Clebsch-Gordan 系数投影到平凡表示 V₀。

这个三阶标量与球面双谱等价:无论输入如何旋转,最终标量保持不变;同时,它保留了二阶功率谱会丢失的相位耦合信息,因此能够承载更高容量的水印。

 图5  TRIAD 框架:在高阶球谐子空间中嵌入水印,通过三阶表示耦合与 V₀ 投影得到旋转不变的球面双谱标量,再完成消息解码。图源:TRIAD 论文。

从经验鲁棒到结构保证:数据增强只能抽样有限角度;TRIAD 让旋转作用在表示空间中被严格抵消,因此任意角度的鲁棒性来自网络结构和群表示,而不是记住训练时见过的姿态。

结果:连续旋转下保持近乎 100% 比特准确率

论文在 panoContext 与 SUN360 上使用 10,000 幅全景图训练、2,000 幅测试,默认嵌入 32 bit 水印。

对每个旋转角度,实验均在球面上均匀采样 1,000 个旋转轴。

结果显示,未使用旋转增强时,多个平面水印基线一旦离开 0°,比特准确率很快跌至接近随机猜测的 50%;即使加入离散旋转增强,基线表现仍随角度剧烈波动。

相比之下,TRIAD 在 0° 到 180° 的测试范围内保持近乎 100% 的比特准确率。

 图6  随机 SO(3) 旋转下的比特准确率。TRIAD 在无增强和有增强设置中均保持稳定,基线则在未见旋转角度上明显失效。图源:TRIAD 论文。

在视觉保真方面,TRIAD 的 32 bit 配置达到 39.22 dB PSNR 和 0.9946 SSIM。

面对 JPEG、缩放、对比度、亮度、高斯噪声、模糊、中值滤波及混合失真时,比特准确率为 97.5% 至 100%,混合失真下为 98.4%。

三阶双谱的容量优势也得到验证:二阶功率谱在 32 bit 时仅有 61.3% 比特准确率,而三阶双谱在 16、32 和 64 bit 设置下均报告 100% 的比特准确率。

 图7  TRIAD 与多种水印方法的视觉对比。原图与含水印图肉眼接近,右侧为放大的残差。图源:TRIAD 论文。

两篇论文的共同启示:把身份锚定在不变量上

Rel-Zero 与 TRIAD 面向的攻击空间并不相同:前者面对生成模型造成的语义与外观变化,后者面对球面数据上的连续几何变换。

但它们做出了相似的研究选择,即不再把鲁棒性理解为“训练时多见一些攻击”,而是追问“什么结构在变换后仍然存在”。

Rel-Zero 的答案是图像块之间的相对关系。生成式编辑通常受内容保持、局部约束和低维编辑方向影响,因此图像内部的部分关系几何仍然稳定。

TRIAD 的答案是群表示中的平凡分量。通过三阶耦合把等变特征投影为标量,可以在数学结构上消除旋转带来的姿态变化。

一个来自数据规律,一个来自表示论,但最终都把水印从脆弱的绝对值迁移到了更稳定的关系或不变量上。

可推广的方法论:面对新的内容变换,鲁棒水印未必只能依赖更大的模型和更多攻击增强。先识别变换群、保持量与可观测关系,再选择嵌入和提取空间,往往能得到更清晰的机制解释与更可靠的泛化。

边界与未来工作

Rel-Zero 依赖生成式编辑保留足够的跨区域关系,并需要可信的外部登记与检索系统;若攻击进行大比例裁剪、完全重绘或刻意破坏关系结构,其稳定性仍需进一步检验。

TRIAD 的理论不变量建立在球面信号与完整 SO(3) 旋转设定上,离散球谐变换、ERP 采样、局部视野或缺失区域都会带来数值误差。

进一步扩大有效载荷,也需要处理高阶频带更容易受压缩和混叠影响的问题。

这些限制并不削弱两项工作的共同价值,反而指出了一条值得继续推进的路线:从平面图像走向球面、三维与多模态内容,从经验攻击集合走向对称性和不变量,从单一水印信号走向与内容内在结构绑定的身份表示。

更多阅读

#投 稿 通 道#

 让你的文字被更多人看到 

如何才能让更多的优质内容以更短路径到达读者群体,缩短读者寻找优质内容的成本呢?答案就是:你不认识的人。

总有一些你不认识的人,知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁,促使不同背景、不同方向的学者和学术灵感相互碰撞,迸发出更多的可能性。 

PaperWeekly 鼓励高校实验室或个人,在我们的平台上分享各类优质内容,可以是最新论文解读,也可以是学术热点剖析科研心得竞赛经验讲解等。我们的目的只有一个,让知识真正流动起来。

📝 稿件基本要求:

• 文章确系个人原创作品,未曾在公开渠道发表,如为其他平台已发表或待发表的文章,请明确标注 

• 稿件建议以 markdown 格式撰写,文中配图以附件形式发送,要求图片清晰,无版权问题

• PaperWeekly 尊重原作者署名权,并将为每篇被采纳的原创首发稿件,提供业内具有竞争力稿酬,具体依据文章阅读量和文章质量阶梯制结算

📬 投稿通道:

• 投稿邮箱:hr@paperweekly.site 

• 来稿请备注即时联系方式(微信),以便我们在稿件选用的第一时间联系作者

• 您也可以直接添加小编微信(pwbot02)快速投稿,备注:姓名-投稿

△长按添加PaperWeekly小编

🔍

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」

点击「关注」订阅我们的专栏吧

·

跳转微信打开