TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案
原创 字节安全研究团队 2026-09-23 18:06 北京

随着大模型在智能客服、代码助手、知识问答、办公协同等场景中加速落地,越来越多企业开始将模型以 MaaS 形式部署到云上,以兼顾性能、成本与运维效率。但在这一部署模式下,租户向云端发送敏感提问(如未公开财报、商业机密代码、病历)就像“明信片寄信”一样可能被云厂商运维/中间链路窥见。 对于医疗、法务、企业知识库、研发代码等高敏感场景而言,这类隐私风险已成为大模型规模化应用的重要障碍。
近期,来自字节跳动安全研究团队和香港城市大学的联合研究 《TWIST: Private Tenant-Dedicated LLM Serving via Joint Model-Token Transformation》 被网络与系统安全领域国际顶级学术会议 ACM CCS 2026 接收(ACM Conference on Computer and Communications Security,与 IEEE S&P、USENIX Security、NDSS 并称安全领域 4 大国际顶级会议)。该工作聚焦云上模型托管场景,提出了一种兼顾隐私保护、推理可用性与工程可部署性的新方法,为大模型安全推理提供了一条更具实用性的技术路径。
一、大模型上云之后,推理隐私面临现实挑战
近来,随着大模型在智能客服、代码助手、知识问答、办公协同等场景中加速落地,越来越多企业开始将模型以 MaaS (Model as a Service,模型即服务)形式部署到云上,由云端服务器提供推理服务。例如,PC 厂商为终端客户提供本地工作助手 Agent,但是利用云端服务器提供 LLM 推理服务。 在这种模式下,服务提供方掌握了实际推理链路,无论是提示词、生成结果,还是激活值、注意力权重、KV Cache 等运行时信息,都可能成为服务侧可观测对象。
传统解决方案如密码学和可信硬件虽然安全性高,但成本和部署门槛也很高。相比之下,混淆类方案更轻量、接入更方便,能够满足 LLM 系统的实际安全需求。不过,传统的数据混淆方法采用数据脱敏、Token 替换、加噪等技术,往往又难以同时兼顾“安全”和“效果”。
二、关键贡献:机制、理论与系统实现
针对这一问题,团队提出了一种模型与数据协同进行变换的新型混淆机制 TWIST(Tenant-dedicated Weight-Input Space Transformation)。其核心思路是,利用密钥将输入 Token 与模型计算过程映射到同一个变换后的坐标空间中,使服务端仍可沿用标准推理流程完成计算,而变换后的数据难以恢复为可读的明文。
这一设计带来的关键价值在于,它不再把全部隐私保护压力都压在输入侧扰动上,而是通过一致的联合变换机制,在维持大模型标准推理能力的同时,更好地缓解隐私保护与模型可用性之间的矛盾。
TWIST 的主要贡献体现在三个方面:
在机制设计上,TWIST 提出了联合模型-Token 变换,加性-乘性混合噪声等机制,突破了传统差分隐私中加噪类方案的效用-安全性矛盾。
在理论分析上,工作基于 Rényi-metric Differential Privacy(RmDP) 对离线模型发布与在线 Token 保护进行统一组合分析,为这类联合变换推理机制建立了更贴近实际部署场景的隐私度量框架。
在系统实现上,TWIST 在 Attention、FFN、RMSNorm、MoE routing 等模块上构造与结构兼容的变换方式,使模型推理仍可正常执行。TWIST 面向现有 serving 流程进行设计,能够兼容标准推理引擎,而不依赖高开销密码学推理或特定可信硬件环境,这使其更接近真实工业部署需求。
三、机制创新带来的隐私与可用性平衡
3.1 TWIST 核心机制:联合模型-Token 变换
TWIST 的标准流程分为离线与在线两个阶段。离线阶段时,租户先本地生成私有密钥,并使用该密钥对模型进行一次性变换,包括词表 Token 混淆置换π、可逆权重变换以及校准噪声注入。在线阶段时,租户使用私有密钥对输入 Token 进行混淆变换后发送到云端,云端直接处理混淆态数据,不泄露原始明文数据。这套流程,就像发信人与收信人提前约定了一套‘特制密码字典与解题逻辑’,外人看到的算式全是乱码符号,但模型按照这套暗号规则依旧能算出正确答案。
以一次实际查询为例:租户在客户端输入 what is privacy computing,会使用密钥将这串明文 Token 混淆为 #@ 5s8 | (takf%14# … 后才发送到云端——云服务商从推理服务入口就看不到租户的真实输入。模型在离线阶段已用相同密钥完成变换,因此混淆模型的 Embedding 层、多层 Transformer 等结构能够直接从混淆 Token 中正确提取语义信息,服务端无需修改标准推理引擎即可加载混淆模型完成推理。在此过程中,所有中间激活和注意力分数始终处于混淆态,云端只能执行计算,无法从中还原出可读语义。推理结束后,云端返回的同样是混淆结果 3$^G4*(3f1a …,最终由客户端用密钥逆变换为可读的 Privacy computing is …。

3.2 加性/乘性混合噪声提升隐私与可用性的平衡
TWIST 利用离线阶段的词表 Token 置换与在线阶段的 Token 混淆来支持保障隐私的同时保持效果可用。然而,这种隐私保护手段也面临着被破解的风险。对大模型而言,Token 在进入模型后,并不是以原始文字形式参与计算,而是被映射为一组数值表示。攻击者可以观测和分析 Token 在模型内部计算过程中的数值表示,从而还原隐私信息。
针对上述威胁,TWIST 并非简单地对所有数据统一加噪,而是将乘性噪声和加性噪声分工使用,以分层方式削弱攻击能力。首先,乘性噪声的作用是切断最直接的对照路径。如果没有这一层处理,攻击者更容易直接比较明文模型与混淆模型中 Token 数值表示的相似关系,从而进行高信息量的对照分析。加入乘性噪声后,Token 的内部表示被映射到另一套数值空间中,攻击者无法再轻易利用原始的整体相似关系做直接比对。这相当于先把最容易利用、信息量最大的一类攻击面压缩掉,使攻击者只能转向更间接的统计线索。
其次,加性噪声的作用是继续扰乱这些残余线索。即使攻击者已经从乘性变换之后的模型上找到了某些仍然相对稳定的特征,例如局部统计特征或排序特征,这些特征也不是完整信息。加性噪声会进一步在这些残余特征上引入随机扰动,使它们变得不稳定、不精确、难以长期累积利用。于是,攻击者即使保留了某些线索,也难以据此稳定建立 Token 映射关系。
因此,这两类机制各自承担不同角色:乘性噪声负责缩小入口,加性噪声负责扰乱推断。二者结合后的效果,把攻击从 “直接、稳定、高信息量” 的恢复过程,压缩成 “间接、脆弱、低信息量” 的试探过程。如此一来,攻击者想要利用数值表示还原隐私信息的难度会被显著提升。
四、安全建模与形式化度量
4.1 威胁模型:诚实但好奇的云服务提供方
TWIST 采用的是经典的诚实但好奇(honest-but-curious)威胁模型。换句话说,我们默认云服务提供方会按协议正常运行推理服务、不会随意篡改执行流程,但它会尽可能被动地利用其服务器上所有软件层可见的信息,尝试恢复租户的明文输入或相关秘密参数。
在这一模型下,信任边界可以非常清晰地划分:
客户端(可信侧):持有私有密钥、明文输入、明文输出,以及所有用于联合变换的秘密参数。论文假设租户控制的客户端未被攻破。
云服务提供方 (不可信侧):部署运行混淆后的模型服务,能看到混淆后的 Token 序列、混淆后的模型权重,以及推理过程中产生的各类运行时状态。
4.2 “离线&在线”双阶段分析
与 TWIST 的两阶段部署流程相对应,论文将安全建模也拆分为离线和在线两部分,攻击者在两个阶段中分别有不同的观测能力和恢复目标。
离线阶段,攻击者能够观察到租户上传的混淆模型权重,并且拥有明文模型的先验知识。它的目标是利用明文和混淆模型的关系,恢复混淆置换 π。
在线阶段,攻击者能够观察到租户输入的明文 Token 序列对应的混淆 Token 序列,并尝试结合离线阶段所获取的信息,将混淆 Token 序列还原为明文 Token 序列。
4.3 形式化度量:RmDP(Rényi-metric Differential Privacy)
为了把上述两阶段攻击视角下的隐私泄漏强度严格量化,论文选用了 RmDP(Rényi-metric Differential Privacy) 作为形式化度量工具。 RmDP 为混淆方案建立了一把量化大模型语义泄漏的‘数学尺子’,定量说明其在同等效果下隐私泄漏量优于传统加噪方法。
传统的差分隐私(Differential Privacy)通常关注"相邻数据集"之间输出分布的差异,非常适合数据库统计发布这类场景。但对于大模型隐私推理来说,我们要保护的对象——Token 序列、Token 置换——并不是简单的"是否包含某条记录"的二元关系,而是具有结构化距离的对象:
两个 Token 序列之间,有编辑距离、汉明距离等自然度量;
两个置换之间,也有置换空间中的距离概念。
RmDP 的核心优势在于,它把"距离"显式地引入隐私定义中:如果两个秘密在度量空间中相距越近,那么攻击者从观测结果中区分它们的难度就应该越大;而隐私预算则与这一距离成比例地累积。用更通俗的话说:
RmDP 回答的是"两个秘密相差多远时,攻击者能从输出中看出多少差别",而不是只回答"是否相邻"。
这种形式化框架非常贴合 TWIST 的分析需求:既可以用来衡量离线模型发布对 Token 置换 π 的泄漏,也可以衡量在线 Token 发布对明文 Token 序列的泄漏,最后还能把两部分预算组合起来,得到一个统一的隐私上界。基于这套统一的 RmDP 框架,论文形式化地证明了一个结论:与传统地、仅在输入侧加噪的隐私保护方案相比,TWIST 的联合模型-Token 变换可以在相同效用下,取得更小的整体隐私预算,即更优的隐私-效用权衡。
4.4 TWIST 的安全边界
TWIST 的形式化理论分析具有明确的适用边界:其 RmDP 框架主要聚焦于核心推理链路上两类最高风险 ——离线阶段 Token 置换 π 的恢复与在线阶段明文 Token 序列的重构。这一理论建模基于 “诚实但好奇” 的假设,并不涵盖实际生产中所有潜在的工程威胁。在真实部署环境下,主动恶意攻击、选择输入(chosen-input)攻击,以及请求长度、重复模式、时序特征和长期词频 / 共现统计等旁路信息,都可能成为实际的信息泄露通道。因此,TWIST 提供的是核心推理机制上的隐私保证而非绝对的端到端系统安全,在工程落地时,必须配合 padding 填充、请求分桶、密钥定期轮换等系统级缓解措施,共同构建纵深防御体系。
五、系统实现与工程应用
TWIST 在系统实现上的核心优势在于:不修改推理引擎、不依赖特殊硬件,通过 “在离线模型 Checkpoint 上进行一次性联合变换 + 客户端轻量 Token 映射”,即可在标准推理流水线上实现高效隐私推理。
针对现代大模型架构(Dense 及 DeepSeek 等超大规模 MoE),TWIST 为 Attention、FFN、RMSNorm 与 MoE Routing 等核心模块设计了保结构变换,兼顾了数学不变量约束与工程可执行性。在实际推理系统部署中,展现出优异的工程友好性:
服务端与框架零侵入:直接加载变换后的 Checkpoint 沿用标准自回归推理。适配 vLLM、SGLang 等主流 Serving 引擎时,无需修改底层算子、CUDA Kernel 或依赖 TEE 硬件,普通 GPU 即可承载。
业务接口完全透明:对外暴露的服务接口保持不变,服务端接收的依然是标准 Token 序列输入并返回生成结果,无需对现有 MaaS 或专属托管平台的调用链路进行重构。
客户端计算极轻量:客户端无需承担前向计算或高开销加密,仅需在请求前后执行 O(1) 查表级的 Token 映射与逆映射 (π / π⁻¹),天然适配 PC、移动端及轻量级 Agent 场景。
六、实测验证:隐私更强,效果接近明文,额外开销保持在个位数
6.1 实验设置
模型:实验选用 Qwen2.5、Qwen3、DeepSeek-V3.1、Llama3 等典型稠密(Dense)和混合专家(MoE)模型。
数据集:为综合评估混淆机制对各类任务的效用影响,实验采用中文综合评测 C-Eval、英文综合评测 MMLU、代码生成 HumanEval、指令跟随 IFEval、物理知识问答 PIQA、情感分类 SST-2 数据集进行评测。
攻击方法:实验选用了七种具体的攻击,涵盖三类典型威胁,全面衡量 TWIST 抵御各种威胁的效果。
参数不变量类型:攻击者利用 TWIST 方案的机制原理,尝试在明文模型与混淆模型之间找到一些“始终不变”的数值关系(不变量),并据此反推出其中使用的混淆机制。实验选用了针对词表置换不变量攻击(VMA) [1],和参数统计不变量攻击(IA)[2]。
反演类型:反演攻击是大模型隐私保护中的典型威胁。攻击者利用明文模型与混淆模型在推理过程中激活状态的相似性,从观测到的中间结果中反推出租户的原始输入。实验选用了最近邻匹配(NN)、基于语言模型的反演模型攻击(IMA)[3]和隐藏层状态反演攻击(ISA)[4]。
词频类型:词频攻击是针对固定明密文映射场景的经典隐私攻击方案,其核心原理是利用自然语言中不同 Token 的出现频率差异,通过统计混淆 Token 的频率分布,还原明文 Token 与混淆 Token 之间的映射关系。实验选用了近邻词频匹配攻击(TFMA),以及基于语言模型的替换密码解密攻击(SDA)[5]。
6.2 实验结果
现有工作对比
实验使用 Qwen2.5-14B-Instruct 对比了 SANTEXT、RANTEXT、DP-Forward、SGT 四种前沿的隐私保护推理方案。结果显示,TWIST 在 SST-2、MMLU、PIQA、IFEval 等任务上的表现与明文推理非常接近,准确率差距控制在 0.12%到 2.22%之间。同时,TWIST 能够有效抵御 VMA、NN、IMA、IA、ISA 这几种攻击,Token 恢复成功率最高仅 13.51%,多项攻击甚至降至 0%,在安全和效果上均显著优于现有方案。

不同种类模型的测试结果
更进一步,实验使用 7 个不同规模、架构的模型进行测试,结果展现出 TWIST 稳定的隐私保护与任务效果平衡能力。对于 671B 参数量级的 DeepSeek-V3.1-Terminus,TWIST 仍将 Token recovery rate 压低到 4.80%,同时任务效果损失仅为 0.0% - 3.5%,在线推理速度损失保持在 10% 以内。这表明,该方案不仅适用于中等规模模型,也具备面向超大模型服务场景的工程可行性。

词频信息的威胁
针对词频信息泄露,实验首先测试了攻击者在不同数据分布先验知识的情况下,使用 TFMA 和 SDA 的攻击效果。可以看到,即使攻击者与租户使用相同数据集 Huatuo26M(不同子集)发起攻击,仅根据词频信息还原的文本质量仍然有限。例如,SDA 的恢复文本与原始文本的 BLEU-4 指标仅 2.1,通常认为 BLEU-4>20 才具备一定的可读性。同时,随着攻击者观测数据量的增加,SDA 这种基于语言模型的词频攻击并不能持续提高攻击效果。


性能开销
在部署成本上,TWIST 的离线变换属于一次性预处理。实验结果显示,在 CPU-only 资源下,32B 参数量模型离线处理时间为 9.28 分钟,671B MoE 模型需 482 分钟,且这一成本可在长期部署中摊薄。在线阶段的 TTFT 和 TPOT 增幅整体维持在个位数水平。

七、总结与展望
7.1 云上大模型隐私推理的实用路径
TWIST 是在混淆保护路线上的一次系统性探索,它回应了当前一个非常现实的问题:当企业希望使用云上专属托管的大模型能力时,是否能在不显著牺牲效果、不重构现有推理系统、也不过度依赖专用硬件的前提下,获得更强的数据隐私保护能力。
TWIST 验证了在纯文本大模型推理场景下,相比传统的数据混淆方案,可以通过联合模型与 Token 空间的协同变换在安全强度、可用性与工程成本之间取得更好的平衡。此次论文入选 ACM CCS 2026,也意味着该方向的研究价值与工程潜力获得了国际主流学术界认可,本工作采用的模型-Token 变换机制也能启发后续的研究工作,助力基于混淆的隐私保护技术更好地在工业级的模型推理中应用。
但需要清醒认识到,TWIST 混淆方案并非绝对安全、普遍适用的终极方案——它在极强攻击者假设下仍存在被进一步突破的风险,随着攻击手段的不断发展,其防御机制也需要不断的更新迭代。对于多模态模型的支持、安全强度与模型效果之间的如何达到更好的平衡,仍需持续探索。
7.2 未来工作:能力拓展与安全性优化
未来,字节跳动安全研究团队将持续迭代适配最新种类的文本模型,并向多模态场景拓展。一方面,文本模型的架构仍在快速迭代中。我们持续追踪前沿主流模型架构(如 DeepSeek V4、GLM-5.3 等),为 TWIST 落地生产应用打好基础。另一方面,面向多模态理解、生成模型,探索图像、音频、视频编码器等模块的隐私保护路径。此前,我们已有一篇针对图文理解模型的工作被 ECCV 2026 接收[6]。
在安全强度上,后续工作将探索更高阶的加固手段。我们洞察发现,联合模型-Token 变换框架的威胁来源主要是攻击者能够对照明文、混淆模型的差异,破解乘性噪声和数据混淆机制,或者利用更高级的语义分布信息来尝试恢复混淆。我们将采取多种手段,例如兼顾训练与安全性的轻量训练等方法,进一步提升 TWIST 的防御能力。