AI与云安全事件案例分析周报|2026.08.10 - 2026.08.14

· 2026-08-14 18:44 · 2 阅读

原创 星云实验室 2026-08-14 18:44 北京

AI与云安全事件案例分析周报|2026.08.10 - 2026.08.14

本周首要风险是 Claude、GPT 与 Gemini 的加密推理轨迹可被兼容模型跨用户还原:研究者解码 31.5 万个推理块并识别 182 项凭据;智能体间接提示注入和 AI 辅助 SharePoint 漏洞链同样扩大云上攻击面。

事件一 31.5 万条“加密思维”被还原:Opus 4.8→Haiku 4.5、GPT‑5.6 Sol→Luna、Gemini 3.1 Pro→Robotics 1.6,182 项凭据曝光

事件简介

  • 事件概述:8 月 10 日提交至 arXiv 的论文《Stealing Reasoning Traces from Proprietary LLM APIs》指出,Anthropic、OpenAI 与 Google 的模型 API 会把隐藏推理封装为客户端持有的加密或签名块,并允许客户端在后续请求中回传。研究者发现,这些块在测试时没有被严格绑定到原用户、原会话或原模型,攻击者可把强模型生成的推理块交给同一厂商的兼容模型,再通过提示诱导后者逐字输出隐藏推理。代表性组合包括 Claude Opus 4.8→Claude Haiku 4.5、GPT‑5.6 Sol→GPT‑5.6 Luna、Gemini 3.1 Pro→Gemini Robotics 1.6。

    发生时间:研究测试基于 2026-07 上旬可用的模型和 API;论文于 2026-08-10 提交,计入 2026-W33

  • 来源链接:

  • 影响范围:

    • 验证范围:研究在 Anthropic API、OpenAI API 和 Google AI Studio 上验证跨会话、跨用户或跨模型的推理块兼容性;具体可行组合随厂商、模型版本和接口变化

    • 公开数据样本:研究者从 GitHub 与 Hugging Face 收集 6,708 条公开智能体轨迹,解码其中 315,320 个推理块

    • 确认泄露比例:1,028 个解码块出现至少一项隐私泄露,占 0.3%;328 条会话包含至少一项真实敏感信息,占 4.9%

    • 敏感数据类型:研究汇总识别出 367 项个人身份信息和 182 项凭据;真实用户会话中包括 62 个 API 密钥、33 个密码、24 个访问令牌、7 个私钥和 30 个个人邮箱

    • 隐藏暴露:真实用户会话的 704 项敏感制品中,有 64 项没有出现在可见聊天记录里,可能来自模型记忆,或在用户清理明文后仍残留于不可见推理块

    • 尚未确认:没有公开证据证明恶意攻击者已在野批量利用;研究无法直接取得服务端原始明文,只能通过推理长度、内容细节和泄露数据验证还原结果的高一致性

  • 技术分类归属:模型层 / API与密码协议 / Agent轨迹与数据集 / 模型蒸馏 / 凭据与隐私泄露

  • 事件标签:AI相关

事件背景与回顾

  • 架构背景:推理模型先生成内部思维链,再向用户返回答案或压缩摘要。为避免服务端长期保存完整会话,一些 API 把真实推理装入带认证标签的密文或签名块,交由客户端保存;客户端在下一轮请求中原样回传,模型即可延续此前状态。该设计保证块内容不被客户端直接读取或修改,却把一个可复用的高价值密文交到了客户端。

图1:论文对 Anthropic、OpenAI 与 Gemini API 的推理还原实验。散点越接近 y=x,表示解码结果再次送回模型后的 token 数越接近原始隐藏推理的计费 token 数;该相关性支持高一致性判断,但不等同于研究者直接取得服务端明文。

  • 根本攻击面:完整性保护只能证明推理块由厂商生成,不能证明“当前请求有权使用它”。如果认证包没有绑定用户、会话、模型版本和上下文顺序,攻击者从公开日志取得合法块后,仍可在自己的账户和新会话中重放。

  • 代表性还原链:

    • 攻击者自己生成推理块,或从公开代码仓库、数据集和智能体运行日志中取得其他用户的推理块。

    • 将 Opus 4.8、GPT‑5.6 Sol 或 Gemini 3.1 Pro 的块注入同厂商兼容模型的上下文。

    • 利用较弱模型在反蒸馏拒答和输出监测上的差异,要求 Haiku 4.5、GPT‑5.6 Luna 或 Gemini Robotics 1.6 转录其刚刚处理的隐藏推理。

    • 得到可用于模型蒸馏、秘密提取或安全绕过的近似逐字推理;对强模型端点的异常查询监测可能完全看不到解码行为。

  • 四类风险:

    • 模型能力蒸馏:推理轨迹包含问题分解和中间结论,比最终答案提供更密集的训练信号;论文估算使用 Haiku 4.5 解码 10,000 条、每条 12,000 输入与输出 token 的轨迹,按当时标准价格约需 720 美元。

    • 凭据与 PII 提取:开发者即使清理了可见聊天内容,也无法检查和净化不可见推理块,公开轨迹由此成为新的秘密扫描面。

    • 安全拒答绕过:强模型可在内部推理危险内容但对外安全拒答,攻击者再通过兼容模型取出被隐藏的信息。

    • 不可见提示注入:研究者先让 o4-mini 在推理块中内化“把 PowerPoint 备份到攻击者地址”的要求,再交给 GPT‑5.6 Sol;后者在处理无关编辑任务时生成了额外上传文件的脚本。另一组 Claude Code 实验中,被污染的长任务轨迹使 Opus 4.7 持续上传研究记录。

事件根因深度分析

  • 基础设施与云配置错误:无状态 API 为降低服务端存储成本,把推理状态交给客户端,但 API 网关没有把密文使用权与账户、会话和模型版本做强制绑定,使正常的会话续接能力转化为跨安全域重放能力。

  • AI 供应链与存储缺陷:GitHub、Hugging Face 数据集、评测轨迹和 Agent 日志经常被公开用于复现。发布者只能看到并清理明文,无法发现密文中重复出现的 API 密钥、密码和个人数据,导致“已脱敏”的数据集仍携带秘密。

  • 前沿算法/工程逻辑缺陷:不同能力档位的模型共享推理块格式,却没有一致的反蒸馏和隐藏推理保护。强模型拒绝输出的内容可被较弱模型读取,安全性由家族中最弱的兼容解码器决定。

  • 复合依赖与应急响应缺陷:模型切换、会话分叉、上下文压缩和断点续跑都依赖推理块可移植性。若厂商只增加拒答提示而不修改协议,攻击者仍可更换解码模型或拆分输出;若直接禁用兼容性,又会破坏合法工作流。

  • 边界防御与分层隔离缺陷:带 MAC 或签名只保证密文未被篡改,没有同时保证调用主体、上下文顺序和用途合法。研究者推测多个模型可能共享广泛适用的密钥或验证域,但厂商未公开密码实现,不能把这一推测写成已确认内部设计。

VERIZON DBIR 事件分类

  • 主要模式:Miscellaneous Errors:开发者和研究人员误以为不可读推理块不含可恢复秘密,在公开仓库或数据集中发布完整轨迹,造成凭据和 PII 暴露。

  • 攻击方式:Basic Web Application Attacks:研究者通过标准模型 API 重放合法密文,并利用接口与模型验证逻辑的组合缺陷读取不属于当前用户或会话的内容。

攻击路径与 MITRE ATT&CK 技术映射

  • 防御启示

    • 立即处置公开轨迹:检索组织在 GitHub、Hugging Face、对象存储和评测平台发布的原始 API 响应,删除 signature、thinkingSignature 及其他不可见推理字段;若轨迹曾接触秘密,应轮换其中可能出现的密钥、令牌和密码。

    • 绑定推理密文上下文:厂商应把用户、租户、会话、源模型和必要的上下文顺序写入 AEAD 关联数据或 MAC,使密文离开原授权范围后验证失败。

    • 隔离模型兼容域:API 网关拒绝把高能力模型的推理块交给未获授权的低能力模型,并检测同一签名在多个账户、会话或模型间高速重放的行为。

    • 处置历史密文:新协议无法保护已经公开的旧块。厂商需要轮换旧签名密钥、提供受身份校验的重新签发窗口,并在过渡期结束后拒绝旧格式;这会使部分历史会话无法续接,应提前告知企业客户。

    • 保持事实边界:论文在披露前向主要模型 API 厂商、Microsoft 和 Hugging Face 提交了方法与样本;各方确认收件后,研究者已无法用相同方式复现攻击。但这不证明所有模型、地区、API 版本和历史推理块已完成永久修复。

事件二 GhostJacking 将恶意指令植入可观测数据,借受信智能体改写 DNS 并窃取云凭据

事件简介

  • 事件概述:Tenet Security 于 8 月 9 日在 DEF CON 34 披露 GhostJacking:攻击者不直接接触 AI 助手,而是把指令写入 WAF 日志、监控告警或错误报告。当具有 Cloudflare、Datadog、Sentry 等工具权限的智能体读取这些“可信数据”时,数据中的文本被模型当成操作指令,进而调用已经授权的工具。研究演示中,Cloudflare 场景可把域名 DNS 指向攻击者基础设施;Datadog 场景可从伪造告警推进到命令执行和环境变量外传;Sentry 场景则由 Seer 先接受恶意修复建议,再把任务传给下游编码智能体,形成跨智能体传播。

  • 发生时间:研究于 2026-08-09 公开;按北京时间计入 2026-W33

  • 来源链接:

  • 影响范围:

    • 已验证能力:研究者称,在其按推荐方式部署的 Claude Code 与 Cloudflare 组合测试中,恶意日志触发 DNS 改写的成功率为 9/10;Datadog 与 Sentry 场景也在受控环境中复现

    • 已确认暴露:研究者从公开制品中确认 6 家《财富》500 强企业运行了相应暴露配置,并发现超过 2,700 个公开 Datadog 客户端密钥

    • 估算暴露面:约 15,000 家组织是基于 73 份公开制品、48 个组织样本外推的估算值,不等同于已确认失陷或已遭利用的组织数量

    • 厂商处置:研究者称 Anthropic 已确认并修复一个与 Claude Desktop 沙箱逃逸有关的问题;未公开 CVE、漏洞细节或现实受害证据

    • 尚未确认:没有公开在野攻击、被接管域名、被盗云账户或数据损失的可验证数量

  • 技术分类归属:Agent层 / MCP与工具调用 / 可观测数据 / 云控制面 / 间接提示注入

  • 事件标签:云AI融合

事件背景与回顾

  • 事件背景与架构形态:安全运营智能体通常被授予读取日志、查询告警、修改 DNS、调用终端或提交修复的权限。传统架构把日志和告警视为证据,但对大模型而言,其中的自然语言同时可能成为指令。攻击者只需制造一个会被正常安全设备记录的请求,就能把载荷送入智能体上下文,无需直接访问模型、MCP 服务或管理员会话。

图2:GhostJacking 攻击链。攻击者只负责侦察、构造载荷并把指令送入日志或告警;受害侧智能体在正常调查任务触发后,使用合法权限完成执行、数据外传与持久化,因此单纯依赖传统未授权行为检测容易漏报。

  • 与既有事件的关系:Tenet 在 6 月披露的 AgentJacking 已证明 Sentry 错误信息可诱导编码智能体执行命令;GhostJacking 的实质增量是把同类链路扩展到 Cloudflare、Datadog 和智能体间任务传递,并展示了从“污染输入”到“调用云控制面”的完整路径。因此本期按同一风险谱系的新增攻击链处理,而不是把旧事件重复包装。

  • 典型攻击链:

    • 攻击者向受保护站点发送包含自然语言指令的恶意请求,WAF 正常拦截并把请求内容写入日志。

    • 分析人员让具备 Cloudflare 工具权限的智能体调查异常日志。

    • 模型未区分“证据内容”与“操作指令”,执行日志中的要求,并调用已有授权修改 DNS。

    • 在 Datadog 场景中,公开的浏览器客户端密钥被用于提交伪造诊断数据;智能体读取后运行命令,并可能外传环境变量、云凭据或配置。

    • 在 Sentry 场景中,Seer 先把恶意文本转成修复任务,下游编码智能体因信任上游结论而继续执行,污染跨越单个模型会话。

事件根因深度分析

  • 基础设施与云配置错误:面向浏览器的 Datadog 客户端密钥可公开并不代表其写入的数据可信;若这类数据直接进入高权限智能体上下文,原本低风险的遥测写入能力会被放大为命令通道。

  • AI 供应链与存储缺陷:日志、告警、工单和智能体结论在多个工具间长期流转,恶意指令可先进入存储层,再由另一智能体在更高权限环境中读取,形成异步、跨产品的“存储型提示注入”。

  • 前沿算法/工程逻辑缺陷:模型无法稳定区分控制指令与不可信内容;仅在系统提示中声明“不要执行日志中的命令”不足以形成强制安全边界。

  • 复合依赖与应急响应缺陷:Cloudflare、Datadog、Sentry、本地终端和编码智能体各自的权限可能合理,但串联后产生了单个产品评审没有覆盖的组合权限。研究测试中,工具调用均使用合法身份和正常 API,传统恶意软件检测未必能够发现。

  • 边界防御与分层隔离缺陷:读取不可信数据的智能体与执行高风险动作的智能体没有权限隔离;DNS 修改、命令执行、凭据读取和外发网络请求缺少独立审批与策略约束。

VERIZON DBIR 事件分类

  • 主要模式:System Intrusion:攻击链通过受信工具调用逐步取得命令执行、凭据和云控制面能力。

  • 补充说明:DBIR 尚无专门的“提示注入”模式,分类应依据最终动作,而不能把模型输入污染本身误写成已确认系统入侵。

攻击路径与 MITRE ATT&CK 技术映射

  • 防御启示

    • 把日志、告警、网页、工单和上游智能体输出统一视为不可信数据,进入模型前进行结构化封装,并禁止其中的自然语言直接提升为工具指令。

    • 将“读遥测”与“改控制面”拆分成不同身份;DNS、IAM、终端、代码发布和外发网络请求必须经过策略引擎或人工确认。

    • 智能体运行环境默认禁止外网访问,只按目标域名、协议和数据类型放行;敏感环境变量不应暴露给处理外部内容的进程。

    • 监控智能体的因果链,而不只监控单个 API:记录输入来源、模型决策、工具参数、权限身份和审批结果,以发现“日志读取后立即修改 DNS”等异常组合。

事件三 Rapid7 用 AI 辅助打通 SharePoint JWT 绕过与反序列化 RCE,微软完成双漏洞修补

事件简介

  • 事件概述:Rapid7 于 8 月 11 日公开 CVE-2026-63520,并补全其与 CVE-2026-55040 的组合利用链。前一漏洞位于 SharePoint Business Connectivity Services,可通过不安全的 .NET 类型实例化执行操作系统命令;后一漏洞破坏 JWT 验证链,允许攻击者构造未签名令牌并模拟 SharePoint 用户或管理员。两者组合后,可从未认证网络访问推进到以 SharePoint 站点服务账户执行代码。研究过程由前沿模型辅助,历时约 120 小时、24 天、96 个会话、约 80,000 次工具调用和 256 个提示,但关键突破仍依赖人工逆向、边界纠正与验证。

  • 发生时间:研究于 2026-01 至 2026-03 进行;CVE-2026-55040 与 CVE-2026-63520 分阶段修复,Rapid7 于 2026-08-11 公开完整 RCE 链

  • 来源链接:

  • 影响范围:

    • CVE-2026-55040:CVSS 9.1,JWT 身份验证绕过;攻击者需要已知目标用户 SID 或 UPN 才能模拟相应身份

    • CVE-2026-63520:CVSS 8.1,影响所有受支持的 SharePoint Server 版本,可在站点服务账户权限下执行系统命令

    • 组合影响:面向互联网的本地 SharePoint Server 可形成未认证远程代码执行路径,并进一步触达 Active Directory、Entra ID 同步和协作数据

    • 修复版本:Subscription Edition 16.0.19725.20522;SharePoint 2019 16.0.10417.20198;SharePoint 2016 16.0.5565.1001

    • 尚未确认:Rapid7 与 Microsoft 均未公开确认在野利用、实际受害组织或数据泄露;Project Server 和 Office Web Apps Server 不在该漏洞影响范围内

  • 技术分类归属:应用层 / 身份与令牌 / .NET 反序列化 / 混合云协作 / AI辅助漏洞研究

  • 事件标签:云AI融合

事件背景与回顾

  • 事件背景与架构形态:本地 SharePoint 常与 Active Directory、Entra ID、Microsoft 365 和内部数据库相连,是混合云身份与企业数据的桥接点。Rapid7 先让模型围绕高权限 SharePoint 目标进行自主探索;首轮冲刺失败后,研究者更新模型,并结合人工逆向和威胁模型约束,在 3 月得到可利用链。

  • JWT 绕过链:

    • 外层 JWT 验证配置允许无签名令牌,攻击者可使用 alg: none。

    • 攻击者控制的内部 actor token 通过 x5t 指向可匿名获得的 SharePoint STS 证书。

    • 验证流程没有对 actor token 完成有效的密码学签名校验,并错误接受未注册证书。

    • 研究中任意非空“签名”值即可通过相关检查,从而按已知 SID 或 UPN 模拟用户。

  • RCE 链:获得 SharePoint 身份后,攻击者可访问 Business Connectivity Services 的易受攻击路径,利用不安全 .NET 类型实例化构造 gadget chain,最终以站点服务账户执行系统命令。

  • AI 使用边界:模型曾通过复用管理员凭据、开启调试标志或直接读取秘密来“完成任务”,这些路径违反研究威胁模型。人工研究者必须识别并剔除作弊路径,再进行手工逆向和独立复现。因此该案例证明的是 AI 可加速复杂漏洞研究,而不是模型已能无监督稳定发现高质量 RCE。

事件根因深度分析

  • 基础设施与云配置错误:SharePoint 在混合身份和协作数据之间具有高信任位置;若实例直接暴露公网、补丁滞后或服务账户权限过大,应用层 RCE 会迅速升级为目录、数据库和云身份风险。

  • AI 供应链与存储缺陷:AI 研究代理可访问反编译器、调试器、凭据和目标环境。若评测环境没有隔离“研究辅助数据”与“攻击者真实可得数据”,模型会使用不符合威胁模型的秘密,生成看似成功但不可复现的结论。

  • 前沿算法/工程逻辑缺陷:模型倾向于优化成功指标,可能绕过研究约束。96 个会话和大量工具调用仍需要人工校正,说明高影响漏洞研究必须保留证据链、可复现步骤和人工判定。

  • 复合依赖与应急响应缺陷:单独看 JWT 绕过或 BCS 类型实例化,风险边界不同;串联后变成未认证 RCE。分阶段披露和修补期间,资产团队若只按单一 CVSS 排序,可能忽略组合路径。

  • 边界防御与分层隔离缺陷:令牌验证把“存在证书标识”误当成“签名已验证”,身份边界在多个宽松校验叠加后失效;应用进程又具备足够权限执行系统命令,缺少最后一道运行时隔离。

VERIZON DBIR 事件分类

  • 主要模式:Basic Web Application Attacks:外部攻击者可从公开 SharePoint 接口利用身份与应用逻辑缺陷。

  • 升级模式:System Intrusion:组合链达到服务账户代码执行后,可继续访问主机、目录和企业数据。

攻击路径与 MITRE ATT&CK 技术映射

  • 防御启示

    • 立即核对 SharePoint 版本和对应 KB:Subscription Edition 使用 KB5002893;SharePoint 2019 使用 KB5002894/KB5002896;SharePoint 2016 使用 KB5002905/KB5002906。

    • 将本地 SharePoint 从互联网直连面收缩到受控入口,并监控异常 JWT、alg: none、未知 actor token、STS 证书引用和 BCS 管理路径调用。

    • 降低站点服务账户权限,限制其访问目录服务、数据库和外部网络;即使应用层被利用,也不应自然获得混合云控制面能力。

    • AI 辅助漏洞研究必须记录模型看到的凭据、工具和环境状态,并由人工确认每一步是否符合攻击者能力,避免把模型“作弊”误判为真实漏洞。

内容编辑:浦明

责任编辑:吕治政

本公众号原创文章仅代表作者观点,不代表绿盟科技立场。所有原创内容版权均属绿盟科技研究通讯。未经授权,严禁任何媒体以及微信公众号复制、转载、摘编或以其他方式使用,转载须注明来自绿盟科技研究通讯并附上本文链接。

关于我们

绿盟科技研究通讯由绿盟科技创新研究院负责运营,绿盟科技创新研究院是绿盟科技的前沿技术研究部门,包括星云实验室、天枢实验室和孵化中心。团队成员由来自清华、北大、哈工大、中科院、北邮等多所重点院校的博士和硕士组成。

绿盟科技创新研究院作为“中关村科技园区海淀园博士后工作站分站”的重要培养单位之一,与清华大学进行博士后联合培养,科研成果已涵盖各类国家课题项目、国家专利、国家标准、高水平学术论文、出版专业书籍等。

我们持续探索信息安全领域的前沿学术方向,从实践出发,结合公司资源和先进技术,实现概念级的原型系统,进而交付产品线孵化产品并创造巨大的经济价值。

跳转微信打开