2026年AI顶会Agent技术综述
原创 riusksk 2026-07-21 08:01 河北

2026年AI顶会Agent技术综述
基于AAAI、ICLR、ICML、ACL、CVPR五大顶会的系统性文献调研,涵盖架构设计、工具调用、多智能体协作、记忆机制、规划推理、评估基准、安全对齐与具身智能八大方向
调研日期:2026年7月20日 · 覆盖论文:300+篇 · 精选论文:60+篇
摘要
2026年,Agent(智能体)技术完成了从"LLM作为静态推理器"到"LLM作为自主智能体"的范式转变。本文系统调研了2026年上半年举办的AAAI、ICLR、ICML、ACL及CVPR五大AI顶会中与agent技术相关的论文,精选60余篇代表性工作,从架构设计、工具调用、多智能体协作、记忆与上下文管理、规划与推理、评估基准、安全与对齐、具身智能与视觉Agent八个维度展开分析。研究揭示出三大核心趋势:多模式统一架构与上下文工程成为agent设计新范式,长程多轮强化学习驱动7B级开源模型比肩闭源旗舰,以及Agent驱动的科学发现(Agentic Science)在Science/Nature密集发表形成完整闭环。本文进一步研判了Agent操作系统、自组织多智能体、个性化agent、世界模型统一等未来发展方向。
关键词:大语言模型智能体 · 多智能体系统 · 强化学习 · 工具调用 · 具身智能 · AI安全
1. 引言:Agent技术的范式转变
大语言模型(LLM)驱动的Agent技术正经历一场深刻的范式转变。如果说2023年是Agent概念的启蒙之年——AutoGPT和ReAct等框架首次展示了LLM自主执行复杂任务的潜力,那么2026年则标志着Agent技术从研究预览走向产业主线部署的关键转折点。伊利诺伊大学香槟分校(UIUC)联合29位作者发表的135页综述[38]为这一转变提供了统一的概念框架,将agentic reasoning组织为三层互补维度:基础agentic推理(规划、工具使用、搜索)、自我进化agentic推理(反馈、记忆、适应)、集体多智能体推理(协调、知识共享、共享目标),横向区分了上下文推理和后训练推理两条改进路径。
这一范式转变的核心驱动力来自三方面。其一,模型能力的跃升:以Claude Opus 4.6为代表的旗舰模型在OSWorld计算机操作基准上达到72.7%,基本追平人类基线72.36%[43];7B级开源模型经多轮强化学习训练后已能在27个任务上追平OpenAI o3和Gemini-2.5-Pro[11]。其二,架构范式的收敛:从纯像素控制转向"连接器优先"(connector-first)的混合架构成为生产标准[54],图结构化工作流编排成为主流[57]。其三,应用场景的拓展:Agent驱动的科学发现系统在Science、Nature等顶刊密集发表,从数据分析延伸到湿实验执行,形成了"观察→决策→执行→迭代"的完整闭环[40][46]。
本文系统调研了2026年上半年举办的五大学术会议——AAAI 2026、ICLR 2026、ICML 2026、ACL 2026和CVPR 2026——中与agent技术相关的论文,精选60余篇代表性工作展开分析。调研覆盖agent架构设计、工具调用、多智能体协作、记忆与上下文管理、规划与推理、评估基准、安全与对齐、具身智能与视觉Agent八大技术方向,并进一步研判Agent操作系统、自组织多智能体、个性化agent等未来发展趋势。
2. 2026年AI顶会Agent研究全景
2026年上半年,五大AI顶会共收录agent相关论文超过300篇,呈现出爆发式增长态势。其中ACL 2026以82篇LLM Agent方向论文居首,ICLR 2026以162篇的规模成为agent研究最大的学术舞台,ICML 2026贡献了59篇LLM Agent和24篇多智能体论文,AAAI 2026收录约33篇,CVPR 2026在机器人与具身智能方向有146篇论文(其中agent方向11篇)[1][2][3][4][49]。
图1:2026年五大AI顶会Agent相关论文数量分布
| 会议 | 论文数 | 可视化 |
|---|---|---|
| AAAI 2026 | 33 | |
| ICLR 2026 | 162 | |
| ICML 2026 | 83 | |
| ACL 2026 | 108 | |
| CVPR 2026 | 11 |
注:ICML 2026含LLM Agent 59篇+多智能体24篇;ACL 2026含LLM Agent 82篇+对话系统26篇
从研究方向分布来看,评估基准、工具调用、架构设计和安全对齐构成了四大研究热点。这一分布反映了agent技术发展的内在逻辑:随着agent能力快速提升,如何准确评估、如何高效使用工具、如何系统化设计架构、如何确保安全运行成为社区共同关注的核心问题。值得注意的是,多智能体协作和记忆机制虽然论文数量相对较少,但涌现出多篇具有范式创新意义的工作。
图2:2026年Agent技术研究方向论文分布(精选样本)
| 研究方向 | 精选论文数 | 分布 |
|---|---|---|
| 评估基准 | 18 | |
| 工具调用 | 15 | |
| 安全与对齐 | 13 | |
| 记忆与上下文 | 14 | |
| 架构设计 | 12 | |
| 规划与推理 | 11 | |
| 多智能体协作 | 10 | |
| 具身智能 | 8 |
从地域和机构分布来看,中国研究机构在agent领域的贡献显著。复旦大学NLP实验室的AgentGym-RL[11]和AgentGym2[31]、北京大学的BAMAS[14]、上海交通大学的TRM[17]等工作均在各自方向产生了重要影响。美国方面,Stanford、UC Berkeley、KAIST、Microsoft Research等机构贡献了ACE[6]、Dyna-Mind[9]等代表性工作。Sakana AI与UBC合作的Darwin Gödel Machine[8]则展现了产业界与学术界协同创新的力量。
3. Agent架构设计:从单一模式到多模式统一
Agent架构设计在2026年呈现出两条清晰的演进脉络:一是从单一执行模式向多模式统一架构演进,二是从被动上下文记录向主动上下文工程转变。
3.1 多模式统一架构
传统LLM agent通常在instant(即时回答)、reasoning(链式推理)和agentic(工具调用+多步执行)三种模式之间切换,不同模式往往依赖不同的提示策略或模型配置。ICLR 2026上发表的A²FM(Adaptive Agent Foundation Model)[5]提出在同一个backbone中统一这三种执行模式,通过"先路由后对齐"训练策略和带成本正则的自适应策略优化(APO),在32B规模上将单次正确答案成本降低约45%。这一工作代表了agent架构从"拼装式"向"一体化"演进的趋势。
另一条路径是通过自动化工作流生成来优化架构。AAAI 2026的A²Flow[1]提出三阶段流水线(案例生成→功能聚类→深度提取),从专家数据中全自动提取可复用的抽象执行算子,替代人工预定义算子,并引入算子记忆机制,在8个基准上整体超越AFLOW且资源消耗降低37%。AgentSwift[1]则通过层次化搜索空间、轻量级value model和不确定性引导的MCTS搜索策略自动发现高性能agent设计。
3.2 上下文工程:从记录到雕刻
上下文管理是agent长程任务执行的核心挑战。2026年的研究将上下文从被动的"历史记录"提升为主动雕刻的"认知工作区",催生了上下文工程(Context Engineering)这一新范式。
ACE: Agentic Context Engineering
ICLR 2026 Stanford University · SambaNova Systems · UC Berkeley
将context视为不断演化的"策略手册"(playbook),通过Generator-Reflector-Curator三角色分工和增量式delta更新来持续积累和精炼策略,解决现有prompt优化中的简洁偏差和上下文坍塌问题,agent任务平均提升10.6%,自适应延迟降低86.9%。[6]
AgentFold: Long-Horizon Web Agents with Proactive Context Management
ICLR 2026 arXiv:2510.24699
将web agent的上下文当作可主动雕刻的"认知工作区",每一步在推理时额外输出"折叠指令",对历史轨迹做细粒度凝练或多步深度合并,使100轮交互后上下文仅约7k token。仅30B激活3B的模型在BrowseComp上达36.2%,超过671B的DeepSeek-V3.1和OpenAI o4-mini。[7]
ICML 2026上,上下文压缩技术进一步深化。ACON[24]提出在自然语言空间优化压缩准则的框架,通过失败轨迹对比迭代改进压缩指南,在AppWorld、OfficeBench等基准上将峰值token用量降低26%–54%。Agent-Omit则用Monte-Carlo rollout量化哪些turn级thought/observation可省略,以冷启动SFT+双采样omit-aware GRPO训练8B agent,在5个基准上大幅减少token用量。Agent JIT Compilation[25]将Web Computer-Use Agent改造为类JIT编译器,把自然语言任务编译为可验证、可缓存、可并行调度的代码计划,比Browser-Use快10.4倍且准确率高28个百分点。
3.3 自我改进与开放式进化
ICLR 2026上最具突破性的架构创新当属Sakana AI与UBC合作的Darwin Gödel Machine(DGM)[8]。该工作让一个编程智能体不断改写自己的代码库来变得更会改代码,用"在benchmark上跑分"的经验证据替代Gödel Machine理论上不可行的形式证明,并用不断生长的智能体archive做开放式探索,把SWE-bench从20.0%推到50.0%、Polyglot从14.2%推到30.7%。DGM代表了"agent改写自身代码"自指改进范式的突破,为通向开放式进化的agent架构提供了可行路径。
图3:Agent架构设计范式演进
| 传统范式 | ↓ 范式转变 | 2026新范式 |
|---|---|---|
| 单一模式执行 固定提示策略 | → | 多模式统一 A²FM (ICLR 2026) |
| 被动上下文记录 历史轨迹堆叠 | → | 上下文工程 ACE / AgentFold |
| 固定架构 人工设计 | → | 自我进化 Darwin GDM (ICLR 2026) |
4. 工具调用与函数调用
工具调用是agent与外部世界交互的核心能力。2026年的研究从奖励模型设计、真实场景评测、多智能体分工和训练数据生成四个方面推进了工具调用技术。
4.1 过程级奖励与信用分配
ICLR 2026上,上海交通大学的TRM(Tool-call Reward Model)[17]针对LLM工具调用中结果奖励信号粒度粗导致梯度冲突的问题,提出为每次工具调用独立打分的过程奖励模型,并设计与PPO/GRPO集成的turn-level信用分配与优势估计策略。这一工作将过程奖励模型(PRM)的思想从数学推理领域成功迁移到工具调用场景,显著提升了多步工具调用的训练效率。
4.2 真实场景评测
WildToolBench[18]从真实用户日志中提炼出"野生"对话的三大特征——复合任务、隐藏意图、指令切换,构建256个场景共1024个任务的多轮多步工具调用benchmark。对57个主流LLM的评测发现没有一个模型session准确率超过15%,揭示了现有工具调用能力在真实场景中的严重不足。这一结果与ICML 2026上MCP-Persona基准的结果一致——在面向真实个性化MCP工具的评测中,Claude-Sonnet-4.5仅达38.66%准确率[3]。
4.3 多智能体分工与训练数据生成
MSARL[19]提出将推理与工具执行解耦——专门的reasoning agent负责战略问题分解和规划,专门的tool agent处理工具执行,通过多小智能体强化学习显著降低单大模型范式中认知负荷干扰问题。AutoTool[1]则基于工具使用惯性构建工具惯性图(TIG),通过统计结构绕过重复的LLM推理来选择工具和填充参数,减少最多30%的推理开销。
ACL 2026上,工具调用训练数据的自动生成成为热点。GenesisFunc[33]用可靠工具池、多agent对话生成和多阶段质检自动构造高质量函数调用训练数据,微调Qwen3-8B后在BFCL、API-Bank、ACEBench上超过同规模开源模型。GOAT[35]让小型开源模型无需人工标注即可将高层目标分解为相互依赖的API调用序列,通过从API文档自动构建"依赖图+call-first合成数据"流水线。DiaFORGE[36]提出消歧中心的合成数据生成管线,让开源LLM在面对近重复企业API时的工具调用成功率比GPT-4o高27个百分点。
5. 多智能体协作系统
多智能体系统(MAS)研究在2026年从"预设角色协作"向"自组织涌现"和"预算感知优化"两个新方向拓展,同时人机协作和失败诊断也成为重要议题。
5.1 预算感知与成本优化
北京大学的BAMAS[14]首次将显式预算约束引入多智能体系统设计:先用整数线性规划(ILP)选择最优LLM集合平衡性能与成本,再用强化学习方法选择交互拓扑,在三个基准任务上匹配SOTA同时成本降低最高86%。这一工作回应了多智能体系统在实际部署中成本爆炸的现实痛点。
5.2 自组织涌现
2026年3月发表的自组织多智能体研究[41]完成了25,000任务的计算实验,覆盖8个模型、4-256个智能体、8种协调协议。研究发现一个令人惊讶的现象:LLM agent在仅有最小结构化脚手架时,会自发产生专门化角色、自愿放弃超出能力范围的任务,并形成浅层层级——无需预分配角色或外部设计。ICML 2026的MAS-Orchestra[3]进一步将"自动多智能体系统设计"重构为RL问题,并提出MASBench从Depth、Horizon、Breadth、Parallelism、Robustness五个维度澄清"多智能体系统何时真正优于单智能体"。
5.3 人机协作与失败诊断
Collaborative Gym (Co-Gym): Enabling and Evaluating Human-Agent Collaboration
ICLR 2026 arXiv:2412.15701
首个支持人与LM智能体在共享任务环境中双向通信、非轮流协作的开放框架,配套同时考核协作结果与协作过程的评测套件,协作agent在Travel Planning/Tabular Analysis/Related Work任务上win rate分别达86%/74%/66%。[15]
AgenTracer[16]则聚焦多智能体系统的失败诊断,用"反事实回放+程序化故障注入"自动标注多智能体失败轨迹,训练8B轻量"失败追踪器",在Who&When基准上agent级准确率反超Gemini-2.5-Pro、Claude-4-Sonnet等巨型模型最多18.18%。ICML 2026的CollabBench[27]面向合作博弈的LLM agent协作评测与训练,用Big Five人格模拟多样化队友,采用双层"效率/情感"混合奖励的RL训练范式,训练后Qwen2.5-7B在效率和情感维度分别提升约19.5%和24.4%。
5.4 产业级多智能体科研系统
Google DeepMind的Co-Scientist[44]代表了多智能体系统在科研领域的最高水平。该系统由Gemini驱动,包含三大阶段六大agent——Generate(提出假说、聚类)、Debate(虚拟同行评审、想法锦标赛)、Evolve(迭代优化、综合洞察),采用类似AlphaGo的Elo锦标赛机制,已在肝纤维化药物重定位、ALS、细胞衰老逆转等领域与Stanford、MIT、Cambridge等机构合作验证。
6. Agent记忆与长期上下文管理
记忆机制是agent处理长程任务的基础设施。2026年的研究从评估、架构设计和训练优化三个层面系统推进了agent记忆技术,涌现出受认知科学和神经科学启发的多种新范式。
6.1 记忆能力评估
ICLR 2026的MemoryAgentBench[12]基于记忆科学将agent记忆能力拆成四项核心能力——准确检索、测试时学习、长程理解、选择性遗忘,构建首个把长文本切块、增量喂给智能体来模拟多轮交互的统一benchmark。研究发现现有长上下文、RAG、商用记忆智能体均无法同时掌握四项能力,揭示了当前记忆技术的根本性局限。
6.2 记忆架构创新
2026年的记忆架构创新呈现出从简单向量存储向结构化、层次化、生物启发式架构演进的趋势:
| 系统 | 会议 | 核心创新 | 关键指标 |
|---|---|---|---|
| AdaMEM | ICML 2026 | 离线长期轨迹记忆+在线合成短期策略记忆双层解耦 | 比静态记忆baseline提升13-17% |
| E-mem | ICML 2026 | 保留原始上下文+小模型助手现场推理,替代压缩 | LoCoMo F1高7.75点,token降70% |
| APEX-MEM | ACL 2026 | 领域无关本体结构化为时间锚定事件属性图 | LOCOMO 88.88%,LongMemEval 86.2% |
| HeLa-Mem | ACL 2026 | 受Hebbian学习启发,共激活强化记忆连接 | LoCoMo SOTA且token更少 |
| GLoW | ICLR 2026 | 全局轨迹前沿+局部多路径优势反思的双尺度世界记忆 | 少100-800×环境交互逼近最强RL方法 |
其中,ACL 2026的HeLa-Mem[4]将对话历史建模为带Hebbian学习动力学的动态图,通过共激活强化记忆间连接,经反思蒸馏将hub记忆浓缩为语义知识,双路检索(语义相似+Hebbian扩散激活)在LoCoMo上达SOTA。这一工作展示了神经科学原理在agent记忆设计中的潜力。APEX-MEM[32]则用领域无关本体将对话结构化为时间锚定事件的属性图,采用只追加存储策略保留信息完整演化,在LOCOMO达88.88%、LongMemEval达86.2%。
6.3 记忆引导的探索与训练
EMPO²[13]结合外部记忆模块与混合on-policy/off-policy更新的RL框架,通过记忆引导探索和知识蒸馏将探索收益内化到模型参数中,在ScienceWorld和WebShop上分别比GRPO提升128.6%和11.3%。E-mem[3]提出以"保留原始上下文+小模型助手现场推理"的事件重构范式替代传统"压缩为embedding/图"的记忆范式,在LoCoMo上比SOTA F1高7.75个点,token消耗降70%。
趋势观察
Agent记忆技术正从"压缩存储"向"结构化保留+按需推理"演进。E-mem的事件重构范式和APEX-MEM的属性图存储都表明,保留原始信息的完整性比追求压缩比更重要,关键在于设计高效的检索和推理机制来利用这些信息。
7. Agent规划与推理
规划与推理是agent决策的核心引擎。2026年的研究将基于模型的RL思想引入LLM agent,通过世界模型模拟、"做梦"式离线规划和长程多轮RL训练,显著提升了agent的决策质量。
7.1 世界模型与模拟推理
ICLR 2026上,Microsoft Research的Dyna-Mind[9]先用RESIM方法(把真实环境交互搭成搜索树再蒸馏成含模拟的推理)教会(V)LM智能体在动手前先在脑中推演未来,再用把"真实未来状态"灌进RL的Dyna-GRPO在线强化模拟能力,在Sokoban、ALFWorld、AndroidWorld上显著超过GRPO/RLOO。DreamPhase[10]进一步让冻结的策略LLM不靠真刀真枪试错,而是先用学到的潜空间世界模型在脑中"做梦"模拟M条多步未来轨迹,用"价值减不确定性"打分并过安全门,把选中轨迹蒸馏成自然语言反思塞回prompt,WebShop上每回合真实API调用从约40次砍到10次以下。
图4:DreamPhase的"做梦"式离线规划流程
① 任务输入
↓
② 策略LLM → 世界模型模拟M条轨迹
↓
③ 价值评估(减不确定性)→ 安全门过滤
↓
④ 选择最优轨迹 → 蒸馏为自然语言反思
↓
⑤ 塞回Prompt → 执行动作 → 真实环境反馈(循环)
7.2 长程多轮强化学习
复旦大学NLP实验室的AgentGym-RL[11]是2026年agent训练领域最重要的开源工作之一。该框架开源解耦的多轮强化学习训练系统,能在Web导航、深度搜索、数字游戏、具身控制、科学任务五大真实场景从零训练LLM agent,并提出ScalingInter-RL"先短程后长程"分阶段训练法,让7B模型在27个任务上追平甚至超过OpenAI o3、Gemini-2.5-Pro。
ICML 2026进一步深化了agentic RL训练的理论理解。"Information Self-Locking"[3]揭示了Agentic RL训练中一种失败机制——agent在训练过程中会"自我锁定"信息流,并提出AREW方法通过轻量方向性反馈重新分配轨迹内credit来缓解。Agentic Monte Carlo[3]将"针对黑盒LLM Agent的RL"重构为"从最优策略后验中采样",用带轻量价值函数的SMC在测试时引导冻结的黑盒模型,无需访问参数即可实现RL式优化。
7.3 推理轨迹评估
ICML 2026的"Beyond the Final Answer"[37]指出"仅看最终答案准确率"掩盖了agent实际推理过程的问题——如低效轨迹、幻觉。该工作提出对工具增强agent推理轨迹本身进行评估的框架,区分"答案对但推理错"的情况,为agent推理质量提供了更精细的评估视角。
8. Agent评估基准:从理想到真实
2026年的agent评估基准研究呈现出鲜明的"去理想化"趋势——从精心设计的受控环境走向真实世界的噪声、异常和长周期场景,揭示了现有agent能力与实际需求之间的巨大鸿沟。
8.1 去理想化真实世界评测
ACL 2026的AgentGym2[31]明确提出"去理想化"评测框架,除推理规划外还评测agent执行端到端流程、通过探索发现工具、为未见任务组合工具、以及对噪声和欠规格信息的鲁棒性。15个模型实验显示即便Gemini和GPT-5也表现挣扎。AgencyBench[30]则覆盖32个真实场景共138个任务,每个场景平均需90次工具调用、100万token、数小时执行,通过用户模拟agent提供迭代反馈实现全自动评估。
8.2 持续演化与长周期评测
EvoClaw: Evaluating AI Agents on Continuous Software Evolution
ICML 2026 USC · Princeton · arXiv:2603.13428
首个面向"持续软件演化"的agent评测基准。用DeepCommit流程把开源仓库的嘈杂commit历史重建为可执行、可验证的里程碑依赖DAG。12个前沿模型在独立任务上>80%,但在持续演化场景下最高仅38%,暴露长期维护与错误抑制能力的严重不足。[29]
AAAI 2026的D-GARA面向Android GUI Agent的动态鲁棒性评估,通过在实时交互过程中注入权限弹窗、电量警告、应用崩溃等真实世界异常,揭示现有SOTA Agent在中断场景下平均成功率下降超过17.5%。ProBench[1]首个同时评估"最终状态"和"操作过程"的移动端GUI Agent benchmark,发现最强模型Gemini 2.5 Pro也仅完成40.1%任务。
8.3 科研实验与个性化评测
ICLR 2026的EXP-Bench[2]从51篇NeurIPS/ICLR 2024顶会论文及开源代码里半自动抽取461个"完整AI研究实验"任务,逼着Agent走完"提假设→设计实验→写代码→真跑→下结论"全流程,最强Agent完整跑通可执行实验成功率仅0.5%。ICML 2026的MacArena在Apple Silicon原生虚拟化框架的真实macOS环境中统一评测,揭示当前GUI agent在macOS上普遍弱于Linux。MCP-Persona[3]首个面向真实个性化MCP工具的LLM agent基准,提出Tool-Traverse、Context-Tree、Persona-Gen三种方法自动合成模拟器代码。
图5:代表性评估基准揭示的Agent能力鸿沟
| 评估基准 | 理想/独立场景 | 真实/持续场景 | 能力鸿沟 |
|---|---|---|---|
| EvoClaw(软件演化) | >80% | 38% | ↓ 42+点 |
| EXP-Bench(科研实验) | — | 0.5% | 极低 |
| WildToolBench(工具调用) | — | <15% | 57个模型全部不及格 |
| ProBench(GUI操作) | — | 40.1% | 最强模型仅四成 |
| MCP-Persona(个性化) | — | 38.66% | Claude 4.5 Sonnet |
数据来源:各基准论文官方报告。真实场景下agent能力普遍远低于理想场景。
8.4 评估方法学创新
ACL 2026的AdaRubric[4]指出"LLM-as-Judge+固定Rubric"不适配目标导向agent轨迹评估,提出让LLM根据任务描述自动生成N维任务特定评分细则,在WebArena/ToolBench/AgentBench上Pearson r=0.79,DPO训练带来+6.8~+8.5%任务成功率。ICLR 2026的ChinaTravel[20]用可组合的领域专用语言把开放式自然语言旅行需求自动翻译成可验证逻辑约束,神经符号agent约束满足率比纯LLM高10倍(37.0% vs 2.60%)。
9. Agent安全与对齐
随着agent能力快速提升和部署范围扩大,安全问题从静态的模型安全扩展到动态的agent安全。2026年的研究聚焦长上下文安全、工具调用注入攻击、欺骗界面防御和黑盒监控四个方向。
9.1 长上下文与工具调用安全
AAAI 2026的"When Refusals Fail"[21]系统研究了LLM Agent在长上下文填充下的安全行为变化,发现声称支持1M-2M token的模型在100K token时已出现>50%性能崩溃,拒绝率以不可预测方式波动——GPT-4.1-nano从5%升至40%,Grok 4 Fast从80%降至10%。ChatInject[22]揭示了LLM Agent中chat template的结构性漏洞,通过在工具返回数据中伪造角色标签,攻击者可将恶意指令伪装为高优先级指令,攻击成功率从5-15%提升至32-52%。
9.2 欺骗界面防御
ACL 2026上,Web Agent面对欺骗界面的脆弱性成为焦点。DUDE[4]将"对抗性欺骗UI"形式化为web agent的独立防御问题,提出两阶段框架——非对称惩罚的混合奖励RL训练评估器+迭代经验总结将失败模式蒸馏为可迁移上下文。在三个VLM agent base上将欺骗引发的失败率从23.5%降至1.5%,任务成功率从9.5%提升到60.5%。WebDecept[4]开发了轻量可插拔的"欺骗界面注入层",GPT-5.1、Claude 4.5、Gemini 2.5普遍脆弱,尤其"隐藏加购/总价操纵"几乎完全失败。
9.3 黑盒监控与说服攻击
ICML 2026的Constitutional Black-Box Monitoring[28]提出端到端"宪法式黑盒监控"框架,仅通过外部可见的工具调用与输出(不看CoT)检测LLM agent的scheming行为。TRAP基准[3]面向Web Agent的"任务重定向说服"评测,将prompt注入分解为5个模块化维度共630种组合,发现平均25%任务被劫持(GPT-5为13%,DeepSeek-R1达43%)。
9.4 效率对齐与道德推理
AAAI 2026的DEPO[23]提出"双重效率"概念,将LLM Agent效率分解为step级(减少每步token数)和trajectory级(减少总步数),基于KTO设计联合优化效率与性能的方法。MoralReason[1]使用GRPO在推理层面训练LLM进行道德框架对齐,在680个高歧义场景上实现功利主义对齐分数从0.207提升到0.964的分布外泛化。ARC Framework[1]从能力视角系统化识别、评估和缓解智能体AI系统的安全风险,为组织级治理提供结构化方法论。
安全洞察
2026年的agent安全研究揭示了一个系统性问题:agent"能识别危险但无法将认知纳入规划和执行"。CVPR 2026的AGENTSAFE[49]在具身agent领域同样发现了这一失效模式。这表明当前的安全机制停留在"感知层"而未深入"决策层",未来需要将安全约束内化到agent的规划和执行回路中。
10. 具身智能与视觉Agent
CVPR 2026中,VLA(Vision-Language-Action)模型成为具身智能的主线,agent与具身智能的结合在主动感知、动作思维链、世界模型统一等方向快速推进。
10.1 能力链式规划
RoboAgent[47]提出能力驱动的规划管线,模型主动调用不同子能力,每个能力维护自己的上下文,产生中间推理结果或与环境交互。将复杂规划分解为单个VLM可更好解决的视觉-语言问题序列,使推理过程更透明可控。
10.2 动作思维链
ACoT-VLA[49]将VLA的"中间推理"从语言子任务或目标图像替换为动作空间中的粗粒度参考动作序列。显式动作推理器生成参考轨迹,隐式动作推理器从VLM的KV cache提取动作先验,两路联合条件化动作头,在LIBERO/LIBERO-Plus/VLABench上达到SOTA。这一工作将Chain-of-Thought从"语言推理"扩展到"动作推理",为具身agent的规划提供了新范式。
10.3 统一潜在动作世界模型
Motus[48]利用Mixture-of-Transformer(MoT)架构整合理解、视频生成、动作三专家,采用UniDiffuser式调度器,支持世界模型、VLA模型、逆动力学模型、视频生成模型等多种建模模式间的灵活切换。Align While Search[49]将搜索建模为单状态贝叶斯自适应控制,在测试时维护分层信念,利用冻结LLM模拟观测进行信念刷新,无需任何梯度更新即可同时提升搜索成功率和降低token开销。
10.4 具身Agent安全
AGENTSAFE[49]是首个系统评估"具身VLM agent执行危险指令"安全性的基准,包含对抗仿真沙箱SAFE-THOR、9,900条按"机器人三定律"分类的危险指令集SAFE-VERSE、覆盖"感知-规划-执行"的诊断协议SAFE-DIAGNOSE。评估9个VLM和2个agent工作流,揭示当前agent"识别危险但无法将认知纳入规划和执行"的系统性失效。
11. 产业进展与开源生态
2026年上半年,四大AI厂商(OpenAI、Anthropic、Google DeepMind、Meta)均交付了GA质量的agent产品,从研究预览转向企业主线部署。同时,开源agent框架经历重大整合,三大框架均达到1.0稳定版。
11.1 产业产品进展
| 厂商 | 产品 | 发布时间 | 核心亮点 |
|---|---|---|---|
| OpenAI | ChatGPT Work | 2026.07 | 企业级Agent,跨应用自主拆解任务,数小时项目专注度[42] |
| Anthropic | Claude Opus 4.6 + Cowork | 2026.02 / 01 | OSWorld达72.7%追平人类;Cowork采用"连接器优先"架构[43][56] |
| Google DeepMind | Co-Scientist | 2026.05 | Nature发表,六大agent协作科研系统,Elo锦标赛机制[44] |
| Meta | Llama 4 Agent Framework | 2026.03 | Apache 2.0开源,企业级安全特性,对标闭源agent平台[45] |
| Stanford | Biomni | 2026.07 | Science发表,通用生物医学Agent,40分钟完成60小时工作量[46] |
Computer Use(计算机操作)能力的突破尤为瞩目。OSWorld基准从2024年10月的14.9%提升至2026年2月Claude Opus 4.6的72.7%,16个月实现约5倍提升,基本达到人类基线[43]。2026年的主导架构从纯像素控制转向"连接器优先"混合架构——优先调用直接API集成,其次浏览器导航,最后才回退到屏幕像素控制[54]。开源生态中H Company的Holo3在OSWorld-Verified达到82.6%,超越闭源前沿模型。
图6:OSWorld计算机操作基准性能演进(2024.10 - 2026.02)
| 时间节点 | 最佳模型性能 | 可视化 | vs 人类基线 |
|---|---|---|---|
| 2024.10(初始) | 14.9% | -57.5点 | |
| 2025年中(快速提升) | ~40% | -32.4点 | |
| 2026.02(Claude 4.6) | 72.7% | +0.3点 | |
| 人类基线 | 72.36% | 基准 |
16个月实现约5倍提升,2026年2月基本追平人类基线
11.2 开源框架整合
2025年底至2026年初,agent框架界经历重大整合浪潮[51][52][53]:
• LangGraph 1.2(2026年5月):细粒度节点执行、DeltaChannel(checkpoint存储减少80%+)、Streaming API v3。月下载量约9000万,生产用户包括Uber、LinkedIn、Klarna、JP Morgan[52]
• Microsoft Agent Framework 1.0(2026年4月3日):将AutoGen和Semantic Kernel合并为一个框架,原AutoGen进入维护模式。自然适配Azure生态和.NET组织[51]
• CrewAI 1.14.6(2026年5月28日):新增flows事件驱动模式和AMP Cloud商业云产品,50行代码构建多agent协作流程[53]
• Hugging Face Smolagents:核心代码仅约1000行,核心理念是"用代码思考的agent"[59]
11.3 Agentic Science:科学发现的完整闭环
2025-2026年间,多个AI Agent驱动科研系统在顶刊发表,形成了清晰的趋势[40]:
• Biomni(Science, 2026.07):Stanford团队,40分钟完成人类团队60小时工作量,效率提升约90倍[46]
• Co-Scientist(Nature, 2026.05):Google DeepMind多agent科研伙伴[44]
• AlphaEvolve(Google DeepMind, 2025.05):打破保持56年的矩阵乘法纪录
这些系统的共同特征是:AI不再只是处理数据的工具,而是具备"观察→决策→执行→迭代"完整闭环能力,区别仅在实验对象不同(数据/显微镜/机械臂/代码)。这一趋势标志着Agentic Science从概念走向实践。
12. 未来发展趋势研判
基于2026年五大顶会的系统性调研,本文研判agent技术未来将沿以下七大方向发展。
图7:Agent技术未来发展趋势全景
| 方向 | 关键要点 |
|---|---|
| 基础设施 | Agent OS成为新中间件 · 图结构编排成主流 · 开源框架整合至1.0稳定版 |
| 架构演进 | 多模式统一backbone · 上下文工程取代被动记录 · 自我进化与开放式进化 |
| 训练范式 | 长程多轮RL · 世界模型模拟推理 · 自组织多智能体涌现 |
| 应用拓展 | Agentic Science完整闭环 · 个性化Agent · 具身智能VLA主线 |
| 安全治理 | 内化式约束嵌入规划回路 · 黑盒监控 · 组织级治理方法论 |
12.1 Agent操作系统:新基础设施层
Agent OS被视为AI agent的基础平台,类比传统OS之于应用程序[58]。其核心服务包括记忆管理(长期知识存储、情景记忆、工作记忆)、工具调用编排、多agent协调、安全沙箱。2026年产业界已从单工具实现转向部署协调的AI agent团队,自主执行端到端工作流。未来Agent OS将成为连接底层模型能力和上层应用的关键中间件。
12.2 自组织多智能体系统
自组织研究发现LLM agent在最小结构化脚手架下会自发产生专门化角色和浅层层级[41]。这一发现挑战了传统多智能体系统需要预设角色和拓扑的设计哲学,预示着未来多agent系统可能从"设计驱动"走向"涌现驱动"。关键开放问题包括:如何控制涌现结构的稳定性、如何平衡效率与灵活性、如何在涌现过程中保证安全。
12.3 个性化Agent
个性化LLM Agent综述[39]将个性化视为跨画像建模、记忆、规划、动作执行四个组件的分布式属性。MCP-Persona基准[3]显示当前最强agent在个性化场景中仅达38.66%。未来个性化agent需要在长期用户交互中持续学习用户偏好,同时保护隐私和安全。
12.4 世界模型统一
Motus[48]的统一潜在动作世界模型和Dyna-Mind[9]的模拟推理代表了世界模型与agent结合的趋势。未来agent将具备更强的"在脑中演练"能力——通过世界模型预测行动后果、评估多条路径、在执行前优化策略。这一方向的核心挑战是构建跨环境泛化的世界模型,以及解决模拟与现实的gap问题。
12.5 Agentic RAG的经验演化
HERA[50]提出将执行经验蒸馏为上下文知识,通过prompt evolution重塑agent行为而无需参数更新。Agentic RAG已从早期的简单"检索-生成"模式演进到Plan-and-Execute RAG等高级模式。未来这一方向将进一步与记忆机制和自我进化结合,形成agent的"经验积累-策略进化"闭环。
12.6 安全治理的内化
2026年的安全研究揭示agent"识别危险但无法纳入规划"的系统性失效[49]。未来安全治理需要从"外挂式监控"走向"内化式约束"——将安全约束嵌入agent的规划回路、执行决策和反思过程中,而非仅依赖外部检测器。ARC Framework[1]的组织级治理方法论和Constitutional Black-Box Monitoring[28]的黑盒监控是这一方向的重要探索。
12.7 长程决策的RL训练范式
AgentGym-RL[11]的"先短程后长程"分阶段训练法和Information Self-Locking[3]的失败机制分析表明,长程决策的RL训练仍面临根本性挑战。未来需要解决credit assignment在超长轨迹中的稀疏性问题、训练稳定性的保证、以及从模拟到真实环境的迁移。7B级开源模型追平闭源旗舰的成绩[11]预示着开源agent生态的快速追赶。
13. 结论
本文系统调研了2026年AAAI、ICLR、ICML、ACL、CVPR五大AI顶会中300余篇agent相关论文,精选60余篇代表性工作展开分析。研究揭示了2026年agent技术的三大核心特征:
第一,范式转变基本完成。从"LLM作为静态推理器"到"LLM作为自主智能体"的转变已从概念验证走向产业部署。UIUC的135页综述[38]提供了统一概念框架,四大厂商均交付GA质量的agent产品,OSWorld基准达到人类基线[43],7B级开源模型追平闭源旗舰[11]。
第二,技术深度快速拓展。多模式统一架构[5]、上下文工程[6]、世界模型模拟推理[9]、自组织多智能体[41]、神经科学启发的记忆架构等方向均出现范式创新。Darwin Gödel Machine[8]的"agent改写自身代码"自指改进代表了通向开放式进化的可行路径。
第三,评估与安全成为紧迫议题。去理想化评测揭示现有agent在真实场景中表现远低于刷榜数字——持续演化场景最高仅38%[29]、完整科研实验成功率仅0.5%[2]。安全研究揭示agent"识别危险但无法纳入规划"的系统性失效[49],长上下文安全[21]和工具调用注入[22]构成新型攻击面。
展望未来,Agent OS作为新基础设施层、自组织多智能体系统、个性化agent、世界模型统一、Agentic Science的完整闭环、安全治理内化、以及长程决策RL训练范式的成熟,将共同塑造agent技术的下一阶段发展。随着这些方向的推进,agent有望从"任务执行工具"进化为"自主探索与发现的伙伴",在科学研究、软件开发、企业管理等领域产生深远影响。
参考文献
[1] PaperNotes, AAAI 2026 Accepted Papers (LLM Agent方向). https://papernotes.org/AAAI2026/llm_agent/
[2] PaperNotes, ICLR 2026 Accepted Papers (LLM Agent方向). https://papernotes.org/ICLR2026/llm_agent/
[3] PaperNotes, ICML 2026 Accepted Papers (LLM Agent方向). https://en.papernotes.org/ICML2026/llm_agent/
[4] PaperNotes, ACL 2026 Accepted Papers (LLM Agent方向). https://en.papernotes.org/ACL2026/llm_agent/
[5] Jian Yang et al., A²FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning. ICLR 2026. https://arxiv.org/pdf/2510.12838
[6] Stanford University et al., Agentic Context Engineering. ICLR 2026. https://arxiv.org/pdf/2510.04618
[7] AgentFold: Long-Horizon Web Agents with Proactive Context Management. ICLR 2026. https://arxiv.org/pdf/2510.24699
[8] Sakana AI & UBC, Darwin Gödel Machine. ICLR 2026. https://arxiv.org/pdf/2505.22954
[9] Baolin Peng et al., Dyna-Mind: Learning to Simulate from Experience. ICLR 2026. https://arxiv.org/html/2510.09577
[10] DreamPhase: Offline Imagination and Uncertainty-Guided Planning. ICLR 2026. https://openreview.net/forum?id=81PJ2KPnmK
[11] 复旦大学NLP实验室 et al., AgentGym-RL. ICLR 2026. https://arxiv.org/pdf/2509.08755
[12] Hu, Wang, McAuley et al., MemoryAgentBench. ICLR 2026. https://arxiv.org/pdf/2507.05257
[13] Liu, Kim et al., EMPO². ICLR 2026. https://arxiv.org/pdf/2602.23008
[14] Liming Yang et al., BAMAS. AAAI 2026. https://ojs.aaai.org/index.php/AAAI/article/view/40226
[15] Vinay Samuel et al., Collaborative Gym. ICLR 2026. https://arxiv.org/pdf/2412.15701
[16] AgenTracer. ICLR 2026. https://arxiv.org/pdf/2509.03312
[17] Kai Yu组, TRM: Tool-call Reward Model. ICLR 2026. https://openreview.net/forum?id=LnBEASInVr
[18] Peijie Yu et al., WildToolBench. ICLR 2026. https://arxiv.org/abs/2604.06185
[19] MSARL. ICLR 2026. https://openreview.net/pdf?id=ZLxKJVdSW4
[20] Shao et al., ChinaTravel. ICLR 2026. https://arxiv.org/pdf/2412.13682
[21] When Refusals Fail. AAAI 2026. https://arxiv.org/pdf/2512.02445
[22] Chang et al., ChatInject. ICLR 2026. https://arxiv.org/pdf/2509.22830
[23] Sirui Chen et al., DEPO. AAAI 2026. https://arxiv.org/pdf/2511.15392
[24] ACON. ICML 2026. https://arxiv.org/abs/2510.00615
[25] Agent JIT Compilation. ICML 2026. https://arxiv.org/abs/2605.21470
[26] AdaMEM. ICML 2026. https://arxiv.org/abs/2606.05684
[27] CollabBench. ICML 2026. https://arxiv.org/abs/2606.05793
[28] Simon Storf et al., Constitutional Black-Box Monitoring. ICML 2026. https://arxiv.org/abs/2603.00829
[29] Gangda Deng et al., EvoClaw. ICML 2026. https://arxiv.org/abs/2603.13428
[30] AgencyBench. ACL 2026. https://arxiv.org/abs/2601.11044
[31] Zhiheng Xi et al., AgentGym2. ACL 2026. https://arxiv.org/abs/2607.05174
[32] APEX-MEM. ACL 2026. https://arxiv.org/abs/2604.14362
[33] GenesisFunc. ACL 2026. https://aclanthology.org/2026.acl-long.1319.pdf
[34] VoxMind. ACL 2026. https://aclanthology.org/2026.acl-long.459.pdf
[35] Hyunji Min et al., GOAT. ACL 2026. https://aclanthology.org/2026.findings-acl.1150.pdf
[36] DiaFORGE. ACL 2026. https://arxiv.org/abs/2507.03336
[37] Wonjoong Kim et al., Beyond the Final Answer. ICML 2026. https://icml.cc/media/icml-2026/Slides/64255_IvmDOa3.pdf
[38] Tianxin Wei et al., Agentic Reasoning for LLMs: A Survey. arXiv:2601.12538. https://arxiv.org/abs/2601.12538
[39] Toward Personalized LLM-Powered Agents. arXiv:2602.22680. https://arxiv.org/abs/2602.22680
[40] Jiaqi Wei et al., From AI for Science to Agentic Science. arXiv:2508.14111. https://arxiv.org/abs/2508.14111
[41] Drop the Hierarchy and Roles. arXiv:2603.28990. https://arxiv.org/abs/2603.28990
[42] OpenAI, ChatGPT Work. https://openai.com/index/chatgpt-for-your-most-ambitious-work/
[43] Anthropic, Claude Opus 4.6. https://www.anthropic.com/news/claude-opus-4-6
[44] Google DeepMind, Co-Scientist. Nature, 2026. https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/
[45] Meta, Llama 4 Agent Framework. https://callsphere.ai/blog/meta-releases-llama-4-agent-framework-open-source-multi-agent-orchestration
[46] Kexin Huang et al., Biomni. Science, 2026. https://www.science.org/doi/10.1126/science.adz4351
[47] Xu et al., RoboAgent. CVPR 2026. https://openaccess.thecvf.com/content/CVPR2026/papers/Xu_RoboAgent_Chaining_Basic_Capabilities_for_Embodied_Task_Planning_CVPR_2026_paper.pdf
[48] Bi et al., Motus. CVPR 2026. https://openaccess.thecvf.com/content/CVPR2026/papers/Bi_Motus_A_Unified_Latent_Action_World_Model_CVPR_2026_paper.pdf
[49] PaperNotes, CVPR 2026 Robotics & Embodied AI. https://en.papernotes.org/CVPR2026/robotics/
[50] HERA. arXiv:2604.00901. https://arxiv.org/pdf/2604.00901v2
[51] Forasoft, LangGraph vs CrewAI vs AutoGen. https://www.forasoft.com/learn/ai-for-video-engineering/articles-ai/langgraph-vs-crewai-vs-autogen-agent-frameworks
[52] Andrew.ooo, LangGraph 1.2 vs CrewAI 1.14. https://andrew.ooo/answers/langgraph-1-2-vs-crewai-1-14-vs-mastra-may-2026/
[53] AliceLabs, Best AI Agent Frameworks 2026. https://alicelabs.ai/en/insights/best-ai-agent-frameworks-2026
[54] AIWiki, Computer-Use Agent. https://aiwiki.ai/wiki/computer-use_agent
[55] DataCamp, Muse Spark 1.1. https://www.datacamp.com/id/blog/muse-spark-1-1
[56] FelloAI, Claude Cowork Guide. https://felloai.com/ko/claude-cowork-guide/
[57] Zylos AI, Graph-Based Agent Workflow Orchestration. https://zylos.ai/en/research/2026-04-14-graph-based-agent-workflow-orchestration-production/
[58] Emerging AI Engineering. https://media.aivoid.dev/pdfs/emerging-ai-engineering-agents-orchestration-and-ai-native-systems_20260504181824.pdf
[59] Hugging Face, Smolagents. https://smolagents.org/hi/