00 REVIEW OVERVIEW
这份综述关注什么
研究对象从单次模型调用延伸到完整 Agent 系统,内容依次讨论系统构成、开源实现、关键机制、前沿问题与评测方法。
一个完整的 Agent 系统通常包含模型、工具接口、运行循环、状态管理、工作流、执行环境、 权限控制和评测反馈。2026 年的开源生态已经为其中多数环节提供了可复用实现; 长任务环境、轨迹数据、可验证反馈、恢复机制和持续评测,则继续构成系统可靠性的关键基础。
系统表现来自整体协同
任务结果由模型、运行框架、工具接口、上下文、执行环境、推理预算和验证器共同产生。
长任务是可靠性的核心尺度
随着任务时间增长,状态漂移、错误累积、恢复能力和结果验证会逐渐成为主要限制。
多 Agent 的收益取决于任务结构
任务的可分解性、并行度、上下文边界和验证方式,共同决定协作带来的收益与成本。
安全贯穿整个执行链
指令层级、最小权限、凭据隔离、操作确认、可信边界和审计记录需要协同设计。
已有稳定实现
多套项目提供了明确接口和生产实践,例如结构化输出、持久化工作流与基础运行追踪。
方法持续完善
研究结果不断更新,系统边界仍在变化,例如长任务运行框架、上下文压缩和计算机操作。
证据仍待积累
论文已展示潜力,复现规模、训练成本和外部有效性仍有限,例如 Agent 强化学习与动态多 Agent 图。
01 SYSTEM STACK
Agent 系统由哪些部分组成
从底层模型到面向用户的应用,Agent 能力分布在多个层次。Codex CLI、Agents SDK、LangGraph、MCP 和 OSWorld 分别处在这条技术栈的不同位置。
Application / Product
用户任务、UI、权限、连接器、云端运行与协作体验
Harness / Scaffold
把模型、工具、上下文、编辑接口、循环与验证拼成可工作的 Agent
Workflow / Runtime
状态、分支、恢复、持久化、并行、人工审批和副作用管理
Agent SDK
Agent loop、tools、handoff、guardrails、sessions、tracing 的代码抽象
Interoperability
工具、数据和远程 Agent 的发现、能力描述与消息交换
Environment & Evaluation
可执行任务环境、状态初始化、验证器、轨迹与安全测试
Model & Inference
推理、生成、工具选择、多模态感知和推理时计算
02 SDK BOUNDARIES
以 Codex 为例理解项目边界
Codex 同时提供 CLI、SDK 与 App Server。以这组工具为切口,可以直观看到终端产品、程序化接口和客户端后端各自承担的职责。
Codex CLI
终端客户端 + 编码 harness
Repo / shell / patch / sandbox / approvals / compaction / TUI / exec从代码中创建和续接 Codex thread,用于 CI、内部工具和应用集成。
更底层的本地 JSON-RPC 接口,暴露 thread、turn、审批、历史和流式事件。
通用 Agent 应用工具箱;可把 Codex 作为 MCP 专家纳入更大的业务工作流。
代码仓库中的 agent turn
终端 UX、shell、patch、文件上下文、沙箱、审批、MCP、非交互执行
业务工作流与跨域服务编排
编码、代码审查、终端自动化
Codex thread / turn
从 TS / Python 控制 Codex、结构化事件与线程延续
通用 Agent 循环与业务编排
CI/CD、内部研发工具、产品内嵌 Codex
JSON-RPC client protocol
认证、历史、审批、thread / turn、流式事件
高层业务 Agent 设计
IDE、桌面端和自定义富客户端
Agent run
loop、tools、agents-as-tools、handoffs、sessions、guardrails、traces
代码仓库专用执行环境与终端交互
通用工具型 Agent、客服、研究与多 Agent 协作
持久化状态图
checkpoint、interrupt、time travel、并行、恢复
领域工具、业务规则与结果验证
长生命周期、可恢复、HITL 流程
Agent / workflow
多语言 agent、BSP 图、checkpoint、middleware、OTel
低延迟的异步并行调度
.NET / Python 与 Azure 企业体系
Agent / graph workflow
多语言、sessions、memory、evaluation、MCP、A2A、部署
应用自身的身份、权限与治理
Google 生态和多形态部署
类型化 Agent
typed deps / output、tools、MCP、evals、durable adapters
完整编码产品与图形界面运行时
重类型、验证和 Python 可维护性的团队
Codex CLI / SDK
提供仓库导航、文件编辑、命令执行、沙箱和上下文管理,适合编码、审查与研发流程集成。
Agents SDK / ADK / PydanticAI
围绕工具调用、会话、结构化输出和 Agent 协作组织应用,可按业务复杂度逐步引入持久化工作流。
状态图与持久化运行时
将持久化状态、幂等副作用、人工中断、版本迁移和恢复语义纳入统一的执行模型。
官方边界: Codex Glossary ↗ Codex SDK ↗ Agents SDK Orchestration ↗ Codex × Agents SDK ↗
03 CORE PRIMITIVES
Agent 系统的八类基础机制
这些机制共同决定任务如何分配、状态如何流转、结果如何验证,以及系统如何暂停、恢复和协作。点击条目可查看常见实现、研究方向与工程要点。
01
路由 Routing
决定下一步由哪个模型、工具、Agent 或流程分支处理。
展开
路由 Routing
决定下一步由哪个模型、工具、Agent 或流程分支处理。
常见实现
规则路由负责确定性判断;模型分类器处理自然语言中的模糊边界;学习型路由利用历史成败与成本优化选择。三类方法通常组合使用,各自承担不同层次的判断。
研究方向
带置信度的 abstention、成本感知模型选择、在线 taxonomy 演化、基于 trace 的路由器训练、风险分级和 policy gate。
主要难点
标签边界漂移、低频类缺数据、错误路由被下游勉强完成、模型自报置信度缺少校准,以及线上分布变化。
工程要点
权限与合规由规则层处理,模型层承担语义选择;系统保留 fallback、top-2 和拒答路径,并分别评估路由准确率与端到端效用。
02
并行 Parallelism
将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。
展开
并行 Parallelism
将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。
适用场景
检索多个来源、独立文件检查、候选解法采样,以及能够分别验证的分片任务。顺序依赖较强的任务通常适合串行处理。
研究方向
动态并发宽度、early stopping、预算分配、异质模型组合、相关错误建模、流式聚合和推测执行。
主要难点
相关错误不会因投票消失;慢分支拖累尾延迟;合并器可能丢失少数正确证据;共享工具还会产生资源竞争与副作用冲突。
工程要点
为每个分支设置时限、预算和幂等键;汇总阶段依据证据和验证结果决策,并明确部分分支失败时的降级方式。
03
交接 Handoff
把后续回复的所有权、上下文和部分权限转移给专门 Agent。
展开
交接 Handoff
把后续回复的所有权、上下文和部分权限转移给专门 Agent。
两种协作模式
Handoff 将后续交互的所有权交给专业 Agent;Agent-as-tool 由管理者保留最终责任,并将专家作为一次受控调用。
研究方向
最小充分上下文、所有权协议、权限委托、handoff 质量评分、自动回退、跨组织 agent card 与能力发现。
主要难点
上下文丢失、重复工作、责任模糊、循环交接、权限无意升级,以及交接完成后缺少最终闭环。
工程要点
交接信息采用结构化格式,包含目标、已知事实、证据、产物、未决问题、权限、完成条件和返回路径。
04
图编排 Graph Orchestration
用节点、边、状态、条件、循环和中断表达可恢复的控制流。
展开
图编排 Graph Orchestration
用节点、边、状态、条件、循环和中断表达可恢复的控制流。
主要作用
图将控制面显式化,定义并行步骤、中断位置、审批节点和恢复路径。模型能力仍来自节点内部的推理与工具使用。
研究方向
从静态模板到动态运行时图、图结构优化、自动分解、拓扑学习、基于 trace 的重写,以及图成本与鲁棒性联合评价。
主要难点
节点粒度难定、状态 schema 演化困难、动态图难审计;Pregel/BSP 的超步屏障可靠,但会让并行路径互相等待。
工程要点
业务状态机可作为主干,Agent 节点嵌入需要局部判断的位置;副作用与推理节点分离,每条边都定义守卫条件、超时、重试、补偿与完成条件。
05
结构化输出 Structured Output
让模型输出满足 JSON Schema / 类型契约的机器可消费结果。
展开
结构化输出 Structured Output
让模型输出满足 JSON Schema / 类型契约的机器可消费结果。
能力边界
约束解码可以保证语法和部分 schema。语法有效性与语义正确性是两项不同要求,仍需检查事实、字段完整性和业务约束。
研究方向
复杂 schema 覆盖、语义约束、可解释 repair、跨 provider 一致性、流式结构化输出和 schema-aware agent planning。
主要难点
不同模型对深层 union 与递归结构的支持不一致;schema 越复杂,推理越容易偏离;自动修复也可能掩盖原始错误。
工程要点
保持 schema 小而稳定,增加语义校验、跨字段不变量和外部查验;高风险字段校验失败时停止执行,并限制自动修复次数。
06
检查点 Checkpoint
持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。
展开
检查点 Checkpoint
持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。
保存内容
这里的 checkpoint 指执行状态快照,包括线程、节点位置、消息、业务状态、待处理工具结果和审批状态;它与模型训练中的权重 checkpoint 含义不同。
研究方向
细粒度增量快照、跨版本迁移、分布式一致性、事件溯源、长期记忆与执行状态分离,以及隐私感知 TTL。
主要难点
外部副作用无法随状态一起回滚;恢复时可能重复发邮件或扣款;不可序列化对象和 schema 升级会破坏旧状态。
工程要点
所有写操作使用幂等键和事务记录;保存“意图—执行—结果”三态;明确至少一次或至多一次语义,并定期进行恢复演练。
07
基础 Tracing
把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。
展开
基础 Tracing
把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。
与评测的关系
运行轨迹回答“发生了什么”,评测回答“结果和过程是否达到要求”。前者也是诊断、回放、数据生产和失效归因的基础。
研究方向
统一 GenAI 语义约定、因果归因、反事实回放、自动 failure labeling、trace compression 和可观测性驱动训练。
主要难点
轨迹体量大且可能包含敏感内容;不同供应商的字段尚未统一;最终失败常由多步共同导致,单点根因标签往往过于粗糙。
工程要点
记录模型与版本、提示词哈希、工具参数摘要、token、延迟、成本、状态转移和审批;正文默认脱敏,并设置采样策略与保留期限。
08
MCP / A2A 互操作
MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。
展开
MCP / A2A 互操作
MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。
MCP
基于 JSON-RPC 的有状态连接与能力协商;server 暴露 tools、resources、prompts,client 可提供 sampling、roots、elicitation。
A2A
通过 Agent Card 发现能力,以 task、message、artifact 建模长任务,支持流式、异步、取消、订阅与多种协议绑定。
研究方向
语义互操作、可信能力描述、策略协商、跨组织身份与计费、可验证 artifact、协议网关和最小上下文交换。
信任与安全
协议统一了连接方式,但信任仍需由身份、权限、校验和审计机制建立。工具描述与远端响应可能包含恶意输入,能力声明也可能过期或不准确。
04 OPEN-SOURCE LANDSCAPE
开源 Agent 项目的能力版图
不同项目覆盖的系统层次和工程重点并不相同。下面按核心抽象、主要能力与适用场景进行排列。
OpenAI Agents SDK
围绕运行循环、工具、交接、护栏、会话和追踪提供轻量抽象。
- 主要能力
- 快速构建通用 Agent 循环
- 适用边界
- 代码仓库执行环境与持久化状态图需由外部组件提供
Google ADK
覆盖多语言 Agent、图工作流、记忆、评测、MCP、A2A 与多种部署形态。
- 主要能力
- 组件覆盖完整,部署选择丰富
- 适用边界
- 组件较多,需要统一应用层治理
LangGraph
面向长生命周期任务的状态图运行时,提供检查点、中断、时间回溯与故障恢复。
- 主要能力
- 状态持久化与故障恢复
- 适用边界
- 领域工具、业务规则与验证器仍需应用定义
Microsoft Agent Framework
将 Agent、运行框架和基于 BSP 超步的工作流整合到 Python 与 .NET 生态。
- 主要能力
- 类型、检查点、OpenTelemetry 与 Azure 集成
- 适用边界
- 并行路径受到超步屏障约束
PydanticAI
以类型化依赖和结构化输出为核心,支持 MCP、评测、上下文压缩和持久化执行适配器。
- 主要能力
- 类型验证、可维护性与模型中立
- 适用边界
- 以 Python 生态为中心,产品界面与执行环境需自行集成
CrewAI
以角色化团队和确定性流程表达协作关系,便于快速搭建多 Agent 原型。
- 主要能力
- 角色与任务关系直观
- 适用边界
- 需控制通信、token 与调试成本
smolagents
提供 CodeAgent 与 ToolCallingAgent 的透明最小实现,适合学习、实验和方法研究。
- 主要能力
- 实现精简,实验迭代快
- 适用边界
- 生产治理与持久化能力需自行补充
Codex CLI
面向代码仓库的终端 Agent,集成命令执行、补丁编辑、沙箱、审批、MCP 与上下文压缩。
- 主要能力
- 成熟的代码仓库执行界面
- 适用边界
- 聚焦编码与终端任务,业务工作流需另行编排
OpenHands
可自托管的软件工程 Agent 平台,包含运行时、沙箱与多种交互界面。
- 主要能力
- 端到端运行与自托管
- 适用边界
- 部署和执行环境的维护成本较高
05 RESEARCH FRONTIERS
Agent 研究的七条关键路线
以下路线覆盖能力扩展、系统方法和生产约束。每条路线分别列出研究问题、代表性证据、主要难点与工程启示。
长任务可靠性与有效自治时间
Agent 能否在几十分钟至数小时的任务中持续维护目标、识别失败、恢复进度,并将监督成本控制在可接受范围?
OSWorld 2.0 截止快照的最佳 500-step 完整完成率;108 个任务的人类中位耗时约 1.6 小时。
已有认识
METR 的 50% time horizon 提供了跨模型比较的趋势指标,但任务仍偏向软件与推理。OSWorld 2.0 显示,长任务中的主要问题已扩展到状态丢失、冲突未解、动态信息遗漏和结果未验证。
研究方向
分段目标与 rolling horizon、失败检测器、进度价值函数、可验证中间状态、预算感知 stopping、恢复策略和人类监督经济学。
主要难点
小错误会随步骤复合增长;终局奖励提供的反馈过晚;Agent 可能把产物存在误判为任务正确;基准任务时长与真实岗位分布仍有差异。
工程启示
任务可拆成带验证条件的里程碑,持续保存已完成事项、下一步和阻塞项;写操作后读回验证,并为长任务设置人工接管点与失败预算。
Context engineering 与长期记忆
在有限上下文中,系统应保存哪些状态,并在何时检索、压缩、更新或遗忘?
MemoryAgentBench 将长期记忆拆成准确检索、测试时学习、长程理解和选择性遗忘;现有方法尚无全能解。
已有认识
长期记忆系统通常将工作状态、情节记录、语义记忆和外部产物分层保存,并按当前任务需要逐步引入旧上下文。
研究方向
主动 compaction、分支/折叠轨迹、记忆写入策略、时序与冲突更新、可学习遗忘、超长 web experience memory 和 provenance-aware retrieval。
主要难点
错误记忆会持续影响后续判断;摘要可能丢失约束;检索相关不代表信息当前有效;跨会话的身份与权限边界也可能泄漏。
工程启示
使用结构化任务状态保存事实、约束、未决项和下一步;原始证据保留引用,记忆附带来源、时间、置信度、作用域和有效期。
Harness 与工具接口设计
工具 schema、返回粒度、编辑接口与环境反馈应如何设计,才能让同一模型更稳定地完成任务?
SWE-agent 把 Agent-Computer Interface 作为独立研究变量:repo 导航、文件编辑和反馈设计会显著改变行为。
已有认识
工具命名、参数 schema、错误语义、返回长度、补丁原语、仓库地图、DOM 与可访问性树,共同决定 Agent 能看到什么、能执行什么,以及如何判断动作结果。
研究方向
自动工具压缩与选择、schema 生成、环境 affordance 学习、错误可恢复接口、tool result distillation、接口共设计与 harness-aware post-training。
主要难点
工具数量增加会提高选择难度;返回过短缺少证据,过长则占用上下文;不可操作的错误文本和接口变化也会削弱恢复能力。
工程启示
一个工具对应一个可验证动作;参数使用领域名词;错误返回原因、是否可重试和建议动作;写操作返回可读回的对象标识。
Agentic post-training 与强化学习
多步工具轨迹和环境反馈如何用于训练 Agent,并缓解稀疏奖励、信用分配与奖励投机?
长轨迹可达百轮乃至百万 token;只给终局 outcome reward,无法稳定判断哪一步值得强化。
已有认识
环境内训练、可验证结果和训练—执行解耦正在形成工具链;Agent Lightning 以 Agent MDP 和统一数据接口连接不同框架的执行轨迹。
研究方向
turn / step / segment credit assignment、过程奖励、反事实优势估计、自生成任务、课程学习、在线环境训练和可验证 reward model。
主要难点
环境昂贵且持续变化;奖励可能遗漏隐性质量;Agent 可能迎合验证器;策略升级后旧轨迹出现分布失配,安全约束也难与探索兼容。
工程启示
高质量运行轨迹、可执行验证器与失败标签构成训练数据基础;独立保留测试环境和红队任务,同时监控任务成功率、成本与策略退化。
多 Agent 的可控扩展
任务可分解性、通信成本和验证方式,如何共同决定多 Agent 系统的实际收益?
一项 180-config 控制研究中,多 Agent 在强顺序推理任务上整体退化;并行可分任务才出现明显增益。
已有认识
并行搜索、独立审查和天然上下文分区更容易获得收益;集中式管理者通常比无中心对话更易控制错误传播。
研究方向
动态团队规模、能力路由、共享黑板、通信压缩、可验证 delegation、社会学习、异质权限和运行时动态图。
主要难点
信息传递后未必能被正确整合;同源模型会产生相关错误;通信消耗大量 token;最终责任归属与失败归因也更困难。
工程启示
建立单 Agent 基线后,再将独立且可验证的子任务分配给专业 Agent;管理者保留结果所有权,每个专家返回证据、置信度与完成条件。
Computer use、浏览器与多模态
从 DOM / API 走向截图、鼠标、键盘和混合感知后,如何保持定位、状态与操作后验证?
OSWorld 2.0 的基线 Agent 平均约 318 次工具调用;远高于 OSWorld 1.0 的约 30 次。
已有认识
视觉定位仍是基础能力;在专业长任务中,跨来源核对、隐状态推断、多条目跟踪、动态更新和视觉结果验收更容易成为瓶颈。
研究方向
视觉 + DOM + API 混合策略、时序视觉、主动观察、UI 世界模型、跨应用状态、操作前后 diff、可验证 artifact 和可扩展训练环境。
主要难点
界面持续变化,像素坐标脆弱,弹窗与焦点不可预测;操作可能产生真实副作用,多模态结果也常缺少确定性验证器。
工程启示
稳定交互由 API 或 DOM 承担,图形界面用于补充;每次动作后重新观察,高风险提交前展示最终差异,并在可重置的隔离环境中保留状态截图。
安全、权限与人类控制
当网页、邮件、工具描述和远程 Agent 都可能包含不可信内容时,系统如何保持用户意图、权限和操作边界?
MCP Security Bench 覆盖名称碰撞、工具描述注入、冒充用户、错误升级等 12 类攻击与 400+ 工具。
已有认识
模型的指令层级可以提高鲁棒性,但无法单独形成安全边界。工具调用能力越强,攻击者借助恶意内容驱动高影响操作的风险也可能上升。
研究方向
任务对齐监控、信息流控制、capability security、短期凭据、可信工具元数据、动态攻击环境、自动 policy synthesis 和安全经济学。
主要难点
间接提示注入尚无通用解法;过度防御会损害正常任务;跨工具组合可能形成意外权限,频繁确认也会造成用户疲劳。
工程启示
数据与指令分层,使用最小权限和短期凭据,分离读写能力;不可逆动作逐笔确认,高风险参数由可信代码生成,全轨迹可回放。
06 PRODUCTION BLUEPRINT
面向生产环境的参考架构
参考架构将任务契约、策略路由、局部 Agent 循环、工具网关、人工审批与结果验证组织在同一条可追踪执行链中。
Task Contract
目标、边界、权限、done、预算、超时
Policy Router
风险分级、模型/工具选择、拒绝与澄清
Bounded Agent Loop
plan → act → observe → verify
Outcome & Regression
结果验证、人工反馈、失败入回归集
Approval / Recovery
人工确认、checkpoint、补偿与接管
Tool Gateway
schema、权限、幂等、审计、MCP / API
交接信息
- 目标与当前 owner
- 事实、证据和来源
- 已产出 artifact
- 未决问题与风险
- 可用权限与禁区
- 完成条件与返回路径
恢复状态
- 业务状态与 schema 版本
- 节点位置和待执行意图
- 外部副作用 ledger
- 工具结果与幂等键
- 审批状态和超时
- 恢复 / 补偿策略
运行轨迹
- 模型、版本与 prompt hash
- 工具参数摘要和结果状态
- 状态转移与 handoff
- token、费用和延迟
- 重试、错误和人工介入
- 最终 grader 与失败标签
07 EVALUATION SYSTEM
如何评估一个 Agent 系统
公共评测提供跨系统参照;固定模型、工具、环境与预算的内部任务集,则用于选型、上线和持续回归。
公开评测中的数据与验证问题
OpenAI 2026 年审计报告指出,SWE-Bench Pro 公共子集在 8 个月内从 23.3% 升至 80.3%, 并估计 27.4%–34.1% 任务存在测试、提示或覆盖问题。这些结果说明,公开高分需要结合任务新颖性、验证器质量和人工审查解读。
一次成功
最接近普通用户单次运行体验。
能力上限
给 k 次机会至少一次成功。
连续可靠
连续 k 次均成功,衡量可依赖性。
监督成本
人工澄清、确认、纠错和接管时间。
总拥有成本
token、墙钟时间、工具调用、环境和工程维护。
安全损失
越权、错误写入、泄露、拒绝不足与过度拒绝。
真实 Linux 终端任务
CLI / coding / DevOps harness
对模型、环境、预算强耦合
SWE-bench真实仓库 issue 修复
软件工程 Agent
污染、测试质量、版本差异
DeepSWE原创长程软件任务
新一代 coding Agent
规模小、独立复现仍有限
BFCL函数调用与格式
工具型模型 / Agent
较少涉及完整业务流程
τ-bench多轮工具与策略遵循
客服 / 企业流程
领域和用户模拟有限
WebArena真实网站端到端操作
Browser Agent
维护成本与网站覆盖
OSWorld 2.0长时跨应用 computer use
桌面 / 多模态 Agent
运行昂贵、系统耦合
AgentDojo任务能力 + 间接注入
工具型 Agent 安全
攻击面不可穷举
MCP-AgentBenchMCP 工具发现与组合
MCP client / Agent
聚焦协议工具层
METR Time Horizon可完成任务的时间跨度
长任务 Agent
任务分布偏技术类
可比实验的六项控制变量
- 01同一模型版本与推理设置
- 02同一系统任务契约
- 03同一工具与 JSON schema
- 04同一初始环境与数据快照
- 05同一 token / 时间 / 费用预算
- 06同一 grader、done 与安全标准
每任务至少 3–5 次;报告置信区间和失败分布;保留完整 trace;同时记录代码量、 开发时间、调试成本、恢复成功率与人工介入分钟数。
理解失败:目标或约束读错
路由失败:选错工具 / Agent / 分支
状态失败:遗忘、污染、冲突未更新
执行失败:参数、定位、权限、环境错误
恢复失败:重试、补偿、checkpoint 无效
验证失败:没查、grader 漏判、提前结束
安全失败:越权、注入、泄露、错误确认
经济失败:虽成功但比人工更贵或更慢
08 ADOPTION GUIDE
从研究结论到项目选型
下表给出不同场景可优先验证的技术组合,以及概念验证阶段需要重点观察的系统能力。
确定性企业流程
LangGraph / Microsoft Agent Framework / PydanticAI
状态、checkpoint、审批、幂等、副作用恢复
轻量通用 Agent
OpenAI Agents SDK / Google ADK / smolagents
工具闭环、结构化输出、trace、失败分类
知识与文档流程
LlamaIndex / LangGraph + retrieval / PydanticAI
解析、权限、召回、引用、知识更新
多 Agent 研究
ADK / CrewAI / Agents SDK / LangGraph
单 Agent 基线、可分解性、协调成本、归因
Coding Agent
Codex CLI / SDK / OpenHands / SWE-agent / Aider
repo map、patch、测试反馈、沙箱、compaction
Browser / Computer use
API / DOM 优先的混合 harness + 隔离环境
动态定位、验证、安全副作用、人工接管
建立内部 Agent 评测能力
定义任务契约
- 20–50 个真实高价值任务
- done、权限、预算、停止条件
- 应拒绝 / 应澄清负样本
最小单 Agent 基线
- 固定模型、工具和 sandbox
- 确定性 grader 与 trace
- 建立失败 taxonomy
受控对照实验
- 选择 3–5 个候选实现
- 每任务运行 3–5 次
- 评估效果、成本与介入
灰度与回归闭环
- 低风险自动化,高风险确认
- 线上失败进入回归集
- 每周复盘 trace 与权限
工作流提供确定性结构,Agent 处理局部不确定性,工具与环境返回可验证状态; 检查点、运行追踪、评测和权限控制共同构成可恢复、可审计的生产系统。
APPENDIX REFERENCES
资料来源与研究口径
资料以项目官方文档、代码仓库、论文和评测集网站为主;预印本结果按其任务范围和复现情况审慎解读。
SDK、运行时与协议 16
长任务、上下文与记忆 11
Harness、图、Tracing 与强化学习 14
多 Agent、Computer Use 与安全 15
评测、方法与审计 12
调研截止:2026-07-28
覆盖范围:通用 Agent、企业工作流、研究 / 浏览、Coding、Computer use、协议、运行时、安全与评测。
使用提示:项目能力、许可证、协议版本和榜单会变化,正式选型时应再次核验。