REVIEW / 2026 LLM AGENT SYSTEMS

Agent 系统研究综述系统构成、开源生态、研究前沿与工程实践

本文以 LLM Agent 为核心对象,梳理模型如何借助工具与环境执行任务, 状态与工作流如何支撑长时间运行,以及安全、评测和工程基础设施如何共同决定系统表现。

RESEARCH CUTOFF 28 · 07 · 2026

面向技术研究、架构设计与项目评估

10章节
08核心构件
07研究路线
60+一手来源
综述范围

覆盖通用 Agent、企业工作流、Coding Agent、Computer use、互操作协议、运行时、安全与评测。

00 REVIEW OVERVIEW

这份综述关注什么

研究对象从单次模型调用延伸到完整 Agent 系统,内容依次讨论系统构成、开源实现、关键机制、前沿问题与评测方法。

研究对象

一个完整的 Agent 系统通常包含模型、工具接口、运行循环、状态管理、工作流、执行环境、 权限控制和评测反馈。2026 年的开源生态已经为其中多数环节提供了可复用实现; 长任务环境、轨迹数据、可验证反馈、恢复机制和持续评测,则继续构成系统可靠性的关键基础。

01

系统表现来自整体协同

任务结果由模型、运行框架、工具接口、上下文、执行环境、推理预算和验证器共同产生。

02

长任务是可靠性的核心尺度

随着任务时间增长,状态漂移、错误累积、恢复能力和结果验证会逐渐成为主要限制。

03

多 Agent 的收益取决于任务结构

任务的可分解性、并行度、上下文边界和验证方式,共同决定协作带来的收益与成本。

04

安全贯穿整个执行链

指令层级、最小权限、凭据隔离、操作确认、可信边界和审计记录需要协同设计。

工程共识

已有稳定实现

多套项目提供了明确接口和生产实践,例如结构化输出、持久化工作流与基础运行追踪。

活跃方向

方法持续完善

研究结果不断更新,系统边界仍在变化,例如长任务运行框架、上下文压缩和计算机操作。

前沿探索

证据仍待积累

论文已展示潜力,复现规模、训练成本和外部有效性仍有限,例如 Agent 强化学习与动态多 Agent 图。

01 SYSTEM STACK

Agent 系统由哪些部分组成

从底层模型到面向用户的应用,Agent 能力分布在多个层次。Codex CLI、Agents SDK、LangGraph、MCP 和 OSWorld 分别处在这条技术栈的不同位置。

07

Application / Product

用户任务、UI、权限、连接器、云端运行与协作体验

Codex App · Claude Code · OpenHands
06

Harness / Scaffold

把模型、工具、上下文、编辑接口、循环与验证拼成可工作的 Agent

Codex CLI · SWE-agent · Aider
05

Workflow / Runtime

状态、分支、恢复、持久化、并行、人工审批和副作用管理

LangGraph · Microsoft Agent Framework
04

Agent SDK

Agent loop、tools、handoff、guardrails、sessions、tracing 的代码抽象

OpenAI Agents SDK · Google ADK · PydanticAI
03

Interoperability

工具、数据和远程 Agent 的发现、能力描述与消息交换

MCP · A2A
02

Environment & Evaluation

可执行任务环境、状态初始化、验证器、轨迹与安全测试

SWE-bench · τ-bench · OSWorld · AgentDojo
01

Model & Inference

推理、生成、工具选择、多模态感知和推理时计算

Frontier / open-weight models

02 SDK BOUNDARIES

以 Codex 为例理解项目边界

Codex 同时提供 CLI、SDK 与 App Server。以这组工具为切口,可以直观看到终端产品、程序化接口和客户端后端各自承担的职责。

CODING SPECIALIST

Codex CLI

终端客户端 + 编码 harness

Repo / shell / patch / sandbox / approvals / compaction / TUI / exec
Codex SDK

从代码中创建和续接 Codex thread,用于 CI、内部工具和应用集成。

App Server

更底层的本地 JSON-RPC 接口,暴露 thread、turn、审批、历史和流式事件。

Agents SDK

通用 Agent 应用工具箱;可把 Codex 作为 MCP 专家纳入更大的业务工作流。

项目 / 形态核心抽象内置能力需要外部系统补充适用场景
Codex CLIApplication / Harness

代码仓库中的 agent turn

终端 UX、shell、patch、文件上下文、沙箱、审批、MCP、非交互执行

业务工作流与跨域服务编排

编码、代码审查、终端自动化

Codex SDKProgrammatic control

Codex thread / turn

从 TS / Python 控制 Codex、结构化事件与线程延续

通用 Agent 循环与业务编排

CI/CD、内部研发工具、产品内嵌 Codex

Codex App ServerClient backend

JSON-RPC client protocol

认证、历史、审批、thread / turn、流式事件

高层业务 Agent 设计

IDE、桌面端和自定义富客户端

OpenAI Agents SDKGeneral SDK

Agent run

loop、tools、agents-as-tools、handoffs、sessions、guardrails、traces

代码仓库专用执行环境与终端交互

通用工具型 Agent、客服、研究与多 Agent 协作

LangGraphState runtime

持久化状态图

checkpoint、interrupt、time travel、并行、恢复

领域工具、业务规则与结果验证

长生命周期、可恢复、HITL 流程

Microsoft Agent FrameworkAgents + Harness + Workflows

Agent / workflow

多语言 agent、BSP 图、checkpoint、middleware、OTel

低延迟的异步并行调度

.NET / Python 与 Azure 企业体系

Google ADKFramework + Runtime

Agent / graph workflow

多语言、sessions、memory、evaluation、MCP、A2A、部署

应用自身的身份、权限与治理

Google 生态和多形态部署

PydanticAITyped Python SDK

类型化 Agent

typed deps / output、tools、MCP、evals、durable adapters

完整编码产品与图形界面运行时

重类型、验证和 Python 可维护性的团队

代码仓库自动化

Codex CLI / SDK

提供仓库导航、文件编辑、命令执行、沙箱和上下文管理,适合编码、审查与研发流程集成。

通用业务 Agent

Agents SDK / ADK / PydanticAI

围绕工具调用、会话、结构化输出和 Agent 协作组织应用,可按业务复杂度逐步引入持久化工作流。

长流程与故障恢复

状态图与持久化运行时

将持久化状态、幂等副作用、人工中断、版本迁移和恢复语义纳入统一的执行模型。

官方边界: Codex Glossary ↗ Codex SDK ↗ Agents SDK Orchestration ↗ Codex × Agents SDK ↗

03 CORE PRIMITIVES

Agent 系统的八类基础机制

这些机制共同决定任务如何分配、状态如何流转、结果如何验证,以及系统如何暂停、恢复和协作。点击条目可查看常见实现、研究方向与工程要点。

01

路由 Routing

决定下一步由哪个模型、工具、Agent 或流程分支处理。

展开

常见实现

规则路由负责确定性判断;模型分类器处理自然语言中的模糊边界;学习型路由利用历史成败与成本优化选择。三类方法通常组合使用,各自承担不同层次的判断。

研究方向

带置信度的 abstention、成本感知模型选择、在线 taxonomy 演化、基于 trace 的路由器训练、风险分级和 policy gate。

主要难点

标签边界漂移、低频类缺数据、错误路由被下游勉强完成、模型自报置信度缺少校准,以及线上分布变化。

工程要点

权限与合规由规则层处理,模型层承担语义选择;系统保留 fallback、top-2 和拒答路径,并分别评估路由准确率与端到端效用。

02

并行 Parallelism

将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。

展开

适用场景

检索多个来源、独立文件检查、候选解法采样,以及能够分别验证的分片任务。顺序依赖较强的任务通常适合串行处理。

研究方向

动态并发宽度、early stopping、预算分配、异质模型组合、相关错误建模、流式聚合和推测执行。

主要难点

相关错误不会因投票消失;慢分支拖累尾延迟;合并器可能丢失少数正确证据;共享工具还会产生资源竞争与副作用冲突。

工程要点

为每个分支设置时限、预算和幂等键;汇总阶段依据证据和验证结果决策,并明确部分分支失败时的降级方式。

03

交接 Handoff

把后续回复的所有权、上下文和部分权限转移给专门 Agent。

展开

两种协作模式

Handoff 将后续交互的所有权交给专业 Agent;Agent-as-tool 由管理者保留最终责任,并将专家作为一次受控调用。

研究方向

最小充分上下文、所有权协议、权限委托、handoff 质量评分、自动回退、跨组织 agent card 与能力发现。

主要难点

上下文丢失、重复工作、责任模糊、循环交接、权限无意升级,以及交接完成后缺少最终闭环。

工程要点

交接信息采用结构化格式,包含目标、已知事实、证据、产物、未决问题、权限、完成条件和返回路径。

04

图编排 Graph Orchestration

用节点、边、状态、条件、循环和中断表达可恢复的控制流。

展开

主要作用

图将控制面显式化,定义并行步骤、中断位置、审批节点和恢复路径。模型能力仍来自节点内部的推理与工具使用。

研究方向

从静态模板到动态运行时图、图结构优化、自动分解、拓扑学习、基于 trace 的重写,以及图成本与鲁棒性联合评价。

主要难点

节点粒度难定、状态 schema 演化困难、动态图难审计;Pregel/BSP 的超步屏障可靠,但会让并行路径互相等待。

工程要点

业务状态机可作为主干,Agent 节点嵌入需要局部判断的位置;副作用与推理节点分离,每条边都定义守卫条件、超时、重试、补偿与完成条件。

05

结构化输出 Structured Output

让模型输出满足 JSON Schema / 类型契约的机器可消费结果。

展开

能力边界

约束解码可以保证语法和部分 schema。语法有效性与语义正确性是两项不同要求,仍需检查事实、字段完整性和业务约束。

研究方向

复杂 schema 覆盖、语义约束、可解释 repair、跨 provider 一致性、流式结构化输出和 schema-aware agent planning。

主要难点

不同模型对深层 union 与递归结构的支持不一致;schema 越复杂,推理越容易偏离;自动修复也可能掩盖原始错误。

工程要点

保持 schema 小而稳定,增加语义校验、跨字段不变量和外部查验;高风险字段校验失败时停止执行,并限制自动修复次数。

06

检查点 Checkpoint

持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。

展开

保存内容

这里的 checkpoint 指执行状态快照,包括线程、节点位置、消息、业务状态、待处理工具结果和审批状态;它与模型训练中的权重 checkpoint 含义不同。

研究方向

细粒度增量快照、跨版本迁移、分布式一致性、事件溯源、长期记忆与执行状态分离,以及隐私感知 TTL。

主要难点

外部副作用无法随状态一起回滚;恢复时可能重复发邮件或扣款;不可序列化对象和 schema 升级会破坏旧状态。

工程要点

所有写操作使用幂等键和事务记录;保存“意图—执行—结果”三态;明确至少一次或至多一次语义,并定期进行恢复演练。

07

基础 Tracing

把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。

展开

与评测的关系

运行轨迹回答“发生了什么”,评测回答“结果和过程是否达到要求”。前者也是诊断、回放、数据生产和失效归因的基础。

研究方向

统一 GenAI 语义约定、因果归因、反事实回放、自动 failure labeling、trace compression 和可观测性驱动训练。

主要难点

轨迹体量大且可能包含敏感内容;不同供应商的字段尚未统一;最终失败常由多步共同导致,单点根因标签往往过于粗糙。

工程要点

记录模型与版本、提示词哈希、工具参数摘要、token、延迟、成本、状态转移和审批;正文默认脱敏,并设置采样策略与保留期限。

08

MCP / A2A 互操作

MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。

展开

MCP

基于 JSON-RPC 的有状态连接与能力协商;server 暴露 tools、resources、prompts,client 可提供 sampling、roots、elicitation。

A2A

通过 Agent Card 发现能力,以 task、message、artifact 建模长任务,支持流式、异步、取消、订阅与多种协议绑定。

研究方向

语义互操作、可信能力描述、策略协商、跨组织身份与计费、可验证 artifact、协议网关和最小上下文交换。

信任与安全

协议统一了连接方式,但信任仍需由身份、权限、校验和审计机制建立。工具描述与远端响应可能包含恶意输入,能力声明也可能过期或不准确。

04 OPEN-SOURCE LANDSCAPE

开源 Agent 项目的能力版图

不同项目覆盖的系统层次和工程重点并不相同。下面按核心抽象、主要能力与适用场景进行排列。

GENERAL SDKMIT

OpenAI Agents SDK

围绕运行循环、工具、交接、护栏、会话和追踪提供轻量抽象。

主要能力
快速构建通用 Agent 循环
适用边界
代码仓库执行环境与持久化状态图需由外部组件提供
FRAMEWORKAPACHE-2.0

Google ADK

覆盖多语言 Agent、图工作流、记忆、评测、MCP、A2A 与多种部署形态。

主要能力
组件覆盖完整,部署选择丰富
适用边界
组件较多,需要统一应用层治理
ENTERPRISEMIT

Microsoft Agent Framework

将 Agent、运行框架和基于 BSP 超步的工作流整合到 Python 与 .NET 生态。

主要能力
类型、检查点、OpenTelemetry 与 Azure 集成
适用边界
并行路径受到超步屏障约束
TYPED PYTHONMIT

PydanticAI

以类型化依赖和结构化输出为核心,支持 MCP、评测、上下文压缩和持久化执行适配器。

主要能力
类型验证、可维护性与模型中立
适用边界
以 Python 生态为中心,产品界面与执行环境需自行集成
ROLE-BASEDMIT

CrewAI

以角色化团队和确定性流程表达协作关系,便于快速搭建多 Agent 原型。

主要能力
角色与任务关系直观
适用边界
需控制通信、token 与调试成本
MINIMALAPACHE-2.0

smolagents

提供 CodeAgent 与 ToolCallingAgent 的透明最小实现,适合学习、实验和方法研究。

主要能力
实现精简,实验迭代快
适用边界
生产治理与持久化能力需自行补充
CODING HARNESSAPACHE-2.0

Codex CLI

面向代码仓库的终端 Agent,集成命令执行、补丁编辑、沙箱、审批、MCP 与上下文压缩。

主要能力
成熟的代码仓库执行界面
适用边界
聚焦编码与终端任务,业务工作流需另行编排
CODING PLATFORMMIT

OpenHands

可自托管的软件工程 Agent 平台,包含运行时、沙箱与多种交互界面。

主要能力
端到端运行与自托管
适用边界
部署和执行环境的维护成本较高

05 RESEARCH FRONTIERS

Agent 研究的七条关键路线

以下路线覆盖能力扩展、系统方法和生产约束。每条路线分别列出研究问题、代表性证据、主要难点与工程启示。

01
快速演进

长任务可靠性与有效自治时间

Agent 能否在几十分钟至数小时的任务中持续维护目标、识别失败、恢复进度,并将监督成本控制在可接受范围?

20.6%

OSWorld 2.0 截止快照的最佳 500-step 完整完成率;108 个任务的人类中位耗时约 1.6 小时。

已有认识

METR 的 50% time horizon 提供了跨模型比较的趋势指标,但任务仍偏向软件与推理。OSWorld 2.0 显示,长任务中的主要问题已扩展到状态丢失、冲突未解、动态信息遗漏和结果未验证。

研究方向

分段目标与 rolling horizon、失败检测器、进度价值函数、可验证中间状态、预算感知 stopping、恢复策略和人类监督经济学。

主要难点

小错误会随步骤复合增长;终局奖励提供的反馈过晚;Agent 可能把产物存在误判为任务正确;基准任务时长与真实岗位分布仍有差异。

工程启示

任务可拆成带验证条件的里程碑,持续保存已完成事项、下一步和阻塞项;写操作后读回验证,并为长任务设置人工接管点与失败预算。

02
方法成型

Context engineering 与长期记忆

在有限上下文中,系统应保存哪些状态,并在何时检索、压缩、更新或遗忘?

4 能力

MemoryAgentBench 将长期记忆拆成准确检索、测试时学习、长程理解和选择性遗忘;现有方法尚无全能解。

已有认识

长期记忆系统通常将工作状态、情节记录、语义记忆和外部产物分层保存,并按当前任务需要逐步引入旧上下文。

研究方向

主动 compaction、分支/折叠轨迹、记忆写入策略、时序与冲突更新、可学习遗忘、超长 web experience memory 和 provenance-aware retrieval。

主要难点

错误记忆会持续影响后续判断;摘要可能丢失约束;检索相关不代表信息当前有效;跨会话的身份与权限边界也可能泄漏。

工程启示

使用结构化任务状态保存事实、约束、未决项和下一步;原始证据保留引用,记忆附带来源、时间、置信度、作用域和有效期。

03
关键变量

Harness 与工具接口设计

工具 schema、返回粒度、编辑接口与环境反馈应如何设计,才能让同一模型更稳定地完成任务?

ACI

SWE-agent 把 Agent-Computer Interface 作为独立研究变量:repo 导航、文件编辑和反馈设计会显著改变行为。

已有认识

工具命名、参数 schema、错误语义、返回长度、补丁原语、仓库地图、DOM 与可访问性树,共同决定 Agent 能看到什么、能执行什么,以及如何判断动作结果。

研究方向

自动工具压缩与选择、schema 生成、环境 affordance 学习、错误可恢复接口、tool result distillation、接口共设计与 harness-aware post-training。

主要难点

工具数量增加会提高选择难度;返回过短缺少证据,过长则占用上下文;不可操作的错误文本和接口变化也会削弱恢复能力。

工程启示

一个工具对应一个可验证动作;参数使用领域名词;错误返回原因、是否可重试和建议动作;写操作返回可读回的对象标识。

04
研究前沿

Agentic post-training 与强化学习

多步工具轨迹和环境反馈如何用于训练 Agent,并缓解稀疏奖励、信用分配与奖励投机?

100+ turns

长轨迹可达百轮乃至百万 token;只给终局 outcome reward,无法稳定判断哪一步值得强化。

已有认识

环境内训练、可验证结果和训练—执行解耦正在形成工具链;Agent Lightning 以 Agent MDP 和统一数据接口连接不同框架的执行轨迹。

研究方向

turn / step / segment credit assignment、过程奖励、反事实优势估计、自生成任务、课程学习、在线环境训练和可验证 reward model。

主要难点

环境昂贵且持续变化;奖励可能遗漏隐性质量;Agent 可能迎合验证器;策略升级后旧轨迹出现分布失配,安全约束也难与探索兼容。

工程启示

高质量运行轨迹、可执行验证器与失败标签构成训练数据基础;独立保留测试环境和红队任务,同时监控任务成功率、成本与策略退化。

05
条件性收益

多 Agent 的可控扩展

任务可分解性、通信成本和验证方式,如何共同决定多 Agent 系统的实际收益?

−39–70%

一项 180-config 控制研究中,多 Agent 在强顺序推理任务上整体退化;并行可分任务才出现明显增益。

已有认识

并行搜索、独立审查和天然上下文分区更容易获得收益;集中式管理者通常比无中心对话更易控制错误传播。

研究方向

动态团队规模、能力路由、共享黑板、通信压缩、可验证 delegation、社会学习、异质权限和运行时动态图。

主要难点

信息传递后未必能被正确整合;同源模型会产生相关错误;通信消耗大量 token;最终责任归属与失败归因也更困难。

工程启示

建立单 Agent 基线后,再将独立且可验证的子任务分配给专业 Agent;管理者保留结果所有权,每个专家返回证据、置信度与完成条件。

06
环境耦合

Computer use、浏览器与多模态

从 DOM / API 走向截图、鼠标、键盘和混合感知后,如何保持定位、状态与操作后验证?

318 calls

OSWorld 2.0 的基线 Agent 平均约 318 次工具调用;远高于 OSWorld 1.0 的约 30 次。

已有认识

视觉定位仍是基础能力;在专业长任务中,跨来源核对、隐状态推断、多条目跟踪、动态更新和视觉结果验收更容易成为瓶颈。

研究方向

视觉 + DOM + API 混合策略、时序视觉、主动观察、UI 世界模型、跨应用状态、操作前后 diff、可验证 artifact 和可扩展训练环境。

主要难点

界面持续变化,像素坐标脆弱,弹窗与焦点不可预测;操作可能产生真实副作用,多模态结果也常缺少确定性验证器。

工程启示

稳定交互由 API 或 DOM 承担,图形界面用于补充;每次动作后重新观察,高风险提交前展示最终差异,并在可重置的隔离环境中保留状态截图。

07
基础保障

安全、权限与人类控制

当网页、邮件、工具描述和远程 Agent 都可能包含不可信内容时,系统如何保持用户意图、权限和操作边界?

12 attacks

MCP Security Bench 覆盖名称碰撞、工具描述注入、冒充用户、错误升级等 12 类攻击与 400+ 工具。

已有认识

模型的指令层级可以提高鲁棒性,但无法单独形成安全边界。工具调用能力越强,攻击者借助恶意内容驱动高影响操作的风险也可能上升。

研究方向

任务对齐监控、信息流控制、capability security、短期凭据、可信工具元数据、动态攻击环境、自动 policy synthesis 和安全经济学。

主要难点

间接提示注入尚无通用解法;过度防御会损害正常任务;跨工具组合可能形成意外权限,频繁确认也会造成用户疲劳。

工程启示

数据与指令分层,使用最小权限和短期凭据,分离读写能力;不可逆动作逐笔确认,高风险参数由可信代码生成,全轨迹可回放。

06 PRODUCTION BLUEPRINT

面向生产环境的参考架构

参考架构将任务契约、策略路由、局部 Agent 循环、工具网关、人工审批与结果验证组织在同一条可追踪执行链中。

01

Task Contract

目标、边界、权限、done、预算、超时

02

Policy Router

风险分级、模型/工具选择、拒绝与澄清

03

Bounded Agent Loop

plan → act → observe → verify

06

Outcome & Regression

结果验证、人工反馈、失败入回归集

05

Approval / Recovery

人工确认、checkpoint、补偿与接管

04

Tool Gateway

schema、权限、幂等、审计、MCP / API

STATE STORETRACE & COSTMEMORY WITH PROVENANCESANDBOX & CREDENTIALS
HANDOFF CONTRACT

交接信息

  • 目标与当前 owner
  • 事实、证据和来源
  • 已产出 artifact
  • 未决问题与风险
  • 可用权限与禁区
  • 完成条件与返回路径
CHECKPOINT CONTRACT

恢复状态

  • 业务状态与 schema 版本
  • 节点位置和待执行意图
  • 外部副作用 ledger
  • 工具结果与幂等键
  • 审批状态和超时
  • 恢复 / 补偿策略
TRACE CONTRACT

运行轨迹

  • 模型、版本与 prompt hash
  • 工具参数摘要和结果状态
  • 状态转移与 handoff
  • token、费用和延迟
  • 重试、错误和人工介入
  • 最终 grader 与失败标签

07 EVALUATION SYSTEM

如何评估一个 Agent 系统

公共评测提供跨系统参照;固定模型、工具、环境与预算的内部任务集,则用于选型、上线和持续回归。

!

公开评测中的数据与验证问题

OpenAI 2026 年审计报告指出,SWE-Bench Pro 公共子集在 8 个月内从 23.3% 升至 80.3%, 并估计 27.4%–34.1% 任务存在测试、提示或覆盖问题。这些结果说明,公开高分需要结合任务新颖性、验证器质量和人工审查解读。

审计原文 ↗
pass@1

一次成功

最接近普通用户单次运行体验。

pass@k

能力上限

给 k 次机会至少一次成功。

passk

连续可靠

连续 k 次均成功,衡量可依赖性。

HITL

监督成本

人工澄清、确认、纠错和接管时间。

Σ cost

总拥有成本

token、墙钟时间、工具调用、环境和工程维护。

risk

安全损失

越权、错误写入、泄露、拒绝不足与过度拒绝。

CONTROLLED SHOOTOUT

可比实验的六项控制变量

  1. 01同一模型版本与推理设置
  2. 02同一系统任务契约
  3. 03同一工具与 JSON schema
  4. 04同一初始环境与数据快照
  5. 05同一 token / 时间 / 费用预算
  6. 06同一 grader、done 与安全标准

每任务至少 3–5 次;报告置信区间和失败分布;保留完整 trace;同时记录代码量、 开发时间、调试成本、恢复成功率与人工介入分钟数。

F1

理解失败:目标或约束读错

F2

路由失败:选错工具 / Agent / 分支

F3

状态失败:遗忘、污染、冲突未更新

F4

执行失败:参数、定位、权限、环境错误

F5

恢复失败:重试、补偿、checkpoint 无效

F6

验证失败:没查、grader 漏判、提前结束

F7

安全失败:越权、注入、泄露、错误确认

F8

经济失败:虽成功但比人工更贵或更慢

08 ADOPTION GUIDE

从研究结论到项目选型

下表给出不同场景可优先验证的技术组合,以及概念验证阶段需要重点观察的系统能力。

场景优先候选关键验证项
A

确定性企业流程

LangGraph / Microsoft Agent Framework / PydanticAI

状态、checkpoint、审批、幂等、副作用恢复

B

轻量通用 Agent

OpenAI Agents SDK / Google ADK / smolagents

工具闭环、结构化输出、trace、失败分类

C

知识与文档流程

LlamaIndex / LangGraph + retrieval / PydanticAI

解析、权限、召回、引用、知识更新

D

多 Agent 研究

ADK / CrewAI / Agents SDK / LangGraph

单 Agent 基线、可分解性、协调成本、归因

E

Coding Agent

Codex CLI / SDK / OpenHands / SWE-agent / Aider

repo map、patch、测试反馈、沙箱、compaction

F

Browser / Computer use

API / DOM 优先的混合 harness + 隔离环境

动态定位、验证、安全副作用、人工接管

90-DAY LAB PLAN

建立内部 Agent 评测能力

W01–0201

定义任务契约

  • 20–50 个真实高价值任务
  • done、权限、预算、停止条件
  • 应拒绝 / 应澄清负样本
W03–0502

最小单 Agent 基线

  • 固定模型、工具和 sandbox
  • 确定性 grader 与 trace
  • 建立失败 taxonomy
W06–0903

受控对照实验

  • 选择 3–5 个候选实现
  • 每任务运行 3–5 次
  • 评估效果、成本与介入
W10–1204

灰度与回归闭环

  • 低风险自动化,高风险确认
  • 线上失败进入回归集
  • 每周复盘 trace 与权限
SYSTEM VIEW

工作流提供确定性结构,Agent 处理局部不确定性,工具与环境返回可验证状态; 检查点、运行追踪、评测和权限控制共同构成可恢复、可审计的生产系统。

APPENDIX REFERENCES

资料来源与研究口径

资料以项目官方文档、代码仓库、论文和评测集网站为主;预印本结果按其任务范围和复现情况审慎解读。

SDK、运行时与协议 16
长任务、上下文与记忆 11
Harness、图、Tracing 与强化学习 14
多 Agent、Computer Use 与安全 15
评测、方法与审计 12

调研截止:2026-07-28

覆盖范围:通用 Agent、企业工作流、研究 / 浏览、Coding、Computer use、协议、运行时、安全与评测。

使用提示:项目能力、许可证、协议版本和榜单会变化,正式选型时应再次核验。