Skip to main content

Agent Infra

Agent Infra 指介于 Agent 应用代码与模型/工具之间的基础设施层,负责流量治理、访问控制、执行可见性与状态持久化。本板块收录该层的六个专题,共 39 篇。

该层的共同特征是:与 Agent 的业务逻辑无关,更换模型供应商或编排框架后依然存在。

一、范围与边界

站内三个板块沿 LLM 应用栈的不同位置切分:

越往右越靠近硬件,越往左越靠近业务Agent 应用Agent 怎么写出来框架选型 · 编排范式产品源码拆解Agent Infra 本板块Agent 怎么在生产上跑得住网关 · 安全 · 可观测性持久化执行 · 执行沙箱AI Infra模型怎么跑得快CUDA · PagedAttentionPD 分离同一个现象「一次请求变慢了」,三个板块给出的排查方向完全不同 —— 判断归属的标准是:换一家模型供应商之后这个问题还在不在,以及它跟 Agent 的推理过程有没有关系。
中间这一层的共同特征是:与 Agent 的业务逻辑无关,更换模型供应商或编排框架之后它依然存在。

三者的判据可以用同一个故障现象区分。以「一次请求变慢了」为例:

归属板块排查方向
AI InfraKV Cache 命中率下降、batch 调度使 decode 阶段饥饿
Agent 应用编排范式导致单次任务被拆成多轮模型调用
Agent Infra路由命中冷却中的后端、限流排队、某租户占满配额

判据:若该问题在更换模型供应商后依然存在,且与 Agent 的推理过程无关,则属于 Agent Infra。

二、六个专题的位置

前五个专题对应同一条请求链路上的五个关注点,第六个不在生产链路上:

请求链路(毫秒到秒)Agent 应用网关模型 / 工具安全每一跳的准入与授权可观测性每一跳的记录与计费执行沙箱工具真跑起来时的隔离边界不在请求链路上(分钟到天)持久化执行跨越进程生命周期保管状态 —— 进程没了,任务还在网关处在链路中心:安全策略的主要执行点在它上面,可观测数据的主要产生点也在它上面。
五个专题里只有持久化执行不在请求链路上,它的时间尺度比其余四个大三到六个数量级 —— 这也是它和网关容错最容易被混为一谈、却完全不同的原因。

网关处于链路中心:安全策略的主要执行点在网关,可观测性数据的主要产生点也在网关。持久化执行是唯一不在请求链路上的专题,它的时间尺度是分钟到天,其余三者是毫秒到秒。

专题篇数覆盖内容
Agent 网关11部署形态、路由与容错、多租户配额、MCP 代理、缓存、Token 速率保障、国内外托管产品对比、性能开销
Agent 安全6威胁模型、MCP 授权规范演进、工具投毒与 Rug Pull、防线分层、供应链攻击复盘
Agent 可观测性4Trace 结构、OpenTelemetry 与 OpenInference 两套语义约定、成本归因、方案选型
Agent 持久化执行6Checkpoint 机制、确定性重放、故障恢复、四条技术路线选型
Agent 执行沙箱6隔离的四个维度、容器与 microVM 与用户态内核三条路线、E2B 快照机制、开源产品实现、出口管控
Agent 训练环境6训练环境与运行时沙箱的分野、AgentENV 的存储与快照机制、三套环境接口标准、训练框架接入方式、任务环境选型

三、按问题查阅

问题对应文档
不了解这一层,需要从概念入手网关 01 - 网关是什么
自建还是采购托管产品网关 08 - 云厂商怎么做09 - 国外托管网关
模型调用不稳定、需要故障转移网关 03 - 路由与容错
多团队共用账号、需要配额与计费归属网关 04 - 多租户与配额可观测性 03 - 成本归因
重复请求占比高、需要降低成本网关 06 - 缓存
需要为高优先级客户保障 token 速率网关 07 - Token 速率与 QoS
接入 MCP 工具、需要工具级授权网关 05 - MCP 网关安全 04 - 防线在哪一层
评估第三方 MCP Server 风险安全 03 - 工具投毒与 Rug Pull
线上问题无法定位可观测性 01 - Agent 的 Trace 长什么样
长任务中断后需要续跑持久化执行 01 - 为什么需要
要执行模型生成的代码、需要隔离执行沙箱 01 - 为什么需要沙箱05 - 选型与落地
要做 agentic RL,需要大规模供给可重置的环境训练环境 01 - 为什么不是运行时沙箱02 - AgentENV 拆解

四、覆盖范围

从单次请求的路由,到长任务的状态持久化,再到不可信代码的执行隔离,本层已覆盖 Agent 生产链路的主要环节。