在 QCon 全球软件开发大会 2026 北京站,火山引擎应用观测技术负责人钱世俊带来了《给 Agent 做“CT”:大规模 Agent 的可观测与质量保障体系》的分享,系统讲述了从零构建 Agent 统一观测底座、实现链路白盒化透视的工程实践。 与传统的确定性微服务不同,Agent 能够自主规划任务、调用外部工具、沉淀记忆与知识库。能力跃升的同时,也让故障排查变得异常困难——响应变慢、反馈报错,甚至出现与输入毫不相关的自言自语,传统日志手段几乎无法还原其内部决策过程。更棘手的是成本:一次编排偏差可能在极短时间内触发巨量大模型调用,让 Token 消耗指数级飙升。
文章图片 2
钱世俊把 Agent 系统的观测难点归纳为三个维度:与传统微服务的本质差异、内部决策过程难以分析、成本管控失去确定性。他提出用“CT 系统”的思路,让研发者能看清 Agent 从输入到输出的每一步决策轨迹,回答可见性、可解释性、可行动性三个核心问题,形成可闭环的改进路径。 从工程架构看,Agent 系统自上而下分为业务应用层、Agent 框架层、大模型推理服务层和云基础设施层,四个层次的观测数据分散在不同系统中。要把这些数据串成一条完整的链路,需要一套跨越基础设施到业务语义的统一观测底座,这也是当前可观测性建设最大的难点。
文章图片 4
Agent 的可观测与质量保障,本质上是对“不确定性”的管理。企业要让智能体真正进入生产环境,就不能只关心模型效果,还要看到它每一步在做什么、为什么这么决策、消耗了多少算力。这与星战科技 OPC 智能体协作平台强调的工程化、可控化方向一致——智能体协作平台的价值,正在于让复杂协作过程可观测、可管控、可优化。 一个明显的行业趋势是,Agent 可观测性正在从“加分项”变成“必选项”。金融、政务、制造等对合规和稳定性要求高的行业,尤其需要证明智能体运行过程可审计、结果可解释。可以预见,围绕 Agent 的监控、日志、链路追踪与成本管理工具,将形成一个快速增长的细分市场。
文章图片 6
从概念验证到规模落地,Agent 需要的不只是更强的模型,而是一套能看得见、管得住、调得好的工程体系。给 Agent 做“CT”,看似是运维命题,实则是智能体走向生产级应用必须补上的一课。