专场:可观测性驱动 Agent 质量演进与架构优化
在企业级 Agent 从 Demo 走向规模化生产的过程中,可观测性绝不应止步于“事故后的看图排障”。传统的 APM 指标无法评估智能体的决策优劣,而零散日志也难以解释“系统返回 200,但用户任务彻底失败”的假健康状态。如何精准定位异常?如何量化 Agent 过程质量?如何确保 Prompt、Tool 或模型升级后系统不发生隐形降级? 本专场聚焦 Agent 可观测性与质量闭环体系建设。我们将深入探讨如何打通 “全链路观测 ➔ 跨层因果归因(RCA) ➔ 失败样本回流 ➔ LLMs-as-a-Judge 过程评估 ➔ 自动化发布门禁” 的完整质量飞轮。 专场将包含一线落地实战经验:从基于 LLMs-as-a-Judge 的过程与结果双重评估(Rubrics 机制),到跨层因果链下的异常根因定位;从 Tool/MCP 循环与记忆截断的精准拦截,到线上 Trace 转化为离线回归测试集(Trace-to-Dataset)。我们旨在为 complex Agent 构建可复盘、可评估、可演进的质量底座,保障企业 Agent 规模化运行的稳定性与持续进化。