Agent 质量工程实践:构建 Agent 可测试、可评估、可质检体系
议题背景:
传统软件测试仅聚焦功能验证,无法适配 AI Agent 迭代特性:交付标准从二元功能校验升级为效果量化,研发流程由线性阶段转为全生命周期数据反馈闭环,长尾幻觉、工具调用异常、效果退化等问题测试成本指数级上涨。本次分享基于去哪儿自研智能体平台 QMoss 万级 PD 落地实践,以开源 Langfuse 为核心搭建企业级可观测底座,落地三层量化指标、分级测试集、多类型评分器与线上线下双层质检机制;完整披露 ClickHouse 集群部署、内部 SSO 打通、传统链路互通等落地踩坑方案,并落地数据分析 Agent、AI CR Agent 两大业务实例。整套体系实现 Agent 问题发现周期从天级缩短至小时级,大幅降低人工验证成本,形成观测 - 评估 - 修复的自进化 LLMOps 闭环,为企业生产级 Agent 质量保障提供可复用落地方案。
内容大纲:
1. Agent 质量面临全新行业痛点
1.1 两大核心变革:交付标准升维、研发流程非线性化
1.2 建设目标:打造可观测、可评估、可质检质量护城河
2. Agent 质量工程完整落地体系
2.1 可观测底座:企业本地化 Langfuse 实践
2.1.1 架构设计:复用企业中间件降本
2.1.2 生产踩坑:CK 集群部署两大问题解决方案
2.1.3 企业集成:SSO 登录、OTEL 埋点、打通传统 QTrace
量化:累计 200+Trace,模型累计成本 670 美元
2.2 标准化自动化评估体系
2.2.1 三层量化指标 + 两级测试集设计
2.2.2 三级评分器 + 流量自动回放回归流水线
2.3 双层质检架构:离线门禁 + 线上实时哨兵闭环
3. 两大生产 Agent 实战案例
3.1 数据分析 Agent:幻觉检测与 Trace 驱动自进化优化
踩坑:LLM 混淆代码函数与工具调用;修复周期从天→小时
3.2 AI CR Agent:自动代码评审 + 一键修复与召回率评估体系
数据:70% 识别缺陷为代码可读性、逻辑缺陷类问题
4. 实践总结与未来演进方向
4.1 落地核心结论
4.2 三大演进路线:自主评估、动态自适应、多智能体协同质检
听众收益:
1. 掌握企业级 Langfuse 生产落地避坑完整方案:获取 ClickHouse 集群部署、内部单点登录、传统监控链路打通等真实踩坑解决方案,无需重复踩坑,快速搭建 Agent 全链路观测底座。
2. 落地一套可直接复用的 Agent 标准化评估体系:学会三层量化指标、分级测试集、多阶评分器组合、自动化回放流水线完整设计思路,解决 Agent 效果无法量化、回归成本高的行业难题。
3. 获得生产级 Agent 自进化 LLMOps 落地范式:借鉴数据分析 Agent、AI CR Agent 两大真实业务案例,掌握 “观测发现坏例 - 自动根因分析 - 自动修复 - 自动化回归” 闭环能力,显著降低 Agent 迭代人力成本、缩短优化周期。