专场:AI 时代的效能度量与工程治理
AI 编程正推动代码产出效率十倍级提升,但传统度量体系失效、技术债加速堆积、安全风险隐性渗透——效能红利正以质量债的形式被悄悄透支。本专场聚焦"度量重构"与"工程治理"两大主线,从适配人机协同的质效度量新范式、度量驱动的组织协作提效,到存量系统的 AI 辅助重构、增量代码的 CR 与测试策略适配,再到 AI 生成代码的可维护性量化与安全左移,分享一线落地实战,帮企业在 AI 研发浪潮中既跑得快、又守得住。
专场出品人:李焕雄 
腾讯音乐 研发效能中心总监
腾讯音乐研发效能中心总监、T12资深测试开发专家,集团质量通道会长,集团质量与效能负责人。中大MBA,具备PMP/ACP/NPDP全套项目产品管理认证,拥有10余项技术发明专利。统筹管理项目管理、测试、效能、运管技术等多支核心技术团队,专注全域质量保障、测试开发、研发效能治理、规模化项目管理领域多年,具备行业领先的质效平台落地、体系搭建与技术团队管理实战经验。
杨永
联想 中国区销售服务交付团队 AI架构师
联想中国区销售服务交付团队AI架构师,长期从事企业级应用、人工智能与智能体系统的技术研发及工程交付,拥有超过14年企业IT与数字化建设经验。
现主要负责企业级智能体、AI工程化及相关技术架构建设,参与并负责联想乐享企业超级智能体、凤凰企业级Agent能力底座、Agent质量治理与工程体系等核心项目,从业务场景、系统架构到生产环境落地积累了丰富实践经验。
在企业级Agent建设过程中,重点推动智能体从“功能实现”向“生产级质量工程”演进,围绕Agent Runtime、Skill/MCP体系、Trace全链路可观测、Badcase分析、Reflection反思机制、LLM-as-a-Judge质量评估以及持续优化闭环开展技术实践。
擅长领域包括:企业级Agent架构设计、Agent Quality Engineering、智能体可观测性与评估体系、Harness Engineering、AI Native研发工程、RAG与知识工程、Skill/MCP能力体系,以及AI在电商与企业服务场景中的规模化落地。
待定
待定
从可观测到可进化:企业级 Agent 的质量闭环与持续演进实践
一、议题背景: 
随着企业级 Agent 从 Demo 逐渐进入真实生产环境,传统软件质量保障方法正在面临新的挑战。
Agent 的一次回答并不是简单的“输入—输出”,而可能包含意图理解、Planning、知识检索、Memory、Skill/Tool/MCP 调用、模型推理以及多轮状态管理等多个动态决策过程。
 因此,在生产环境中经常出现一种新的质量问题:
系统调用成功、接口返回正常,但用户任务实际上失败了。
传统日志、APM、接口成功率只能告诉我们“系统有没有报错”,却很难回答:
 Agent 为什么做出了这个决策?
哪一步开始偏离正确路径?
是知识问题、模型问题、上下文问题,还是 Tool/Skill 调用问题?
如何判断一次 Agent 执行过程到底“好不好”?
线上失败案例如何真正变成系统下一次提升的输入?
凤凰在企业级智能体实践中,逐步形成了一套围绕 Trace → Diagnose → Reflection → Evaluation → Improvement 的 Agent 质量闭环,希望通过本次分享探讨:如何让 Agent 从“能够运行”,走向“可观测、可评估、可优化、可持续进化”。
 
二、分享核心内容

01|Agent 进入生产环境后,质量问题发生了什么变化
首先介绍传统应用质量保障与 Agent 质量保障之间的本质差异。
传统软件关注确定性执行,而 Agent 更接近一个动态决策系统。
一次任务的最终质量不仅取决于模型,还取决于:
Context × Planning × Knowledge × Memory × Model × Skill / Tool × Runtime
通过真实业务中的典型 Badcase,分析几类常见 Agent Failure:
最终答案正确,但执行路径存在风险
Tool 调用成功,但 Tool 选择错误
知识召回正确,但模型没有正确使用
Memory / Context 污染导致后续推理逐渐偏离
多轮任务中某一个中间步骤失败,最终结果仍然“看起来合理”
系统技术指标全部正常,但用户任务没有完成
 引出核心观点:
Agent Quality ≠ Response Quality,而是 End-to-End Task Quality。
02|Trace:把 Agent 的黑盒执行过程变成可观察的决策链
介绍凤凰如何构建 Agent 全链路 Trace。
 不再只记录 API Log,而是记录一次 Agent Run 中完整的决策过程:
 User Query

Intent / Context

Planner

Knowledge / Memory Retrieval

Model Reasoning

Skill / Tool / MCP Selection

Tool Execution

Observation

Next Action

Final Response
重点分享 Trace 中需要关注的几个质量对象:
Input、Context、Decision、Action、Observation、Output。
通过 Trace 将传统的“结果排查”升级为:
Step-level Debugging + Decision-level Observability。
进一步介绍如何利用 Trace 实现:
异常步骤识别、调用链还原、Tool/MCP 参数分析、Token与Latency分析、上下文分析以及跨层 Root Cause Analysis。
03|Reflection:从“找到问题”进一步走向“理解为什么失败”
仅仅有 Trace 仍然只能回答:
发生了什么?
 下一步需要回答:
为什么会这样?
 介绍凤凰如何在 Trace 之上引入 Reflection / AI Diagnosis 机制。
 Agent 自动读取执行轨迹,对一次失败过程进行结构化复盘,包括:
 Failure Stage
→ 问题发生在哪个阶段
Root Cause
→ 模型、知识、Context、Memory、Skill、Tool 还是业务规则问题
Evidence
→ 从 Trace 中提取关键证据
Expected Behavior
→ 正确执行路径应该是什么
 Improvement Suggestion
→ Prompt、Knowledge、Skill、Model、Routing 或 Runtime 应该如何调整
最终把传统依赖人工专家分析的问题排查过程,逐渐转化为:
Trace → AI Diagnosis → Reflection Report。
同时分享 Reflection 如何与 Badcase、问题跟踪和工程研发流程连接起来。
04|Evaluation:从“最终答案评分”升级为“Agent 过程质量评估”
Agent 评估不能只 Judge 最终回答。
一个最终答案可能是正确的,但执行过程中可能经历:
错误 Tool 调用、无效循环、多余检索、错误 Planning 或高风险推理路径。
因此凤凰逐步构建:
 Result Evaluation + Process Evaluation。
从多个维度评估一次 Agent Run:
任务完成度
答案准确性
知识 Groundedness
Tool / Skill Selection
Tool Parameter Accuracy
Planning Quality
Context Utilization
Memory Usage
Execution Efficiency
Safety & Compliance
结合 Rubrics、规则评估、LLM-as-a-Judge 和业务指标,形成统一的 Agent Quality Score。
进一步介绍:
Single Step Evaluation → Trace Evaluation → Task Evaluation → Scenario Evaluation。
 让质量评估从单次回答逐步提升到完整业务任务。
05|Quality Loop:让线上问题真正驱动 Agent 持续进化
最后重点介绍凤凰如何把 Trace、Reflection 和 Evaluation 串成一个完整闭环:
Production Traffic
→ Trace Capture
→ Failure Detection
→ Root Cause Analysis
→ Reflection
→ Badcase Classification
→ Dataset / Testset Generation
→ Evaluation
→ Prompt / Knowledge / Skill / Model Optimization
→ Regression Evaluation
→ Release
→ Production Monitoring
形成:
Observe → Diagnose → Reflect → Evaluate → Improve → Verify
的 Agent Quality Loop。
 线上每一个 Badcase 不再只是一个需要关闭的问题单,而会逐渐沉淀成为:
Failure Case → Evaluation Case → Regression Case → Quality Asset。
最终让生产数据成为 Agent 持续演进的数据资产。
三、实践案例
结合企业级超级智能体实际生产案例,展示一次典型问题如何完成完整闭环:
用户反馈问题
→ Session / Query 定位
→ Trace 自动还原
→ AI Diagnosis
→ Root Cause 判断
→ Reflection
→ 自动生成优化建议
→ Badcase 入库
→ Evaluation Case 生成
→ 修复验证
→ Regression
→ 再发布
重点分享真实实践中遇到的问题:
 如何处理非确定性输出;
如何定义 Agent 的“正确”;
如何减少 LLM-as-a-Judge 自身的不稳定性;
如何平衡自动评估与人工评审;
以及如何让质量数据真正进入研发闭环,而不是形成另一个孤立的质量平台。
四、核心观点
本次分享希望传递三个核心观点:
1. Observability is the foundation of Agent Quality
看不见 Agent 如何思考和行动,就无法真正治理 Agent 质量。
2. Evaluation must move from Output to Process
Agent 质量评估必须从最终答案扩展到执行过程、决策过程和任务完成质量。
3. Every Failure Should Become a Quality Asset
真正成熟的 Agent Quality Engineering,不只是解决 Badcase,而是让每一次失败都进入评估体系和回归体系,推动系统持续进化。
最终实现:
From Observable Agent
to Measurable Agent
to Self-Improving Agent.
敬请期待
......
.....
待定
待定
敬请期待
....
关注QECon公众号
关注QECon视频号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
159-0126-5561 小娟 
媒体合作
135-1619-6409  皮皮
购票咨询
小娟 15901265561
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561