专场:评测驱动研发:模型与 Agent 的能力度量体系 
本专场聚焦模型与智能体的评测体系搭建与实际研发落地。研发优化迭代依赖量化依据,缺少标准化度量,模型与Agent的升级优化便无明确抓手。当前多数评测方式指标不成体系、贴合业务场景不足,难以有效指导AI编码、人机协作、智能体任务执行等研发工作。本场将围绕实操落地,分享LLM与智能体评测体系的搭建方法,梳理AI编码效率、人机协作效能等核心评估指标,介绍评测基准的设计逻辑、实操流程及行业对标手段,帮助团队建立常态化评测机制,依托量化数据推进模型与Agent的常态化迭代优化。
专场出品人:茹炳晟 
腾讯研究院 高级技术顾问
中国计算机学会TF多智能体系统SIG副主席,中国计算机学会TF数据科学与知识工程SIG执委,“软件研发效能度量规范“标准核心编写专家,中国商业联合会互联网应用技术委员会智库专家,中国通信标准化协会TC608云计算标准和开源推进委员会云上软件工程工作组副组长,腾讯云架构师技术同盟入会主席,年度IT图书最具影响力作者,多本技术畅销书作者,著作有《软件研发效能提升之美》《现代软件测试技术之美》《测试工程师全栈技术进阶与实践》《多模态大模型技术原理与实战》《高效自动化测试平台:设计与开发实战》《软件研发效能提升实践》《软件研发效能权威指南》《现代软件测试技术权威指南》《高质效交付》《代码之外:软件工程师成长手记》等,译作有《软件设计的哲学》《整洁架构之道》《持续架构实践》《构建Agentic AI系统》《大模型驱动的软件测试:从理论到实践》《平台工程》《企业架构决策:战略框架与实施指南》《AI领导力》《现代软件工程》《计算机科学通识:计算思维培养与多学科问题解决实践》《DevOps实践指南(第2版)》《精益DevOps》《基础设施即代码-模型驱动的DevOps》等,国内外各大技术峰会的联席主席,出品人和Keynote演讲嘉宾。公众号“茹炳晟聊软件研发”主理人。
付敏
蚂蚁集团  AI质量工程师
现任蚂蚁集团大安全部门AI质量工程师,深耕通用安全质量领域5年。曾就职于京东、高德担任质量工程师,积累了丰富的互联网大厂质量保障实战经验。
专业聚焦通用安全质量保障体系构建,在网络安全攻防、网关实时识别引擎、零信任架构、办公安全等核心安全能力领域具备多年质量保障经验,主导并参与过多项企业级安全平台的质量体系建设与风险防控项目。
近2年聚焦AI技术与质量工程的融合创新,致力于运用大模型、智能体等AI技术重塑质量工作流(Quality Workflow),在测试用例智能生成、缺陷预测、自动化诊断及智能评审等场景推动质量效能升级,探索AI时代下安全质量保障的新范式。
待定
待定
从"跑通"到"跑稳":评测如何驱动 Coding Agent 质量能力进化
议题背景:
随着AI技术的爆发,Coding领域正经历一场效率狂飙:从产品经理直接上手驱动的“Vibe Coding”,到团队自建Coding Bot自主完成编码任务,代码的交付速度被极大拉升。然而,这种“野蛮生长”带来了严峻的质量挑战:交付速度的飞跃,让质量保障成为了新的交付瓶颈。
同时,AI生码引入了不同于传统开发模式的风险敞口——大模型的幻觉、逻辑黑盒与上下文丢失,导致生成的代码可能暗藏安全漏洞、逻辑缺陷或偏离预期,传统针对人工编写代码的质量拦截机制,已难以应对AI批量生码带来的新型风险。
面对“速度狂飙”与“质量失控”的矛盾,我们需要重新思考:
1.如何打破传统QA范式,用AI技术重塑质量Workflow,让质量保障速度匹配AI的交付速度?
2.面对黑盒般的Coding Agent,如何通过系统化的评测手段,精准探测其能力短板与风险敞口?
3.评测不应只是事后的“守门员”,如何将其转化为牵引力,以评测结果反向驱动Coding Agent及整体评测能力的进化?
本次议题将直面AI编码时代的质量痛点,分享从“被动兜底”到“以评测为牵引、AI重塑流程”的破局之道。

内容大纲:
1. 痛点与破局:AI生码狂飙下的质量暗礁与旧范式失效
1.1 问题分析:Vibe Coding与Bot编码带来的“效率幻觉”与风险敞口
1.2 技术抉择:从“人海拦截”转向“AI重塑Workflow+评测牵引”
2. Workflow重塑:AI融入测试流的技术抉择与踩坑实录
2.1 技术抉择:RAG+结构化约束,破解AI生成用例的“幻觉陷阱”
2.2 工程实践:构建“需求-生码-审查”的AI协同质检闭环
3. 评测即牵引:精准狙击Coding Agent短板与工程实践
3.1 工程实践:设计“诱导性+边界性”靶场用例,探测Agent风险敞口
3.2 避坑与闭环:评测结果反哺Agent,从“事后发现”到“事前规约”
4. 价值落地:量化收益与核心反思
4.1 收益量化:效能与质量的双向跃升
4.2 反思:AI时代质量工程师的边界重塑

听众收益:
1. 打破传统QA思维局限,获取AI质量Workflow重塑的实战路径
2. 获得一套可落地的Coding Agent评测方法论
3. 获得质量workflow AI重构的一手经验与避坑指南
刘洋
去哪儿旅行 基础架构高级后端开发工程师
负责公司质量与效率类平台建设,包含智能体平台、智能体可观测、AICR等
待定
待定
Agent 质量工程实践:构建 Agent 可测试、可评估、可质检体系
议题背景:
传统软件测试仅聚焦功能验证,无法适配 AI Agent 迭代特性:交付标准从二元功能校验升级为效果量化,研发流程由线性阶段转为全生命周期数据反馈闭环,长尾幻觉、工具调用异常、效果退化等问题测试成本指数级上涨。本次分享基于去哪儿自研智能体平台 QMoss 万级 PD 落地实践,以开源 Langfuse 为核心搭建企业级可观测底座,落地三层量化指标、分级测试集、多类型评分器与线上线下双层质检机制;完整披露 ClickHouse 集群部署、内部 SSO 打通、传统链路互通等落地踩坑方案,并落地数据分析 Agent、AI CR Agent 两大业务实例。整套体系实现 Agent 问题发现周期从天级缩短至小时级,大幅降低人工验证成本,形成观测 - 评估 - 修复的自进化 LLMOps 闭环,为企业生产级 Agent 质量保障提供可复用落地方案。

内容大纲:
1. Agent 质量面临全新行业痛点
1.1 两大核心变革:交付标准升维、研发流程非线性化
1.2 建设目标:打造可观测、可评估、可质检质量护城河
2. Agent 质量工程完整落地体系
2.1 可观测底座:企业本地化 Langfuse 实践
2.1.1 架构设计:复用企业中间件降本
2.1.2 生产踩坑:CK 集群部署两大问题解决方案
2.1.3 企业集成:SSO 登录、OTEL 埋点、打通传统 QTrace
量化:累计 200+Trace,模型累计成本 670 美元
2.2 标准化自动化评估体系
2.2.1 三层量化指标 + 两级测试集设计
2.2.2 三级评分器 + 流量自动回放回归流水线
2.3 双层质检架构:离线门禁 + 线上实时哨兵闭环
3. 两大生产 Agent 实战案例
3.1 数据分析 Agent:幻觉检测与 Trace 驱动自进化优化
踩坑:LLM 混淆代码函数与工具调用;修复周期从天→小时
3.2 AI CR Agent:自动代码评审 + 一键修复与召回率评估体系
数据:70% 识别缺陷为代码可读性、逻辑缺陷类问题
4. 实践总结与未来演进方向
4.1 落地核心结论
4.2 三大演进路线:自主评估、动态自适应、多智能体协同质检

听众收益:
1. 掌握企业级 Langfuse 生产落地避坑完整方案:获取 ClickHouse 集群部署、内部单点登录、传统监控链路打通等真实踩坑解决方案,无需重复踩坑,快速搭建 Agent 全链路观测底座。
2. 落地一套可直接复用的 Agent 标准化评估体系:学会三层量化指标、分级测试集、多阶评分器组合、自动化回放流水线完整设计思路,解决 Agent 效果无法量化、回归成本高的行业难题。
3. 获得生产级 Agent 自进化 LLMOps 落地范式:借鉴数据分析 Agent、AI CR Agent 两大真实业务案例,掌握 “观测发现坏例 - 自动根因分析 - 自动修复 - 自动化回归” 闭环能力,显著降低 Agent 迭代人力成本、缩短优化周期。
陈永健
华为 AI与智能应用 测试总工
20年华为运营商领域软件测试经验,6级专家,目前主要负责华为运营商软件数智化转型与AI云原生平台开发与测试,长期专注测试技术发展,在智能体开发评测,混沌工程(高可靠性测试)、生态兼容性测试、自动化测试、AI大模型评测、性能与仿真测试等领域有深入探索,支撑和保障全球300+运营商客户稳定运营。
待定
待定
AI原生智能体长程任务可靠性验证实践
议题背景:
Agentic智能体的非确定性、多轮工具调用与记忆状态依赖,让传统断言式测试失效,尤其面向长程任务下的结果漂移、线上异常等问题频发并因缺少中间态难以复现。本课题结合华为智能体测试实践,给出长程任务"可观测—可注入—可度量"的可靠性测试方案。打破Agent黑盒,全链路可控注入生成,执行快照,破解不可复现;注入 LLM 超时限流、感知异常、工具异常、上下文膨胀等典型故障,验证降级与自愈;以固定种子和多次注入故障采样把偶发失败量化为稳定通过率。复盘评测集污染、Judge 自身漂移、注入粒度粗导致误判等踩坑与规避手段。实践已在商用项目落地,有效支撑评测结果和用户体验的一致性的同时,提前识别和修复智能体缺陷。

内容大纲:

1. 背景:一个长程任务的翻车现场
1.1 从一个真实事故讲起  
2. 业务与测试挑战:长程任务到底难在哪 
2.1 什么是"长程任务":四个判据  
2.2 与单轮LLM测试、传统软件测试的差异  
2.3 六类长程专属失效模式  
2.4 为什么传统断言式测试全面失效  
3. 总体技术方案:可观测—可注入—可度量
3.1 三层测试金字塔:Step / Trajectory / Task  
3.2 方案全景:三件套能力地图  
4. 关键实现一:全链路可观测与可回放
4.1 Trace模型:把智能体执行建模为带状态的轨迹树  
4.2 埋点设计:五个要素  
4.3 快照与回放:让偶发问题变成确定性用例  
4.4 长程专项:里程碑校验与目标漂移检测  
5. 关键实现二:面向长程任务的故障注入
5.1 注入矩阵设计方法论:从失效模式反推注入点  
5.2 注入实现:四层拦截手段  
5.3 长程典型故障清单  
5.4 断点续跑与幂等:checkpoint & resume 专项验证  
5.5 注入粒度与爆炸半径控制  
6. 关键实现三:非确定性治理与度量 
6.1 从"偶尔失败"到可量化指标:pass^k  
6.2 方差控制与统计显著性  
6.3 分层度量指标体系  
6.4 Agent-as-a-Judge的校准与去偏  
7. 工程落地:测试平台架构与工具链  
8. 效果与结论
8.1 落地效果  
8.2 结论与下一步建议

听众收益:
1.  一套实战项目可参考的智能体故障注入测试清单 — 六类长程失效模式各配可自动执行的注入用例与判定标准。
2. 一套让偶发问题可复现的测试工程方案 — Trace 模型、五个必采埋点、录制重放与里程碑漂移检测,可直接改造现有测试平台,
3. 一套智能体可靠性的度量体系 — 用 pass^k 取代 pass@1、方差控制,让质量结论经得起追问。
敬请期待
......
.....
待定
待定
敬请期待
....
关注QECon公众号
关注QECon视频号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
159-0126-5561 小娟 
媒体合作
135-1619-6409  皮皮
购票咨询
小娟 15901265561
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561