专场:评测驱动AI研发:构建持续进化的反馈飞轮 
......
专场出品人:付宇 
支付宝技术部 行业质量与评测技术负责人
毕业于上海交大,在DFKI GmbH从事NLP相关工作。曾担任过余额宝、乘车码、健康码等多个国民级应用的质量保障1号位。现专注于政务民生、出行酒旅、就业与物流等行业的技术风险保障,致力于行业AI助手评测技术体系的创新攻坚,助力算法敏捷迭代与效果提升。
廖飞强
微众银行 研发经理
微众银行一线研发经理,目前主要负责数字金融相关项目研发,探索前沿技术,例如AI, 区块链等领域,都有一线的研发实践积淀。
待定
待定
测得准·比得明·练得强:异构框架下 AI 智能体过程评估的工程实践
议题背景:
随着 AI 智能体在金融场景规模化落地,"造智能体快、评智能体难"成为普遍瓶颈:评估对象从确定性的文本映射,变为非确定性的多步决策过程,传统只看"最终答案"的评测无法暴露推理链路与工具调用中的隐患。本议题分享我们在智能体评估上的工程实践——以"全链路过程评估"替代结果评估:通过 OpenTelemetry 标准协议 + 统一采集中枢,实现对异构 Agent 框架(Dify、LangChain 等)的零侵入 Trace 获取,经 Observation→Span 转换还原为可评估单元;引入工具语义等价判定、步骤效率、计划质量等 6 类 20+ 过程指标,并落地 CI/CD 质量门禁。同时针对桌面端助理,在"内网零开放端口、零客户端改造"约束下设计安全评估架构。目前已覆盖数十个数字员工,投入产出比约 1:3,沉淀出可复用的方法论与踩坑经验。

内容大纲:
1. 背景与挑战:为什么 Agent 评估比想象中难
1.1 从"文本映射"到"多步决策":评估对象的本质变化
1.2 只看结果的三大盲区——推理链路、工具调用、步骤效率不可见
1.3 云端数字员工 vs 桌面端助理:两类场景的不同评估难点
2. 整体设计:一套底座 + 双通道评估体系
2.1 统一评估平台分层架构(测试集生成 · 评估引擎 · 指标库 · 质量大盘)
2.2 "测得准 · 比得明 · 练得强"的设计目标
2.3 结果评估与过程评估的关系与取舍
3. 关键技术 ①:异构框架下的零侵入 Trace 采集(核心)
3.1 多框架 Trace 异构难题(SDK / OpenTelemetry / 平台内置各不相同)
3.2 以 OpenTelemetry 为标准协议 + 采集中枢的零侵入方案
3.3 Observation→Span 转换层:把 RAG / 工具 / 思考链还原为可评估单元
3.4 ⚠️ 踩坑:优雅降级——Trace 缺失/超时时自动回退结果评估
4. 关键技术 ②:过程指标体系与语义级评估
4.1 6 类 20+ 过程指标全景(RAG / 多轮 / Agentic 工具 / 规划 / MCP / 上下文)
4.2 超越字段匹配:工具语义等价判定与步骤效率评分
4.3 LLM-as-Judge 的可靠性——代码规则 + LLM + 人工"三轨评分"
4.4 业务自定义指标的扩展机制
5. 工程化落地:从评估到"以评促练"飞轮
5.1 CI/CD 质量门禁:把评估嵌入智能体上线流程
5.2 质量大盘与版本回归对比
5.3 强约束场景:桌面端"零端口 / 零改造"的内网安全评估架构
5.4 落地数据与投入产出
6. 踩坑总结与展望
6.1 数据污染、字段匹配失效、业务方接入动力等真实踩坑
6.2 行业统一评估标准缺失的破局思路
6.3 下一步:评估驱动的 Agent 自动化进化闭环

听众收益:
1.一套可直接复用的"过程评估"方法论与指标清单:6 类 20+ 过程指标体系 + 自定义扩展机制,带你跳出"只看结果"的评测盲区,真正测出 Agent 推理与工具调用的质量。
2.异构框架零侵入 Trace 采集的完整工程路径:OpenTelemetry 标准协议 + 统一采集中枢 + Observation→Span 转换层的实现细节,可迁移到自己的技术栈,少走我们踩过的弯路。
3.强约束场景下的评估架构范式与落地经验:内网 / 隐私敏感场景(零端口、零客户端改造)的安全评估设计,以及把评估嵌入 CI/CD、形成"以评促练"飞轮的实操套路。
刘洋
去哪儿旅行 基础架构高级后端开发工程师
负责公司质量与效率类平台建设,包含智能体平台、智能体可观测、AICR等
待定
待定
Agent 质量工程实践:构建 Agent 可测试、可评估、可质检体系
议题背景:
传统软件测试仅聚焦功能验证,无法适配 AI Agent 迭代特性:交付标准从二元功能校验升级为效果量化,研发流程由线性阶段转为全生命周期数据反馈闭环,长尾幻觉、工具调用异常、效果退化等问题测试成本指数级上涨。本次分享基于去哪儿自研智能体平台 QMoss 万级 PD 落地实践,以开源 Langfuse 为核心搭建企业级可观测底座,落地三层量化指标、分级测试集、多类型评分器与线上线下双层质检机制;完整披露 ClickHouse 集群部署、内部 SSO 打通、传统链路互通等落地踩坑方案,并落地数据分析 Agent、AI CR Agent 两大业务实例。整套体系实现 Agent 问题发现周期从天级缩短至小时级,大幅降低人工验证成本,形成观测 - 评估 - 修复的自进化 LLMOps 闭环,为企业生产级 Agent 质量保障提供可复用落地方案。

内容大纲:
1. Agent 质量面临全新行业痛点
1.1 两大核心变革:交付标准升维、研发流程非线性化
1.2 建设目标:打造可观测、可评估、可质检质量护城河
2. Agent 质量工程完整落地体系
2.1 可观测底座:企业本地化 Langfuse 实践
2.1.1 架构设计:复用企业中间件降本
2.1.2 生产踩坑:CK 集群部署两大问题解决方案
2.1.3 企业集成:SSO 登录、OTEL 埋点、打通传统 QTrace
量化:累计 200+Trace,模型累计成本 670 美元
2.2 标准化自动化评估体系
2.2.1 三层量化指标 + 两级测试集设计
2.2.2 三级评分器 + 流量自动回放回归流水线
2.3 双层质检架构:离线门禁 + 线上实时哨兵闭环
3. 两大生产 Agent 实战案例
3.1 数据分析 Agent:幻觉检测与 Trace 驱动自进化优化
踩坑:LLM 混淆代码函数与工具调用;修复周期从天→小时
3.2 AI CR Agent:自动代码评审 + 一键修复与召回率评估体系
数据:70% 识别缺陷为代码可读性、逻辑缺陷类问题
4. 实践总结与未来演进方向
4.1 落地核心结论
4.2 三大演进路线:自主评估、动态自适应、多智能体协同质检

听众收益:
1. 掌握企业级 Langfuse 生产落地避坑完整方案:获取 ClickHouse 集群部署、内部单点登录、传统监控链路打通等真实踩坑解决方案,无需重复踩坑,快速搭建 Agent 全链路观测底座。
2. 落地一套可直接复用的 Agent 标准化评估体系:学会三层量化指标、分级测试集、多阶评分器组合、自动化回放流水线完整设计思路,解决 Agent 效果无法量化、回归成本高的行业难题。
3. 获得生产级 Agent 自进化 LLMOps 落地范式:借鉴数据分析 Agent、AI CR Agent 两大真实业务案例,掌握 “观测发现坏例 - 自动根因分析 - 自动修复 - 自动化回归” 闭环能力,显著降低 Agent 迭代人力成本、缩短优化周期。
邵涛
腾讯 微信 算法工程师
腾讯 WXG 测试中心 IH-VQA 团队算法工程师,专注图像 / 视频质量评估模型的研发与落地。核心工作包括构建可解释差异感知框架、搭建视频号画质多模态大模型评估体系,并将其应用于编解码器 / 画质算法版本迭代的 A/B 可解释评测、拍摄美颜与 AIGC 特效等多候选效果图的算法选型支撑等场景,推动视频号、朋友圈、直播等核心产品的画质评测从人工盲测向标准化、可解释的 AI 流程演进。
待定
待定
腾讯微信IH-VQA团队首创iDiff:
多模态大模型在可解释双图对比评测中的实践与应用
议题背景:
传统图像质量评估(IQA)多输出单一标量分数,难以回答"为什么好、差在哪"等归因问题,在工程实践中价值有限。本议题提出双分支协同框架 iDiff:将判别式偏好预测(Answer Model)与结构化推理生成(Thinking Model)解耦,并结合多视图输入分解、多源特征注入、Answer-aware 指令微调等关键技术,解决了 MLLM"会讲不会判"与传统模型"会判不会讲"的矛盾。目前该方案已落地微信视频号盲测、编解码器 A/B 对比等核心业务场景,推动画质评估从人工质检升级为可归因的 AI 标准化流程。

内容大纲:
1. 问题与挑战
1.1 视频号 / 直播场景下的三类真实业务问题:版本对比、设备成片差异、AIGC 候选图优选
1.2 当前痛点:传统判别式小模型(给分不解释)/通用 MLLM(解释幻觉)
1.3 算法效果评估:判别准确率与推理过程的可靠性
2. iDiff 核心设计:双分支协同架构
2.1 Answer Model 三级增益路径
2.1.1 多视图输入分解:拼接图拆分为 4 路输入,准确率 0.5784 → 0.6961
2.1.2 内容感知专门化:人像 / 场景分而治之,场景子集准确率跃升至 0.8077
2.1.3 多骨干等权集成:5 个骨干模型投票融合,最终提升至 0.9118
2.2 Thinking Model 渐进式增强路径
2.2.1 模板化推理正则:领域专属模板 vs 通用模板,BLEU 从 0.0221 → 0.0858
2.2.2 多源特征注入:传统 CV 统计量 + 学习型 IQA 指标联合注入 Prompt,缓解"极相似图对判断模糊"问题
2.2.3 Answer-aware 指令微调:将 Ground Truth 写入 Prompt 驱动"理由精修",规避模型"答案复制"捷径
3. 工程落地与效能收益:iDiff 在微信核心业务中的规模化应用
3.1 视频号双栖盲测:从外包主观标注/小模型质检,到 iDiff 可解释大模型的升级
3.2 编解码器及画质算法迭代:替代单刺激 NR-IQA 与人工盲测,实现自动化、可定位的细粒度差异评估
3.3 一线创作工具选型支持:构建可批量、可解释、可归档的 AIGC / 影像工具标准化 PK 流程

听众收益:
1. 大模型画质评测落地思路:学习成对图像对比任务中的特征工程方法包括多视图拆解、领域分治、传统 CV 特征注入,缓解 MLLM 对极相似图像判断中的”幻觉"与"逻辑断层”问题,使得MLLM 在高精度、强可解释场景落地。
2. 标准化评测基建方案:获取一套可复用的自动化画质评测与 PK 架构,可直接迁移至 A/B 测试、竞品对比场景,降低人工质检成本。
顾汉杰
阿里云 云原生高级技术专家
拥有12年软件研发与技术架构经验,长期深耕日志、可观测与大数据领域,近年聚焦AI应用可观测与质量工程方向。目前负责AgentLoop——一站式AI应用可观测与质量评估平台的产品设计与落地,打通从运行时
数据采集(Trace/日志)、数据集与Pipeline处理、Agent能力评估与实验、到记忆与RL训练信号的完整闭环。他主导了AgentLoop在电商智能客服Agent场景的首个生产级落地,构建了覆盖研发态预跑评测与运行时在线质检的全链路质量管控体系,将机审覆盖
率从不足5%提升至95%+、人工标注成本降低60%+。擅长将一线生产实践提炼为可复用的工程方法论。
待定
待定
AgentLoop:运行时数据驱动的全链路Agent质量闭环与
自进化飞轮——电商智能客服落地实践
议题背景:
当Agent从Demo走向生产,质量便从“能不能跑通”变成了“每天数十万通真实对话里有多少在悄悄出错”:传统抽样质检覆盖率不足5%、离线测试集又脱离线上真实分布,问题往往在用户投诉之后才被发现。AgentLoop的答案是回到数据——以Agent运行时数据为地基,把采集、处理、评估、实验、审计、经验反哺串成一条端到端闭环,让质量从“发布前的一道关卡”变成“贯穿生产全程、并驱动Agent自我进化的数据飞轮”。本议题将以电商智能客服这一真实生产场景为案例,完整拆解这条闭环的每一环与背后的取舍。

内容大纲:
1. 背景:当Agent冲进生产,质量掉进“黑盒”
1.1 电商智能客服走向“AIAgent+人工”混合模式:质量难量化、难监控、无统一标准
1.2 传统抽样质检覆盖率不足5%,95%+的对话进入“质量黑盒”
1.3 AgentLoop的解法:以运行时数据为地基,串起采集→处理→评估→实验→审计→经验反哺的全链路质量闭环
2. 地基:Agent运行时数据的采集与处理
2.1 主打运行时数据:全量采集多轮对话、工具调用、检索、模型输入输出、Token与耗时的Trace(框架无关接入)
2.2 从原始Trace到可用数据:结构化、会话级轨迹组装、脱敏与海量span治理
2.3 线上Trace自动转Dataset:让真实生产数据直接成为评估素材
2.4 踩坑:50KB大字段处理、跨账号只读授权、海量日志查询分片
3. 度量:评测驱动,从抽检到全检
3.1 评估范式转变:从“单次回复好不好”到“多步任务成没成”
3.2 评估器体系:Agent-as-a-Judge+rubric,内置幻觉、正确性、工具合理性、置信度等评估器
3.3 过程指标+结果指标双层体系,机审覆盖率5%→95%+
3.4 分析洞察:评分分布/趋势+聚类归因,异常区域自动定位
3.5 踩坑:评估器一致性、幻觉抑制、成本控制、“评估器自身也要被评估”
4. 验证与守线:实验+审计
4.1 实验:prompt/模型/策略A/B对比,用评估分数验证改进,支持灰度门禁与回滚
4.2 审计:隐私/交易资损/营销合规红线的一票否决门禁
5. 反哺:上下文工程与经验库,让Agent越用越聪明
5.1 从Agent轨迹中提炼可复用经验:成功轨迹沉淀经验、失败轨迹沉淀规避
5.2 记忆库+经验库反哺下一次运行,闭合数据飞轮
5.3 从评估到信号:把评估结果转化为可验证的RL训练信号
6. 闭环成效与复盘
6.1 量化收益:机审覆盖率5%→95%+、人工标注成本↓60%+、处理准确率96%+
6.2 沉淀:可复用的电商智能客服评估能力包与全链路工程范式
6.3 反思:哪些交给Agent、哪些留给人;平台化vs通用评估框架的取舍

听众收益:
1.一套可复制的生产级Agent质量闭环方法论:以运行时数据为核心,串起采集、处理、评估、实验、审计、经验反哺的端到端链路,而非零散测试技巧,拿回去就能对照落地。
2.全链路工程落地细节与真实踩坑:海量Trace治理与会话级轨迹组装、Agent-as-a-Judge评估器设计、线上Trace自动转数据集,以及50KB大字段、跨账号只读授权、评估器一致性等一线坑点的解决思路。
3.数据飞轮如何反哺Agent自进化:BadCase回流→智能聚类与链路归因→评测集自动扩充,再借助经验库从真实轨迹中沉淀可复用经验、记忆库积累上下文,把评估结果转化为可验证的RL训练信号,让Agent越用越聪明;并附机审覆盖率5%→95%+、人工标注成本↓60%+、处理准确率96%+的量化复盘。
王鹏昊
支付宝 算法工程师
任职于支付宝技术部,从事 GUI Agent方向研究工作。项目经验覆盖政务、出行、物流等垂类行业智能体的端到端评测,擅长 GUI Agent 训练调优等工作。
待定
待定
从问答到办事:基于 GUI Agent 的政务智能体端到端评测
议题背景:
晓政作为政务民生 AI 助手的核心挑战,不只是回答问题,而是能否在真实办事场景中理解用户意图、完成多轮交互、调用页面能力并给出可验证结果。传统评测更多关注单轮问答或离线指标,难以覆盖账号资格、页面操作、环境依赖、结果校验等端到端问题。本议题围绕晓政办事场景,分享如何建设面向真实任务的 benchmark 与评测集,如何通过语料合成、训练策略和训练环境建设提升 GUI Agent 的 UI 操作能力,以及在评测复现、badcase 归因、沙箱环境 和后训练数据闭环中的实践经验。

内容大纲:
1. 办事场景端到端评测问题拆解
1.1 政务民生 AI Agent 的评测目标:从“答得对”到“办得成”
1.2 办事场景与普通问答评测的差异:多轮交互、页面跳转、状态依赖、结果校验
1.3 端到端评测的核心难点:任务可执行性、页面稳定性、过程证据与失败归因
1.4 为什么需要 GUI Agent 作为评测执行器,而不只依赖离线问答指标
2. Benchmark 与评测集建设
2.1 办事任务拆解方法:用户意图、前置条件、操作步骤、页面动作、验收标准
2.2 评测集样本分层:可自动执行、半自动验证、暂不适合自动化执行
2.3 Benchmark 样本构造:任务描述、输入参数、预期结果、校验信号
2.4 badcase 标签体系:Agent 理解失败、页面操作失败、环境异常、样本不可执行、结果校验失败
3. GUI Agent 驱动的评测执行链路
3.1 GUI Agent 的角色定位:端到端评测执行器,而不是被评测对象
3.2 输入输出设计:任务指令、页面截图、操作动作、执行轨迹、校验结果
3.3 移动端 UI 执行框架:页面感知、动作生成、操作执行、截图回放、结果记录
3.4 MiniBench 复现方法:样本整理、batch prompts 构造、多轮执行、截图采集、结果回写
3.5 评测报告生成:成功率、失败类型、截图证据、可复现路径与问题归因
4. GUI Agent 后训练数据闭环
4.1 后训练目标:提升 GUI Agent 在真实办事页面中的 UI 操作稳定性
4.2 语料来源:真实办事流程、MiniBench 执行轨迹、人工标注操作序列、badcase 修正样本
4.3 语料合成:将用户意图、页面截图、动作步骤、校验结果组织成可训练样本
4.4 数据筛选:剔除环境异常、样本不可执行、账号状态阻塞等低质量轨迹
4.5 训练迭代:通过执行结果和 badcase 归因,反向补充高价值训练数据
5. 工程实践与踩坑经验
5.1 页面动态变化导致轨迹失效:如何通过截图回放和状态对齐辅助定位
5.2 任务执行过程不稳定:如何区分模型执行失败、页面异常和样本不可执行
5.3 真实业务场景难自动化:如何通过样本分层、前置条件标注和人工兜底降低误判
5.4 批量评测工程化:日志、截图、结果归因、报告沉淀如何串起来
6. 效果与后续演进
6.1 MiniBench 复现与晓政场景验证的阶段性结果
6.2 端到端评测体系带来的收益:更接近真实用户、更容易复盘、更能定位问题
6.3 后续方向:扩大办事场景 Benchmark、完善样本准入标准、沉淀评测数字员工能力
6.4 从评测结果到能力迭代:将 badcase、执行轨迹和结果归因持续反哺评测集与后训练数据建设

听众收益:
1. 理解办事场景 AI 助手的端到端评测方法,了解从 benchmark、评测集到结果归因的完整设计思路。
2. 获得 GUI Agent 后训练的实践经验,包括语料合成、训练策略、执行环境和 badcase 处理。
3. 了解真实业务落地中的关键坑点,如页面状态变化、环境异常等归因。
 
沈阳
淘天集团  高级测试开发工程师
淘天集团 营销营销&交易技术 高级测试开发工程师,目前主要负责淘天集团 营销导购会场质量保障、会场AI测试 智能测试数据员工落地实现等,保障营销导购会场、营销工具投放、营销大促等项目的高可用性、稳定性和演练;以及营销平台方舟搭建、阿拉丁投放以及其他相关营销工具稳定性保障工作。
待定
待定
MTC 评测平台建设方案
议题背景:
MTC 把"Agent 好不好"从主观判断变成可复现、可回归、可归因的工程度量。平台层(MTC)解决怎么跑得稳、跑得可追溯;方法论层(ome skill)解决评什么、数据够不够、指标准不准、跑完怎么改。 

内容大纲:
1. 背景与定位
1.1 Agent 时代测试的三个失效点
传统测试假设"输入确定 → 输出确定"。而 Agent 是概率性、多轮、带工具调用的系统,导致三个失效:
 - 结果不可复现——同一 query 两次跑分不同,无法判断改动是否有效  
 - 没有基——只能说"感觉变好了",说不出好多少、哪里好  
 - 指标无区分度——流畅度、连贯性这类维度所有版本都是高分,无法排序和选型  
 1.2 双层体系与硬边界
1.2.1 平台层 MTC:评测对象/指标/数据集实体、执行引擎、报告与归因  
1.2.2 方法论层 ome skill:方案设计、数据集构建审计、指标设计校准、执行编排、归因分析
2. 评测矩阵 = 评测对象 × 数据集 × 评测指标
2.2 评测对象层:协议化屏蔽异构被测系统
2.3 评测指标层:规则、模型、人工三条通路并存
llm_judge(多模型通道)、rule(Groovy 本地脚本)、manual(人工打标)、custom HTTP 判分、本体召回专用指标。
两个关键设计:
打分范围与目标值解耦:targetAccuracy`是及格线不是打分上限,且不进 LLM prompt——否则分数会塌到阈值附近  
pass@N/pass^N:把概率性系统的稳定性显式建模为一个维度  
2.4 数据集层:从线上回流到基线沉淀
多来源接入(人工、ODPS、 QA、ALD、HTTP)+ 场景集 + 候选样本池与保鲜看板 + 按业务隔离。定位是把"线上真实流量 → 候选池 → 评测集 → 基线"这条保鲜链路工程化,而不是维护一份静态用例表。
3. 执行引擎:从单次调试到规模化批跑
3.1 编排主流程
3.2 复杂模式评测并发与稳定性
- pass@N 多次采样带 checkpoint 断点续跑  
- llm as user;agent as user 多轮对话评测
- 对比对象评测  
3.3 全链路可观测
3.4 评测工作台
工作台深链承接 → debugRun 单次调试 → 流式 SSE 执行 → 同步阻塞接口(供 CLI/CI 调用)→ 定时批跑 + 钉钉卡片通知。构成从"人工调试"到"无人值守回归"的完整梯度。
4. 结果层:报告、对比与归因
4.1 报告视图按评测形态分化
完整报告 / 本体召回面板 / 多对象对比 / 人工打标矩阵 / Query-GT-Actual 紧凑视图,同一份数据多种读法。
4.2 多对象 ABC 对比
父单记录多个评测对象快照,报告摘要、对比查看、评测记录三处共用同一套对比组件与 A/B/C 角标,支持人工判定胜出。这是版本选型和 prompt 迭代的主要决策界面。
4.3 三级归因体系
| 层级 | 粒度 | 用途 |
| --- | --- | --- |
| L1 Case 级 | 单条 bad case | 定位具体失败原因 |
| L2 报告级 | 一次评测 | LLM 生成归因报告 |
| L3 大盘级 | 跨报告聚合 | 趋势与优先级 |
报告级四分类:缺知识 / 缺工具 / 提示词问题 / 其他,直接映射到可执行的改进动作。
4.4 闭环
度量看板 + 缺陷台账 → 回灌候选池与数据集,让每次评测产生的失败样本成为下一轮的资产。
5. 方法论层:ome skill 把"怎么评"变成可执行流水线
5.1 定位
Skill 管方法论,引擎管执行。每个 skill 既能脱离平台独立跑(本地 jsonl + 统一结果契约),也能把产物发布进工程态获得可追溯性。
5.2 六环流水线
plaintext
benchmark-survey  生态调研
   → plan         评测方案 evaluation.spec
   → dataset      构建 + 10 维健康度审计
   → criteria     指标设计 → judge 装配对齐 → 校准门禁
   → run          统一结果契约
   → diagnosis    归因报告 + 改进 feedback

关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛