专场:AI 质量管控:从左移到右移的全链路实践 
随着AI编码工具的快速普及,生成代码已成为开发日常,但随之而来的幻觉、缺陷和安全隐患也越来越突出,传统的质量保证方式已明显跟不上节奏。 本专场探讨在AI时代,如何建立一套真正适配的全链路质量保障体系:从开发早期就做好针对AI代码的评审和幻觉检测,到引入适合AI原生应用的新型测试方法,再到利用智能工具加强安全扫描和生产阶段的持续监控,实现从左移预防到右移验证的完整闭环。结合当前行业面临的实际挑战与最新实践,分享如何在加快交付的同时,切实把控住代码质量和风险,帮助团队平稳完成向AI驱动开发的转型。
专场出品人:白路 
小红书 搜推广效率工程负责人
毕业于哈尔滨工业大学计算学部。先后就职于华为、百度,曾负责百度搜索、文心模型等核心产品的质效保障与稳定性能力建设,在引擎算法链路风险治理、研发效能提升、测试智能化及大模型效果评测等领域积累了丰富的实践经验。当前聚焦 Agent 驱动的智能变更管控与稳定性风险治理,探索 AI Native 时代的质效研发新范式。
李雁翎
微众银行 AI 测试架构师
拥有8年软件质量保障经验。本科毕业于西安电子科技大学,硕士毕业于华中科技大学,具备扎实的计算机与工程理论基础。
曾先后就职于美团、字节跳动、Shopee及微众银行等头部互联网与金融科技企业,长期深耕金融支付、信贷核心、电商交易等业务领域,对高并发、高可用系统的质量保障有着丰富的实战积累。
在质量内建与测试左移方面,主导过多个业务线的流程优化与质量防控体系搭建,通过需求阶段介入、精准测试与持续集成实践,有效将缺陷发现左移,显著降低线上风险。在AI赋能测试提效方向,深入探索并落地了智能用例生成、流量回放、缺陷预测、回归策略优化等方案,在多个核心系统项目中取得了明显的质量与效率双提升,具备从方案设计到规模化落地的完整经验。
核心方向:测试左移、AI驱动测试提效、金融系统质量保障、质量效能提升
待定
待定
从需求到可执行脚本:测试知识库驱动的 AI 测试落地实践
议题背景:
AI 辅助研发中开发提速明显、测试感受不深,差距不在会不会用 AI,而在知识资产与约束机制。"需求到测试设计"离需求最近、返工成本相对较低,业内普遍存在如下痛点:
1. 覆盖受限于文档完整度,视野外入口漏测
2. 影响面分析更多依赖专家经验
3. 需求信息不全,存在沟通成本
4. AI 生成内容细节臆造,审核成本高
前两类缺信息来源,后两类缺约束机制

内容大纲:
1. 问题定位:提效剪刀差成因、左移落点选择、四类卡点、需求与测试设计的本质
2. 受控生成链(需求到测试设计):需求体检问人不猜、影响面双向收敛、场景矩阵集合对照、预期取值链、八道出厂门禁、裁决沉淀闭环
3. 知识库建设(卡点倒推):代码给结构、案例给行为、裁决做仲裁;只读声明不读逻辑、可信分级、按需查询、基线保鲜
4. 脚本生成:三段式直转、中间契约映射(带置信度、缺口显式保留)、Mock 与执行开关自动推断、模板加组件复用
5. 边界与要点:适用象限与迁移成本;五条方法红线——缺口问人、声明不作预期、现状不等于预期、集合对照、全程可溯源

听众收益:
1. 方法论:用"缺口问人、集合对照、出厂门禁"管住 AI 生成质量,约束的是方法而非模型
2. 建库思路:由生成链卡点倒推建库,避免"先建库再找用途"
3. 三条实践:显式化"不知道"、信息分权流转、裁决沉淀复用
4. 决策参考:适用边界与迁移成本,评估如何分阶段引入
焦海棠
岩山科技二三四五 高级测试工程师
岩山科技旗下2345网络科技高级测试工程师,深耕互联网质量管控领域十余年,在研发效能提升、业务质量赋能方面拥有丰富实践经验。长期专注于精准测试、研发效能与自动化体系建设,当前聚焦 AI 测试前沿方向,主导落地多项 AI 测试核心能力,推动质量平台智能化升级,自主规划并完整构建精准测试 1.0与 TIA 2.0 双版本技术体系。 擅长技术经验沉淀与赋能分享,获评公司年度最受欢迎分享嘉宾。
待定
待定
从语义盲区到智能对齐一-构建需求-代码-图谱三位一体的
精准测试闭环
议题背景:
在软件质量保障演进中, 精准测试 面临“回归盲区”与“追溯断裂”的双重挑战。传统的定性测试模式在处理 Merge Request 时,难以量化 增量代码对业务逻辑的渗透程度 ,导致全量回归低效且盲目。
业务需求、架构拓扑与源码实现之间的信息孤岛,使得“变更影响谁、测试测什么”成为难以达成共识的瓶颈。
本方案通过构建一套基于“增量语义 - 拓扑映射 - 需求原子”的智能引擎,旨在实现质量风险在代码合并阶段的精准前置与闭环管控。

内容大纲:
1. 演讲摘要与核心痛点
1.1 核心痛点解析 :回归盲区、追溯断裂、量化共识缺失。
1.2 核心方案介绍 :多维异构拓扑建模、双向追溯性共识校验、靶向驱动闭环、混合决策增强。
2. 核心架构:多维拓扑图谱建模与双向共识校验
2.1 系统架构全景图 :语义接入层、核心引擎层、存储与知识层、AI 增强层的全链路协同。
3. 核心功能实现:从静态代码到业务语义的拓扑映射
3.1 多维异构的代码知识图谱拓扑建模 (Part A) :多维节点建模(跨越业务与代码边界)、启发式入口发现引擎(解决静态解析断链)、逻辑集群风险度量。
3.2 双向追溯校验:需求与实现的双引擎对齐 (Part B) :双塔向量空间对齐(AI 语义对齐)、方向性偏差检测算法(识别对齐/正交/相悖)、逻辑合规性穿透(拦截逻辑孤岛)。
4. 智能质量门禁:质量门禁已形成“评估决策 + 发布准入”双层闭环
4.1. 自动化质量门禁:实现分级管控:三级门禁 + 发布准入、多维决策:告别单一分数判定、智能处置:自动化决策建议、透明可溯:结构化决策留痕
4.2 演示示例
5. 工程挑战与 AI 增强解决方案
三大核心挑战与应对:
1)挑战一:如何应对非标准、模糊的 PRD?
2)挑战二:语义偏离与 AI 幻觉的治理
3)挑战三:海量 Diff 下的语义稀释与成本控制
6. 核心优势对比与收益
6.1 对比分析 :传统人工模式 vs 本方案智能全链路协同引擎。
6.2 收益 :-质量前置发现:通过语义校验,将 30% 的“逻辑不一致”缺陷在合入前拦截。回归效能提升:精准回归模式使无效执行减少 70%,测试数据构造效率提升 50% 以上。

听众收益:
1. 方法借鉴 :从“信息孤岛”到“三位一体”的共识重塑 掌握如何通过“需求-代码-图谱”三位一体的建模思路,打破研发链路中的信息断层。学习如何构建跨越业务语义与底层实现的异构知识图谱,实现质量风险的量化评估与可视化对齐。
2. 技术启发 :学习“规则+AI”混合模型在解决异构代码解析、语义偏离等复杂工程问题上的实战思路。
3. 效能提升 :获取精准测试 TIA 2.0 的落地经验,从“物理链路分析”向“业务语义洞察”的范式转移:通过回归范围收敛与资产自愈,显著降低测试人力投入。
4. 避坑指南 :攻克大规模工程落地的挑战,参考针对海量 Diff 数据下的“语义稀释”、LLM 计算成本优化、以及 AI 幻觉引发误报的成熟应对策略(如结构化预降维、置信度阈值机制),为团队在复杂业务场景下落地智能质量体系提供避坑指南。
时零
bilibili 高级测试开发工程师
哔哩哔哩 高级测试开发工程师。主要负责营收业务的质量保障与提效
工具开发,方向覆盖 Web 性能、Web AI 自动化测试、测试数据构造(造数)等。
擅长领域:AI Agent 在测试场景的工程化落地、复杂前端(弹窗/面板/跨域 iframe/H5)
UI 自动化、断言可靠性设计、测试数据构造与测试效能建设。

【任职经历】
毕业后曾就职于美团,负责首页业务的质量保障工作,积累了大流量核心页面的质量
保障与测试体系经验;现于哔哩哔哩负责直播营收业务的质量保障与提效工具建设。

【团队背景】
所在团队负责 B 站直播营收业务(礼物、弹幕、天选、大航海、榜单、PK 等)的质量
保障与测试效能建设。直播营收链路具有"UI 交互复杂、页面状态强依赖前置数据、
断言难以标准化"三大特征,传统自动化测试维护成本高、覆盖率难以提升。团队围绕
这些痛点,将 AI Agent 引入 UI 自动化测试与测试数据构造,持续探索"从辅助到自治"
的测试提效路径。

【项目经验】
主导/深度参与两套面向内部的 AI 测试基础设施建设:
· AI 浏览器自动化测试平台(PortKey / 门钥匙)——基于 browser-use + CDP,用
  自然语言描述用例即可驱动浏览器完成直播间 UI 测试,支持 Agent 逐步决策与
  代码生成双模式,具备步骤级/任务级评估、DOM+视觉组合断言、跨域 iframe/H5
  取证、多模型 Provider 与并发调度等能力;
· 测试数据构造 Agent(AgentQ,上游供给)——自然语言编排接口调用链,在 UAT
  环境构造测试数据,通过 MCP 协议与执行平台解耦协作,形成"造数据→跑 UI→
  自动判定"闭环。

上述能力已实际落地到直播营收多轮回归与大型专项(巅峰之夜、PK、天选等)的
日常测试中。
待定
待定
AI UI 自动化测试中的"判定可信度"工程
——直播营收业务里驯服 Test Oracle 的实战
议题背景:
用 AI Agent 驱动浏览器做 UI 测试,"把流程跑通"已不难,真正的拦路虎是测试最古老的难题——测试预言(Test Oracle):当判定对错的"判官"从人换成概率模型,它说的"通过"到底可不可信?直播营收业务尤其棘手:UI 交互复杂、控件深藏跨域iframe/H5、页面状态强依赖前置数据、断言难以标准化。我们基于 browser-use + CDP搭建 AI 自动化测试平台,用"Agent 决策 + 代码生成"双模式平衡灵活性与可复现性,以"步骤级评估 + 任务级评审 + DOM/视觉组合取证"压制假阳性判定,配合错误熔断与自愈控制成本,并用造数 Agent 作为上游供给打通"造数据→跑 UI→自动判定"闭环。平台已累计执行超千次真实任务,稳定回归用例集判定准确率达 100%(零误判);通过分层重试把断言空响应存活率从 19% 提升到 96%,每步执行耗时下降 33%,并让失败原因100% 可归因。本议题分享这套体系的关键实现、踩坑经验与在多轮回归、大型专项中的落地效果。

内容大纲:
括号内为可量化支撑,均取自项目内真实报告;标 [团队确认] 的一处用真实回归工时补齐。
1. 问题:AI 测试的"判定可信度"危机
1.1 测试预言(Test Oracle)问题——判官换成模型后,"通过"为何不可信
1.2 直播营收的三重放大器:高交互 / 强状态依赖 / 弱可断言
1.3 业界 Demo 的止步之处:跑通 ≠ 可回归(先立靶子)
2. 执行层:自主性与可复现性的取舍
2.1 双模式设计——Agent 逐步决策(探索)vs 代码生成(回归固化)
2.2 为什么回归场景必须"固化":同一用例两次跑出两条路径的翻车实录
2.3 选型边界:什么场景用哪种模式(附决策表)
3. 判定层:把假阳性摁下去(全场核心)
3.1 假阳性 > 假阴性——"看起来绿了"的静默漏网为何更致命
3.2 三级判定:step 级评估 → Judge 模型任务级评审 → DOM/视觉组合取证
3.3 什么时候信 DOM、什么时候必须上视觉:一组误判 case 拆解
3.4 踩坑实录:一次上游空响应如何被"错误计数耦合"放大成整个任务失败(上游故障率从 18% 劣化到 81% 期间的真实事故复盘)
3.5 收益:断言空响应存活率从 19% 提升到 96%(Layer A+B 分层重试);25 条批量重跑抽样复核,成功/失败/unknown 三类标签判定准确率 100%(零误判)
4. 取证层:拿不到证据的地方怎么取证
4.1 跨域 iframe / H5 的同源策略死角
4.2 DOM → CSS+文本 → 视觉 三级 fallback 定位
4.3 踩坑:iframe 断言失效、H5 滚动穿透的定位与修复
5. 成本与稳定:给 Agent 装刹车   
5.1 错误归类:LLM 服务故障 vs 断言失败 vs 决策失败,不能共用一个重试预算
5.2 熔断与快速失败——阻断"换参数碰运气"式空转
5.3 收益(基于 1171 条真实任务前后对比):
5.3.1 平均每步耗时 -33%(21.6s → 14.4s),核心工作区 -38%(18.0s → 11.1s)
5.3.2 单任务平均 token -9.2%;极端失控任务从 3468s 压到 551s
5.3.3 失败模式从"慢速反复重试"转为"早期快速失败"(失败任务每步耗时反低于成功任务)
6. 上游供给:造数如何喂饱执行(辅助线)
6.1 用例跑不起来的真因:PK 没开、天选没发
6.2 造数 Agent(1100+ 原子操作、80+ 场景编排)经 MCP + <<..>> 造数块解耦接入
6.3 "取资产与做操作永远分两步"的编排纪律
7. 落地效果与结论
7.1 覆盖专项:巅峰之夜 / PK / 天选等大型活动回归,累计执行超千次真实任务、覆盖 7+ 业务工作区
7.2 判定质量:稳定回归用例集单批通过率 68%,其中成功/失败/unknown 三类标签判定准确率 100%(零误判)——AI 给出的"通过/失败"结论与人工复核完全一致
7.3 失败 100% 可归因:业务断言不通过 / 环境错误 / LLM 服务故障分类清晰,让"AI 测挂了"从黑盒变成可分类、可治理的工程问题
7.4 回归提效:一轮直播营收回归用例的人工执行成本由 [团队确认] 压缩至 [团队确认]
7.5 结论:AI 测试走向"自治",胜负手是判得准、停得住、跑得稳
7.5.1 数据来源:任务执行指标报告(超千条真实任务)、视觉断言稳定性迭代分析、批量重跑
7.5.2 复核报告,均为项目内已发生的真实数据。标注 [团队确认] 的回归提效数据请用真实
7.5.3 回归工时填写(建议口径:一轮回归从 X 人天缩短至 Y 小时),这是评审最买账的收益指标。

听众收益:
1. 一套可复用的"AI 判定可信度"工程范式:如何用步骤级+任务级+DOM/视觉组合取证,系统性压制 AI 测试的假阳性,而不是靠调 prompt 碰运气——这套方法论可直接迁移到任何 AI 驱动的 UI/接口自动化场景。
2. 复杂前端的实战解法:跨域 iframe / H5 取证、Agent 决策与代码生成的选型边界、错误熔断与成本控制等一线踩坑经验,帮听众避开把 AI 测试推向生产时的典型深坑。
3. 从"能跑 Demo"到"进回归流水线"的完整判断标准:什么样的 AI 测试能力才算真正可上生产,以及造数—执行—判定闭环如何协作落地,给正在评估或建设同类平台的团队一份可对照的决策参考。
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561