AI UI 自动化测试中的"判定可信度"工程
——直播营收业务里驯服 Test Oracle 的实战
议题背景:
用 AI Agent 驱动浏览器做 UI 测试,"把流程跑通"已不难,真正的拦路虎是测试最古老的难题——测试预言(Test Oracle):当判定对错的"判官"从人换成概率模型,它说的"通过"到底可不可信?直播营收业务尤其棘手:UI 交互复杂、控件深藏跨域iframe/H5、页面状态强依赖前置数据、断言难以标准化。我们基于 browser-use + CDP搭建 AI 自动化测试平台,用"Agent 决策 + 代码生成"双模式平衡灵活性与可复现性,以"步骤级评估 + 任务级评审 + DOM/视觉组合取证"压制假阳性判定,配合错误熔断与自愈控制成本,并用造数 Agent 作为上游供给打通"造数据→跑 UI→自动判定"闭环。平台已累计执行超千次真实任务,稳定回归用例集判定准确率达 100%(零误判);通过分层重试把断言空响应存活率从 19% 提升到 96%,每步执行耗时下降 33%,并让失败原因100% 可归因。本议题分享这套体系的关键实现、踩坑经验与在多轮回归、大型专项中的落地效果。
内容大纲:
括号内为可量化支撑,均取自项目内真实报告;标 [团队确认] 的一处用真实回归工时补齐。
1. 问题:AI 测试的"判定可信度"危机
1.1 测试预言(Test Oracle)问题——判官换成模型后,"通过"为何不可信
1.2 直播营收的三重放大器:高交互 / 强状态依赖 / 弱可断言
1.3 业界 Demo 的止步之处:跑通 ≠ 可回归(先立靶子)
2. 执行层:自主性与可复现性的取舍
2.1 双模式设计——Agent 逐步决策(探索)vs 代码生成(回归固化)
2.2 为什么回归场景必须"固化":同一用例两次跑出两条路径的翻车实录
2.3 选型边界:什么场景用哪种模式(附决策表)
3. 判定层:把假阳性摁下去(全场核心)
3.1 假阳性 > 假阴性——"看起来绿了"的静默漏网为何更致命
3.2 三级判定:step 级评估 → Judge 模型任务级评审 → DOM/视觉组合取证
3.3 什么时候信 DOM、什么时候必须上视觉:一组误判 case 拆解
3.4 踩坑实录:一次上游空响应如何被"错误计数耦合"放大成整个任务失败(上游故障率从 18% 劣化到 81% 期间的真实事故复盘)
3.5 收益:断言空响应存活率从 19% 提升到 96%(Layer A+B 分层重试);25 条批量重跑抽样复核,成功/失败/unknown 三类标签判定准确率 100%(零误判)
4. 取证层:拿不到证据的地方怎么取证
4.1 跨域 iframe / H5 的同源策略死角
4.2 DOM → CSS+文本 → 视觉 三级 fallback 定位
4.3 踩坑:iframe 断言失效、H5 滚动穿透的定位与修复
5. 成本与稳定:给 Agent 装刹车
5.1 错误归类:LLM 服务故障 vs 断言失败 vs 决策失败,不能共用一个重试预算
5.2 熔断与快速失败——阻断"换参数碰运气"式空转
5.3 收益(基于 1171 条真实任务前后对比):
5.3.1 平均每步耗时 -33%(21.6s → 14.4s),核心工作区 -38%(18.0s → 11.1s)
5.3.2 单任务平均 token -9.2%;极端失控任务从 3468s 压到 551s
5.3.3 失败模式从"慢速反复重试"转为"早期快速失败"(失败任务每步耗时反低于成功任务)
6. 上游供给:造数如何喂饱执行(辅助线)
6.1 用例跑不起来的真因:PK 没开、天选没发
6.2 造数 Agent(1100+ 原子操作、80+ 场景编排)经 MCP + <<..>> 造数块解耦接入
6.3 "取资产与做操作永远分两步"的编排纪律
7. 落地效果与结论
7.1 覆盖专项:巅峰之夜 / PK / 天选等大型活动回归,累计执行超千次真实任务、覆盖 7+ 业务工作区
7.2 判定质量:稳定回归用例集单批通过率 68%,其中成功/失败/unknown 三类标签判定准确率 100%(零误判)——AI 给出的"通过/失败"结论与人工复核完全一致
7.3 失败 100% 可归因:业务断言不通过 / 环境错误 / LLM 服务故障分类清晰,让"AI 测挂了"从黑盒变成可分类、可治理的工程问题
7.4 回归提效:一轮直播营收回归用例的人工执行成本由 [团队确认] 压缩至 [团队确认]
7.5 结论:AI 测试走向"自治",胜负手是判得准、停得住、跑得稳
7.5.1 数据来源:任务执行指标报告(超千条真实任务)、视觉断言稳定性迭代分析、批量重跑
7.5.2 复核报告,均为项目内已发生的真实数据。标注 [团队确认] 的回归提效数据请用真实
7.5.3 回归工时填写(建议口径:一轮回归从 X 人天缩短至 Y 小时),这是评审最买账的收益指标。
听众收益:
1. 一套可复用的"AI 判定可信度"工程范式:如何用步骤级+任务级+DOM/视觉组合取证,系统性压制 AI 测试的假阳性,而不是靠调 prompt 碰运气——这套方法论可直接迁移到任何 AI 驱动的 UI/接口自动化场景。
2. 复杂前端的实战解法:跨域 iframe / H5 取证、Agent 决策与代码生成的选型边界、错误熔断与成本控制等一线踩坑经验,帮听众避开把 AI 测试推向生产时的典型深坑。
3. 从"能跑 Demo"到"进回归流水线"的完整判断标准:什么样的 AI 测试能力才算真正可上生产,以及造数—执行—判定闭环如何协作落地,给正在评估或建设同类平台的团队一份可对照的决策参考。