议题背景:
在软件质量保障体系中,测试效能始终是团队面临的核心挑战。随着业务复杂度上升,传统的手工用例编写与人工代码审查模式正在逼近瓶颈:
(1) 用例编写耗时长,测试人员重复劳动比例高,如何利用 AI 能力实现用例的自动化生成?
(2) 企业内网环境下模型接入路径多样,选择接 API 接口还是 MCP 协议?不同方案的合规风险与落地成本如何权衡?
(3) 通用知识与业务知识边界模糊,知识库设计不合理导致生成质量低下,如何科学划分并持续运营?
(4) 效果好坏凭感觉,缺乏量化评估体系,如何建立可信的取数与评估机制来驱动迭代?
(5) Code Review 流程松散,问题发现滞后,如何将 AI 能力与 CR 环节深度融合,形成强约束的质量卡口?
本次分享将完整呈现我们团队从 0 到 1 构建 Cursor 插件、实现用例自动生成并延伸至 AI Code Review(AICR)的全过程,以及历经多代演进从规则驱动走向 Skill 化架构、最终赋能三方团队的实践路径与关键经验。
内容大纲:
1)测试团队效能现状与痛点:用例编写占比分析、CR 问题遗漏率数据
2)为什么选择 Cursor 作为切入点:IDE 原生集成 vs 独立平台的优劣对比
整体演进路线图:三阶段概览(原始探索 → 迭代优化 → 能力赋能)
第一阶段:原始探索——打通 AI 测试生成的基础链路
1)技术选型:API 接口 vs MCP 协议,如何做决策
API 接口方案:集成简单、灵活可控,但上下文传递能力有限、工具调用链路长
MCP 协议方案:工具生态丰富、模型感知能力强,但协议复杂度高、调试成本大
企业内网场景下的选型关键因素:延迟、稳定性、维护成本
我们的最终选择与原因复盘
2)合规先行:如何避免企业内部权限引发的合规风险
数据流向管控:代码、用例内容是否上传外部模型的风险识别
权限分层设计:哪些功能对哪些角色开放
3)知识库架构设计:通用知识库与业务知识库的划分逻辑
通用知识库:测试方法论、用例模板、代码规范,如何沉淀与版本管理
业务知识库:需求文档、接口文档、历史用例,如何结构化与动态更新
RAG 召回策略设计:如何让模型优先使用业务上下文
冷启动问题:知识库为空时如何保证生成质量
第二阶段:迭代优化——数据驱动效果提升与规模推广
1)效果评估体系建设:如何科学取数、量化好坏
评估维度设计:用例覆盖率、用例可执行率、人工修改量、缺陷发现率
数据采集方案:埋点设计与用户行为日志分析
基线建立方法:与人工用例质量对比的实验设计
典型评估结果展示与解读
2)推广落地:从小团队试点到多团队规模化使用
冷启动策略:选择种子用户与试点项目的标准
用户阻力分析:信任感建立、使用习惯迁移成本
推广节奏设计:灰度发布 → 全量上线的里程碑管理
运营机制:反馈收集、案例分享、使用激励
3)架构升级:为何从规则(Rules)迁移到 Skill 化架构
规则方案的局限:维护成本高、复用性差、扩展性瓶颈
Skill 化架构的核心优势:模块解耦、能力组合、统一管理
迁移过程中的关键挑战与解决方案
迁移前后的效果对比数据
第三阶段:能力赋能——从工具到平台,辐射更广场景
1)AI Code Review(AICR):将 AI 纳入质量卡口
AICR 与传统 CR 的定位关系:辅助 vs 约束
基于用例的 CR 规则绑定:用例覆盖缺失如何触发 CR 拦截
CR 结果与缺陷数据的联动分析
落地效果:CR 覆盖率、问题拦截率、人效对比
2)赋能三方团队:功能生成与验收用例的协同生产
场景介绍:三方团队交付物质量参差不齐,如何通过 AI 建立统一验收标准
三方协作模式下的知识库共享机制
验收用例自动生成流程:需求输入 → 用例输出 → 人工确认
落地实践与数据成效展示
总结与展望
三阶段核心经验提炼
关键决策回顾:哪些判断是对的,哪些走了弯路
未来方向:Agent 化测试、多模态用例生成
听众收益:
听众将从本次分享中获得以下实际收益:
技术选型参考:清晰了解 API 接口与 MCP 协议在企业测试场景下的选型逻辑,避免重走弯路;
合规风险意识:掌握企业内网 AI 工具落地的合规要点,建立数据安全边界;
知识库设计方法:获得可复用的通用/业务知识库划分框架,直接指导实际建设;
效果量化思路:学习如何建立可信的 AI 工具评估体系,用数据驱动持续优化;
推广落地经验:了解 AI 测试工具从试点到规模化的全流程推广策略;
架构演进启示:理解从规则到 Skill 的架构升级背后的工程思考;
场景延伸灵感:通过 AICR 与三方赋能案例,拓宽 AI 在测试领域的应用想象空间。