背景周一一早研发一口气合了 20 个改动。你手里的回归清单还没跑完问一句这次动了支付会碰到哪些用例没人答得上来。全量跑一遍四小时只挑支付又怕漏。这个挑活儿的活正是 ContextQA 在 10 月 5 日发布的 Ship 想接手的。它是什么 / 解决什么问题Ship 是在线服务。它盯的不是代码写得好不好而是每次改动上线前用户点得出来的流程还走不走得通。可以把它理解成一个只干三件事的同事挑活、跑腿、留记录——研发提了改动它先判断会碰到哪些流程再打开浏览器把这几个流程点一遍。区别在于它点的是部署好的真实页面跟人手动测一个姿势。它做了什么它由三种情况触发做的东西都会变成用例。第一种是有人提了改动。它先做一次影响面分析这次改动会碰到哪些流程再只跑受影响的用例。Ship 产品页示例里一个只改三个文件的改动映射到三条用户流程12 条用例跑完抓到一条严重缺陷。第二种是有人报了 bug。收到描述后它自己重放复现、录屏、抓网络请求定位到具体哪一行示例里会话过期后转圈不停38 秒就复现了。第三种是生产环境出异常。它分析真实用户会话发现异常就复现成常驻用例——示例是 15 分钟看完 1284 条会话抓到重复支付。这些用例都留在套件里以后每次改动都跑。数据 / 效果Ship 产品页头版是四个数字72% 的回归在合并前被抓住、94% 的改动覆盖率、bug 解决快 68%、每次发布质量成本降 43%。限定是官方页面没写方法、样本量和统计时间。一篇 10 月 5 日的第三方分析文章progressiverobot.com指出这些数字该当成厂商自述而不是测量结果。它的收费按信用点credit按量扣的点数算1 点 0.025 美元分析一次改动 10 点。同一份产品页上还有份示例报告Release 284质量分 92、分析 31 个变更、抓到 3 个回归、预计避免 1.84 万美元缺陷成本。文章也说页面没说明它来自真实客户。你能怎么用前提有两个改动都走代码评审每次改动都有能打开的部署环境。15 天试用给 3000 点别指着仓库等结果读代码 1000 点、走页面流程 500 点一半就没了。剩 1500 点这样花10 次 bug 复现150 点 12 次改动分析每次约 106 点。费率就是上面那套一次分析 10 点、每 4 个步骤 1 点。然后拿已知答案考它把几个已修好的老 bug 当新 bug 喂进去再把上月你清楚结果的改动重跑一遍。能带走的口诀先算每次改动的成本约 106 点合 2.65 美元再算每个有用发现的成本——总点数除以它抓到你原本漏掉的真 bug 数。前置知识两样看得懂研发改了哪里讲得清一条业务流程。从功能测试视角看哪些场景适合哪些别用适合每次上线前都要人工把核心流程点一遍、或 bug 描述含糊得靠猜的团队。别用① 用户报的问题没法重放② 没有稳定的部署环境③ 探索性测试为主的活——它只会跑流程不会帮你想新场景。新人最容易踩的四个坑坑① 把绿色定向回归当成这次改动没问题。它只跑了它自己挑的流程影响面地图漏一条依赖它会安静地全绿。定期跑一次全量当保险。坑② 直接收下它写进用例库的新用例。那篇文章建议每条进常驻套件的用例都要人工过一遍。坑③ 只算月费。49 美元的前提是点数够用一个改动差不多 106 点几百个改动就会溢到按点加购。坑④ 分不清真缺陷和偶发失败flaky用例自己偶发地红一下跟产品好坏无关。签之前问清它怎么区分两者。跟传统测试方法的关系这是老办法的新包装换掉的只是挑用例那一层。2018 年 Meta 就公开过这类做法只跑三分之一的用例抓住 99.9% 以上的回归。这做法叫选择性回归测试只挑受影响的用例跑其余不跑。差别在粒度老工具在用例和代码依赖这层挑Ship 在用户流程这层挑。它不是替代你是你定标准和预期它负责跑。对功能测试工程师意味着什么要学但不急它替你做的是跑和复现不是判断。你十年练出来的三件事它替代不了把改动翻译成会碰到哪些流程、把预期从需求文档里定下来、判断一条失败是缺陷还是环境问题。建议先练一件事把一条业务流程用 AI 听得懂的话写出来——这在任何 AI 测试工具里都通用。小结最后留个选择题。你最近一次动手跑回归卡在哪一步① 不知道改动影响哪些用例只能全量跑 ② 跑了但漏了线上才炸 ③ bug 复现不了来回问研发 ④ 还没轮到我用 AI先围观下一篇我会把AI 写的用例怎么验它真有用拆成三个问句——不装任何工具明天就能用。