AI介入测试工作流程之后,如何把控测试质量和问责?
AI 测试工作流中的“人在环上”人工审核关口示意AI 负责把测试做快人负责把生成内容人工审核到位。内容确认清楚测试质量控制与责任归属才同时成立。AI 介入测试工作流程之后测试和验收不再是“系统跑过一遍”那么简单——当 AI 辅助测试 已经覆盖条款拆解、测试用例生成、自动化执行与测试报告输出“这次验收按什么测、范围是否符合要求、内容是否准确、哪些内容是谁确认的”就成了更现实的问题。2026 年 8 月 2 日欧盟《人工智能法案》EU AI Act进入全面执行阶段。根据欧盟委员会驻塞浦路斯代表处 2026 年 7 月 31 日公告欧盟 AI Office 与各成员国主管机构开始执行新的透明度与监管要求。同年 8 月中华人民共和国商务部相关刊文也提到该法案对高风险 AI 系统明确提出落实人工监督Human Oversight、开展合规评估等要求。把这条时事放回标准符合性检测与产品上线验收场景里会看到一个很直接的问题当 AI 让条款拆解、测试用例生成和自动化回归测试都更快的时候质量控制也最容易跟着“轻下去”——系统跑得更快人工判断却变轻了。流程看起来更完整真正决定质量的关键动作却被模糊掉。这也正是擎测在产品设计里坚持“人在环上Human-in-the-Loop、人工审核不可跳过”的原因AI 已经进场之后人的角色应该放在哪里质量又该如何被真正控住。不过把这件事落回到测试一线会更直观。AI 介入测试工作流程后业务正确性仍需人工把关。擎测在 AI 智能生成的内容进入自动化执行、归档或入库之前设置人工审核Human Review环节。人重点确认内容是否完整理解是否准确后续是否可执行。审核到位结论层面的责任归属Accountability才自然成立。这不是削弱自动化而是让 AI 测试具备业务合理性可解释性Explainability与可追溯性。一、AI 进入测试工作流程后测试质量为什么容易失衡很多人会自然地把人在环上理解成对自动化的一种保守姿态好像系统已经能做的事人还非得再看一遍多少有点拖效率。可放到测试、验收和标准符合性检测场景里人的参与从来不是为了再做一遍而是为了完成 AI 很难天然承担的那部分工作——也就是带语境的判断动作。AI 擅长的是规模化处理资料整理、条款拆解、候选测试用例生成、批量执行、测试报告初稿速度确实上去了。但测试和验收真正依赖的是判断动作到底测什么、不测什么。哪些场景必须覆盖、哪些场景不在本次验收范围内。什么算通过、什么必须整改。方法是按标准逐条核验还是按业务路径抽测。一条异常是页面变化、数据问题、环境异常、流程变化还是业务逻辑不一致。一份结果能不能直接进入验收结论。这些问题都不是“会不会做”的问题而是“怎么判断”的问题。只要是判断就一定还需要人参与。AI 可以基于相似样本生成内容但很难自然知道项目当前的交付目标是什么、这次验收最重要的风险点在哪、哪些条款是强约束、哪些结果虽然技术上通过但业务上仍有疑问。这些都依赖人对语境的把握也是当下 AI 治理AI Governance 讨论中 人在环上Human-in-the-Loop 被反复强调的原因。所以AI 进入测试工作流程后测试质量之所以容易失衡并不是 AI 不够好而是当 AI 已经把是什么和怎么做搭起来之后按什么标准判断由谁确认出问题归谁这层判断反而容易被默认让给系统。这正是人和 AI 的边界需要重新划清的地方。二、擎测如何把“人在环上”落到测试工作流里上面的问题看起来都和“人要不要参与”有关但真正落到执行层面关键并不是把人喊回流程里而是把人的确认动作放在关键节点上。擎测TestPilot的做法很直接AI 可以先生成测试用例、标准模板或用例模板草稿但这些内容不会被默认当成最终结果。进入自动化执行、归档或入库之前必须先经过人工审核必要时编辑再确认能不能继续往下走。人工审核主要看三件事。1看内容是否完整避免关键内容被漏掉审核人员会对照原始资料、标准条款或任务要求查看生成结果有没有遗漏。例如测试场景是否覆盖完整前置条件、操作步骤、预期结果是否齐全关键验收点有没有缺失。AI 可以把内容先整理出来但是否覆盖到本次任务真正关心的范围仍然需要人来确认。2看内容是否准确避免理解偏差进入后续流程测试内容不是“看起来像”就可以。审核人员需要判断生成结果有没有理解偏差标题和模块是否对应真实业务步骤是否符合实际操作预期结果是否合理标准条款或测试依据有没有被写偏。只有这些内容被确认清楚后面的执行和报告才有可信的基础。3看内容是否可执行避免生成结果停留在纸面上对测试用例来说审核的重点是测试人员能不能照着做、做完后能不能判断结果。步骤太笼统、条件不明确、预期结果说不清的内容都需要在审核阶段调整。换句话说人工审核不是为了重复 AI 的工作而是把“生成出来”变成“后续能用”。在不同流程里审核后的去向也不完全一样。产品测试流程里人工审核主要用于确认生成的测试用例是否可以进入后续执行。标准模板拆解流程里人工确认后的模板可以继续归档。因此“人在环上”在擎测里不是一句口号而是一个实际的流程关口。它重点解决的是内容有没有漏、理解有没有偏、后续能不能用。至于“沉淀为可复用资产”更准确地说是模板类流程在审核确认之后带来的延展价值而不是所有审核阶段都统一要审的一项内容。三、写在最后把角色交还给流程也把判断交还给人人参与得够不够不是看谁坐在工位上时间更长也不是看谁在最后签了字而是看关键的方向、边界、标准基线、预期结果与合格标准这些判断有没有被明确地安排在流程的节点上。如果这些关键判断一直都在那 AI 跑得越快质量越稳。如果这些关键判断被默认让给了系统那 AI 跑得越快反而越容易在要紧的地方出错。擎测坚持“人在环上、人工审核不可跳过”本质上并不是在反对自动化而是在替自动化守住最基本的角色分工。在 AI 智能测试工作流中AI 已经把测试方向、标准基线与产品扩展、测试流程以及预期结果与合格标准搭起来了。人真正要做的是对这些已经生成的信息进行人工审核和把控。审核到位结论才有可解释性的依据责任归属也才自然成立。AI 负责规模化处理人负责关键审核与关键判断。两者各就各位测试质量控制才真正成立——这正是当前 AI 治理语境下“人在环上”对自动化提出的底线要求。如果你也在推进 AI 测试、上线验收或质量工程不妨回头看一眼自己的测试流程AI 已经生成了什么人到底审核了其中哪几项结论的责任又建立在哪些审核动作之上这三件事分清楚测试质量和问责才不会变成空话。四、常见问题FAQQ1AI 已经能做这么多为什么测试和验收还需要人参与因为 AI 擅长的是规模化处理测试和验收真正依赖的却是带语境的判断。测什么、怎么测、什么算通过、什么算风险往往取决于项目目标、业务口径和验收边界这些都需要人来定。AI 是放大器方向、边界和方法仍要由人确定——这也是当前 AI 治理框架下人在环上被反复强调的原因。Q2人在环上人在测试工作流程里到底扮演什么角色人的角色不是替 AI 重做一遍而是对 AI 生成内容进行人工审核和把控。在 AI 智能测试工作流中AI 可以先生成测试用例、标准模板或用例模板草稿。人真正要做的是确认这些内容是否完整、是否准确、是否能进入后续执行、归档或入库。审核到位结论才具备可解释性的基础。Q3在人工智能法案EU AI Act全面执行的背景下人在环上Human-in-the-Loop为什么变得更关键因为 EU AI Act 明确把人工监督Human Oversight列为高风险 AI 系统的合规要求之一要求部署方对 AI 输出保留有效的人工复核与干预能力。对于上线验收和标准符合性检测场景来说把人在环上做成机制既是 AI 治理的现实要求也是结论具备责任归属与可解释性的基础。Q4擎测在人在环上Human-in-the-Loop这件事上的具体做法是什么擎测把人工参与设计成不可跳过的流程关口产品测试用例进入执行前需要人工审核。标准模板拆解结果需要审核后再归档。这样 AI 负责规模化生成人负责关键判断二者在流程里各司其职。

相关新闻

【联系jmeter】ServeRest

【联系jmeter】ServeRest

ServeRest 它支持完整的 GET/POST/PUT/DELETE 操作和数据持久化,能让你练习增删改查、头认证、查询字符串等核心技能;官方推荐用 Docker 或 npx 两种方式在 Linux 上本地运行。选哪种取决于你机器上已经有什么。 🐳 方式一:使用 D…

2026/10/11 5:39:49 阅读更多 →
为什么有validation set(验证集)还会产生过拟合问题?

为什么有validation set(验证集)还会产生过拟合问题?

回顾训练集和验证集的训练过程先是在训练集进行训练,然后把训练好的模型放到验证集上去验证,例如我们在训练集上得到的三个模型,放到验证集上验证并选择loss最小的模型其实我们换个视角来看,也就是三个模型在验证集继续进行训练&a…

2026/10/11 5:39:49 阅读更多 →
git常用操作流程

git常用操作流程

一:正常工作目录开发功能: 1.git checkout ct_work_1 : 切换到工作分支ct_work_1 2.git fetch origin :先把服务器最新状态拉下来,刷新 origin/IPC_Dev 3.git merge origin/IPC_Dev :将ct_work_1刷新到最新代码 5.描述工作内容:3.1 问题/目标。3.2 当前环…

2026/10/11 5:39:49 阅读更多 →

最新新闻

PS5游戏存档工具开发与跨平台迁移实践

PS5游戏存档工具开发与跨平台迁移实践

我无法基于当前输入生成符合要求的博文。原因如下:项目标题“AnyPS5”缺乏明确指向性,未说明是硬件改装、模拟器方案、跨平台兼容层、游戏存档工具、远程串流方案,还是其他技术方向;项目正文为空,无任何功能描述、技术…

2026/10/11 6:21:14 阅读更多 →
分布式事务与最终一致性:双 11 扣减库存与赠送积分的本地消息表落地

分布式事务与最终一致性:双 11 扣减库存与赠送积分的本地消息表落地

大促架构设计里有一条用真金白银换来的血泪教训:凡是在每秒数万 TPS 的主交易链路上搞跨服务强一致分布式事务(如 2PC/XA、全局事务锁)的,双 11 零点基本没有不翻车的。 三年前我们曾经迷信过某开源分布式事务框架。大促零点洪峰一…

2026/10/11 6:21:14 阅读更多 →
轻量级多仓库协同:一个字母g+Markdown看板的工程实践

轻量级多仓库协同:一个字母g+Markdown看板的工程实践

1. 项目概述:当 Git 操作被压缩成一个字母,看板成了28个项目的神经中枢“一个字母 g 管 Git,一块看板管 28 个项目的 AI 员工 zen-gitsync”——这个标题不是营销噱头,而是我在某跨团队协作实验室里真实落地的一套轻量级工程协同方…

2026/10/11 6:21:14 阅读更多 →
Claude Code插件:JetBrains IDE语义级AI编程工作流

Claude Code插件:JetBrains IDE语义级AI编程工作流

1. 这不是又一个“AI写代码”插件:它专为JetBrains生态重构工作流JetBrains党——这个在IDE界自带信仰标签的群体,对工具的挑剔程度远超普通开发者。我们不是不接受AI辅助,而是拒绝把AI塞进一个不匹配的壳子里。当看到“Claude Code插件”这个…

2026/10/11 6:21:14 阅读更多 →
技能追踪系统:基于Git与纯文本的可验证能力操作系统

技能追踪系统:基于Git与纯文本的可验证能力操作系统

1. 项目概述:当“skills”不再只是简历上的单词,而成为可验证、可组合、可进化的个人能力操作系统“skills”这个词最近在技术社区、职业发展平台和高校教学研讨中高频出现,但它早已不是求职简历里那行潦草罗列的“Python/Photoshop/沟通能力…

2026/10/11 6:21:14 阅读更多 →
基于深度学习的坐姿纠正系统:从摄像头到提醒的全栈实现

基于深度学习的坐姿纠正系统:从摄像头到提醒的全栈实现

简介:这份资源是一套基于深度学习的坐姿纠正系统全栈项目代码,面向希望将姿态识别技术落地为完整应用的开发者与学习者,可用于毕业设计、课程项目或技术练手。项目以人体姿态估计为核心,实时监测用户坐姿并给出纠正建议&#xff0…

2026/10/11 6:20:14 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →