Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了
关注 霍格沃兹软件测试开发 公众号回复「资料」, 领取人工智能测试开发技术合集8 月 26 日Qwen 团队发布了 Qwen3.8-Flash-Next。这次更新有几个信息很抓眼球125B 主模型参数每个 Token 只激活约 6B原生支持 26 万 Token 上下文可扩展到 100 万Coding、Agent、工具调用能力继续增强。同时Qwen Cloud 上的生产版本命名为 Qwen3.8-Flash默认就是 100 万 Token 上下文。如果只是日常聊天这些数字可能没那么有感觉。但如果你是开发、测试、运维或者其他 IT 从业者这次更新其实很值得看。因为从 Qwen3.8-Flash 身上能看到一个越来越明显的趋势大模型正在从“回答问题”继续往“完成工作”走。而软件研发恰好是这一轮变化最明显的场景之一。Qwen3.8-Flash模型体验地址技术报告https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf技术博客https://qwen.ai/blog?idqwen3.8-flash-nextHugging Facehttps://huggingface.co/Qwen/Qwen3.8-Flash-Next?spma2ty_o06.30285417.0.0.1d73c921FsyOPefileQwen3.8-Flash-NextModelScopehttps://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spma2ty_o06.30285417.0.0.1d73c921XAP2dVfileQwen3.8-Flash-Next千问AI平台https://www.qianwenai.com/models/qwen3.8-flash01 先说最直观的上下文来到 100 万 TokenQwen3.8-Flash-Next 原生上下文长度达到 262,144 Token并且可以扩展到 1,000,000 TokenQwen Cloud 提供的 Qwen3.8-Flash 则默认支持 1M 上下文。100 万上下文到底意味着什么以前使用 AI Coding很多人的操作是复制一段代码 → 丢给模型 → 问它哪里有问题。或者测试同学复制一段需求 → 让模型生成测试用例。这当然能用但跟真实的软件工程还有很大距离。因为真正做一个项目模型要理解的东西远不止一段代码。比如一个支付需求改动测试人员可能同时要看PRD 和需求变更接口文档前后端代码数据库表结构上下游服务历史测试用例历史 Bug日志Git Commit / Diff监控信息过去最大的一个问题就是这些东西根本塞不进去。上下文越来越长之后AI 才有机会从“看懂一个文件”逐渐走向“理解一个项目”。当然100 万 Token 不代表把整个公司代码库一股脑塞进去就完事了。真正落地依然涉及代码检索、知识库、上下文管理、权限控制等工程问题。但模型能够处理的上下文上限提高确实给复杂研发任务提供了更大的空间。02 Coding 能力已经不是“帮你补几行代码”了这次 Qwen 官方给出的测试成绩里Coding 是一个明显重点。例如SWE-bench Pro62.5SWE-bench Multilingual81.0DeepSWE 1.158.7这些 Benchmark 和以前单纯考“写一道算法题”不太一样更偏向真实软件工程理解代码仓库、定位问题、修改代码、解决 Issue。([Qwen][1])这也是最近 AI Coding 最明显的一次变化。前两年大家谈 AI 编程更多想到的是“帮我生成一个 Java 方法。”现在已经越来越像“你自己去代码仓库里找问题然后把它解决掉。”这两件事不是一个量级。现在 Codex、Claude Code、Qwen Code 这类 Coding Agent 的工作模式越来越接近读取代码 → 搜索项目 → 分析依赖 → 修改文件 → 执行命令 → 跑测试 → 根据结果继续调整。甚至这次 Qwen 官方已经专门给出了接入 Claude Code 和 Codex 的方式Qwen API 同时兼容 Anthropic 协议和 OpenAI Responses 协议。所以如果现在对 AI Coding 的理解还停留在“代码补全工具”其实已经有些滞后了。03 Agent 能力也在明显加强图片另外一个值得关注的关键词就是Agent。这次 Qwen3.8-Flash-Next 在官方公布的 Toolathlon Verified 工具调用评测中拿到了 73.5长流程办公任务 CoWorkBench 为 73.9。分数本身不是最重要的。重要的是现在厂商越来越重视一件事模型能不能自己调用工具完成任务因为聊天模型和 Agent 最大的区别之一就在这里。你问 ChatGPT“帮我分析一下为什么这个接口测试失败了。”它给你一段分析这是 AI 助手。但如果它可以自己读取接口文档 → 调测试平台 → 执行接口 → 获取 Response → 查询日志 → 查看数据库 → 分析原因 → 修改测试脚本 → 再执行一次这时候性质就完全不一样了。它已经开始进入真正的软件研发流程。04 这件事对测试行业影响其实更直接为什么我们一直强调测试从业者要关注 Agent因为测试工作天然就适合被拆成大量“工具调用”。举个很现实的例子。现在很多测试团队已经开始使用 AI 生成测试用例需求文档↓大模型↓测试用例这属于第一阶段。但再往后发展很可能变成读取需求↓分析代码 Diff↓查询历史 Bug↓识别影响范围↓生成测试用例↓调用自动化测试平台↓执行测试↓读取失败日志↓分析异常↓输出测试报告这里面只有其中几步是在“生成内容”。剩下的大部分工作本质上都是模型 工具 工作流。所以未来 AI 测试真正的核心很可能不是单独研究Prompt 怎么写得更好而是研究怎么让模型拥有完成测试任务所需要的上下文和工具。这就涉及到企业知识库、RAG、MCP、Tool Calling、Agent、自动化测试平台、CI/CD。这些东西开始逐渐连起来了。05 100 万上下文对测试其实特别有用测试工作的一个特点是信息非常散。需求在需求平台。代码在 Git。测试用例在测试管理平台。Bug 在 Jira。接口文档在 Swagger。日志在 ELK。监控又在另外一套系统。一个经验丰富的测试工程师之所以能判断风险很多时候并不是因为他会执行多少测试用例。而是因为他能把这些信息串起来。例如这个接口虽然只改了一个字段但它会不会影响订单状态这个模块以前是不是出过类似 Bug这次代码修改到底影响到了哪些下游服务哪些历史测试用例需要重新执行这类问题其实非常吃上下文。长上下文 代码能力 企业知识库组合起来之后AI 才更有可能真正参与需求理解变更影响分析测试范围判断历史缺陷关联测试用例生成而不是每次只看一小段材料然后给一个看起来正确、实际上不了解业务背景的答案。06 还有一个容易被忽略的变化成本AI 真正进入企业之后不能只看模型强不强。还有一个非常现实的问题贵不贵。如果一个测试 Agent 每天要反复读取代码、需求、日志再调用十几次甚至几十次模型那么调用量和普通聊天完全不是一个级别。Qwen 官方披露Qwen3.8-Flash-Next 相比 Qwen3.7-Plus训练成本约为后者的 1/9同时也在降低推理成本。其架构采用 125B 主模型但每 Token 只激活约 6B 参数。官方在发布时给 Qwen3.8-Flash 公布的 Qwen Cloud 定价为输入0.16 美元 / 百万 Token输出0.47 美元 / 百万 Token。截至 8 月 26 日官方发布文章时API 标注为即将开放。这其实是 Flash 模型很重要的一层意义。企业需要的未必永远是“能力最强的那个模型”。很多业务真正需要的是能力足够强同时速度、成本、吞吐量也能接受。尤其是自动化测试、客服、代码 Review、日志分析这类高频任务。一天跑几次和一天跑几十万次完全是两套经济账。07 这还是一次 Qwen4 架构的“提前剧透”这次发布还有一个值得关注的点。Qwen 官方明确表示Qwen3.8-Flash-Next 同时也是 Qwen4 新架构的一次提前预览。这次主要调整了四个方向Attention、Residual、Embedding、Optimization。其中一个比较容易理解的是 Qwen Sparse AttentionQSA。长上下文最大的麻烦之一就是上下文越长Attention 的计算和显存访问成本越高。QSA 的思路可以粗略理解成不是每次都把前面所有内容重新仔细看一遍而是先找到真正重要的内容再重点关注。Qwen 官方给出的测试中在 100 万 Token 上下文下QSA Attention Kernel 的 Prefill 和 Decode 最高分别实现 7.6 倍和 4.9 倍加速。对于普通用户来说不需要研究这些架构细节。但这背后的方向其实很清楚模型越来越大但每次计算不一定越来越贵上下文越来越长但不能简单靠堆算力解决Agent 越来越复杂对推理效率的要求反而越来越高。这也是下一代模型架构正在重点解决的问题。08 测试工程师真正要关注的不是哪家模型跑分第一现在几乎每隔一段时间就会发布一个新模型。今天 Qwen明天 DeepSeek后天可能又是 Claude、Gemini 或 GPT。如果每一个模型出来我们都只是比较谁参数更大、谁 Benchmark 高了两分、谁又超过谁了。其实意义并没有那么大。对于测试从业者更值得关注的是模型能力变化背后的工作方式变化。从最近这一轮模型更新来看几个方向已经越来越清楚长上下文让 AI 能理解更多项目级信息。Coding让 AI 从生成代码走向修改真实代码仓库。Tool Calling让 AI 可以连接测试平台、数据库、浏览器、命令行和内部系统。Agent让 AI 可以把这些能力串起来连续完成一个复杂任务。这几个能力如果单独看都不算特别新。但当它们逐渐组合到一起之后软件测试的工作方式就会开始发生变化。写在最后Qwen3.8-Flash 这次发布我觉得真正值得关注的并不是某一个跑分。而是一个越来越明显的信号大模型正在从“给答案”走向“做事情”。对于测试行业来说也是一样。AI 测试的下一阶段很可能不会只是帮我们多生成几条测试用例。而是让 AI 真正进入需求分析、代码理解、风险识别、用例设计、自动执行、问题定位和质量反馈。测试工程师当然没必要看到一个新模型就开始焦虑。但有一件事情值得提前准备过去我们学习的是怎么使用测试工具接下来我们还要开始学习怎么把 AI 变成测试工具的一部分。而 Qwen3.8-Flash 这次更新的 100 万上下文、Coding、Agent 和 Tool Calling恰好都在把这件事情往前推。本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容侧重测试实践、工具应用与工程经验整理。

相关新闻

爱奇艺前端笔试复盘:从JS机制到手写代码的校招考点解析

爱奇艺前端笔试复盘:从JS机制到手写代码的校招考点解析

爱奇艺2018秋季校招前端工程师(第一场)笔试复盘周末帮一个学弟整理笔试题,翻出了爱奇艺2018秋季校招前端工程师(第一场)这套卷子。回想当年我自己也参加过这场笔试,一晃几年过去,如今站在面试官…

2026/8/29 21:48:06 阅读更多 →
DeepSeek V4-Pro闪电二连击:国产大模型正在改写什么规则

DeepSeek V4-Pro闪电二连击:国产大模型正在改写什么规则

关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集 没有发布会,没有预告,它悄悄上线了——然后整个行业都睡不着了 大家好,我是某互联网公司的技术架构负责人。 上周三凌晨,团队群里突然弹…

2026/8/29 21:48:06 阅读更多 →
如果你今年准备找测试开发工作,我建议你认真看看DeepSeek Harness

如果你今年准备找测试开发工作,我建议你认真看看DeepSeek Harness

关注 「软件测试就业联盟」公众号,陪你走好校招求职的每一步 问个扎心的问题:你的简历上是不是也写着"熟悉 Python、熟悉 Selenium、了解 pytest"?如果十份简历里有九份长这样,面试官凭什么记住你? 今天给一…

2026/8/29 21:48:06 阅读更多 →

最新新闻

车规级贴片电阻功率密度提升:RMCA系列选型与散热设计实战

车规级贴片电阻功率密度提升:RMCA系列选型与散热设计实战

1. 为什么车规级电阻突然开始谈“功率密度”了先聊个真实的场景。前阵子帮朋友看一个BMS(电池管理系统)的方案,板子空间压得非常紧,采样电路、均衡电路、隔离通信全挤在一块不到巴掌大的PCB上。结果卡在一个毫欧级采样电阻的选型上…

2026/8/31 0:10:10 阅读更多 →
高边开关芯片工程样品识别:从丝印、批次到电气参数全攻略

高边开关芯片工程样品识别:从丝印、批次到电气参数全攻略

1. 这个项目到底在做什么先直接说结论:这个项目干的事情,就是在一堆高边开关芯片里,把那些还没转正的“工程样品”给挑出来。做硬件的人都知道,工程样品这个坑,踩进去轻则产品功能异常,重则批量退货、名誉扫…

2026/8/31 0:10:10 阅读更多 →
Sub-1GHz收发器实战:远距离低功耗无线监测方案解析

Sub-1GHz收发器实战:远距离低功耗无线监测方案解析

做果园环境监测项目的时候,我在 2.4 GHz 方案上吃够了苦头:树冠遮挡严重,30 个节点分布在几百亩地里,网关放在板房旁,最远的节点距离将近 700 米,用 2.4 GHz 跑下来丢包率感人,最后只能靠加路由…

2026/8/31 0:10:10 阅读更多 →
SoC神经网络加速实战:从硬件原理到模型部署与调优

SoC神经网络加速实战:从硬件原理到模型部署与调优

这两年只要聊到端侧AI,绕不开的一个话题就是:如何在功耗和成本都有严格限制的硬件上,把神经网络跑起来。我这两年经手了好几个项目,从智能摄像头到工业质检设备,方案从纯CPU硬扛,到外挂独立加速卡&#xff…

2026/8/31 0:10:10 阅读更多 →
半桥SiC评估板实战:从硬件细节到双脉冲测试

半桥SiC评估板实战:从硬件细节到双脉冲测试

拿到一块半桥SiC功率模块评估板(Eval Board),多数工程师的第一反应是把母线电源接上去,赶紧看波形,然后心里嘀咕一句“这板子挺贵的”。我建议你先停一停。评估板这东西,最容易让人高估的是它的“Demo属性”…

2026/8/31 0:10:10 阅读更多 →
线性执行器机械臂搭建全记录:从舵机到高精度定位的进阶指南

线性执行器机械臂搭建全记录:从舵机到高精度定位的进阶指南

很多玩机械臂的朋友,第一反应就是用舵机。便宜、好买、资料多,一转一个角度,看起来也像那么回事。但我自己做了几个舵机版本之后,越来越觉得不对劲:关节一多,末端的晃动就控制不住,负载稍微大点…

2026/8/31 0:09:10 阅读更多 →

日新闻

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

接到一个仪表类项目,要在 LAT1189 上输出几种不同波形:正弦、三角、带可调死区的脉冲,频率和幅度都得能实时改。板子上没有 DAC,就一个定时器加几个 DMA 通道。我一开始觉得在定时器中断里改比较寄存器也能应付,后来把…

2026/8/31 0:00:05 阅读更多 →
Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

前两周调试一块带着Cortex-M3内核的板子,IDE里下载固件时突然弹出一行刺眼的错误: error: flash download failed - cortex-m3 。这种报错在嵌入式开发里太常见了,常见到很多人第一反应就是换根数据线、重插一下调试器,但重启三…

2026/8/31 0:00:05 阅读更多 →
STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

做STM32 GUI开发的朋友应该都有体会——界面搭得再漂亮,一旦屏幕切换卡成PPT,整个产品的档次瞬间就没了。早期我在LAT1212这个基于STM32的GUI工程上用TouchGFX做二次开发,最头疼的不是画界面,而是怎么让切换动画既流畅又自然。Tou…

2026/8/31 0:00:05 阅读更多 →

周新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/8/30 0:00:01 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/8/30 0:00:01 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/8/30 0:00:01 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/30 21:10:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/30 18:07:21 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/30 21:10:44 阅读更多 →