我实测了千问 3.8 Max:强是真强,但是别着急,看完再决定用不用
2.4 万亿参数、仅次于 Fable 5、即将开源——阿里这次口号喊得震天响。我花了一天时间把它翻了个底朝天说点大实话。7 月 19 号千问团队静悄悄地把 Qwen 3.8 Max Preview 扔上了线。没有发布会没有预热就一条推文「这是除了 Fable 5 外最强大的模型」。2.4 万亿参数原生多模态即将开源。听上去牛逼得不行。但我这个人比较俗不看广告看疗效。于是花了一天时间在 Qoder千问的编程 IDE和网页版上把它里里外外测了个遍。先说结论能用有些场景甚至让人眼前一亮。但别急着把你的主力模型切过来它还是个预览版坑不少。先搞清楚你现在拿到的是什么这是一个 Preview 预览版不是正式版。什么概念没有公开的 Benchmark 跑分表没有技术报告没有激活参数量没有开源权重连许可证长什么样都不知道——这些官方自己都没拿出来。官方说的是「正式版出了之后会开放完整权重」。所以你现在拿到手的跟最终成品可能会有不小差距。举个例子之前腾讯 Hy3 的预览版和正式版时隔三个月简直像两个模型。但 Preview 也不是完全不能用。它已经在千问官网、Token Plan API、Qoder 和 QoderWork 全量开放了。Qoder 里甚至可以直接把上下文拉到 100 万 token百万字级别这一点是实打实的。哪些场景让我觉得「行啊千问」复杂数据仪表盘——最强的加分项第三方评测机构 ZPedia 用一套很硬核的题目测了它。其中一道是给定 28 条多模型 API 运行记录制作一个运营驾驶舱包含五项核心指标、四类图表、三级筛选、异常检测规则和成本模拟器。Qwen 3.8 交出了一个 1203 行的单文件 HTML。柱状图、折线图、气泡散点图、环形图全部用原生 SVG 生成没有依赖任何第三方库。五项指标默认视图的数值跟标准答案完全一致。这说明什么模型第一反应不是画个好看的壳而是先把数据层的计算逻辑理顺再让图表和指标共用同一份状态。 这种「先算对再画好看」的思维方式在真实业务场景比跑分重要得多。复杂规则仿真系统——逻辑能力到位同一组测试里还有道变态题给一个 24×16 的建筑网格12 个人员、4 扇防火门、2 个出口、1 个烟雾源要求写一个完整的疏散仿真沙盘。烟雾会扩散门会在特定时间关闭人要根据当前状态动态重新规划路线。Qwen 3.8 用 724 行代码搞定了。不是写死轨迹的那种「伪仿真」而是建立了网格、门、人员、烟雾、出口六类独立状态以 0.5 秒为步长推进用 A* 寻路算法动态计算路径。我们验证了 12 名人员的初始路径长度全部跟标准答案对得上。数据到视频的端到端生成还有一道题是给一组 JSON 格式的服务异常和恢复数据直接生成一支可播放的复盘视频 MP4。还别说Qwen 3.8 真的干出来了——1920×1080、30fps、15 秒、H.264 编码。延迟曲线随时间上升、恢复阶段的指标向改善方向运动、片头片尾文案完整——而且所有文字是程序化绘制的没有生成式视频常见的跳字和变形问题。从结构化数据到一支能直接用的视频这是一个完整的生产闭环。网站和前端开发——基本功扎实我在 Qoder 里让它做了几个网页。一个个人作品集首页第一版就带了缓入缓出的过渡动画审美在线。Qoder 内置了 161 种风格参考Airbnb、Apple、Figma 等可以直接套用。简单前端需求它是真的能省时间。哪些场景让我直摇头3D 复杂场景——翻车了我让它做一个「莫奈吉维尼睡莲花园」的 Three.js 3D 体验场景。提示词写得很详细整片池塘就是一幅画水面和花园由漂浮的纯色笔触构成可以乘船穿行。结果第一次交付完全是碎片在旋转看不出任何花园的样子。第二次让它修正勉强能看到桥的形状了但跟「莫奈花园」的关系大概就是几片绿和几个圆圈。跟 Fable 5 的 3D 能力比差了一个档次。3D 魔方——直接崩溃ZLedia 的评测里同一套题目下的 3D 魔方任务——需要实现真正可玩的 3×3×3 魔方包括六面旋转、算法队列、撤销重做、25 步确定性打乱。Qwen 3.8 在分析阶段表现得相当出色它主动检查了动画速度、非法算法拒绝、撤销重做历史、Promise 语义等。看思考过程你以为稳了。结果写到一半直接 Internal error: terminated。这对于开发者意味着什么你花了 token、时间眼看着推理质量很高结果最后一步崩了前功尽弃。这种不稳定性是真没法放进工作流里。视觉还原——八成功力差两成细节让它复刻 NASA Webb 太空望远镜的网页——结构识别得很准双层导航、正文区域、八类图片分类全对。Logo 用 SVG 重绘、底部天文图用 Canvas 生成断网也能看。但整体缩小了一圈。 它知道页面上有什么但不知道这些东西在屏幕上该占多大。留白不够、对比度偏低、信息密度差了那么一口气。简单说能用但不精致。速度慢多个评测都提到同一个问题——它比 Kimi K3 慢。一个 3D 任务深度思考能跑几十秒出来的结果还不一定对。对需要快速迭代的场景这个等待成本不小。幻觉率偏高有评测指出Qwen 3.8 Preview 的幻觉率不低尤其长任务中容易出现编造。Kimi K3 的幻觉率虽然也高51%但至少基准性能更强容错空间大一些。一张表说清楚Qwen 3.8 vs 竞品我的真实建议什么人现在可以试试你已经在阿里云生态里百炼平台上跑着其他千问模型想看看新旗舰的能力天花板在哪你做的工作偏数据分析、报表生成、API 数据转可视化Qwen 3.8 在这个领域确实有新意你对视频自动生成有需求5 个 Case 里视频那道表现最完整你就是好奇拿 Token Plan 的免费额度玩玩——反正不亏什么人千万别急着换你的生产环境跑了千问 3.7稳定运行中——别动。3.7 是成熟产品3.8 是 Preview两者可能差一个季度以上的打磨。你做 3D 网页、游戏原型、视觉设计类任务——目前的 3.8 Preview 还不如 Kimi K3你需要把模型部署在自己服务器上——权重没出来就算出来了2.4T 参数你也没法跑你的工作流有交付截止日期——一次崩溃就够你受的你在做财务、医疗等对幻觉零容忍的场景——Preview 的幻觉率还不靠谱最后一句话Qwen 3.8 Max 不是一个能「平替 Fable 5」的模型但它确实在某些领域数据结构化、Agent 长程逻辑、数据到视频做出了让人愿意继续关注的东西。问题在于现在拿到的只是一个 Preview而且 Preview 和最终版可能差很远。所以我不会说「赶紧上车」——我会说「再等等等正式版和权重出来看独立评测机构的分数再决定要不要认真用」。这批国产万亿模型Kimi K3、Qwen 3.8、DeepSeek V4 正式版的节奏已经越来越快。再过一两个月这片天可能又不一样了。以上数据均采用与芯云token调取www.xinyuntoken.com/sign-up?aff… Kimi K3 或其他模型欢迎在评论区交流测试方法和结果。

相关新闻

Wireshark 解密並導出TLS 1.2 / TLS 1.3 明文的方法(可控制 Client 端)

Wireshark 解密並導出TLS 1.2 / TLS 1.3 明文的方法(可控制 Client 端)

文章目录前情提要前提說明方法一:RSA 私鑰解密(僅適用 TLS 1.2,且 Cipher Suite 無 ECDHE/DHE)方法二:SSLKEYLOGFILE(推薦,TLS 1.2 與 TLS 1.3 皆適用)1. 設置環境變數2. 依 Client 類型確認接入方式3. 抓包 產生流量4. Wireshark 指向 keylog 檔案5. 驗證總結建議前情提要 W…

2026/7/23 16:49:58 阅读更多 →
Kimi联网搜索结果精准度提升实战(实测提升67.3%召回率):从API调用链到缓存穿透的全栈优化路径

Kimi联网搜索结果精准度提升实战(实测提升67.3%召回率):从API调用链到缓存穿透的全栈优化路径

更多请点击: https://kaifayun.com 第一章:Kimi联网搜索结果精准度提升实战(实测提升67.3%召回率):从API调用链到缓存穿透的全栈优化路径 在真实生产环境中,Kimi大模型调用外部搜索引擎API时,原…

2026/7/23 16:49:58 阅读更多 →
AI与大模型新闻日报 | 2026-07-23

AI与大模型新闻日报 | 2026-07-23

AI与大模型新闻日报20260723大模型技术共 11 条新闻1. “Gemini,谁啊?”谷歌前沿 AI 模型迟迟未发布,竞争对手“群嘲”来源: IT 之家时间: 2026-07-22 23:25摘要: IT之家 7 月 23 日消息,据《商业内幕》今天(23 日&…

2026/7/23 16:49:58 阅读更多 →

最新新闻

基于springboot滑雪场预约系统

基于springboot滑雪场预约系统

滑雪场预约系统的选题背景随着冬季运动的普及和滑雪旅游的蓬勃发展,滑雪场逐渐成为人们休闲娱乐的热门选择。传统的滑雪场管理方式依赖人工预约和现场购票,效率低下且容易出错,尤其在旅游旺季,排队时间长、信息不对称等问题严重影…

2026/7/23 16:58:01 阅读更多 →
实用视频格式转换工具:转GIF、转音频和各类格式转换

实用视频格式转换工具:转GIF、转音频和各类格式转换

聊一聊这几天连续分享的都是跟视频有关的文章,现在的文章风格和上次写的《文档生成视频转换工具》一样了。另外,还分享了《视频横转竖神器》,为的就是能更好地适应各大平台,适应用户。现在大家看文章的少了,听文章&…

2026/7/23 16:58:01 阅读更多 →
MediaPipe手部追踪与Rerun可视化实战

MediaPipe手部追踪与Rerun可视化实战

1. 项目概述 MediaPipe作为Google开源的多媒体机器学习框架,其手部追踪解决方案在计算机视觉领域已成为实时手势交互的黄金标准。这个项目将展示如何利用MediaPipe的Hand Landmark模型配合Rerun可视化工具,构建一个端到端的手势识别系统。不同于传统Open…

2026/7/23 16:58:01 阅读更多 →
Unity射线检测与LineRenderer可视化实战:从原理到性能优化

Unity射线检测与LineRenderer可视化实战:从原理到性能优化

1. 项目概述:为什么射线检测是Unity开发的基石在Unity开发中,无论是制作一款第一人称射击游戏,还是开发一个VR交互应用,甚至是实现一个简单的UI点击反馈,有一个功能你几乎无法绕开,那就是射线检测。它就像开…

2026/7/23 16:58:01 阅读更多 →
Minidayz1.4.1网页版:生存游戏轻量化与跨平台优化

Minidayz1.4.1网页版:生存游戏轻量化与跨平台优化

1. Minidayz1.4.1网页版:经典生存游戏的轻量化重生作为一个从2013年就开始接触生存类游戏的硬核玩家,我至今还记得第一次在手机上打开Minidayz时的震撼。这款由Bohemia Interactive开发的像素风生存游戏,用极简的界面和硬核的机制&#xff0c…

2026/7/23 16:58:01 阅读更多 →
python 学习资源推荐系统

python 学习资源推荐系统

一、关键词学习资源推荐系统、学习资源推荐、学习资源推荐信息管理、学习资源推荐后台管理二、作品包含源码数据库PPT全套环境和工具资源本地部署教程三、项目技术前端技术: Html、Css、Js、Vue2.6、Element-ui后端技术:Java、SpringBoot2.2.2、MyBatis-…

2026/7/23 16:57:00 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻