美版豆包G3.7Flash,快到飞起,超3分钟算我输!
美版豆包又更新了还有人记得谷歌的 Gemini 系列么好像被极度边缘化了上次 Flash 更新的时候我其实专门写过一系列文章介绍 Antigravity 这个智能体以及测试了 3.5 Flash。当前的感觉是 Flash 的前端设计还是很屌的然后我就再也没关注过了看到 3.7 Flash 更新了我又打开了尘封已久的 Antigravity又折腾了一下网络。用了一下发现一种很神奇的感觉。先说一下我的第一感受Flash 真的是快到飞起好像完全不用思考也不需要纠错一个任务给它它刷的一下做完了。GLM 5.3 需要一小时完成一个任务Gemini 3.7 Flash 三分钟搞定。我测试了好多个例子大部分例子没有超过 3 分钟。唯一一个让它用了 4 分钟的是超级玛丽。没有过多思考没有大量调用工具没有什么功能验证也不搞截图验证没有疯狂的修改代码。 就是双手插兜一句话就帮你把事儿给办了。我严重怀疑它在敷衍我但是看了一下结果好像也还行比 DSP 强多了。这是一种什么样的存在啊谷歌是在什么平行时空发展么Gemini 3.7 的气质和当前主流的模型完全不一样。今天有必要来好好观摩观摩了基准数据按照惯例我们先要看一下官方的发布描述和基准信息我首先刷到的帖子是 DeepMind 发布的这个帖子帖子的内容也非常简洁Gemini 3.7 Flash 来了。 它在编码、知识工作和网页开发方面更强大。所以这次的重点是编码、知识工作、网页开发谷歌真的是与世隔绝了么它居然没有说 Agent 这个词只说了 Coding我也不知道它说的更强大是强大到什么程度了。赶紧来看一波基准数据吧关于基准它主要是发了 4 张截图。第一张是 FrontierCode这个基准是和生产代码质量相关的指标主要是评估模型产出可直接上线的生产级代码的能力看代码是否健壮、可部署不是玩具样例。这个指标比 3.6 高了很多也要强于 Sonnet 5 和 Terra。第二张是 DeepSWE长周期软件工程真实开源项目的 bug 修复任务长上下文、真实仓库代码复现真实工程师改 bug 场景考验长代码理解、项目级调试。这个指标仅比 Terra 低一些比其他选手都要高。第三张是AutomationBench企业工作流自动化企业办公自动化任务写脚本、API 调用、业务流程自动化偏向 RPA / 业务脚本场景。这个指标遥遥领先同台选手。第四张是 Code ArenaWeb 前端 / 全栈开发竞技场输出完整可运行网页应用分数是 Arena 得分数值越高 Web 开发能力越强。这个指标也是遥遥领先同台选手。看数据是不是也挺不错的这个主要是得益于它选择的对手。它这次选的对手都不是顶级版本而是二线版本。Claude 家的没有选 Opus 5而是选了 Sonnet 5GPT 5.6 家的没有选 Sol而是选了 Terra。从这里可以看出一个关键点。谷歌已经不想在技术上争第一了。它只希望能在二流队伍里就行了。这个多少有点让人失望但是如果它这个模型能力真的还可以然后又快又便宜那么也不错这也算是一种务实吧。今天重点是来看一下它的能力现在到底是什么水平七七八八的介绍差不多了终于可以进入正题了开始上手实测咯我已经把最近的几个例子全部测了一波了下面看详情赛博朋克版清明上河图我们还是从这个例子开始吧。为什么要测这个例子以及具体的提示词是什么这些我已经讲过很多次了。早上刚说过我就不重复了。测试工具我们就用谷歌官方的 Antigravity 然后创建一个 Gemini 3.7 Flash 目录然后在里面创建一个对话把我们的提示词扔给它接下来我就要开始准备进行漫长的等待了。没想到的是它两分钟就搞定了我直接惊掉下巴结果如下打开之后没有任何错误就是这个风格有点独特和抽象和以往的都不一样。我看了一下细节细节并不是很好。毕竟只用了 2 分钟。以往测过的模型一般是在十几分钟到几十分钟。这次测试最凸出的是它的速度这个速度实在是太快了天文机械表和 GLM 5.3 的测试顺序保持一致第二个例子是天文机械表。直接看结果吧这个配色和界面设计好像还不错。但是它少了两个指针我用黄色箭头补全了。另外就是画面里面一直有个东西在闪烁我也不知道是啥。效果大概就是这个样子时间嘛就是 1 分钟搞定。 太离谱了别人起码要消耗十几分钟才能完成。由于 G哥 写代码根本不存在过程所以我也没必要去分析什么了。复刻游戏按照惯例也让它复刻一下经典的《坦克大战》和《超级玛丽》坦克大战的 UI 做得还不错游戏界面也还可以这个界面是有一些细节问题的但是整体来说还可以玩起来也没啥问题。基本达到了中上水平。完成这个例子的时间依旧没有超过 3 分钟没有任何复杂的验证就是刷刷一下子就搞好了搞完之后没有任何基础错误超级玛丽除了色调有点独特之外完成度也很高第一个版本主要是存在跳跃高度问题导致游戏无法继续。然后花费 1 分钟让它修复了一下就全部 OK 了。游戏里下蹲水管、隐藏蘑菇、无敌和子弹全部都是有的。整体的效果已经是中上偏上水平了。这个例子很多选手花了几十分钟做得惨不忍睹而它只花了 4 分钟。这是它唯一一个超过 3 分钟的例子。到这里确实有点惊人了。我早上测试 GLM 5.3 的时候整整跑了一个多小时做了无数验证还错了一次。最后是花了两个小时做到了不错的效果。而 G3.7 Flash 只用了 41 分钟G3.7 Flash 到底是一个什么样的存在呢它为什么可以在极短的时间里完成这么多事情呢3D台球最后我们来一个开放题。不提供详细的提示词。直接跟它说“我想做一个 3D 台球你有什么想法”我看了一下它的想法还是挺到位你看它说的多好啊制作一款高品质的3D 网页端台球游戏3D Pool / Billiards是一个非常精彩且兼具技术挑战性的项目。它不仅要求精准的物理模拟还需要细腻的 3D 光影质感和直观流畅的击球操控。以下我从技术架构、核心物理、视觉与镜头、游戏模式、交互设计五个维度为你梳理的一套完整方案与创意构想这个例子的制作过程简直就是和许愿一样你说要什么它立马改不管你提多么复杂的需求二话不说给你改1 分钟给你效果。几轮对话之后已经做得比较完善了都包含了十几个功能菜单了。大部分改得还不错只是有一个问题它一直修复不了。就是球桌上的 6 个孔一直挖不好。你怎么说都挖不好这个 3 分钟成型、1 分钟改一次的版本的例子在以往的测试中已经属于上等水平了比 GLM 5.3 和 K3 要好。谷歌的模型太奇特了好像完全不用动脑子就是靠肌肉记忆做事情特别快。但是你也不要希望它自己反思什么反思这种事情不存在的。另外一个神奇之处是比如 DSP 和 GLM 写的代码如果不反复检测和修复基本没法用。但是谷歌这个模型不做任何复杂的校验生成的代码居然是可以跑的也没有出现基础的语法错误。鉴于它的速度实在是太快了首次生成的代码也不是不能用即便有问题改一下也极快。所以这个模型其实是有很大的实用性的效率真的太高太高太高了除了模型之外我必须要吐槽一下谷歌的Antigravity体验太糟糕了。这么大个公司做的编程智能体真的是一坨莫名其妙动不动就未知错误这个 agent error 我都看吐了大部分时间就浪费在这个上面了。另外要找生产的文件我还得自己去文件管理器里面找他都无法右键直达也无法在对话中预览结果。另外模型配额消耗方面好像还可以我这些个例子在其他模型上面跑基本能把基础套餐的周配额都跑完。但是 Gemini 这里看着好像还可以啊周配额只消耗了 5 个点只能说不内耗的模型做事就是快消耗就是少。谷歌真的是玩了一波与众不同我感觉它炼丹的方式和追求的目标已经和当前主流模型公司分道扬镳了。它就是练出了一个能力中等偏上但是速度极快的模型。当别人全部在搞 Agent 的时候感觉它是完全在硬练模型所以它的公告里只说了编程能力有很大的提升但是没有说 Agent 能力有很大的提升因为它在 Antigravity 中基本上不怎么调用工具也不做什么复杂的验证直接一把梭。我记得 3.5 的时候它还喜欢动不动就做个计划现在是计划都不做了。拿到需求立马开干干完立马收工绝对不浪费一秒钟我G哥可谓是大模型中的“闪电侠”

相关新闻

Gradle国内镜像配置全攻略:原理、方案与实战避坑指南

Gradle国内镜像配置全攻略:原理、方案与实战避坑指南

1. 项目概述:为什么我们需要配置Gradle国内镜像?如果你在国内做Java或Android开发,十有八九都经历过Gradle构建时漫长的等待。看着命令行里一行行“Downloading...”的提示,进度条像蜗牛一样爬行,那种感觉真是让人抓狂…

2026/9/11 8:07:55 阅读更多 →
7天挑战项目:高效学习与习惯养成实践指南

7天挑战项目:高效学习与习惯养成实践指南

1. 项目概述"Day 7"这个看似简单的标题背后,实际上蕴含着丰富的可能性。作为一个从业多年的内容创作者,我见过无数以天数命名的项目,它们往往代表着某种持续性的挑战、学习计划或创意实验。这类标题最大的魅力在于它的开放性——既…

2026/9/12 18:16:40 阅读更多 →
Windows批处理脚本实现图片批量重命名实战

Windows批处理脚本实现图片批量重命名实战

1. Windows图片批量重命名批处理脚本实战刚接手一个摄影项目,发现客户发来的300多张产品图命名全是"DSC_XXXX.jpg"这类相机默认名称。作为经常处理图片素材的从业者,我决定分享这个用Windows批处理脚本实现图片批量重命名的完整方案。这个方案…

2026/9/7 6:43:25 阅读更多 →

最新新闻

RAG 重排序实测:双编码召回 + CrossEncoder 精排,500 条真实查询上的收益与代价

RAG 重排序实测:双编码召回 + CrossEncoder 精排,500 条真实查询上的收益与代价

本文是「RAG 链路实测」第 2 篇 上篇:RAG 分块策略实测 后端做了多年了,推荐、搜索都碰过,对这套分层不陌生:召回用便宜的向量检索把十万候选筛到几百,精排用贵的模型把几百排到几十。RAG(检索增强生成&am…

2026/9/12 19:41:16 阅读更多 →
从零实现 C++ AI 大模型接入 SDK(二):项目演示、环境搭建与 ChatSDK 快速上手

从零实现 C++ AI 大模型接入 SDK(二):项目演示、环境搭建与 ChatSDK 快速上手

目录 一、先看一下最终项目效果 1.1 启动 AIChatServer 1.2 打开网页聊天界面 1.3 实际发送一条消息 二、开发环境搭建 2.1 本系列采用的开发方式 2.2 安装 Trae 并连接远程服务器 2.3 clangd 和 CMake Tools 三、安装项目需要的第三方依赖 3.1 先看项目到底依赖什么…

2026/9/12 19:41:16 阅读更多 →
Python验证码生成与安全防护实战指南

Python验证码生成与安全防护实战指南

1. Python 图片验证码库核心选型指南验证码作为现代Web应用的基础安全组件,其重要性不言而喻。Python生态中有多个成熟的验证码生成库,每个都有其特定的适用场景和技术特点。以下是经过实战检验的四大主流选择:1.1 captcha库:轻量…

2026/9/12 19:41:16 阅读更多 →
218、【AI】【模型部署】Notebook 源码拆解:输出 data 的多格式与前端择优渲染

218、【AI】【模型部署】Notebook 源码拆解:输出 data 的多格式与前端择优渲染

【声明】本博客所有内容均为个人业余时间创作,所述技术案例均来自公开开源项目(如Github,Apache基金会),不涉及任何企业机密或未公开技术,如有侵权请联系删除 标题 218、【AI】【模型部署】Notebook 源码拆…

2026/9/12 19:41:16 阅读更多 →
非线性模型预测控制(NMPC)原理与Matlab实现

非线性模型预测控制(NMPC)原理与Matlab实现

1. 非线性模型预测控制(MPC)基础解析 非线性模型预测控制(Nonlinear Model Predictive Control, NMPC)是传统MPC在非线性系统领域的自然延伸。与线性MPC相比,NMPC能够更精确地描述现实世界中普遍存在的非线性动态特性。…

2026/9/12 19:41:16 阅读更多 →
qwen-code ACP Session 初始化超时取消机制:从 Bridge 到 Agent 的 Deadline 全链路设计与实现

qwen-code ACP Session 初始化超时取消机制:从 Bridge 到 Agent 的 Deadline 全链路设计与实现

qwen-code ACP Session 初始化超时取消机制:从 Bridge 到 Agent 的 Deadline 全链路设计与实现 【免费下载链接】qwen-code An open-source AI coding agent that lives in your terminal. 项目地址: https://gitcode.com/GitHub_Trending/qw/qwen-code 导读…

2026/9/12 19:40:15 阅读更多 →

日新闻

道路直播实战指南:从选点设备到安全运营,打造有温度的路况慢直播

道路直播实战指南:从选点设备到安全运营,打造有温度的路况慢直播

我做了半年多的道路直播,从零粉丝的冷清画面,到高峰期几千人同时在线看一个路口,最大的体会就八个字:以安全为基,藏温暖于行。道路直播这个赛道,看着是架个摄像头对着马路,真正做起来才发现&…

2026/9/12 0:00:03 阅读更多 →
AutoHedge:自动化对冲交易系统的架构设计与实战落地

AutoHedge:自动化对冲交易系统的架构设计与实战落地

AutoHedge这个词,拆开看就是两个单词:自动和对冲。我在交易这行混了十来年,见过太多人死在没有纪律的对冲执行上——行情来了手忙脚乱,计算器还没按完,价差已经跑没影了。所以当我决定把“对冲”这件事彻底交给代码时&…

2026/9/12 0:00:03 阅读更多 →
DnCNN与BM3D对比:图像去噪原理及MATLAB实战

DnCNN与BM3D对比:图像去噪原理及MATLAB实战

简介:面向图像去噪算法研究与毕业设计场景的完整MATLAB仿真项目,集合均值滤波、中值滤波、非局部均值(NLM)、三维块匹配(BM3D)等传统算法,以及基于深度卷积神经网络的DnCNN去噪模型,…

2026/9/12 0:00:03 阅读更多 →

周新闻

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 0:04:23 阅读更多 →
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/12 17:11:40 阅读更多 →
基于CNN的调制信号识别:MATLAB实现时频图分类实战

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 8:03:07 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/9 7:36:02 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/12 18:29:34 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/12 19:02:44 阅读更多 →