“Gemini,谁啊?”谷歌Gemini 3.5 Pro一拖再拖,引Meta、OpenAI接连嘲讽:希望它有一天能训练完!
整理 | 郑丽媛出品 | CSDNIDCSDNnewsAI 江湖的“王座”从来没有真正稳固过。几个月前谷歌凭借 Gemini 3 系列模型一度被认为重新找回了竞争优势但如今随着 OpenAI、Anthropic、Meta 等玩家持续发力AI 赛道的格局正在快速变化。近日Meta 首席 AI 官、被称为公司“最高薪员工”的 Alexandr Wang因一句简单却极具挑衅意味的话引起热议“gemini who?Gemini谁啊”这场口水战的背后其实是一场 AI 巨头之间的公开较量——Meta 最新模型 Muse Spark 1.1 在一份模型排行榜中超过了谷歌刚发布的 Gemini 3.6 Flash而 Alexandr Wang 则借机向这位老牌 AI 巨头“开了一枪”。一时间AI 圈再次掀起讨论Meta真的开始追上谷歌了吗一句“Gemini 谁啊”Alexandr Wang 向谷歌开炮事情源于 X 用户 Tae Kim 分享的一份 AI 模型性能排行榜。榜单引用了 Artificial Analysis Intelligence Index 的数据对当前主流大模型进行了综合比较。其中Anthropic 的 Claude Fable 5、OpenAI 的 GPT-5.6 等顶级模型仍处于领先位置而 Meta 的 Muse Spark 1.1 则在部分关键能力测试中超过谷歌最新的 Gemini 3.6 Flash。数据显示Gemini 3.6 Flash 得分为 50而 Muse Spark 1.1 凭借在推理能力、代码生成以及 Agent 任务执行方面的优势排名更高。Tae Kim 在分享这份榜单的帖子时直接写道“谷歌这么早就被 Alexandr Wang 击败而 Meta 的新 AI 团队规模相比之下还很小这对谷歌来说也太尴尬了。”随后Alexandr Wang 转发了该帖子并只留下了一句话“gemini who?Gemini谁啊”短短2 个单词却火药味十足——毕竟谷歌长期以来一直被认为是全球 AI 技术的重要玩家而 Gemini 系列更是谷歌押注未来竞争的核心产品。而 Alexandr Wang 也并不是普通的 AI 从业者。2025 年Meta CEO 扎克伯格高调招募这位 Scale AI 创始人并通过一笔约 150 亿美元规模的交易将其纳入 Meta AI 战略核心。随后Alexandr Wang 便被任命为 Meta 首席 AI 官负责推动 Meta 的超级智能方向。所以从某种意义上来说他的这句“gemini who?”不仅是在嘲讽谷歌的模型也是在宣告 Meta 新 AI 团队正在加速追赶。Meta 的“新王牌”Muse Spark 1.1并非没有争议Alexandr Wang 此次敢于“喊话”谷歌底气来自 Meta 最新推出的 AI 模型——Muse Spark 1.1。这是 Meta Superintelligence Labs 推出的多模态 AI 模型也是 Meta 重新调整 AI 战略后的重要成果。与传统聊天机器人不同Muse Spark 的重点并不是简单回答问题而是面向更加复杂的 Agent 任务。所谓 Agent就是拥有一定自主执行能力的 AI 助手用户提出目标后模型不仅能生成文字还可以规划步骤、调用工具、操作软件并完成一系列任务。Meta 表示Muse Spark 1.1 在许多方向都进行了强化多步骤推理、工具调用、电脑操作能力、编程任务以及多模态理解。官方还指出该模型能更好地处理需要规划和协调多个外部应用与服务的个人 Agent 场景。为此Meta 还开放了新的 Meta Model API 公测让开发者可以直接调用 Muse Spark 1.1。不过虽然 Meta 对 Muse Spark 1.1 给予了高度评价但行业内也存在不同声音。例如AI 研究员 François Chollet 此前曾公开批评 Muse Spark认为它过度针对公开 Benchmark 进行优化而在其他实际能力方面有所不足。面对这一质疑Alexandr Wang 并没有回避而是回应称Meta 很清楚 Muse Spark 在某些测试中存在不足例如 ARC AGI 2 表现并不理想。这也体现出了 Meta 当前的一种策略不追求所有指标全面领先而是重点突破 Agent、代码和真实任务执行能力。毕竟随着大模型竞争进入下一阶段单纯比拼聊天能力已经越来越难体现差距真正决定其商业价值的可能是“AI 能不能帮用户完成事情。”Gemini 3.5 Pro 的持续延期让谷歌开始显得“掉队”其实在 Alexandr Wang 发布“gemini who?”的当天谷歌刚发布了三款新 AI 模型性能提升且成本降低的 Gemini 3.6 Flash、针对网络安全优化的 Gemini 3.5 Flash Cyber以及面向 AI 智能体场景的 Gemini 3.5 Flash-Lite。是的Gemini 3.6 Flash 刚发布就在榜单中输给了 Muse Spark 1.1。但据谷歌强调其实 Gemini 3.6 Flash 在多个方向都进行了增强1代码能力提升在 DeepSWE 测试中Gemini 3.6 Flash 得分达到 49%相比上一代 Gemini 3.5 Flash 的 37% 有明显提升。在机器学习研究任务测试 MLE Bench 中成绩也从 49.7% 提升至 63.9%。2Agent 和电脑操作能力增强谷歌表示Gemini 3.6 Flash 在 OSWorld-Verified 测试中的成绩从 78.4% 提升至 83%。同时Computer Use 能力已作为客户端工具集成到 Gemini API 和 Gemini Enterprise 中让模型可以更直接地参与电脑操作任务。3知识工作能力增强在 GDPval-AA v2 测试中Gemini 3.6 Flash 达到 1421 分高于上一代的 1349 分。还有部分企业客户反馈新模型尤其擅长文档解析、图表理解、数据分析和自动生成报告。不过相比 Gemini 3.6 Flash 的发布外界其实更关注谷歌另一款旗舰模型Gemini 3.5 Pro。按照此前规划这款模型应该成为谷歌下一阶段挑战 OpenAI GPT 系列、Anthropic Claude 系列的重要产品——但目前Gemini 3.5 Pro 的发布时间持续推迟这也是此次 Alexandr Wang 对其进行“嘲讽”的一个重要原因。除了 Alexandr WangOpenAI 技术团队成员 Thibault Sottiaux 也对谷歌的延期暗讽了一番。此前谷歌产品负责人 Logan Kilpatrick 在 X 上宣布下一代旗舰模型 Gemini 4 已正式开始预训练并称这是 Gemini 系列的下一个重要里程碑。对此ThibaultSottiaux 回复道“希望它有一天能训练完吧”诚然最近几周 OpenAI 和 Anthropic陆续推出新一代旗舰模型这让谷歌的延迟显得更加明显。例如Raymond James 分析师 Josh Beck 就表示Gemini 3.5 Pro 的延期已经改变了市场对谷歌的看法从过去的“领先者”变成了“追赶者”。不过也有人认为这种判断可能过于草率。“谷歌是一家规模更大的公司它的发展方式和竞争对手有所不同。”Moor Insights Strategy 分析师 Anshel Sag 推测既然谷歌提前预热 Gemini 4某种程度上说明“他们手里已经有了更好的东西”。但他同时也指出现在 AI 行业的发展速度非常快并不是每一次模型升级都会带来真正意义上的突破。而面对外界的各种讨论截至目前谷歌尚未进行相关回应。最后或许正如 Anshel Sag 的判断“现在就说谁被淘汰、谁赢了还太早。”一次 Benchmark 排名变化并不能决定最终胜负今天是 Muse Spark 挑战 Gemini明天可能又会出现新的黑马——唯一可以确定的是AI “王座”正在变得越来越拥挤。那么在新一轮 AI 巨头混战中你又看好哪家的 AI 模型呢参考链接https://www.businessinsider.com/rivals-mock-google-gemini-3-5-pro-delay-2026-7https://timesofindia.indiatimes.com/technology/tech-news/metas-highest-paid-employee-alexandr-wang-has-forgotten-who-the-worlds-biggest-internet-company-is-says-who-/articleshow/132553769.cms GOSIM SHENZHEN 2026 全球开源 AI 大会10 月 16—17 日 · 深圳150 国内外讲师 · 2000 全球开发者 · Agentic AI开源大模型 / 开源机器人 / 边缘智能体 / 智能体操作系统Keynote Workshop Hackathon AI Vision Forum 早鸟限时抢购中 扫码购票锁定你的 AI 盛会席位

相关新闻

JavaScript自带内置库(ES 标准)

JavaScript自带内置库(ES 标准)

JS 语言本身内置对象 & API,不用引入任何文件数组 Array:map、filter、reduce、sort、find对象 Object:assign、keys、values、entries字符串 String:split、replace、includes、match数学 Math:random、floor、ce…

2026/7/24 12:55:26 阅读更多 →
字节跳动开源DeerFlow 2.0(让AI真正“干活“的框架)

字节跳动开源DeerFlow 2.0(让AI真正“干活“的框架)

本文介绍了字节跳动开源的 DeerFlow 2.0——一个定位为“Super Agent Harness(超级 Agent 执行底座)”的开源项目,核心主张是让 AI 从“会聊天”升级为“会干活”,自主把完整工作流跑完。 一、它和普通 AI 助手的本质区别 普通助手…

2026/7/24 12:54:26 阅读更多 →
文本预处理技术:提升NLP模型效果的关键步骤

文本预处理技术:提升NLP模型效果的关键步骤

1. 文本处理的核心挑战与价值 脏数据就像厨房里没洗干净的食材,无论你的烹饪技术多高超,最终菜品都会大打折扣。在自然语言处理领域,未处理的原始文本数据通常包含: 乱码字符(如�符号) 不一致…

2026/7/24 12:54:26 阅读更多 →

最新新闻

TikTok 视频详细数据包含哪些内容?一篇文章全面了解

TikTok 视频详细数据包含哪些内容?一篇文章全面了解

很多人第一次接触 TikTok 数据时都会问: 一条视频到底有哪些可以分析的数据? 实际上,远比想象中丰富。 一条 TikTok 视频通常包含哪些信息? 常见字段包括: 基础信息 Video ID视频链接发布时间视频标题视频描述视…

2026/7/24 13:01:29 阅读更多 →
Docker Compose 核心价值与实战配置详解

Docker Compose 核心价值与实战配置详解

1. Docker Compose 核心价值解析在容器化技术普及的今天,单容器部署早已不能满足实际业务需求。我经历过数十次从单容器到多容器系统的迁移过程,Docker Compose 的价值在于用声明式配置解决容器编排的"最后一公里"问题。通过一个简单的 docker…

2026/7/24 13:01:29 阅读更多 →
语法不报错≠迁移成功|拆解传统数据库迁KES的六大隐性SQL逻辑陷阱

语法不报错≠迁移成功|拆解传统数据库迁KES的六大隐性SQL逻辑陷阱

一、前言 SQL标准只是一个框架性规范,很多细节行为并没有做强制规定,各家数据库厂商都有自己的实现逻辑和扩展特性。传统商用数据库比如Oracle、开源数据库比如MySQL,都发展了二三十年,为了兼容历史版本、降低用户使用门槛&#x…

2026/7/24 13:01:29 阅读更多 →
.NET现代化构建方案:容器化与增量编译实战

.NET现代化构建方案:容器化与增量编译实战

1. 项目背景与核心价值十年前我第一次接触.NET项目时,MSBuild的复杂配置让我在团队构建流程上耗费了整整两周时间。如今看到微软最新推出的.NET构建工具链革新方案,不禁感慨技术演进的惊人速度。这次我们要深入探讨的,正是当前.NET生态中最具…

2026/7/24 13:01:28 阅读更多 →
巴斯吸尘器深度评测:16000Pa超强吸力,车载家用全能清洁利器

巴斯吸尘器深度评测:16000Pa超强吸力,车载家用全能清洁利器

巴斯吸尘器深度体验:车载家用全能清洁利器,16000Pa超强吸力实测 在日常清洁工作中,无论是家庭大扫除还是车内细节清理,一款性能出色的吸尘器能极大提升效率。最近体验了巴斯品牌的无线吸尘器,其16000Pa超强吸力、紫外线…

2026/7/24 13:01:28 阅读更多 →
AI 编程伦理与安全:使用 AI 写代码前必须知道的五个原则

AI 编程伦理与安全:使用 AI 写代码前必须知道的五个原则

AI 编程伦理与安全:使用 AI 写代码前必须知道的五个原则前言:一个令人警醒的真实故事 2023年,三星电子发生了一件让整个科技行业警醒的事。三位工程师在使用 ChatGPT 辅助工作时,将公司内部的源代码粘贴到了 ChatGPT 的对话中——…

2026/7/24 13:00:28 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻