AI快速进步但不会通用超级智能:技术约束与工程实践判断
1. 为什么这个判断值得认真对待1.1 一个反直觉但越来越主流的观点AI 会快速进步但不会走向通用超级智能——这个判断乍一听有点矛盾。既然进步快为什么不会走到那一步但如果你真的在一线做模型训练、做产品落地、做推理优化你会发现这个判断其实非常务实。它不是在唱衰 AI而是在区分两件被大众媒体混为一谈的事能力的快速提升和形态的根本跃迁。Nathan Lambert 是 AI 领域少数既做过前沿研究、又长期做公开技术写作的人。他在强化学习、指令微调、RLHF 这些方向上有实打实的工程经验同时他的表达一直偏克制不太做夸张预测。所以当他说快速进步但不会通用超级智能时这不是情绪化的立场而是基于对训练管线、数据瓶颈、评估方式的长期观察得出的判断。我自己的体会是过去几年每次出现一个能力跃升外界就会立刻跳到AGI 要来了但真正做工程的人看到的是一条收益递减但仍在增长的曲线而不是一条垂直起飞的指数曲线。这两者的区别决定了你该怎么规划自己的技术路线和产品节奏。1.2 这篇文章想解决什么问题我想把 Lambert 这个判断拆开讲清楚三件事快速进步具体快在哪里哪些方向还在持续变好哪些已经明显放缓不会通用超级智能背后的技术理由是什么不是哲学争论而是工程约束对做产品、做研究、做技术选型的人这个判断意味着什么你该怎么下注。适合读这篇的人正在做 AI 应用落地的工程师、做技术规划的管理者、以及被各种AGI 倒计时说法搞得很焦虑的从业者。如果你只是想看热闹这篇可能不太适合因为我会花大量篇幅讲训练细节和评估方法。提示本文讨论的是技术趋势判断不涉及任何具体公司、机构或人物的评价所有案例均为说明性虚构场景。2. 拆解快速进步到底哪些能力在涨2.1 能力提升的三个真实来源要理解快速进步先得搞清楚进步从哪来。根据公开的研究脉络和工程实践当前模型能力的提升主要来自三个方向而且这三个方向的边际收益完全不同。第一个来源是数据质量和配比。早期大家拼的是数据量后来发现数据质量、去重、配比、课程学习curriculum learning对最终效果的影响远大于单纯堆量。一个典型的例子是同样规模的模型经过精细清洗和配比的数据训练后在推理类任务上的表现可以拉开明显差距。这个方向的收益还在但已经进入精耕细作阶段靠的是大量实验和人工判断不是简单加资源就能解决。第二个来源是后训练post-training技术。指令微调、RLHF、DPO、以及各种偏好优化方法是过去两三年能力提升最明显的环节。一个基础模型经过好的后训练在对话、指令遵循、格式控制上的表现会有质的变化。这个方向目前仍然活跃但已经出现明显的方法收敛——大家用的核心思路越来越像差异更多在数据构造和工程细节上。第三个来源是推理时计算inference-time compute。也就是让模型在回答前多想一会儿通过思维链、搜索、采样投票等方式提升难题上的表现。这个方向是最近讨论最多的因为它不需要重新训练直接改推理策略就能涨点。但它有明确的天花板推理时计算只能把模型已有的潜在能力激发出来不能凭空创造新能力。2.2 哪些方向已经明显放缓说完成长点也得说放缓的地方否则快速进步就变成了盲目乐观。预训练规模扩展的收益在递减。这是业内比较一致的观察。早期模型参数量翻倍效果提升非常明显现在继续扩大规模需要的数据量、算力、工程复杂度都在指数上升但效果提升的斜率明显变缓。这不是说扩展没用而是说单纯靠更大来换更强的性价比在下降。长尾知识和精确事实性仍然是硬骨头。模型在常见问题上表现很好但一碰到冷门领域、精确数值、时效性强的信息就容易出错。这个问题不是靠加参数能解决的它涉及数据覆盖、检索增强、以及模型对自己不知道的校准能力。多步复杂推理的稳定性不足。单步推理现在做得不错但一旦任务需要十几步甚至几十步的连贯推理错误就会累积。你让它做一道中等难度的数学题它可能对你让它做一个需要二十步推导的工程估算它中途跑偏的概率就明显上升。下面这张表可以帮你快速对照当前的能力格局能力方向当前状态进步速度主要瓶颈指令遵循与对话较成熟放缓数据质量、边界情况单步推理良好中等训练数据覆盖多步复杂推理不稳定较快但波动大错误累积、验证机制长尾事实性较弱慢数据覆盖、检索整合代码生成较强较快长上下文、项目级理解多模态理解快速提升快跨模态对齐、数据自主长程任务早期不确定规划、记忆、可靠性2.3 为什么快不等于会起飞这里有个关键的认知陷阱把能力曲线的斜率当成趋势的外推。看到过去两年进步快就假设未来两年会同样快再假设这个速度会一直持续到超级智能。但真实的技术曲线往往不是这样。我打个比方。一个学生从 60 分提到 80 分可能只需要好的学习方法和几个月努力从 80 分提到 90 分难度明显上升从 90 分提到 95 分可能要付出前面所有努力的总和。AI 能力提升也有类似结构容易摘的果子先被摘掉剩下的越来越难。而且更关键的是不同能力之间不是简单叠加。一个模型在语言上很强、在推理上不错、在代码上也可以不代表它就能自主完成一个需要长期规划、自我纠错、跨领域整合的复杂任务。能力的拼接本身就是一个未解决的难题。3. 不会通用超级智能的技术理由3.1 通用超级智能到底指什么在讨论会不会之前得先定义清楚通用超级智能指什么。通常它包含几个特征跨领域通用在几乎所有认知任务上达到或超过人类顶尖水平自主性能自己设定目标、拆解任务、长期执行自我改进能显著提升自身能力形成正反馈循环可靠性在关键任务上稳定可信不会随机失败。这四个特征里前两个是能力问题后两个是系统问题。而恰恰是后两个构成了当前技术路线最难跨越的门槛。3.2 数据墙模型没见过的东西学不会第一个硬约束是数据。当前主流方法本质上还是从数据中学习模式。模型能处理它训练时见过或类似的东西但对完全陌生的领域它的表现会明显下降。有人会说那合成数据呢让模型自己生成数据训练自己。这个思路确实有用但有天花板合成数据的质量受限于生成它的模型的能力。如果模型本身在某个方向不行它生成的合成数据在这个方向上也不会好自我提升就变成了自我循环。这就像一个学生只靠自己复习没有新教材、没有老师反馈他的进步会很快遇到瓶颈。真正的能力跃迁往往需要新的信息源而不是在已有信息里反复打转。3.3 可靠性墙能对一次不等于能一直对第二个硬约束是可靠性。模型在演示里表现惊艳但一到生产环境就暴露问题同样的输入换个说法结果就变了多跑几次答案不一致遇到边界情况直接崩掉。这个问题在单次任务里可能不明显但在长程自主任务里是致命的。假设一个任务需要 50 个步骤每步成功率 95%那么整体成功率只有 0.95 的 50 次方大约是 7.7%。也就是说单步看起来很高的可靠性在长链条里会迅速衰减。要让长程任务可靠单步成功率得做到 99.9% 甚至更高而且还要有自我验证和纠错机制。这跟模型很聪明是两回事它是一个系统工程问题。3.4 目标与价值对齐不是技术问题那么简单第三个约束是目标和价值。一个真正通用的系统需要理解什么该做、什么不该做需要在模糊情境下做出符合人类预期的判断。这不是靠更多数据能解决的因为它涉及价值判断的复杂性和情境依赖性。我举个生活化的例子。你让一个助手帮我把这件事处理好什么是处理好在不同情境下答案完全不同。人类靠大量常识和社会经验来填补这些空白而模型目前在这方面还很脆弱。它可能在某类任务上表现很好但换一个情境它的判断就可能完全跑偏。3.5 为什么这些约束不会自然消失有一种乐观假设是只要模型足够大、数据足够多、训练足够久这些约束会自然消失。但从工程角度看这个假设站不住脚。数据墙不会因为模型变大而消失因为问题在于信息源不在于处理能力。可靠性墙不会因为模型变聪明而消失因为问题在于错误累积的数学结构。价值对齐不会因为模型见多识广而消失因为问题在于情境判断的开放性。这些约束更像是结构性的而不是规模性的。规模能缓解一部分但不能从根本上消除。4. 这个判断对从业者意味着什么4.1 产品侧别赌全能赌专精如果你在做 AI 产品这个判断最直接的启示是不要赌一个模型什么都能干而要赌它在特定场景下干得足够好。具体来说与其做一个通用助手不如做一个在明确场景下、有明确输入输出、有明确质量标准的工具。比如不是帮你写所有文档而是帮你把会议记录整理成结构化纪要不是帮你做所有分析而是帮你从这批数据里找出异常点并给出可能原因不是帮你写所有代码而是帮你把这段逻辑重构成可测试的函数。场景越具体你越能定义清楚什么算成功越能设计评估方法越能把可靠性做到可用水平。通用性带来的灵活性往往被可靠性问题抵消掉了。4.2 技术侧把精力放在最后一公里从技术投入角度这个判断意味着基础模型的进步你控制不了但应用层的最后一公里你有很大空间。所谓最后一公里包括检索增强把模型不知道的、时效性强的信息通过检索补进去工具调用让模型去调用计算器、数据库、API而不是自己硬算验证与纠错加一层检查机制对模型输出做校验和修正人机协作在关键决策点让人介入而不是追求全自动。这些工作不性感但它们是让 AI 真正可用的关键。我见过太多团队把精力全花在换更强的模型上却忽略了这些工程细节结果产品体验一直上不去。4.3 个人侧别被AGI 倒计时绑架对个人来说这个判断最大的价值是降低焦虑。每隔一段时间就有人喊AGI 还有 X 年搞得很多人觉得自己的技能马上要过时。但如果你理解技术约束你会知道能力提升是渐进的你有时间适应通用系统不会突然出现专精能力仍然值钱真正稀缺的是把 AI 用好的能力而不是 AI 本身。与其焦虑会不会被取代不如花时间学怎么把 AI 工具用出效果怎么设计好的工作流怎么判断模型输出的质量。这些能力在可预见的未来都会很值钱。5. 常见误读与排查5.1 把进步快读成马上到最常见的误读是把当前进步速度线性外推。看到模型一年内从不会写代码到能写不错的代码就假设明年能独立做项目后年能自己开公司。但真实曲线往往在某个点后变缓而且不同能力的曲线形状不一样。排查方法当你听到一个预测时问三个问题——它假设了哪个能力在持续提升这个能力的瓶颈是什么瓶颈有没有被解决如果答不上来这个预测大概率是拍脑袋。5.2 把不会超级智能读成AI 没用另一个极端是听到不会通用超级智能就觉得 AI 是泡沫。这完全是误读。不会通用超级智能不等于不会深刻改变很多行业。计算器不会通用智能但它改变了数学工作方式搜索引擎不会通用智能但它改变了信息获取方式。AI 在专精任务上的价值已经足够大。5.3 把技术判断读成立场表态还有一种误读是把技术判断当成站队。讨论 AI 会不会通用超级智能本质是技术问题不是立场问题。你可以同时相信AI 会带来巨大变化和它不会变成科幻里的超级智能。这两者不矛盾。下面这张表整理了常见误读和对应的正确理解常见误读问题所在更准确的理解进步快 马上 AGI线性外推曲线会变缓瓶颈真实存在不会 AGI AI 没用非黑即白专精价值已经很大规模够大就能突破忽视结构约束数据、可靠性、对齐是结构问题讨论这个 站队混淆技术与立场这是工程判断不是立场通用 更好忽视可靠性专精往往比通用更可用5.4 实操中的排查清单如果你在做技术规划可以用这个清单自查我的方案是否依赖模型什么都能干这个假设如果是风险很大。我有没有定义清楚什么算成功没有的话评估无从谈起。我的任务链条有多长链条越长可靠性要求越高。我有没有为模型不知道的情况设计兜底没有的话生产环境会出问题。我是在追更强模型还是在做最后一公里后者往往回报更高。6. 我自己的几点体会做了几年 AI 相关的工程和产品我对这个判断的体会是它帮你把注意力从未来会不会拉回到现在能做什么。我踩过的一个坑是早期总想等更强的模型出来再动手结果等来等去发现真正决定产品体验的是数据质量、流程设计、错误处理这些不酷的东西。模型换了一代又一代但这些工程能力是累积的越早开始越有优势。另一个体会是别把模型的演示能力当成生产能力。演示里它妙语连珠生产里它可能因为一个边界情况就崩掉。评估一个 AI 方案一定要看它在真实数据、真实场景、真实压力下的表现而不是看精心准备的 demo。最后分享一个小技巧当你评估一个 AI 能力时别只问它能不能做要问它做错的概率有多大、错了之后怎么发现、发现了怎么补救。这三个问题的答案往往比能不能做更能决定一个方案能不能落地。这个判断后续还可以这样扩展如果你在做垂直领域的 AI 应用可以进一步研究该领域的数据获取难度、错误容忍度、以及人工介入成本这三个变量基本决定了 AI 在这个领域能走多远。

相关新闻

一小时搞懂扩散模型:从DDPM原理到Stable Diffusion实战

一小时搞懂扩散模型:从DDPM原理到Stable Diffusion实战

1. 为什么扩散模型值得你花一小时搞懂如果你最近在关注图像生成领域,大概率已经被"扩散模型"这四个字反复刷屏。不管是文生图、图生图、超分辨率重建,还是视频生成、音频合成,背后几乎都站着同一个核心架构——Diffusion Model。但…

2026/10/12 3:30:04 阅读更多 →
OpenAI Realtime 语音 API 的 Python 客户端:ell 仓库 openai_realtime 子项目实战解析

OpenAI Realtime 语音 API 的 Python 客户端:ell 仓库 openai_realtime 子项目实战解析

人工智能大模型提示工程AI 应用 【免费下载链接】ell A language model programming library. 项目地址: https://gitcode.com/gh_mirrors/ell/ell 点击查看 免费下载 x/openai_realtime 是 ell 语言模型编程仓库中的一个独立子项目:它把 OpenAI 官方的…

2026/10/12 3:29:03 阅读更多 →
知识蒸馏小模型72小时工程落地全链路实测

知识蒸馏小模型72小时工程落地全链路实测

1. 项目概述:为什么一个“小模型发布72小时”的测试值得专门写一篇长文?“知识蒸馏小模型发布72小时,我替你试完了”——这个标题不是营销噱头,而是我过去三天的真实工作日志。它背后藏着当前AI落地最现实的矛盾:大模型…

2026/10/12 3:29:03 阅读更多 →

最新新闻

mediamtx v1.21.2发布:UDP、JWT、RTSP、RTMP、HLS、WebRTC全面修复,稳定性与安全性再提升

mediamtx v1.21.2发布:UDP、JWT、RTSP、RTMP、HLS、WebRTC全面修复,稳定性与安全性再提升

2026年10月10日,mediamtx 发布 v1.21.2 最新版本。本次更新以“修复与改进”为主,覆盖通用逻辑、API、Media-Over-QUIC、RTSP、RTMP、HLS、WebRTC 以及依赖库升级等多个方向。 v1.21.2 没有引入新的功能模块,而是集中处理实际运行中可能出现的…

2026/10/12 5:43:21 阅读更多 →
哪个品牌密码锁最安全 高端市场占比领先全维安防更靠谱安心

哪个品牌密码锁最安全 高端市场占比领先全维安防更靠谱安心

在智能家居全面普及的今天,智能密码锁已经成为了家庭安全防护的核心入口。哪个品牌密码锁最安全,不仅关乎家庭财产安全,更影响着日常进出的便捷体验与全场景安防体验。2026年以来,国内智能门锁行业技术迭代加速,市场格…

2026/10/12 5:43:21 阅读更多 →
2026家用智能锁品牌推荐:德施曼热门产品深度解析

2026家用智能锁品牌推荐:德施曼热门产品深度解析

随着智能家居行业的快速发展,智能门锁已经成为了千家万户的入户安防首选。相较于传统机械锁,智能门锁不仅提供了更加便捷的多种解锁方式,还集成了猫眼可视、AI安防、远程对讲等功能,全方位提升家庭入户安全与使用体验。在2026年上…

2026/10/12 5:43:21 阅读更多 →
本地化企业知识库方案拆解:8 步把文档变成知识库

本地化企业知识库方案拆解:8 步把文档变成知识库

## 背景在项目复盘场景里,企业文档散落各处、找人问半天是效率的主要损耗点。## 核心能力- 全程本地运行,原始文档与知识数据不出电脑- 8 步流水线自动化:解析→结构化→质检→复核→分片→向量库→验收- 内置本地大模型,离线推理…

2026/10/12 5:43:21 阅读更多 →
81 极物科技 | KNX调试 - 个体地址过滤与报文隔离

81 极物科技 | KNX调试 - 个体地址过滤与报文隔离

极物科技 | KNX调试 - 个体地址过滤与报文隔离 前言 工程品质是 KNX 国际标准三十年立足全球的根基,而可观测性是品质的前提。 报文追踪把“看不见的总线”变成“看得见的证据”:每一次收发都有记录、每一次异常都有据可查。本文围绕报文追踪的接收链路、…

2026/10/12 5:43:21 阅读更多 →
百万级缺陷样本开源:工业视觉的「地基」被补上了

百万级缺陷样本开源:工业视觉的「地基」被补上了

1.工业质检的两道坎 ▍坎一:数据各管各的现成的工业缺陷数据集,几乎都窝在单一行当里。VisA、3CAD 盯着 3C 电子,PKU-GoodsAD 盯着包装,Real-IAD、MulSen-AD 盯着材料。覆盖面稍宽些的 VISION、MVTec AD、MMAD,又卡在…

2026/10/12 5:42:21 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →