所有大模型追到根,都只是一个神经元在做加法——差别只在“你的数据是什么形状“
摘要一张《Types of Neural Networks in AI》九宫格信息图配一句被误读成术语科普的话所有 LLM 追根溯源都是「一个神经元把数字加起来」。但过去七十年真正发生的事情其实只在回答一个问题——你的数据是什么形状本文按形状重排这九种网络空间走 CNN、序列走 RNN/LSTM、关系走 GNN、而 Transformer 根本不是第四种形状它是完全图上的 GNN。文中补了一串原文没有的硬数据Rosenblatt 1958 年那台 Mark I 感知机重达数吨、400 个光电管Minsky Papert 1969 年用一册书把单层感知机送进第一次 AI 寒冬1969–1982Hochreiter Schmidhuber 1997 年靠该留什么、该忘什么这一个门控想法撑起了序列模型二十年以及最反直觉的一条实用建议——结构化业务数据上梯度提升树XGBoost/LightGBM/CatBoost通常仍然赢过神经网络Kaggle 表格赛约七成冠军出自它们。结论换架构改的不是那五个概念权重、激活、损失、反向传播、过拟合而是谁参与计算、怎么聚合、按什么顺序。别问用哪个架构问你的数据长什么样。正文一、先破掉一个误解这张图不是术语表图片标题是《Types of Neural Networks in AI》作者 Satish Kumar Subramanian一张规规矩矩的九宫格Perceptron、MLP/Dense、CNN、RNN、LSTM、Transformer、Autoencoder、GAN、GNN每格三栏——结构描述、可视化结构、主要应用底部一条 KEY CONCEPTS 串起权重、激活、损失、反向传播、过拟合。LangChain 那句原文说得比图本身漂亮Every LLM you use traces back to one neuron adding up numbers. Everything since then answers one question: what shape is the data?前半句没错。你现在用的大模型追到最底层就是一个加权求和再过一道阈值的动作——1958 年 Rosenblatt 那台能用数据改自己参数的机器和今天手机里跑的神经网络共享同一句咒语w ← w − η∇E只不过把电位器换成了浮点数。但后半句才是真正值钱的部分也是大多数人跳过的地方。一个神经元能做的事太少了少到连异或这种最简单的规则都学不会。七十年里所有架构创新的动机其实都不是我们想要更强的模型而是我们把数据摆错了姿势图像数据是二维空间文本是一维序列社交网络是一张图。你拿处理序列的办法去处理空间就必然要重写一套东西。所以这张图真正的读法不是九种网络各有用途而是一张数据形状 → 架构的对照表。二、第一个故事最值得讲感知机是怎么被一本书锤进寒冬的九格里排第一的 Perceptron是整条链里最有戏剧性的一环。1958 年Frank Rosenblatt 在康奈尔造出 Mark I 感知机——一台重达数吨、占满整个房间的机电怪物用 400 个光电单元当眼睛电位器当权重靠接线员手调。它能在几百次尝试内学会区分图形左右半区。当时媒体的口径是机器要思考了。结构上它简单得可怜若干输入乘上权重求和再过一道阈值输出 0 或 1。就是一个开关。1969 年马文·明斯基和西摩尔·派珀特出版《Perceptrons》冷静地证明了一件事单层感知机连 XOR异或都算不出来。XOR 是什么是最典型的非线性规则——两个条件里恰好满足一个才成立。在平面上画你要把两类点分开XOR 的点是十字交叉分布一条直线切不开。而单层感知机的全部能力就是画一条直线。这记重锤不是打在技术上是打在信心上。叠加同期英国的 Lighthill 报告1973大举削减 AI 经费、美国 Mansfield 修正案把 DARPA 资助扭向有明确军事产出的方向神经网络研究被拖进了第一次 AI 寒冬大约 1969 年持续到 1982 年。这里有个值得记住的细节明斯基和派珀特批评的是单层但被判死刑的是神经网络。而叠多层怎么训练这个问题1986 年 Rumelhart、Hinton 等人用反向传播解开了——中间隔了 17 年。现在所有大模型的老家就坐在那一格。顺带说一句 MLP多层感知机就是把感知机一层一层摞起来用反向传播训。但原文那句提醒别忽略——在结构化的表格业务数据上梯度提升树往往仍然赢先试它们。这一点我们第四节单独讲因为它被低估得最厉害。三、九个架构其实只解决了三种形状现在把九格重排。你会发现它们不是九个并列选项是同一个邻域聚合模板的三种特化。数据的形状痛点解法代价空间图像全连接每层两两相连参数量爆炸CNN 共享卷积核猫在角落也还是猫丢全局靠叠加视野序列文本、语音、时序顺序必须逐字读前面忘得快RNN → LSTM 用门控决定留什么、忘什么串行难并行关系图把网络压成一张张行关系信号就没了GNN 在节点之间传消息图大就过平滑、过压缩没有已知结构token 集合不知道谁该跟谁说话Transformer全连接注意力复杂度随长度平方增长1. CNN 解决的是空间这件事。卷积的核心 idea 只有一句一张图里猫在左上角还是右下角不影响它是猫。如果让每个神经元都去看全图参数量会大到不可训练让卷积核只在局部滑、并且同一套权重在每一个位置复用视觉问题才变得可学。LeCun 1989 年把反向传播装进 CNN 做手写数字识别就是这条路。今天几乎所有视觉骨干ResNet、EfficientNet乃至 ViT 之前的整个 ImageNet 时代都长在这一个 idea 上。2. RNN / LSTM 解决的是顺序。RNN 一个字一个字读把记忆往前传。但梯度顺着时间往回走时会指数级衰减所以开头的信息到后面就淡了——这就是所谓长程依赖问题。1997 年 Hochreiter 和 Schmidhuber 的解法朴素到近乎狡猾给网络装门。该记的打开该忘的关掉遗忘门、输入门、输出门。就这一个想法让序列模型又活了二十年撑起了 2017 年之前几乎全部的语音识别、机器翻译和时间序列预测。3. Transformer 不是第四种形状——它是完全图上的 GNN。原文把这条当 fun fact 轻轻带过Fun fact: a transformer is a GNN on a fully connected graph.这句话的技术含量被严重低估了。学术界对这个等价关系的表述更完整标准的邻域聚合更新长这样——h_v(k1) σ( W₁·h_v(k) W₂·Σ_{u∈N(v)} h_u(k) )其中 N(v) 是 v 的邻居集合。CNN、GNN、Transformer 三者的区别只在于跑在哪张图上、边怎么加权CNN跑在规则网格图上邻居固定每个位置偏移学一份权重 → 平移等变Transformer跑在完全图上任意两个 token 之间都连一条边边权由 attention 动态算出自带置换等变GNN跑在数据自带的图上连接关系本身就是要被预测的信息换句话说这三者是同一个模板的三个实例。这个视角的价值在于你下次看到任何一种新架构先问它跑在哪张图上大半问题就自己解了。4. Autoencoder 和 GAN 是另外一挂——它们不解决形状解决怎么造。自编码器把数据压进一个窄瓶颈latent再重建。重建不出来的那部分就是异常的。这个性质让它安静地好用—— fraud detection、缺陷检测、去噪、压缩而且它现在就住在很多现代图像生成器的内部。GAN生成器造假判别器判真假。 brilliant但训练不稳、容易模式崩塌只造得出几种样本多样性崩掉。所以图像生成这条路上扩散模型基本把它替换掉了——扩散把一次生成拆成很多个稳定的小步骤比博弈稳得多。四、被低估最深的一句表格数据先上树别上神经网络原文第 2 格底下那行小字是整篇里我最想让你记住的一句On structured business data, gradient-boosted trees still often win. Try them first.这不是一句随口的行话它有扎实的实证支撑Grinsztajn 等人 2022 年的论文《Why tree-based models still outperform deep learning on tabular data》给出了结构性原因决策树是轴对齐切分天然贴合业务数据里那些分段结构——价格档位、年龄区间、地域类别、时段规律它对无关特征天然鲁棒直接不切它不需要特征归一化而且不依赖 augmentation。Kaggle 表格类竞赛至今约七成冠军出自 GBDT 集成通常 XGBoost LightGBM CatBoost 堆叠深度学习方案主要出现在带文本特征或超大数据的赛道。更现实的理由是可解释性信贷、保险核保、临床辅助这些场景里监管机构要的是 SHAP 值这种能被客户和合规部门读懂的归因而神经网络的归因又慢又是近似值。反向的结论同样重要神经网络在表格上输是因为它的默认先验平滑、连续、可微跟业务数据的现实分段、离散、规则生成不匹配。神经网络天生爱光滑流形而会计凭证和用户属性压根不是流形。所以上深度学习和上神经网络从来不是一回事。原文这半句提醒比它列的那九个架构加起来都实用。五、五个词才是钥匙换架构只改这三件事图底那排 KEY CONCEPTS——Weights、Activation、Loss、Backpropagation、Overfitting——是真正通用的部分。Weights模型学到的东西Activation让模型能弯而不是只能画直线Loss离标准答案有多远Backpropagation它怎么变好Overfitting它背答案而不是学规律原文说得很干脆学会这五个任何架构都读得懂。这句话的准确翻译是——换架构改的不是这五个词而是三件更具体的事谁参与计算、怎么聚合、按什么顺序。举个例子你把一个 Transformer 换成 CNN变的是谁参与计算从所有 token 变成固定窗口内的像素和怎么聚合从注意力加权变成卷积求和权重、损失、反向传播、过拟合——一个字都没动。反过来如果你连这五个词都不熟那九种架构在你眼里就真的是九个互不相干的名词背下来三天就忘。六、三个可以马上拿来自检的问题第一问我的数据里有什么结构是我根本没用上的如果你手里是带空间结构的东西却用了全连接带时间顺序的东西却用了 MLP带网络关系的东西却 join 成一张表——那不是模型没选对是数据被你提前挫平了。这时候换架构的收益远大于调参。第二问我现在这个架构是不是在硬造结构原文第 8 条和第 9 条其实都在说这件事表格数据先试 GBM图数据别压成行。第三问我为省算力砍掉的那部分砍的是效率还是能力这一条最容易被搞混。Transformer 的二次代价是真实存在的——每个 token 都要看所有 token所以序列一长成本就平方级往上蹿这也是长上下文一直很难的根源。于是有了分组查询注意力GQA、滑动窗口注意力SWA、稀疏与线性注意力最近两年开源模型标配的 GQA 就是这么来的。但要注意区分两件事砍窗口是砍效率砍谁参与聚合才是砍能力。现在的共识是——大多数层只需要读懂眼前128 个 token 的量级留少数几层保留全局视野就够。这个判断成立的前提是多数任务不需要每层都看全篇而不是全局注意力没用。七、结语七十年只做了一件事——给数据找到它该待的形状1958 年一台几吨重的机器用 400 个光电管学画直线媒体说机器要思考了。1969 年一本书证明它连异或都算不出来整个领域被送进寒冬。1986 年反向传播让多层网络重新可训。1997 年两个门控让序列模型多活了二十年。2017 年一篇《Attention Is All You Need》把并行化塞进注意力规模才算真正开始跑起来——代价是平方级的账单。七十年过去底层那个动作一次都没变把数字加起来。变的是一件事——我们把数据摆成了什么形状。图里那句收尾的话值得原样抄下来Math the architecture to the shape of your data.别问用哪个架构。先低头看看你的数据它长什么样。今日互动在你的业务场景里目前打交道最多的是哪种架构是稳如老狗的 MLP 树模型还是正在吞噬一切的 Transformer欢迎在评论区聊聊。免责声明本文基于公开技术资料与论文Rosenblatt 1958、Minsky Papert 1969、Hochreiter Schmidhuber 1997、Vaswani et al. 2017、Goodfellow et al. 2014、Grinsztajn et al. 2022以及Transformers are GNNs相关研究整理撰写文中所述架构特性与对比结论供学习参考。信息图原文作者为 Satish Kumar Subramanian文中部分性能与 benchmark 数据随版本与评测集变化实际选型请以官方技术报告与自有数据实测为准。

相关新闻

中文法律大模型落地实战:从语料清洗到RAG检索增强的完整指南

中文法律大模型落地实战:从语料清洗到RAG检索增强的完整指南

简介:这份资源面向希望将大语言模型落地到中文法律场景的开发者与算法学习者,聚焦法律问答、法条理解与指令微调等应用方向,适合具备一定Python与深度学习基础、想快速跑通法律领域模型训练与推理流程的读者。压缩包共42个文件,约…

2026/10/5 3:38:10 阅读更多 →
AI应用必答题:context-mode上下文管理实战与调优

AI应用必答题:context-mode上下文管理实战与调优

最近有个词在 AI 应用开发圈子里越聊越热——context-mode。如果你也在做 Chatbot、智能体或者 AI 工作流,大概率已经遇到同一类问题:对话一长,模型就开始"失忆",回着回着就把用户几分钟前说过的话忘得一干二净&#xf…

2026/10/5 3:37:10 阅读更多 →
Apache Hive实战:从SQL到离线数据仓库,大数据分析核心指南

Apache Hive实战:从SQL到离线数据仓库,大数据分析核心指南

1. 为什么大数据仓库会选中Apache Hive1.1 问题起点:MapReduce的门槛很多人第一次接触Apache Hive,其实是带着一个很现实的困惑过来的:既然已经能用Hadoop存海量数据,也有MapReduce这种计算框架了,为什么还要多此一举&…

2026/10/5 3:37:09 阅读更多 →

最新新闻

AI工程硬核自学手册:从跑通Demo到生产落地

AI工程硬核自学手册:从跑通Demo到生产落地

1. 这本“跪着读完”的手册,到底在教什么?“几乎跪着读完了这本硬核入门AI工程自学手册!”——这句话不是夸张修辞,而是我翻到第87页、手写笔记堆满三本A5本、IDE里跑崩第七次模型训练后,真实脱口而出的感叹。它不讲“…

2026/10/5 5:03:44 阅读更多 →
AI辅助论文写作:从选题到框架搭建的完整指南

AI辅助论文写作:从选题到框架搭建的完整指南

如果你也跟我一样,第一次拿到毕业论文选题时对着空白文档坐了四十分钟,光标闪了一下午,屏幕上依然只有那一行“摘要”两个字,那你大概能明白为什么最近人人都在聊AI写论文。但说实话,我从去年到今年看了几十份用AI写的…

2026/10/5 5:03:44 阅读更多 →
乳腺癌病理图像自动分类:从数据准备到部署的深度学习实践

乳腺癌病理图像自动分类:从数据准备到部署的深度学习实践

简介:由山东中医药大学何雪英、韩忠义、魏本征发表于《计算机工程与应用》2018年第54卷第12期的研究论文以PDF文档形式呈现,针对乳腺癌病理图像自动分类这一临床痛点,提出采用改进的深度卷积神经网络模型,并借助数据增强与迁移学习…

2026/10/5 5:03:44 阅读更多 →
RAG客服机器人实战:原理拆解与工程落地避坑指南

RAG客服机器人实战:原理拆解与工程落地避坑指南

1. 为什么客服机器人总爱“一本正经地胡说八道”先说我自己的真实经历。之前团队做了一个客服机器人,接的是某产品的售后知识库,整理了几百篇 Word 和 PDF 文档,喂给大模型做微调。结果上线第一天就翻车了:用户问“保修期多久”&a…

2026/10/5 5:03:44 阅读更多 →
客服机器人RAG落地实战:从本地部署到检索增强,告别幻觉

客服机器人RAG落地实战:从本地部署到检索增强,告别幻觉

做客服机器人,最怕的不是答不上来,而是胡说八道。答不上来,用户顶多骂一句“这客服不行”;答错了,比如把退货政策说成“全场 72 小时极速退款”,用户照着操作,最后退款被拒,那就是实…

2026/10/5 5:03:44 阅读更多 →
cracer纪念版红队工具包:开箱即用的域渗透与横向移动补给站

cracer纪念版红队工具包:开箱即用的域渗透与横向移动补给站

简介:cracer纪念版渗透测试工具包是一套面向网络安全初学者与渗透测试实践者的集成化工具集合,聚焦Web漏洞探测、内网渗透、密码爆破及信息收集等核心攻防场景,助力用户快速搭建本地靶场环境并开展实战演练。资源为549.31MB的ZIP压缩包&#…

2026/10/5 5:02:44 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →