常用的激活函数总结
激活函数名表达式导数表达式sigmoidf(x)1 1 e − x \frac{1}{1e^-x}1e−x1​f’(x)f(x)(1-f(x))Tanhf(x) tanh(x) e x − e − x e x e − x \frac{e^x-e^-x}{e^xe^-x}exe−xex−e−x​f’(x)1-( ( f x ) ) 2 ((fx))^2((fx))2Reluf ( x ) m a x ( 0 , x ) { 0 x ≤ 0 x x gt; 0 f(x)max(0,x) \begin{cases}0amp;\text{$x\leq0 $ }\\xamp;\text{$xgt;0$} \end{cases}f(x)max(0,x){0x​x≤0x0​f ′ ( x ) { 0 x ≤ 0 1 x gt; 0 f#x27;(x) \begin{cases}0amp;\text{$x\leq0 $ }\\1amp;\text{$xgt;0$} \end{cases}f′(x){01​x≤0x0​LeakyReLUf ( x ) m a x ( 0.001 x , x ) { 0.001 x x ≤ 0 x x gt; 0 f(x)max(0.001x,x)\begin{cases}0.001xamp;\text{$x\leq0 $ }\\xamp;\text{$xgt;0$} \end{cases}f(x)max(0.001x,x){0.001xx​x≤0x0​f ′ ( x ) { 0.001 x ≤ 0 1 x gt; 0 f#x27;(x) \begin{cases}0.001amp;\text{$x\leq0 $ }\\1amp;\text{$xgt;0$} \end{cases}f′(x){0.0011​x≤0x0​PReLUf ( x ) m a x ( 0.001 x , x ) { α x x ≤ 0 x x gt; 0 f(x)max(0.001x,x)\begin{cases}\alpha xamp;\text{$x\leq0 $ }\\xamp;\text{$xgt;0$} \end{cases}f(x)max(0.001x,x){αxx​x≤0x0​f ′ ( x ) { α x ≤ 0 1 x gt; 0 f#x27;(x) \begin{cases}\alpha amp;\text{$x\leq0 $ }\\1amp;\text{$xgt;0$} \end{cases}f′(x){α1​x≤0x0​ELUf ( x ) { x x ≥ 0 α ( e x − 1 ) xlt;0 f(x)\begin{cases}xamp;\text {$x \geq 0$}\\ \alpha (e^x -1) amp;\text{xlt;0}\end{cases}f(x){xα(ex−1)​x≥0x0​f ′ ( x ) { 1 x ≥ 0 α e x x lt; 0 f#x27;(x)\begin{cases}1amp; \text{$x \geq 0$}\\\alpha e^x amp;\text{$xlt;0$} \end{cases}f′(x){1αex​x≥0x0​Maxoutf ( x ) m a x ( w 1 T x b 1 , w 2 T x b 2 ) f(x)max(w_1^T x b_1,w_2^T x b_2)f(x)max(w1T​xb1​,w2T​xb2​)f ( x ) m a x ( w 1 , w 2 ) f(x)max(w_1,w_2)f(x)max(w1​,w2​)各种激活函数图像sigmoidTanhRELULeaky ReLUPReLUELU为什么需要激活函数标准说法这是由激活函数的性质所决定来, 一般来说, 激活函数都具有以下性质:非线性: 首先,线性函数可以高效可靠对数据进行拟合, 但是现实生活中往往存在一些非线性的问题(如XOR), 这个时候, 我们就需要借助激活函数的非线性来对数据的分布进行重新映射, 从而获得更强大的拟合能力. (这个是最主要的原因, 其他还有下面这些性质也使得我们选择激活函数作为网络常用层) 可微性: 这一点有助于我们使用梯度下降发来对网络进行优化 单调性: 激活函数的单调性在可以使单层网络保证网络是凸优化的 f(x)≈x: 当激活满足这个性质的时候, 如果参数初值是很小的值, 那么神经网络的训练将会很高效(参考ResNet训练残差模块的恒等映射); 如果不满足这个性质, 那么就需要用心的设值初始值( 这一条有待商榷 )如果不使用激活函数, 多层线性网络的叠加就会退化成单层网络,因为经过多层神经网络的加权计算都可以展开成一次的加权计算更形象的解释对于一些线性不可分的情况, 比如XOR, 没有办法直接画出一条直线来将数据区分开, 这个时候, 一般有两个选择.如果已知数据分布规律, 那么可以对数据做线性变换, 将其投影到合适的坐标轴上, 然后在新的坐标轴上进行线性分类而另一种更常用的办法, 就是使用激活函数, 以XOR问题为例, XOR问题本身不是线性可分的,关于各个激活函数的比较和适用场景神经元饱和问题: 当输入值很大或者很小时, 其梯度值接近于0, 此时, 不管从深层网络中传来何种梯度值, 它向浅层网络中传过去的, 都是趋近于0的数, 进而引发梯度消失问题zero-centered: 如果数据分布不是zero-centered的话就会导致后一层的神经元接受的输入永远为正或者永远为负, 因为 ∂f∂wx, 所以如果x的符号固定,那么 ∂f∂w 的符号也就固定了, 这样在训练时, weight的更新只会沿着一个方向更新, 但是我们希望的是类似于zig-zag形式的更新路径 (关于非0均值问题, 由于通常训练时是按batch训练的, 所以每个batch会得到不同的信号, 这在一定程度上可以缓解非0均值问题带来的影响, 这也是ReLU虽然不是非0 均值, 但是却称为主流激活函数的原因之一)各种激活函数优缺点分析激活函数名优势劣势适用场景Sigmoid可以将数据值压缩到[0,1]区间内1. 神经元饱和问题2.sigmoid的输出值域不是zero-centered的3. 指数计算在计算机中相对来说比较复杂在logistic回归中有重要地位Tanh1. zero-centered: 可以将 (−∞,∞) 的数据压缩到 [−1,1] 区间内2.完全可微分的反对称对称中心在原点1. 神经元饱和问题2. 计算复杂在分类任务中双曲正切函数Tanh逐渐取代 Sigmoid 函数作为标准的激活函数ReLU1. 在 (0,∞) ,梯度始终为1, 没有神经元饱和问题2. 不论是函数形式本身,还是其导数, 计算起来都十分高效3. 可以让训练过程更快收敛(实验结果表明比sigmoid收敛速度快6倍)4. 从生物神经理论角度来看, 比sigmoid更加合理1. 非zero-centered2. 如果输入值为负值, ReLU由于导数为0, 权重无法更新, 其学习速度可能会变的很慢,很容易就会”死”掉(为了克服这个问题, 在实际中, 人们常常在初始化ReLU神经元时, 会倾向于给它附加一个正数偏好,如0.01)在卷积神经网络中比较主流LeakyReLU1. 没有神经元饱和问题2. 计算高效3. 收敛迅速(继承了ReLU的优点)4. 神经元不会”死”掉(因为在负值时, 输出不为0, 而是x的系数0.001)PReLU1. 没有神经元饱和问题2. 计算高效3. 收敛迅速(继承了ReLU的优点)4. 神经元不会”死”掉(因为在负值时, 输出不为0, 而是x的系数 α )5. 相对于Leaky ReLU需要通过先验知识人工赋值, PReLU通过迭代优化来自动找到一个较好的值, 更加科学合理, 同时省去人工调参的麻烦ELU1. 拥有ReLU所有的优点2. 形式上更接近于zero-centered3. 在面对负值输入时,更加健壮1. 引入了指数计算, 使计算变的复杂MaxoutMaxout 1. 跳出了点乘的基本形式2. 可以看作是ReLU和Leaky ReLU 的一般化形式3. linear Regime(啥意思?)!4. 在所有输入范围上都没有神经元饱和问题5. 神经元永远不会”死”掉6. 拟合能力非常强它可以拟合任意的的凸函数。作者从数学的角度上也证明了这个结论即只需2个maxout节点就可以拟合任意的凸函数了(相减)前提是”隐含层”节点的个数可以任意多1. 使得神经元个数和参数个数加倍, 导致优化困难激活函数的使用原则1. 优先使用ReLU, 同时要谨慎设置初值和学习率 ( 实际操作中如果你的learning rate 很大那么很有可能你网络中的40%的神经元都 “dead” 了。 当然如果你设置了一个合适的较小的learning rate这个问题发生的情况其实也不会太频繁 )2. 尝试使用LeakyReLU/PReLU/Maxout/ELU等激活函数3. 可以试下tanh, 但是一般不会有太好的结果4. 不要使用sigmoid其他激活函数https://www.jiqizhixin.com/articles/2017-10-10-3参考激活函数总结

相关新闻

Java面向对象设计模式

Java面向对象设计模式

设计模式(Design Patterns) ——可复用面向对象软件的基础 设计模式(Design pattern)是一套被反复使用、多数人知晓的、经过分类编目的、代码设计经验的总结。使用设计模式是为了可重用代码、让代码更容易被他人理解、保证代码可靠…

2026/7/28 18:18:09 阅读更多 →
零训练AI换脸神器:roop-unleashed专业级面部替换终极指南

零训练AI换脸神器:roop-unleashed专业级面部替换终极指南

零训练AI换脸神器:roop-unleashed专业级面部替换终极指南 【免费下载链接】roop-unleashed Evolved Fork of roop with Web Server and lots of additions 项目地址: https://gitcode.com/gh_mirrors/ro/roop-unleashed 想要在几分钟内实现专业级的面部替换效…

2026/7/28 18:18:09 阅读更多 →
django-QueryDict对象

django-QueryDict对象

视图中,用户发送的get与post请求数据,都被封装为QueryDict对象了 认识一下QueryDict对象 该对象类似于一个字典 QueryDict源码 class QueryDict(MultiValueDict):"""A specialized MultiValueDict which represents a query string.A Que…

2026/7/28 18:18:09 阅读更多 →

最新新闻

企业AI定制开发踩过的坑——交付周期凭什么能压到几周

企业AI定制开发踩过的坑——交付周期凭什么能压到几周

# 企业AI定制开发踩过的坑——交付周期凭什么能压到几周## 引言企业想做AI定制开发,最常被问到的是"多久能交付"。市面上的回答从三个月到一年不等,企业听完往往打退堂鼓。其实定制开发的周期长,很多时候不是因为需求难&#xff0c…

2026/7/28 18:28:12 阅读更多 →
笔记四:常用布局:相对布局——RelativeLayout

笔记四:常用布局:相对布局——RelativeLayout

引言 在上一节中我们对LinearLayout进行了详细的解析,LinearLayout也是我们 用的比较多的一个布局,我们更多的时候更钟情于他的weight(权重)属性,等比例划分,对屏幕适配还是 帮助蛮大的;但是使用LinearLayout的时候也有一个问题,…

2026/7/28 18:28:12 阅读更多 →
如何快速找到并安装最适合的用户脚本:Greasy Fork实用指南

如何快速找到并安装最适合的用户脚本:Greasy Fork实用指南

如何快速找到并安装最适合的用户脚本:Greasy Fork实用指南 【免费下载链接】greasyfork An online repository of user scripts. 项目地址: https://gitcode.com/gh_mirrors/gr/greasyfork Greasy Fork是一个功能强大的在线用户脚本仓库,为用户提…

2026/7/28 18:28:12 阅读更多 →
问题解决方案之VC++

问题解决方案之VC++

文|Seraph本文档主要记录VC编程过程中,经常遇到的一些问题,以供大家参考。一、开发多文档形式在初始化时,使其框架以及视图最大化 框架最大化为在应用程序类的初始化函数中添加如下代码:BOOL CMDIAppDemoApp::InitInstance() …

2026/7/28 18:28:12 阅读更多 →
7天解放双手:AzurLaneAutoScript自动化脚本终极指南

7天解放双手:AzurLaneAutoScript自动化脚本终极指南

7天解放双手:AzurLaneAutoScript自动化脚本终极指南 【免费下载链接】AzurLaneAutoScript Azur Lane bot (CN/EN/JP/TW) 碧蓝航线脚本 | 无缝委托科研,全自动大世界 项目地址: https://gitcode.com/gh_mirrors/az/AzurLaneAutoScript 还在为碧蓝航…

2026/7/28 18:28:12 阅读更多 →
3步解锁VK视频下载自由:告别缓冲,永久珍藏精彩时刻

3步解锁VK视频下载自由:告别缓冲,永久珍藏精彩时刻

3步解锁VK视频下载自由:告别缓冲,永久珍藏精彩时刻 【免费下载链接】VK-Video-Downloader Скачивайте видео с сайта ВКонтакте в желаемом качестве 项目地址: https://gitcode.com/gh_mirrors/vk/VK…

2026/7/28 18:27:12 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻