2014年,两条溪流汇成了一条河
2014年秋天,如果你问一个计算机视觉领域的研究者“深度学习能识别视频里的动作吗”,大部分人会摇头。不是深度学习不行,而是它在这件事上一直打不过一群“老古董”方法。这些老方法有个专业名字。 手工特征*指研究者根据经验设计的特征提取规则,不是通过学习得到的,比如统计图像里边缘的方向分布,或者追踪像素点在视频中的运动轨迹。在2014年之前,最强的视频动作识别方法叫做密集轨迹Dense Trajectories,它通过追踪视频里成千上万个点的运动路径,再统计这些路径周围的图像特征,拼出一套动作的“指纹”。这套指纹式的方法在标准数据集UCF-101上能拿到87.9%的准确率。深度学习这边呢?最好的尝试是把视频的每一帧当成一张图片,直接扔进卷积神经网络。结果准确率只有65.4%,比手工特征低了整整22.5个百分点。22.5个百分点意味着什么?意味着每识别10个动作,深度学习就要比手工方法多认错两个还多。这个差距在当年被很多人认为是“深度学习的天花板”,理由也很直接视频比图片多了一个时间维度,而卷积神经网络天生擅长处理空间结构,不擅长处理运动。牛津大学Karen Simonyan和Andrew Zisserman这两位研究者,决定回答一个问题深度学习到底能不能理解“动”这件事,而不是只理解“长什么样”。他们给出的答案,后来被写进了一篇叫《Two-Stream Convolutional Networks for Action Recognition in Videos》的论文里。这个方法的核心思路简单到有点反直觉不要让一个网络同时学“形状”和“动作”,而是拆成两个网络,一个专门看形状,一个专门看动作,最后把两边的判断结果加起来。问题出在哪:视频不是图片的堆叠要理解这个设计的必要性,得先弄清楚为什么直接把视频塞进图片分类网络会失败。一个动作,比如“挥手”,由两部分信息组成。第一部分是场景和物体的样子,手是什么形状,背景是什么环境。第二部分是运动,手往哪个方向挥,速度多快,轨迹是什么样。普通的卷积神经网络在静态图片分类上表现极好,因为它擅长捕捉纹理、边缘、颜色这类空间信息。但当你把视频的一帧一帧塞给它,让它自己去“悟”出运动模式,它其实很难悟出来。原因在于卷积操作本身是为静态图案设计的。它去检测“这里有个圆形”“那里有条竖线”,却没有天然的机制去捕捉“这个点在下一帧移动到了那里”。你让它隔着单张图片猜运动方向,相当于给它一张照片让它猜快门按下前后物体往哪边动,信息压根不在这张图里。这就是为什么早期尝试直接堆叠视频帧的方法,准确率只有65.4%,比手工特征还差一大截。Simonyan和Zisserman的洞察是,如果网络自己学不会捕捉运动,那就不要让它自己学,直接把运动信息用现成的算法算出来,喂给另一个专门的网络。这个现成的算法叫光流。 光流*描述视频里每一个像素点从上一帧到下一帧移动方向和速度的向量场,是计算机视觉里的经典技术,不需要深度学习,用传统算法就能计算。两条流:空间流和时间流论文的核心结构因此变成了两条并行的卷积网络,论文管它们叫“空间流”和“时间流”。空间流干的事很朴素,输入单独一帧图像,判断画面里有什么,谁在做什么姿势。这条流基本就是一个常规的图片分类网络,输入是RGB图片,判断“这个人手里拿着球拍”“背景是网球场”这类静态信息。时间流则完全不看图片的颜色和纹理,它的输入是连续多帧计算出来的光流场,也就是每个像素“往哪儿动、动多快”的信息。它不关心画面上是不是网球场,只关心手臂挥动的方向和速度是不是符合“挥拍”这个动作的运动特征。![两条流的结构图]论文里的结构图画得很清楚一段视频先被拆成两路输入,一路是某一帧的原始画面,另一路是这一帧附近若干帧算出的光流叠加图。两路各自送进一个卷积网络,各自吐出一个分类结果,最后把两个结果的分数加权合并,得出最终判断。这个设计能不能工作,关键要看合并之后效果怎样。论文给出的答案是,单独用空间流,准确率是72.6%,单独用时间流,准确率是81.0%,两者融合之后,达到88.0%。这里有个细节值得说清楚单独的时间流,也就是只看运动不看画面的网络,准确率比只看画面的空间流高了整整8.4个百分点。这说明在“动作”这个任务上,运动信息本身比画面信息更重要。这也印证了他们最初的判断,普通卷积网络学不好视频,不是因为网络不够大,而是因为它压根没被喂到运动信息。如果不拆成两条流会怎样?论文里也做了对比,前面提到的直接堆叠视频帧的方法只有65.4%,比两流方法融合后的88.0%低了22.6个百分点。这个差距基本说明了一件事,深度学习不是学不会视频里的动作,而是之前的做法没有把正确的信息喂给它。这里可以打一个类比。假设你要教一个从没见过体育比赛的人辨认“投篮”和“传球”这两个动作,你给他看一张静止的照片,他大概能看出这是篮球场,画面里有个人举着球,但他猜不出球接下来往哪儿飞。如果你换成给他看一段慢动作的手臂摆动轨迹,哪怕看不清是谁在打球,他也能准确判断这是投篮还是传球的姿势。两种信息各有各的用处,同时给他看,他判断得最准。如果你非要让他只凭一张静止照片就猜出运动方向,他大概率猜错,这正是早期深度学习方法在视频动作识别上栽跟头的原因。为什么光流要单独算,而不是让网络自己学有人可能会问,深度学习不是最擅长自动学习特征吗,为什么这里还要用一个传统算法先把光流算出来,再喂给网络?这不是绕了个弯路吗?答案在于当时的算力和数据条件。2014年的卷积神经网络想要从原始像素直接学出精确的运动估计,需要海量标注数据和更深的网络结构,而当时能用的视频动作识别数据集规模很小,UCF-101总共只有13320段视频。这么小的数据规模,不足以让网络从零学会计算光流这么精细的任务。于是最实际的做法是,借用计算机视觉里已经成熟几十年的光流估计算法,把这一步的计算精度直接“外包”出去,网络只需要学习“看到这样的运动模式,应该判断为什么动作”,而不需要自己从像素里推导运动是什么。这是一种务实的工程选择不追求端到端全部由神经网络完成,而是让传统算法和深度学习各自发挥所长。这就好比装修房子,你完全可以雇一个全能工人从水电到瓦工全部自己上手,但如果这个工人对水电不熟,勉强上手可能漏水漏电,不如直接请一个专业电工把线路布好,工人负责后续的瓷砖和粉刷。传统光流算法就是这里的“专业电工”,它把最难、最精细的运动计算做好,深度学习网络专心做它擅长的模式识别和分类。如果非要让新手工人从零学电路,大概率是又慢又容易出错。数据不够怎么办:多任务训练拆成两条流之后,Simonyan和Zisserman还面临一个具体的工程难题,时间流网络需要海量的视频数据来训练,但当时能用的标注视频数据集非常有限。他们用的解决办法叫多任务学习。 多任务学习*让同一个网络同时在两个不同的数据集上训练,共享大部分网络参数,只在最后输出层区分任务,这样可以用一个数据集的数据帮助另一个数据集的学习。具体做法是,他们把UCF-101和另一个数据集HMDB-51放在一起训练同一个时间流网络,网络的大部分层参数是共享的,只有最后的分类层是各自独立的。这样一来,即使单个数据集的数据量不够,合在一起训练也能让网络学到更泛化的运动特征。实验结果证明这个做法确实有效,加入多任务学习后,时间流网络在UCF-101上的准确率从80.4%提升到81.0%,提升幅度不算夸张,但在当时数据稀缺的条件下,这是一个实打实的增益,而且几乎没有额外成本。站在历史节点上回头看这篇论文发表的意义,放在2014年的时间点上看格外清楚。在此之前,深度学习在图像分类上早已证明了自己,2012年的AlexNet横扫ImageNet图像分类比赛,让整个领域相信卷积神经网络是未来。但视频领域是个例外,深度学习方法迟迟打不过手工设计的密集轨迹特征,这让不少人怀疑,卷积网络的成功是不是只局限于静态图像,视频这种带时间维度的数据可能天然不适合它。两流网络第一次让深度学习在视频动作识别的标准测试集上超过了手工特征方法,88.0%对87.9%,虽然只领先了0.1个百分点,但这是质的突破。它证明了深度学习不是不能理解动作,只是之前没有找到正确的信息表达方式。这个时间点上还有个值得说的细节,Karen Simonyan和Andrew Zisserman同属牛津大学的VGG研究组,而就在两流网络论文发表几个月后,他们两人又发表了另一篇论文,提出了后来家喻户晓的VGGNet,一个通过堆叠简单卷积层大幅提升图像分类性能的网络结构。这两篇论文几乎是同期完成的工作,某种程度上反映了这个团队当时在深度学习结构设计上密集探索的状态,一边琢磨怎么把网络做深做对,一边琢磨怎么把时间信息喂给网络。两流网络之后,这个思路很快被后续研究继续放大。2015年,Feichtenhofer等人在两流网络基础上提出了改进的融合策略,研究如何在网络的不同层级把空间流和时间流的信息更早地结合起来,而不是像原始论文那样只在最后输出层简单相加,这让融合后的准确率进一步提升。2016年,Wang等人提出的Temporal Segment Networks时序分段网络把两流结构扩展到整段视频而不只是短片段,通过对视频均匀采样多个片段分别提取两流特征再聚合,解决了原始两流网络只能看视频里很短一段画面、难以捕捉长时间动作的问题,在UCF-101上把准确率推到了94%以上。再往后,3D卷积网络逐渐兴起,直接用三维卷积核同时处理空间和时间维度,试图让网络自己学会捕捉运动,不再需要手工计算光流这一步。这类方法某种程度上是对两流网络路线的反思,如果网络足够大、数据足够多,是不是可以省掉光流这个中间步骤?但即便如此,两流网络提出的“空间信息和时间信息应该分开处理再融合”这个核心思想,直到今天仍然在很多视频理解模型的设计里留有影子。关键数据一览| 方法 | 准确率(UCF-101) ||---|---|| 密集轨迹手工特征,此前最强方法 | 87.9% || 直接堆叠视频帧的深度学习方法 | 65.4% || 仅空间流 | 72.6% || 仅时间流 | 81.0% || 时间流加多任务学习 | 81.0%较无多任务学习的80.4%提升0.6个百分点 || **两流网络融合空间流时间流** | **88.0%** |写在后面读这篇论文时最让我意外的一点是,时间流单独的准确率(81.0%)比空间流单独的准确率(72.6%)高出这么多。这说明在“认出一个动作”这件事上,动作本身怎么动,比画面里有什么东西,信息量更大。这其实推翻了一个直觉,我们平时看视频认动作,好像更依赖“看清楚发生了什么”,但对机器来说,运动轨迹反而是更可靠的线索。另一个值得琢磨的地方是,这篇论文没有强行用深度学习取代一切,而是老老实实借用了传统光流算法。这提醒我一个容易被忽略的事实,新技术的第一次突破,往往不是靠彻底抛弃旧方法,而是靠找到旧方法和新方法的正确接口。后来3D卷积网络试图让网络自己学会算“光流”,某种程度上是在赌算力和数据会持续变得便宜,这个赌注后来确实赢了,但在2014年那个时间点,老老实实借用光流算法才是对的选择。如果两条流的信息可以互相帮助,那能不能有第三条流,专门捕捉更长时间尺度的动作模式?这个问题后来的研究确实在回答,但两流网络这篇论文当时并没有给出答案。QAQ1两流网络Two-Stream Convolutional Networks是什么?A两流网络是Simonyan和Zisserman在2014年提出的视频动作识别方法,用两个独立的卷积网络分别处理单帧画面(空间流)和运动光流信息(时间流),再将两者的判断结果融合,首次让深度学习在UCF-101数据集上超过了手工特征方法。Q2两流网络为什么要用光流而不是让网络自己学习运动信息?A因为2014年的视频数据集规模很小,网络难以从零学会精确估计运动,所以研究者借用了成熟的传统光流算法直接计算运动信息,再交给网络学习如何根据这些运动模式判断动作类型,这样效率更高、效果更好。Q3两流网络的准确率相比之前最强的手工特征方法提升了多少?A两流网络融合后的准确率是88.0%,此前最强的手工特征方法密集轨迹是87.9%,两者非常接近,但这是深度学习第一次在视频动作识别标准测试上追平并略微超过手工特征方法,具有里程碑意义。

相关新闻

本地大模型部署指南:llama.cpp与GGUF格式实践

本地大模型部署指南:llama.cpp与GGUF格式实践

1. 先搞清楚 llama.cpp 和 GGUF 到底解决了什么问题 如果你正在找一种方法,能在自己的电脑上,不依赖任何外部 API 和网络,就能运行一个像模像样的 AI 助手,那 llama.cpp 和 GGUF 格式就是目前最直接、最省心的组合。 很多人一听到…

2026/8/18 22:08:21 阅读更多 →
ComfyUI精准编辑新突破:Krea2 Identity Edit LoRA实战测评与工作流优化指南

ComfyUI精准编辑新突破:Krea2 Identity Edit LoRA实战测评与工作流优化指南

你刚接触 ComfyUI 时,是不是也经历过这样的阶段:看着别人分享的酷炫工作流,自己导入后却只能生成一些“差不多”的图片,想微调某个细节——比如把微笑的嘴角拉平一点,或者把散乱的头发收束得更整齐——却发现无从下手&…

2026/8/18 22:08:21 阅读更多 →
Llama.cpp与vLLM本地部署实战:从硬件选型到生产部署的完整指南

Llama.cpp与vLLM本地部署实战:从硬件选型到生产部署的完整指南

这类工具最值得先看的不是功能列表,而是能不能在普通环境里稳定跑起来,以及你的任务到底需要哪种能力。Llama.cpp 和 vLLM 是目前本地部署大模型时最常被拿来对比的两个推理引擎,但很多人选型时容易陷入“哪个更好”的误区,结果往…

2026/8/18 22:07:20 阅读更多 →

最新新闻

从零部署Linux服务器深度学习环境:Anaconda+PyTorch+GPU实战指南

从零部署Linux服务器深度学习环境:Anaconda+PyTorch+GPU实战指南

大家好,我是长期在实验室和服务器上“摸爬滚打”的开发者。相信很多同学在接触深度学习时,都遇到过这样的困境:实验室的服务器配置很高,但面对黑乎乎的 Linux 终端,却不知从何下手。想部署一个 PyTorch 环境&#xff0…

2026/8/18 22:39:42 阅读更多 →
华为MetaERP Oracle EBS AR 外币发票、本币收款核销完整会计分录前置基础概念交易币种(外币):Invoice 币种 = USD功能币种(本币):Ledger 本位币 = CNY

华为MetaERP Oracle EBS AR 外币发票、本币收款核销完整会计分录前置基础概念交易币种(外币):Invoice 币种 = USD功能币种(本币):Ledger 本位币 = CNY

Oracle EBS AR 外币发票、本币收款核销完整会计分录 前置基础概念 交易币种(外币):Invoice 币种 USD功能币种(本币):Ledger 本位币 CNY汇率规则 发票入账汇率:交易汇率(发票日期…

2026/8/18 22:39:42 阅读更多 →
2024年地毯批发行业发展现状及佛山区域工厂供给能力分析

2024年地毯批发行业发展现状及佛山区域工厂供给能力分析

一、2024年地毯批发行业整体发展现状 行业调研数据显示,2024年国内地毯批发行业总规模达372亿元,同比增长7.2%,品类结构出现明显分化:传统有胶复合地毯批发量同比下滑11.3%,库存积压率达28%;主打零醛、防水…

2026/8/18 22:39:42 阅读更多 →
AI Agent长期记忆系统构建:从向量检索到工程实践

AI Agent长期记忆系统构建:从向量检索到工程实践

你有没有遇到过这样的情况:给一个AI助手下达了明确的指令,比如“不要用Markdown格式回复”,但它在后续的对话中,依然我行我素,用Markdown格式回复了你?或者,你精心设计了一个AI应用,…

2026/8/18 22:39:42 阅读更多 →
电介吸收效应:精密积分电路中的隐形误差源与应对策略

电介吸收效应:精密积分电路中的隐形误差源与应对策略

1. 从一次“诡异”的测量误差说起 几年前,我在调试一个高精度的数据采集前端电路时,遇到了一个至今记忆犹新的问题。电路的核心是一个经典的积分器,用于将传感器输出的微弱电流信号转换为电压。理论上,这个设计非常成熟&#xff0…

2026/8/18 22:39:42 阅读更多 →
新款长安CS95官图深度解析:设计、动力与市场挑战

新款长安CS95官图深度解析:设计、动力与市场挑战

1. 从官图到实车:新款长安CS95的“官宣”信号解读 看到“将于二季度上市 新款长安CS95官图发布”这条消息,相信很多关注中大型SUV市场的朋友,尤其是长安品牌的拥趸,心里都会咯噔一下。官图发布,意味着这款沉寂已久的旗…

2026/8/18 22:38:42 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/18 9:15:35 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 9:06:28 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/18 9:04:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →