对着摄像头动动嘴唇就能打字:本地实时唇语识别工具 Chaplin 从零实测
对着摄像头动动嘴唇就能打字本地实时唇语识别工具 Chaplin 从零实测【免费下载链接】chaplinA real-time silent speech recognition tool.项目地址: https://gitcode.com/gh_mirrors/chapl/chaplin深夜加班开视频会你想插一句话可四周静得能听见键盘声——于是你只能对着摄像头无声地动动嘴唇屏幕上立刻打出了那句话。这不是科幻片而是本地实时唇语识别工具 Chaplin 每天都在做的事把无声的嘴型实时翻译成能直接输入的文字。一句话说清 Chaplin 是什么Chaplin 是一个完全本地运行的实时视觉语音识别VSR工具它读取摄像头画面中你的唇部动作识别出你无声说出的话再把修正后的文字自动敲到光标所在的位置。整条链路——从唇部检测到模型推理再到文本修正——都在你机器上完成不依赖任何云端服务数据不出门。它依托的是在LRS3 唇读数据集上训练出的 Auto-AVSR 模型配合 RNN 语言模型和本地 Ollama 上的大模型做两级校对最终把闭嘴打字变成现实。从下载到第一次开口全程就三条命令上手过程短得让人意外核心只有三步克隆仓库、跑一键脚本、启动程序。git clone https://gitcode.com/gh_mirrors/chapl/chaplin cd chaplin ./setup.shsetup.sh会自动从 Hugging Face Hub 拉取两个模型预训练的 LRS3_V_WER19.1 识别模型以及配套的英文子词语言模型并放入benchmarks/目录的对应位置。这一步虽然要等一会儿但胜在完全自动化不需要手工对路径。接下来装两样东西Ollama并拉取qwen3:4b模型用于文本修正和 uv 包管理器。然后在项目根目录敲这一条uv run --with-requirements requirements.txt --python 3.12 main.py \ config_filename./configs/LRS3_V_WER19.1.ini detectormediapipe摄像头画面弹出后按下Alt 键Mac 上是 Option开始录制对着镜头无声说话再按一次停止。这时你会看到终端里打出原始识别结果RAW OUTPUT紧接着修正后的句子会被自动输入到当前光标处——就像有个看不见的秘书在替你打字。按q退出。这段代码只做一件事加载模型、打开摄像头、把全局热键和识别线程挂起来。真正打字的逻辑藏在 Chaplin 类里。按下 Alt 键之后机器里发生了什么它内部其实是一条五段流水线每一段都像一个分工明确的车间唇部定位默认用 MediaPipe也可换 RetinaFace在每一帧里框出人脸和关键点相当于给嘴唇标好坐标。启用face_trackTrue后还会做面部跟踪避免每帧重复全图检测。裁剪对齐按眼睛、鼻尖、嘴心的稳定点位做仿射变换把嘴部区域裁成统一的 96×96 小图就像证件照机器自动把脸摆正。特征提取一串嘴唇小图先过 Conv3D 网络抽时空特征再交给 ResNet 骨干网络编码。嘴型的运动模式在这里被压缩成计算机能读懂的动作轨迹。序列解码Transformer 编码器-解码器结合 CTC 损失做 Beam Search。配置里的beam_size40意味着解码时同时保留 40 条候选句子路径像走迷宫时一次开 40 条路最后挑最通顺的一条。两级文本校正第一级是 RNN 语言模型lm_weight0.3在解码时兜底第二级把结果丢给本地 Ollama 上的qwen3:4b让它把明显的错词改对、补上标点、恢复大小写。最后这一环最有意思大模型不只是改对它还会返回一份list_of_changes——明确告诉你它改了哪些词这在排查识别问题时是极好的调试信息。一个反直觉的冷知识它故意把画面录糊Chaplin 在录制时做了三件看起来自降画质的事把分辨率缩小到原来的三分之一、转成灰度图、用 JPEG 质量 25 压缩后写盘。你可能会想这么糙的输入能认出来才怪但反过来想模型训练时吃的本来就不是高清画面而是 LRS3 数据集里那种裁剪好、转灰度的嘴部特写。让实时输入尽量贴近训练分布反而比画质越好越准更符合模型预期。另一个隐藏规则是录制片段短于 2 秒会被直接丢弃——嘴型序列太短模型根本无从判断你说的是什么。所以想测试时别只挤一个单词试着说完整的一句话效果会好很多。两个真实场景把 Chaplin 玩出花场景一给无声教学视频自动生成英文字幕不接摄像头也行InferencePipeline可以直接吃视频文件。写个十几行的脚本遍历目录里所有.mp4逐段识别、写进 txt就能给口型清晰的教学视频批量生成文本from pipelines.pipeline import InferencePipeline import torch pipeline InferencePipeline( config_filename./configs/LRS3_V_WER19.1.ini, devicetorch.device(cuda:0 if torch.cuda.is_available() else cpu), detectormediapipe) transcript pipeline(video_path) print(transcript)这段代码解决的核心问题只有一个把实时摄像头换成离线视频文件其余识别链路完全复用。场景二给无声输入做一个小接口你可以把识别包成一个 HTTP 接口让其他设备把帧传过来、拿回文本。思路极简全局初始化一个 pipeline收到请求就cv2.imdecode解码图片喂给process_frame一类的方法返回 JSON。Chaplin 的模块化设计让这种二次封装非常省力唯一的注意点是模型是英文优化的基于 LRS3 英文数据集想支持中文需要自己换模型或做微调。我踩过的几个坑帮你提前避开没启动 Ollama 就开跑识别那一步可能正常但最后的修正环节会静默失败。务必先ollama pull qwen3:4b并把 Ollama 服务跑起来。Alt 是全局热键代码用pynput注册了全局GlobalHotKeys也就是说哪怕焦点不在摄像头窗口按 Alt 也会触发录制开关。如果你在用 Alt 切换窗口之类的快捷键记得先规划好。多摄像头机器程序默认cv2.VideoCapture(0)如果识别的是错误的那路画面改一下索引即可。光线和角度是硬约束背光、侧脸、手挡嘴都会让识别率断崖式下跌。正对镜头、均匀打光是最便宜的参数调优。写在最后闭嘴是为了让文字先开口Chaplin 打动我的不是准确率有多高而是它把一套原本要写几百行样板代码的视觉语音识别流程压缩成了一次按键体验按下 Alt动动嘴唇文字自己出现在屏幕上。它适合安静场合的无声输入适合语言障碍者的辅助交流也适合任何想研究 VSR 落地细节的开发者——因为它开源、模块清晰pipelines/下的检测器、数据加载、模型推理都是可以单独拎出来读的代码。不必等技术成熟下载、跑通、看 RAW OUTPUT 和list_of_changes的差异你就已经站在读懂这套系统的门口了。下一次想说话却开不了口时不妨让 Chaplin 替你开口。【免费下载链接】chaplinA real-time silent speech recognition tool.项目地址: https://gitcode.com/gh_mirrors/chapl/chaplin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

douyin-downloader:免费的抖音批量下载工具,一条命令搬空整个主页,5分钟上手实操

douyin-downloader:免费的抖音批量下载工具,一条命令搬空整个主页,5分钟上手实操

douyin-downloader:免费的抖音批量下载工具,一条命令搬空整个主页,5分钟上手实操 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, S…

2026/8/24 4:18:58 阅读更多 →
缠论可视化插件ChanlunX完整指南:5分钟让通达信自动画出笔、段与中枢

缠论可视化插件ChanlunX完整指南:5分钟让通达信自动画出笔、段与中枢

缠论可视化插件ChanlunX完整指南:5分钟让通达信自动画出笔、段与中枢 【免费下载链接】ChanlunX 缠中说禅炒股缠论可视化插件 项目地址: https://gitcode.com/gh_mirrors/ch/ChanlunX 你是否也曾对着满是K线的界面,想按缠论手动标注"笔"…

2026/8/24 9:22:05 阅读更多 →
WandEnhancer 完整使用指南:从解锁 Pro 到手机远程控制,一个开源工具全搞定

WandEnhancer 完整使用指南:从解锁 Pro 到手机远程控制,一个开源工具全搞定

WandEnhancer 完整使用指南:从解锁 Pro 到手机远程控制,一个开源工具全搞定 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer …

2026/8/21 17:27:20 阅读更多 →

最新新闻

[量化]《Windows Socket 初始化编程指南:从 WSAStartup 到 RAII 封装》

[量化]《Windows Socket 初始化编程指南:从 WSAStartup 到 RAII 封装》

目录 WSAStartup 函数详解 1. 函数原型与参数 2. WSADATA 结构体 标准初始化流程 1. 完整初始化示例 2. 版本说明 错误处理与调试 1. 常见错误码 2. 调试输出示例 RAII封装与管理 1. 自动管理类 2. 单例模式管理 常见陷阱与最佳实践 1. 多次初始化的处理 2. 线程…

2026/8/24 12:31:29 阅读更多 →
[量化]《底层实现可靠UDP:优于TCP的低延迟可靠传输方案》

[量化]《底层实现可靠UDP:优于TCP的低延迟可靠传输方案》

目录 引言 为什么需要基于UDP的可靠传输 可靠UDP核心机制 STEP1.协议头设计 STEP2.滑动窗口与ACK处理 STEP3.丢包检测与重传策略 STEP4. 拥塞控制(以TFRC为例) STEP5.顺序保证与重排序 高级优化技术 STEP1. 前向纠错(FEC&#xff0…

2026/8/24 12:31:29 阅读更多 →
腾讯元宝流程图怎么导出 ?「AI 导出鸭」一键全搞定,告别格式乱

腾讯元宝流程图怎么导出 ?「AI 导出鸭」一键全搞定,告别格式乱

引言 你是否遇到过:在腾讯元宝辛苦画好的流程图,导出后文字乱码、线条错位、高清图变马赛克?团队协作时,流程图无法直接插入PPT或Word,只能截图再修图?更头疼的是,不同浏览器、不同设备导出的效…

2026/8/24 12:31:29 阅读更多 →
注入型漏洞以及agent-audit的检测原理

注入型漏洞以及agent-audit的检测原理

keywords: AI安全,漏洞,源码 1. 引入 agent-audit能扫描Agent项目源代码,通过静态分析的方法,发现Agent的风险(参考1)。在参考2中可以看到,agent-audit能检测多种安全问题。其中排第一的就是比较…

2026/8/24 12:31:29 阅读更多 →
AI搜索时代网站流量策略:从robots.txt到结构化数据的实战指南

AI搜索时代网站流量策略:从robots.txt到结构化数据的实战指南

1. 背景与核心概念:AI如何重塑内容生态与流量格局 最近,不少内容创作者和网站站长都感受到了一个明显的趋势:来自搜索引擎的自然流量正在发生波动,甚至出现下滑。这背后,以ChatGPT、Gemini等为代表的大语言模型&#…

2026/8/24 12:31:29 阅读更多 →
Unity 2D解谜游戏开发实战:从零构建《深夜小吃店》Demo

Unity 2D解谜游戏开发实战:从零构建《深夜小吃店》Demo

最近在整理游戏开发学习笔记时,想把一个课堂上的2D解谜小Demo——《深夜小吃店》的完整实现过程记录下来。这个项目麻雀虽小,但五脏俱全,涵盖了从场景搭建、交互逻辑到谜题设计的核心流程,非常适合刚学完Unity基础,想动…

2026/8/24 12:30:28 阅读更多 →

日新闻

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践 前端安全依赖分层防护。没有任何单一配置能替代输出编码、权限校验和依赖更新。 把不可信内容当作数据 默认使用框架的转义能力;确需渲染 HTML 时,先在服务端或可信的客户端库中进行白名单过滤。避免把用户输入直接赋给 inne…

2026/8/24 1:08:15 阅读更多 →
Windows登录密码存储机制全解析:从哈希算法到安全加固实战

Windows登录密码存储机制全解析:从哈希算法到安全加固实战

1. 项目概述:Windows登录密码的“黑匣子”每次你按下CtrlAltDel,输入密码,然后看到那个熟悉的桌面,这背后发生了一系列复杂而精密的操作。作为一名长期与Windows系统打交道的从业者,我经常被问到:“我的密码…

2026/8/24 1:08:15 阅读更多 →
AI面试系统安全挑战与解决方案

AI面试系统安全挑战与解决方案

1. 项目概述:AI面试系统的安全挑战去年参与某跨国企业AI面试系统部署时,遇到一个典型案例:候选人在视频面试中无意提到竞争对手产品名称,系统竟自动将该信息关联到企业知识库并生成竞品分析报告。这个看似"智能"的功能&…

2026/8/24 1:08:15 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 0:06:02 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 0:20:20 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 0:14:11 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/23 18:47:06 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/24 11:20:22 阅读更多 →