三步装好、五步成稿:Buzz本地语音转文字工具从入门到自动化
三步装好、五步成稿Buzz本地语音转文字工具从入门到自动化【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz开了两小时会录音躺在手机里逐字整理却要熬到凌晨——这是不是你的日常Buzz 是一款完全离线运行的开源本地语音转文字工具基于 OpenAI Whisper 打造能把音频和视频一键变成带时间戳的文字稿全程不联网、不上传隐私和数据安全都有保障。这篇文章就带你从安装一路走到自动化把这份听写苦差彻底交给它。为什么偏偏是它本地转录到底香在哪 先做个简单的对比。市面上的在线转录服务通常按分钟计费动辄每小时几十块还得把录音上传到别人的服务器而 Buzz 的选择是完全在本地完成全部计算对比维度云端转录服务Buzz 本地转录音频上传必须上传存在泄露风险全程不出电脑收费标准按时长付费免费网络依赖断网即停摆离线可用支持格式通常仅音频音频视频都能转对于内容创作者、做访谈的学者、频繁开会整理纪实的职场人来说这三点几乎就是刚需。而且 Buzz 同时支持 macOS、Windows、Linux还给开发者提供了 Python 包和命令行接口后面想玩自动化也有现成的路。动手前先摸清两件事转写靠什么、电脑要什么配置很多新手装完软件发现跑不起来其实是没搞懂 Buzz 背后有五套不同的转写引擎OpenAI Whisper官方 Python 实现兼容性最好Faster Whisper基于 CTranslate2 优化速度和显存占用更友好Whisper.cppC 编写支持 Vulkan 加速大部分显卡都能用上Hugging Face 模型可接入社区里五花八门的微调模型OpenAI API少数需要联网的场景如翻译、AI 摘要会用到。至于硬件纯 CPU 也能跑只是慢一些。建议至少 8GB 内存配置越高、转录越快NVIDIA 显卡可以走 CUDA 加速Apple Silicon 有原生优化。第一次使用某个模型时需要联网下载权重之后就可以断网工作了。三步完成安装三个平台的三种打开方式安装本身没什么门槛按你的系统挑一条路走macOS从 SourceForge 下载.dmg安装包拖进应用程序文件夹即可Windows下载安装程序一路下一步。注意应用未签名首次运行会被 SmartScreen 拦截点更多信息→仍要运行即可Linux推荐用包管理器安装——flatpak install flathub io.github.chidiwilliams.Buzz或者用 SnapSnap 版建议先装好音频库sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzzPython 开发者还有更轻的玩法一条命令装进环境里pip install buzz-captions python -m buzz想从源码跑、顺便改代码也可以git clone https://gitcode.com/GitHub_Trending/buz/buzz后按仓库文档安装。装好之后验证是否正常就是打开软件看主界面有没有加载出来。五步跑通第一次转录从一段录音到一份文稿第一次用别急着研究高级设置先按下面五步跑通最小流程。第 1 步导入音频文件 点击工具栏的按钮或用快捷键 Ctrl/CmdO 选择文件。支持 MP3、WAV、MP4、AVI 等常见格式可以一次拖多个文件进来批量添加从 1.2.0 版本起还支持直接粘贴 YouTube 链接把在线视频抓下来转写。第 2 步设置任务与语言任务类型选转录保留原语言或选翻译把所有内容译成英文语言能确定就手动指定不确定就交给自动检测模型先用 Tiny 或 Base 验证流程后面再换大的。第 3 步打开高级选项初始提示Initial Prompt可以塞专业术语提取语音能从嘈杂音频里分离人声单词级时间戳会生成精确到每个词的时间标记后续做字幕调整会用到。第 4 步点击运行任务列表会显示实时进度百分比、所用模型和当前状态支持暂停和取消。文件越长、模型越大等待越久都是正常现象。第 5 步查看与导出双击任务行进入转录详情页可以看到每段文字的时间轴边播放音频边高亮对应文字还能用搜索框快速定位。导出时四种格式任选格式适用场景TXT纯文本快速分享SRT标准字幕兼容主流剪辑软件VTT网页视频字幕JSON结构化数据方便程序处理 避坑提示首次运行需要下载模型务必保证联网想快速验证流程先用 Tiny 模型跑一段 30 秒的音频别一上来就挑战 Large。模型选型想让效率和准确率同时在线先看懂这张表 ⚡模型大小直接决定转录的速度与准确率Buzz 官方把 Whisper 五个档位的模型都搬了进来模型参数量磁盘占用速度准确率典型场景Tiny3900 万约 75MB最快中等实时转录、短音频试水Base7400 万约 142MB快良好日常会议记录Small2.44 亿约 466MB中等优秀播客、采访Medium7.69 亿约 1.5GB较慢极佳专业内容制作Large15.5 亿约 2.9GB慢顶级学术研究、高要求场景模型管理在首选项 → Models标签页里可以查看已下载的模型、下载新版本、填写自定义模型链接删掉不用的模型还能释放磁盘空间。想让 Large 也能跑得动就要请出硬件加速NVIDIA GPU装 CUDA 版 PyTorch例如pip3 install -U torch2.8.0cu129 torchaudio2.8.0cu129 --index-url https://download.pytorch.org/whl/cu129Apple Silicon开箱即用M 系列芯片有原生优化其他 GPU 或集显Whisper.cpp 走 Vulkan覆盖面最广。再补两个性能口诀内存够大就调大批处理大小模型文件放 SSD 上加载速度肉眼可见地变快。把转录结果喂得更准的三个小动作模型选对了准确率还能靠操作再上一层楼手动指定语言。自动检测偶尔会翻车尤其面对口音或混合语言时。能确定就用确定的哪怕内容里混了几句外语也以主要语言为准用好初始提示。把专业术语、人名、公司名预先写进提示里Whisper 会明显更懂事。做讲座录音时把课件里出现的关键词都塞进去按内容挑模型。日常会议 Base 就够访谈播客上 Small/Medium学术材料直接 Large别用大炮打蚊子也别凑合。背景噪音大的录音先勾选提取语音分离人声或者配合后面要讲的 DeepFilterNet 降噪插件效果立竿见影。会议和访谈救星实时录音转写这样玩 ️除了导入现成文件Buzz 还能一边录音一边出文字开会时打开它散会就有初稿。操作路径很清晰点击主界面麦克风图标进入录音模式选择输入设备内置麦克风或外接把延迟参数调到 20–30 秒兼顾实时性和识别质量开始录音实时查看逐句结果。如果是在讲座、发布会这类场合可以打开演示窗口全屏展示实时转录观众抬头就能看到字幕还能自定义字体大小和颜色。想要显示更干净就调高静音阈值过滤背景噪音、隐藏尚未确认的部分担心电脑卡顿就拉大转录步长降低系统负载。另外在首选项 → General里可以勾选实时录音转录导出并指定导出目录散会即出稿、自动落盘。从手动到全自动命令行与文件夹监控两条自动化路线手动点按钮适合零散任务批量场景就该上命令行。Buzz 的 CLI 以buzz add为核心# 转录单个文件并指定语言和模型 buzz add --task transcribe --language zh --model-type whisper --model-size medium input.mp3 # 批量处理目录下所有 MP3 buzz add --model-type whispercpp --model-size small *.mp3 # 输出 SRT 字幕 buzz add --task transcribe --srt video.mp4 # 同时导出 SRT、VTT、TXT buzz add --task transcribe --srt --vtt --txt audio.wav # 指定输出目录 buzz add --task transcribe --output-dir ./transcripts audio_files/*.mp3高级参数同样能带进命令行--prompt 专业术语神经网络机器学习注入提示词--word-timestamps开启单词级时间戳--extract-speech分离人声--hide-gui则让任务在后台静默跑完——非常适合放进定时脚本里。不想写脚本就用文件夹监控在首选项 → Folder Watch里指定一个目录Buzz 会盯着它一旦有新音频文件落入就自动转录。还能配置是否递归监控子目录、按扩展名过滤文件类型以及处理完成后对原文件移动、重命名或删除。配合跳过已转录文件插件把文件重新丢进监控目录也不会重复劳动。让字幕听话批量整形与说话人识别转录出来的文字经常一段长一段短直接导出成字幕很难看。Buzz 内置了字幕调整功能打开 Resize 面板就能给字幕整形期望字幕长度控制每行字幕字符数默认 42适合快速对话可以调小演讲内容可以调大按间隙合并把间隔小于 0.2 秒的片段拼起来按标点分割遇到句号、逗号自动断行按最大长度分割强制每行不超过设定长度。经验是间隙合并 标点分割组合使用字幕最自然。需要区分发言人时还有说话人识别功能会议记录里谁说了什么一目了然。给转录流水线加点私货插件系统 从 1.4.5 版本开始Buzz 支持插件扩展不用改核心代码就能定制流程。内置插件已经覆盖了不少高频需求AI 摘要调用 OpenAI 兼容 API把整段转录浓缩成摘要存进备注或单独文件增强语言检测转录前用本地 Whisper 模型先定语言适合完全未知语种的音频导出 DOCX一键把转录导出成 Word 文档可选带时间戳转录调整自动把单词级片段重组成字幕大小的块按间隙合并、按标点分割、强制最大长度和前面的 Resize 是一对好搭档DeepFilterNet 降噪转录前用 AI 模型去背景噪音处理后的音频会存成_DeepFilterNet3.wav新文件跳过已转录文件检查结果文件或转录数据库避免重复劳动。管理入口在帮助 → 插件可以启用/禁用单个插件、拖拽调整执行顺序、点设置图标配置参数甚至通过添加 URL安装社区插件。想自己写插件的话仓库里的buzz/plugins/目录和plugins/AGENTS.md文档就是最好的入门教材。疑难排解速查表慢、不准、延迟高分别怎么办症状原因与对策转录速度太慢检查是否启用 GPU 加速换 Tiny/Base 小模型关掉吃资源的后台程序确认内存充足识别准确率不高排查音频底噪手动指定语言在初始提示里补充专业术语尝试 Medium 档位实时录音延迟明显把延迟参数调到 20–30 秒换外接麦克风关掉不必要的系统声音模型下载失败首次使用必须联网检查网络代理设置后重试导出字幕时间轴错乱确认转录时开启了单词级时间戳再使用 Resize 调整收尾一份可以立刻照做的行动清单 ✅按部就班走完这篇文章你已经具备了把 Buzz 用出生产力的所有知识。接下来建议这样推进按自己的系统完成安装打开主界面确认运行正常用一段 1 分钟内的短音频跑通导入 → 转录 → 导出全流程尝试验证不同模型档位找到自己场景下的效率/准确率平衡点下次开会时打开实时录音体验散会即出稿把常用批次整理成一个文件夹配置监控目录让转录真正自动化需要时按需启用插件把流水线调成自己的形状。工具是死的工作流是活的。把重复的听写交给 Buzz把时间留给真正需要判断力的事——这才是本地语音转文字工具存在的意义。现在就装一个用第一条录音开始吧。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

从 SKILL.md 到 scripts:如何给 CANNBot Skills 做一次设计与实现一致性体检

从 SKILL.md 到 scripts:如何给 CANNBot Skills 做一次设计与实现一致性体检

从 SKILL.md 到 scripts:如何给 CANNBot Skills 做一次设计与实现一致性体检 【免费下载链接】cannbot-skills CANNBot 是面向 CANN 开发的用于提升开发效率的系列智能体,本仓库为其提供可复用的 Skills 模块。 项目地址: https://gitcode.com/cann/ca…

2026/10/11 5:09:03 阅读更多 →
Windows远程桌面从零到精通:配置、优化与公网访问实战指南

Windows远程桌面从零到精通:配置、优化与公网访问实战指南

1. 项目概述:为什么远程桌面是刚需?在IT运维、远程办公或者家庭多设备管理的场景里,你肯定遇到过这样的麻烦:人在外面,需要紧急处理办公室电脑上的一个文件;或者家里的主力台式机性能强劲,但你想…

2026/10/8 5:05:13 阅读更多 →
文件转 Markdown 终极指南:用 MarkItDown 一条命令搞定 PDF、Word 与 Excel

文件转 Markdown 终极指南:用 MarkItDown 一条命令搞定 PDF、Word 与 Excel

文件转 Markdown 终极指南:用 MarkItDown 一条命令搞定 PDF、Word 与 Excel 【免费下载链接】markitdown Python tool for converting files and office documents to Markdown. 项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown MarkItDown 是…

2026/10/8 10:02:42 阅读更多 →

最新新闻

WeChatMsg 完整上手指南:3 种格式导出微信聊天记录,数据永久留在自己手里

WeChatMsg 完整上手指南:3 种格式导出微信聊天记录,数据永久留在自己手里

WeChatMsg 完整上手指南:3 种格式导出微信聊天记录,数据永久留在自己手里 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode…

2026/10/11 5:08:33 阅读更多 →
Python(Windows + Anaconda + VSCode)+Streamlit 简单学生成绩统计可视化看板(数据可视化)

Python(Windows + Anaconda + VSCode)+Streamlit 简单学生成绩统计可视化看板(数据可视化)

一、简介使用 Python、Pandas、Streamlit、Plotly 实现简单学生成绩统计静态数据看板。 通过代码自动生成模拟学生成绩数据集,完成数据清洗、指标统计、多类型图表可视化,最终在浏览器中展示完整可视化看板二、工程结构l/ ├─ main.py # 主程序…

2026/10/11 5:08:33 阅读更多 →
第2章:网络攻击原理与常用方法

第2章:网络攻击原理与常用方法

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 5:08:33 阅读更多 →
考研互助系统毕设全解析:需求、技术、代码与答辩

考研互助系统毕设全解析:需求、技术、代码与答辩

每年带到毕业设计的学生一多,就会发现一个现象:十个做Java毕设的人,八个做商城,六个做管理系统,剩下几个做“某某信息平台”。但“考研互助系统”这类题目,听着热闹,真正做出来的同学却不多。原…

2026/10/11 5:08:33 阅读更多 →
Python+Spring Boot+Vue3全栈实战:中药材商城库存管理系统设计与实现

Python+Spring Boot+Vue3全栈实战:中药材商城库存管理系统设计与实现

做了三个月的全栈项目,从一脸懵到系统上线,期间改了好几版库存算法,最后沉淀出一套能跑通完整业务链路的方案。这篇就以“python基于Spring Boot的中药材网上商城库存管理系统vue3”这个毕设/课设级项目为例,把技术选型思路、数据…

2026/10/11 5:08:33 阅读更多 →
使用ollama  openweb-ui 本地搭建自己的AI

使用ollama openweb-ui 本地搭建自己的AI

前言: ollama 是模型管理器,可以通过他 pull\create 创建ai模型 然后 通过run 跑 ai模型 进行对话(命令行) pull会很慢,可以 自己去下载 模型 需要下载资源:1.ollama 2. 需要的模型 (我这里下载…

2026/10/11 5:07:32 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →