【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载voxtral.c 是一个纯 C 实现的语音识别引擎基于 Mistral Voxtral Realtime 4B 模型能在 macOS 上直接从麦克风实时语音转文字。它零依赖、支持 Apple Silicon Metal GPU 加速文本随说话逐字流出支持中、英、日、法等 13 种语言。本文带你从零跑通对着麦克风说话文字实时蹦出来的完整流程。为什么选择 voxtral.c零依赖的纯 C 实时语音识别引擎大多数语音转文字工具需要 Python 运行时、PyTorch 甚至 vLLM而 voxtral.c 只依赖 C 标准库Metal GPU 加速在 Apple Silicon 上自动启用编码器解码器全程跑在 GPU 上比实时快约 2.5 倍滚动 KV 缓存内存有上限理论上可以无限长时间录音13 种语言EN、ES、FR、PT、HI、DE、NL、IT、AR、RU、ZH、JA、KO内存映射权重模型加载几乎是瞬间完成的项目结构见 README.md各模块分工清晰voxtral.c主推理、voxtral_encoder.c音频编码器、voxtral_decoder.c解码器、voxtral_kernels.cGPU 核函数。麦克风实时转文字原理AudioQueue 与环形缓冲区--from-mic背后的实现非常精简全部在 voxtral_mic_macos.c 一个文件里约 150 行默认麦克风 → AudioQueue(16kHz, 16位, 单声道) → 环形缓冲区(10秒) → 流式识别管线 → 逐字输出AudioQueue 线程macOS 系统采集服务每 100ms 回调一次把 s16le 音频转成浮点环形缓冲区容量 10 秒音频用 pthread 互斥锁保护采集线程写、主线程读静音检测你说停时自动跳过静音片段不浪费 GPU 算力识别管线本身是流式的音频 → Mel 频谱 → 编码器 → 降采样 4x → 解码器 → 文字 token每 80ms 的音频对应一个文字帧所以文字在你话音落下后几乎立刻出现。一键安装编译 voxtral.c 并下载模型最快配置方法第 1 步获取源码git clone https://gitcode.com/gh_mirrors/vo/voxtral.c cd voxtral.c第 2 步按你的 Mac 选择编译后端编辑规则都在 Makefile 里Apple Silicon 机器推荐 MPSMetal GPU最快make mps # Apple SiliconM1/M2/M3/M4推荐 make blas # Intel Mac走 Accelerate 框架编译完成后得到./voxtral可执行文件不需要装任何 Python 包。第 3 步下载模型./download_model.sh脚本download_model.sh会下载约 8.9GB 的模型到./voxtral-model/目录包含 BF16 权重、Tekken 分词器和模型配置。建议留足磁盘空间内存最好 16GB 以上GPU 权重缓存约 8.4GB。麦克风实时语音转文字3 步跑起来一切就绪后只需要一条命令./voxtral -d voxtral-model --from-mic看到Model loaded.后就可以开口说话了终端里文字会随你的语速逐字打印出来按CtrlC停止。下面的演示动画展示的就是 voxtral.c 的实时语音转文字效果——命令执行后转写文本立即开始流式输出macOS 首次运行时系统会弹出麦克风权限请求点允许即可。识别用的是系统默认麦克风想换设备可先在系统设置 → 声音 → 输入中切换。 如果模型一时跟不上实时语速程序会打印警告并自动跳过积压的音频继续追上来不会卡死。降低延迟用 -I 参数调节实时转写速度-I控制编码器每隔多少秒处理一次累积的音频是延迟与效率的关键旋钮./voxtral -d voxtral-model --from-mic -I 1.0 # 延迟更低文字出现更快 ./voxtral -d voxtral-model --from-mic # 默认 2.0 秒默认2.0 秒实时转写体验良好是最佳起点1.0 ~ 2.0 秒实时流的推荐区间低于 0.5 秒不推荐。每次编码器调用有约 50ms 固定开销切太碎反而拖慢 GPU 整体效率想进一步压榨延迟时把-I调到 1.0 左右就是甜点区再低收益递减。进阶玩法监控模式与常用命令速查命令作用--monitor输出 unicode 状态符号实时看编码器/解码器在干什么--silent静默模式stdout 只剩转写文字方便重定向保存--alt 0.95显示相近候选词模型不确定时对比选择--debug逐层逐块调试信息例如把会议录音实时存成文字./voxtral -d voxtral-model --from-mic -I 1.0 --silent meeting.txt--monitor模式下一个健康的流转长这样▶·▪▪▶▪▪——编码器块和快速解码批次交替出现。如果频繁看到⚠、☠说明解码压力过大试试调大-I。另外Linux 或想处理任意格式音频时可以用管道替代麦克风--stdin从标准输入读音频配合 ffmpeg 即可转写 MP3、OGG 等任何格式示例音频见 samples/test_speech.wav。常见问题 FAQQ编译make mps报错确认是 Apple Silicon 机型uname -m应显示arm64Intel Mac 请改用make blas。Q--from-mic在 Linux 上能用吗不能麦克风采集目前仅支持 macOS基于 AudioQueue。Linux 上可用--stdin ffmpeg 管道方案。Q文字出现要等好几秒调低-I如 1.0并确认用的是make mps版本BLAS 后端解码约 335ms/步不适合实时场景。Q支持哪些语言中、英、日、韩、西、法、葡、德、荷、意、阿、俄、印地共 13 种直接说对应语言即可。至此你已经在 Mac 上拥有了一个零依赖、GPU 加速的麦克风实时语音转文字工具。想深入理解模型细节可以读一读自包含的参考实现 python_simple_implementation.py 和 MODEL.md。赞分享【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载相关推荐麦克风实时输入Vosk-api即时语音转录实现麦克风实时输入Vosk api即时语音转录实现 你还在为实时语音转录依赖云端服务而烦恼吗当网络延迟导致语音转文字不同步当隐私数据经过第三方服务器时的安全隐人工智能语音IoT-For-Beginners 虚拟设备实战用 Python 语音 SDK 把麦克风语音实时转换为文本IoT For Beginners 虚拟设备实战用 Python 语音 SDK 把麦克风语音实时转换为文本 本篇技术指南基于 IoT For Beginner教程文档教育物联网嵌入式用 Candle 实现麦克风实时语音转写whisper-microphone 示例深度解读用 Candle 实现麦克风实时语音转写whisper microphone 示例深度解读 本篇技术指南以 candle examples/examples/人工智能大模型机器学习深度学习本地部署模型推理服务创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考