transcribe.cpp
SHA-256一个 C/C++ 语音转文字推理库,支持 16 种模型家族,通过 GGUF/ggml 运行,支持 Metal/Vulkan/CUDA 加速。
轻量高性能的本地语音识别引擎,支持 16+ 模型家族。
核心功能
- 支持 16 个模型家族和 60+ 变体,包括 Parakeet、Whisper、Canary、Moonshine 等
- 基于 ggml 运行时,支持 Metal(Apple Silicon)、Vulkan 和 CUDA 硬件加速
- 内置 tinyBLAS 优化的 CPU 推理路径,无需 GPU 也能快速运行
- 官方提供 Python、TypeScript、Rust、Swift 绑定,便于集成
- 所有模型经过数值验证和 WER 测试,准确性有保障
避坑指南
- •音频输入必须为 16kHz 单声道 WAV,其他格式需用 ffmpeg 或 sox 转换
- •CPU 推理时建议安装 libopenblas-dev 以获得 10-15 倍解码加速
- •部分量化版本(如 Q4_K_M)会略微降低识别准确率,对精度要求高的场景建议使用 F16 或更高精度
- •目前不支持说话人分离(diarization),但 MOSS Transcribe-Diarize 变体例外
适用场景
- 在桌面应用或移动端内嵌离线语音识别功能,无需联网
- 服务器端高并发语音转写,利用 GPU 加速处理大量音频
详细介绍
transcribe.cpp 是一个轻量、高性能的语音转文字推理库,使用 C/C++ 编写。它支持超过 60 种变体,来自 16 个模型家族——包括 Parakeet、Whisper、Canary、Moonshine、SenseVoice 等——采用 GGUF 格式并基于 ggml 运行时。与 OpenAI Whisper(Python 繁重、依赖大)等大而全的方案不同,transcribe.cpp 是一个小巧、可嵌入的库,官方提供 Python、TypeScript、Rust 和 Swift 绑定。它利用 Metal(Apple Silicon)、Vulkan 和 CUDA 进行 GPU 推理,并包含 tinyBLAS 加速的 CPU 备选路径。每个已发布的模型都经过数值验证和 WER 测试,确保生产级准确性。项目采用 MIT 协议,并得到 Mozilla AI、Hugging Face 和 Modal 的支持。
标签
快速上手
安装软件
根据你的发行版安装对应的包(dpkg / rpm / AppImage)
下载预构建的二进制或从源码编译(cmake -B build && cmake --build build)
从 Hugging Face(handy-computer 组织)下载所需模型的 GGUF 文件
运行 transcribe-cli -m 模型路径 音频.wav(16kHz 单声道 WAV 格式)
- 下载预构建的二进制或从源码编译(cmake -B build && cmake --build build)
- 从 Hugging Face(handy-computer 组织)下载所需模型的 GGUF 文件
- 运行 transcribe-cli -m 模型路径 音频.wav(16kHz 单声道 WAV 格式)
已提供 SHA-256 校验码,下载后可自行核对文件完整性
该校验码提取自 GitHub 官方 Release 页面
SHA256 校验码
94c3914b2f8648a1d7c61a713b36ab05dfc38b8e6781ae13ecf841b559c77bff该校验码提取自 GitHub Release 页面,下载后请自行核对文件完整性
本平台所有 SHA-256 校验码均提取自项目在 GitHub 官方 Release 页面发布的文件,未做任何修改。你可以通过 GitHub Releases 页面自行验证。
开源透明
查看 GitHub 源码卸载说明
删除项目目录和编译产物即可。如果通过系统包管理器安装,请使用相应包管理器卸载。
无额外依赖
下载后即可直接使用,无需安装其他运行环境