voicebox
SHA-256オープンソースAI音声スタジオ、ローカルで音声のクローン、生成、ディクテーション入力が可能で、ElevenLabs と WisprFlow の無料代替品です。
スマートダウンロード
Download 版をダウンロード
v0.5.0 · 560.1 MB
ローカルで動作するオープンソースの音声スタジオ。クローン、生成、ディクテーションを一体化し、プライバシーも安心。
主な機能
- 7種類のTTSエンジン(Qwen3-TTS、Chatterbox等)をサポート、23言語
- ゼロショット音声クローン、数秒の音声からクローン可能
- グローバルホットキーによるディクテーション、あらゆるアプリのテキストボックスに対応
- AIエージェントへの音声出力(MCPプロトコル)
- 後処理エフェクター(ピッチシフト、リバーブ、ディレイ等)
できないこと
- •初回使用時にはモデルのダウンロード(約2~8GB)が必要です。ネットワークが安定していることを確認してください。2. Linuxでは現在プリコンパイル済みのバイナリが提供されていないため、ソースコードからビルドする必要があります(公式ガイドを参照)。3. 一部のTTSエンジン(Chatterbox Turboなど)は高いGPUメモリを必要とします(推奨4GB以上)。CPUでも動作可能ですが、速度は遅くなります。4. グローバルディクテーション用のホットキーは、一部のLinuxデスクトップ環境では追加設定が必要な場合があります。
使用例
- コンテンツクリエイター:動画・ポッドキャスト向け多言語ナレーションを生成
- 開発者:個人用AIアシスタントやチャットボットに音声機能を追加
- アクセシビリティ支援:キーボード入力の代わりにディクテーションで効率向上
詳細説明
Voiceboxは、ローカル優先のAI音声スタジオであり、ElevenLabsやWisprFlowのオープンソース代替品です。数秒の音声から声をクローンでき、23言語、7つのTTSエンジンに対応した音声生成、グローバルホットキーによるディクテーション入力、MCP対応のAIエージェントへの音声出力を実現します。すべての処理はローカルで実行され、完全なプライバシーを確保します。クラウド大手とは異なり、Voiceboxは入力と出力を統合し、内蔵のローカル大規模モデルによる精緻化と個人設定により、インターネット接続なしで完全な音声I/Oフローを完了できます。
タグ
はじめ方
ソフトウェアをインストール
ダウンロードした dmg ファイルを開き、アプリを Applications にドラッグ
オペレーティングシステムに応じて対応するインストールパッケージをダウンロードしてください(macOSの場合はDMG、Windowsの場合はMSIをダウンロード)
インストールパッケージをダブルクリックし、指示に従ってインストールを完了してください(macOSの場合はアプリケーションをApplicationsフォルダにドラッグ)
初回起動後、アプリは自動的に必要なモデルをダウンロードします。しばらくお待ちいただければご利用いただけます
- オペレーティングシステムに応じて対応するインストールパッケージをダウンロードしてください(macOSの場合はDMG、Windowsの場合はMSIをダウンロード)
- インストールパッケージをダブルクリックし、指示に従ってインストールを完了してください(macOSの場合はアプリケーションをApplicationsフォルダにドラッグ)
- 初回起動後、アプリは自動的に必要なモデルをダウンロードします。しばらくお待ちいただければご利用いただけます
SHA-256 チェックサム確認済み
GitHub 公式 Release ページから抽出されたチェックサム
SHA256 チェックサム
44d883cde3c3179907f31af54908727a0d7e3a4f99f6bad8be791fbc810d6fc3このチェックサムは GitHub Release ページから抽出されたものです。ダウンロード後にファイルの整合性を確認してください。
本プラットフォーム上のすべての SHA-256 チェックサムは、プロジェクトの公式 GitHub Release ページから抽出されたもので、一切の改変はありません。GitHub Releases ページで独自に検証できます。
オープンソースの透明性
GitHub ソースを見るアンインストール情報
macOS:Voicebox を Applications フォルダからゴミ箱にドラッグします。
追加の依存関係なし
ダウンロード後すぐに使用可能。追加のランタイムは不要です。