ブラウザ内蔵の音声を使ってテキストを読み上げます。50 以上の言語に対応、音声インストール後はオフライン動作。
⚡ 端末内ボイス(オフライン) · 🌐 ネットワーク依存ボイス
このブラウザはファイルへの録音をサポートしていません。Chrome または Edge をご利用いただくか、ダウンロード可能な WAV のためにエンジン B(Piper)に切り替えてください。
Web Speech はブラウザ内でローカルに動作します。テキストはサーバーに送信されません(クラウドボイスはブラウザプロセス内でストリーミングします)。
本テキスト読み上げツールは、ブラウザ内で完結する 2 つの相補的エンジンを提供します。エンジン A(Web Speech)は OS にインストール済みの音声を利用します — 即時、ダウンロード不要、音声インストール後はオフラインで動作しますが、品質は OS によって異なり、低リソース言語のカバレッジは不均一です。エンジン B(Piper Neural via VITS)は初回使用時に Hugging Face からコンパクトな ONNX モデルを読み込み、onnxruntime-web 上で実行し、Google Cloud や Amazon Polly などの商用クラウド TTS に匹敵する音声を生成します。Piper は 35 以上の言語と 100 以上の音声をカバーし、ベトナム語(vais1000、vivos)、日本語、中国語(huayan)、韓国語、Web Speech では使える音声が無いことの多い低リソース欧州言語も含みます。Piper 音声を初めて選ぶと、品質プリセットに応じて通常 10〜60 MB のモデルがダウンロードされ、ブラウザの OPFS ストレージにキャッシュされます。以降の利用は即時でオフラインです。両エンジンとも言語別音声ピッカーを備え、Piper の出力はダウンロード可能な WAV ファイルで、動画エディターやポッドキャストワークフローに直接ドロップできます。
主要言語(英語・スペイン語・フランス語・ドイツ語・日本語・中国語)で素早いナレーションが必要かつ OS 同梱のニューラル音声で十分な場合は Web Speech をお使いください。Piper は以下の場合に推奨します: (1) 低リソース言語で Web Speech に使える音声がない、(2) 編集用にダウンロード可能な WAV が必要、(3) プラットフォーム間で一貫した品質が必要(Web Speech は Windows / macOS / Linux で聞こえ方が異なります)、(4) 機密内容で合成時のネットワーク呼び出しをゼロにしたい(Piper は一度のモデルダウンロード後はローカルで合成します)。