あなたの言語で音声認識。マラーティー語、ヒンディー語、グジャラート語、タミル語、マラヤーラム語、アラビア語、日本語など、90以上の言語をサポートします。 言語パックは不要です。
多言語音声テキスト変換は、音声技術において最も過大宣伝され、実態が伴っていない機能の1つです。ソフトウェア会社は機能ページで「99の対応言語」を掲げながら、実際には多くの言語でのパフォーマンスが低下するという事実を隠しています。1日中スペイン語と英語を切り替えるバイリンガルの専門家や、アラビア語で行われたインタビューを文字起こしする研究者にとって、そのギャップはツールを unusable にする可能性があります。
OpenAI Whisper は2022年に公開された際、この状況を変えました。ウェブから収集した680,000時間の多言語オーディオでトレーニングされており、主要なクラウドプロバイダーのAPI以外で最も広くトレーニングされた公開音声認識モデルです。重要な違いは、Whisper が言語識別と文字起こしをネイティブに連携して処理する単一のモデルであることです。「フランス語用 Whisper」や「日本語用 Whisper」は存在しません。同じモデルが96の言語を処理し、英語と主要な世界の言語間の品質格差は、古いシステムに比べてはるかに狭くなっています。
StarWhisper は、この多言語音声テキスト変換機能を実用的で設定不要のデスクトップアプリケーションとして Windows にもたらします。Python、コマンドライン、技術的なセットアップは不要です。言語を選択し、ホットキーを押して、話すだけです。このページでは、何が機能し、何が機能しないのか、そして異なるモデルサイズとユースケースで多言語音声文字起こしから最高の結果を得る方法についての現実的なガイドを提供します。
研究者、国際ビジネスの専門家、コンテンツクリエイター、バイリンガルユーザーはそれぞれ、多言語文字起こしツールに異なるニーズを持っています。ここでは、実際に重要な機能を挙げます。
英語は上手く処理できるが、第2言語では苦戦するツールは、多言語作業にとって本当に有用ではありません。言語間の品質格差が実用範囲内である程度小さいエンジンが必要です。Whisper の大規模モデルは通常、主要な世界の言語でより良いパフォーマンスを発揮しますが、出力は依然としてオーディオの品質と言語のカバレッジに依存します。
録音間で言語設定を手動で切り替えることは、ワークフローを妨げる摩擦です。優れた多言語音声テキスト変換ツールは、オーディオ自体から話されている言語を識別し、セッションごとに事前に宣言することを要求すべきではありません。
国際チームは、ソース言語に関係なく、会議議事録、インタビューのトランスクリプト、研究結果を英語で必要とすることがよくあります。音声から英語への翻訳機能が組み込まれていることで、以前は文字起こしその後別の翻訳ツールを必要としたワークフローから手動ステップが削除されます。
文字起こしに分単位で課金されるクラウドサービスは、多くの場合、非英語言語に追加料金を課したり、同じ料金を請求しながらパフォーマンスを低下させたりします。すべての言語に均等に適用される定額制料金のみが、多言語ワークフローを経済的に予測可能にする唯一のモデルです。
多言語ユーザーは、異なるデータ所在法を持つ国々で業務を行う可能性が高くなります。米国のサーバーで処理されたフランスのビジネスオーディオは、GDPR の問題を引き起こす可能性があります。ローカルのオフライン処理は、このようなクロスボーダーのコンプライアンスの問題を完全に排除します。
実際のバイリンガルスピーチは、文中で言語を混在させることがよくあります。「So the meeting was at 3 o'clock, aber wir haben keine Einigung erreicht(しかし合意には至りませんでした)」は、ドイツのビジネス環境では自然です。成熟した多言語エンジンは、主要なトランスクリプトを見失うことなく、これらの言語切り替えを処理できます。
古い音声認識アーキテクチャは、各言語に対して別々の音響モデルを維持していました。日本語には日本語のモデル、アラビア語にはアラビア語のモデル、といった具合です。これは組合せ的なスケーリングの問題を引き起こしました。20の言語をサポートするには20のモデル、20のメンテナンス負担、そして各言語への投資量に応じて変動する品質が意味するということです。
Whisper は異なる動作をします。それは多言語データで同時にトレーニングされた単一のエンコーダー・デコーダー Transformer です。モデルは、文字起こしの一部として言語識別を処理することを学習し、別のステップとしては扱いません。StarWhisper をインストールして大規模モデルをダウンロードすると、サポートされる96の言語すべてに対する機能的な多言語音声テキスト変換を、単一の 3GB ファイルで入手できます。フランス語のアドオンや日本語の言語パックはありません。
StarWhisper の自動検出モードは、文字起こしが始まる前に、最初のオーディオセグメントから話されている言語を識別するように Whisper に要求します。主要な世界の言語については、この識別は通常、信頼性が高く高速です。ボイスメモを録音し、文字起こしして、設定を開くことなく、ソース言語でフォーマットされた出力を受け取ることができます。
自動検出は、少数言語、主要な言語と音韻的特徴を共有する地域方言、非常に短い録音では信頼性が低くなります。それらの場合、設定で言語を明示的に設定すると、より一貫した結果が得られます。検出精度はモデルにも依存します。大規模モデルの言語識別は、特に Whisper のトレーニングデータが限られている言語において、小規模モデルよりも有意に優れています。
StarWhisper には、文字起こしと翻訳を1回のパスで実行する「英語に翻訳」モードが含まれています。これは、テキストを別の翻訳 API にルーティングする後処理ステップではなく、Whisper モデル自体の直接の機能です。フランス語を話せば、英語を受け取ります。日本語を話せば、英語を受け取ります。翻訳品質は主要な言語では強力で、ほとんどの専門的なユースケースには適していますが、出版物品質の翻訳にはネイティブスピーカーによるレビューが必要です。
これは、国際的な研究チーム、英語のドキュメント標準化を目指す多国籍企業、外国語のオーディオコンテンツを素早く理解したいコンテンツクリエイターに関連します。ローカルパイプラインは、プライベートなソース言語のオーディオワークフローのためにデバイス上で実行できます。
モデルの選択は、単純な英語のディクテーションよりも多言語音声において、より大きな役割を果たします。小規模モデルは、カバレッジの良いラテンスクリプト言語(ドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語など)でのライブディクテーションにおいて、実用的なデフォルトです。非ラテンスクリプト(CJK、アラビア語、キリル文字)とリソースの少ない言語については、中規模モデルへのステップアップが通常適切です。
Pro ユーザーは large-v2 および large-v3 モデルにアクセスできます。これらは、短いライブクリップよりも長形式の多言語録音のバッチ文字起こしに最適です。短いディクテーション断片では、大規模モデルは過剰修正を行う可能性があります。それらは、余分なコンテキストが計算コストに見合うファイルのために予約してください。NVIDIA GPU を搭載しているユーザーは、CPUのみのシステムよりも大規模モデルのオーディオを有意に高速に処理できるため、長形式の多言語コンテンツがより実用的になります。
StarWhisper は、必要なモデルが利用可能になった後、ローカルで多言語文字起こしを処理できます。多言語文字起こしに、ローカルワークフロー用の別のクラウド言語サービスは必要ありません。これは、クロスボーダーデータコンプライアンスに関連します。クライアントの会話を文字起こすドイツの弁護士、ソースへのインタビューを行うフランスのジャーナリスト、機密性の高いインタビューデータを処理する韓国の研究者はすべて、コンテンツの言語に関係なく、ローカル処理の恩恵を受けることができます。プライバシーに関する考慮事項の詳細については、オフライン音声テキスト変換ガイドを参照してください。
多言語文字起こしの状況には、実際のトレードオフを持つ3つの明確なカテゴリがあります。
| ツール | 言語 | 処理 | 料金 | 非英語精度 |
|---|---|---|---|---|
| StarWhisper (large) | 96の言語 | 100% ローカル | $10/月 定額 | 様々 |
| Google Cloud Speech | 100以上の言語 | クラウドアップロード | $0.016/分以上 | 様々 |
| Otter.ai | 英語中心 | クラウドアップロード | $16.99/月 | 制限あり |
| Whisper CLI (raw) | 96の言語 | 100% ローカル | 無料 | 様々 |
| Azure Speech | 100以上の言語 | クラウドアップロード | $0.017/分 | 様々 |
Whisper CLI の生の環境は、同じ基盤モデルを共有しているため、StarWhisper と同一の文字起こし品質を生成します。StarWhisper が追加しているのは、Windows デスクトップ UX、リアルタイムのマイクディクテーション、フローティングウィジェット、GPU アクセラレーションの事前設定、任意のアプリケーションへの自動テキスト挿入です。生の Whisper と StarWhisper の選択は、ツールを欲するか、ワークフローを欲するかの問題です。
Whisper の多言語精度ベンチマークは、言語グループ別の詳細な単語エラー率表を含む arXiv のオリジナル Whisper 論文で文書化されています。Whisper のトレーニングカバレッジが強い欧州言語は、通常、大規模なローカルモデルで良好にパフォーマンスを発揮します。リソースの少ない言語については、それらの言語に特別に投資しているクラウドシステムがまだ優位性を持っている可能性があります。
StarWhisper の設定で言語を明示的に設定してください。明示的な選択は自動検出よりもわずかに高速で、短いオーディオクリップが誤認識されるまれなケースを回避できます。カバレッジの良いラテンスクリプト言語(ドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語など)については、小規模モデルが実用的なデフォルトです。非ラテンスクリプトとリソースの少ない言語については、中規模にステップアップしてください。大規模モデルは、長形式の録音のバッチ文字起こしに最適です。短いライブディクテーションでは、小規模モデルの方が同等以上にパフォーマンスを発揮することがよくあります。
大規模モデルで自動検出モードを使用してください。StarWhisper は各録音から言語を自動的に識別できます。言語を切り替えるリアルタイムディクテーションセッションでは、言語が事前設定された2つの StarWhisper プロファイルを作成し、必要に応じて切り替えます。これは、高速な切り替えに対して検出に依頼するよりも高速です。ワークフローの設定の詳細については、音声テキスト変換ソフトウェアの概要を参照してください。
「英語に翻訳」オプションを有効にします。これにより、非英語音声から直接、別の翻訳サービスを経由することなく英語テキストが生成されます。ほとんどの専門的なユースケースでは、翻訳品質はメモ、要約、作業文書に十分なものです。法的または出版のコンテキストでは、ネイティブスピーカーに出力をレビューしてもらってください。翻訳品質は、Whisper トレーニングセットでよく表現されているスペイン語、フランス語、ドイツ語、ポルトガル語、イタリア語、その他の言語で最も高くなります。
StarWhisper のローカル処理により、モデルが利用可能になった後、オーディオをデバイス上に保持してオフラインワークフローを行うことができます。これは、ヨーロッパでの GDPR に敏感な業務、オーディオが国境を越えるべきではない状況での機密性の高い研究、法的管轄区に関係なく主題に機密性が求められる専門的なコンテキストに関連します。完全なプライバシー画像については、オフライン音声テキスト変換ページを参照してください。
StarWhisper を多言語使用に設定するには約10分かかります。そのほとんどはモデルのダウンロードの待ち時間です。その後、継続的な設定は一切不要です。
Windows 用多言語音声テキスト変換。ローカルオフラインワークフロー対応。
StarWhisper 無料版をダウンロードWhisper はコードスイッチングをそれなりに適切に処理しますが、単一の言語の完全な文は、密集した言語混合よりも正確な出力を生成します。メモをディクテーションしていて自然に言語を切り替える場合は問題ありません。2つの言語を長いブロックで交互に切り替える録音を処理する場合は、文字起こしの前に言語セクションごとにオーディオを分割すると、よりクリーンな結果が得られます。
古いシステムに対する Whisper の堅牢性の利点は、英語で最大です。非英語言語では、ノイズと圧縮アーティファクトが精度に与える悪影響が大きくなります。背景ノイズのある録音については、StarWhisper にオーディオを供給する前に、音声増強やノイズ除去の前処理(Audacity のノイズ除去のような無料ツールであっても)により、多言語文字起こしの精度が有意に向上する可能性があります。
自動検出は便利ですが、わずかな処理オーバーヘッドが追加されます。1日の大半を1つの言語で文字起こしに費やす場合は、明示的に設定してください。自動検出は、録音がどの言語であるか本当にわからない場合や、混合言語ファイルのバッチ処理のために予約してください。
Whisper は、ほとんどの主要な言語に対して、言語に適した句読点と大文字化を適用します。ドイツ語の名詞は自動的に大文字になります。フランス語の句読点の間隔規則は概ね遵守されます。日本語の出力は適切な漢字、ひらがな、カタカナを使用します。ただし、正式な文書では、一般的ではない句読点や固有名詞の大文字化について、言語固有の規則の最終確認が価値あります。
StarWhisper は Whisper エンジンを通じて96の言語をサポートしています。アプリには設定ドロップダウンに29以上の言語のプリセットが含まれています。それ以外の言語は ISO コードで選択できます。言語精度は Whisper トレーニングデータの利用可能性によって異なり、主要な世界の言語が最も高いパフォーマンスを発揮します。
はい。自動検出モードは、文字起こしが始まる前にオーディオの最初の数秒から話されている言語を識別します。主要な言語については検出が信頼できます。音韻的特徴を共有する少数言語や地域方言については、言語を手動で選択するとより一貫した結果が得られます。
いいえ。Whisper は、すべての96の言語を処理する単一のモデルです。large-v3 モデルをダウンロードすると、すべての言語で完全な多言語機能が得られます。言語ごとのモデルファイルや言語パックのダウンロードはありません。
はい。設定で「英語に翻訳」を有効にすると、非英語音声から英語テキスト出力を受け取れます。翻訳には Whisper の組み込み翻訳機能が使用され、完全にローカルで実行されます。品質は主要な欧州・東アジア言語で最も高くなります。正式な文書の場合は、ネイティブスピーカーによるレビューが推奨されます。
Whisper のカバレッジが強いラテンスクリプト言語(ドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語など)には、小規模モデルが実用的なデフォルトです。非ラテンスクリプト(CJK、アラビア語、キリル文字)とリソースの少ない言語には、中規模にステップアップしてください。大規模は長形式の多言語録音のバッチ文字起こしに最適です。短いクリップでは、小規模モデルの方がパフォーマンスが高いことがよくあります。
はい、必要なモデルが利用可能になった後のローカルワークフローでは機能します。サポートされている言語のオーディオは、別のクラウド言語サービスなしでローカルで処理できます。
Whisper は、言語が音韻的に異なる場合、文内の言語混合(コードスイッチング)をそれなりに適切に処理します。ドイツ語のトランスクリプトにおける英語の専門用語や、英語のインタビューにおけるフランス語のフレーズは、通常、正しく文字起こしされます。長いセクションで2つの言語を切り替える録音については、文字起こしの前に言語セクションごとにオーディオを分割すると、よりクリーンな結果が得られます。
Windows 用の本格的な多言語音声テキスト変換。96の言語、1つのモデル、ローカルオフラインワークフロー。無料で始められ、アカウントは不要です。