コーディングやコマンドラインなしでOpenAI Whisperを使用。 すべてのWhisperモデルを備えたシンプルなデスクトップインターフェース。オフラインでも、またはOpenAI APIでも動作します。
OpenAI Whisperは、OpenAIが2022年9月にリリースした自動音声認識(ASR)システムです。インターネットから収集された68万時間の多言語およびマルチタスクの教師ありデータでトレーニングされており、英語と多言語の両方の音声認識で新たなベンチマークを樹立しました。プロフェッショナルな精度に達するためにドメイン固有の微調整を必要とした以前の最先端のASRシステムとは異なり、Whisperのトレーニングデータの規模により、録音条件、アクセント、話し方、言語に対して強い堅牢性を持つ汎用モデルが生まれました。
OpenAI Whisper 音声認識の主な革新は新しいアーキテクチャではなく、標準的なエンコーダ-デコーダTransformerを使用しています。革新点は、トレーニングデータの規模とマルチタスクフレームにあります:このモデルは、96言語にわたる書き起こし、翻訳、言語識別、音声アクティビティ検出で同時にトレーニングされました。このマルチタスクトレーニングにより、より狭い音声分布でトレーニングされたモデルよりもはるかに優れた一般化が生まれます。
StarWhisperは、Pythonの依存関係を排除し、コマンドライン操作なしで非技術ユーザーでもローカルのWhisper処理を利用可能にするC++ランタイムである whisper.cpp を使用して、OpenAI Whisper 音声認識をWindowsデスクトップアプリケーションにパッケージ化しています。このページでは、Whisperの機能、モデルのバリエーション、およびStarWhisperが日常的な使用でそれらをどのように公開しているかについて説明します。
Whisperは、精度と速度のトレードオフが異なる5つのモデルサイズでリリースされています。作業にどのモデルを使用するかを理解することで、どちらの面でも不必要な妥協を避けることができます。
| モデル | パラメータ | 英語 WER | CPU速度(概算) | StarWhisperプラン |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x realtime | 無料(同梱) |
| base | 74M | ~10% WER | ~7x realtime | 無料(同梱) |
| small | 244M | ~5.5% WER | ~1x realtime | 無料(同梱) |
| medium | 769M | ~3.5% WER | ~0.3x realtime | Pro |
| large-v3 | 1.5B | ~2.5% WER | ~0.1x realtime | Pro |
WER = LibriSpeech クリーンテストセットでの単語誤り率。低いほど良いです。CPU速度は最新のデスクトップCPUでの概算値です。GPU速度は、mediumおよびlargeモデルで5〜10倍速くなります。
ほとんどのリアルタイム音声入力使用ケースにおいて、smallモデル(無料で同梱)は94〜96%の精度を達成し、処理速度はほぼリアルタイムの出力に十分な速さであり、GPUユーザーであっても私たちが推奨する実用的なデフォルトです。large-v3モデルは、長いファイルの一括書き起こしに最適であり、その長いセグメントでのトレーニングが計算に見合う価値を持ちます。短い音声入力クリップでは、large-v3は過度に修正を行い、smallよりも多くのハルシネーション(幻覚)を起こす傾向があります。
公式リポジトリからOpenAI Whisper 音声認識を実行するには、Python 3.9+、PyTorch、ffmpeg、およびGPUドライバーに一致した特定のCUDAツールキットバージョンが必要になることがよくあります。非開発者にとって、これは大きな障壁です。StarWhisperはこれを完全に排除します。whisper.cppランタイムは、インストーラにバンドルされたコンパイル済みのネイティブWindows実行可能ファイルです。StarWhisperをインストールして開き、書き起こします。ターミナル、パッケージマネージャー、バージョンの競合は一切ありません。
StarWhisperは、インストーラにtiny、base、smallモデルをバンドルしており、すぐに使用できます。Proサブスクライバーは、設定パネルからアプリ内で直接mediumおよびlarge-v3をダウンロードできます。モデルの管理、ダウンロード、切り替え、整合性の確認は、GUIを通じて行われ、手動でのファイル配置や設定は不要です。
StarWhisperはNVIDIA GPUを自動的に検出し、whisper.cpp推論を利用可能な場所でCUDAにルーティングします。GPUアクセラレーションにより、OpenAI Whisper 音声認識は、モデルサイズに応じてCPUのみの処理よりも5〜15倍高速になります。CPUではリアルタイムの10倍かかるlarge-v3モデルは、ミッドレンジのNVIDIA GPUでは約1.5〜2倍のリアルタイム速度で実行され、30分の録音が5時間ではなく25分以内で書き起こされることを意味します。
公式のOpenAI Whisperモデルはリアルタイムストリーミング用に設計されておらず、固定されたチャンクで音声を処理します。StarWhisperのストリーミングセグメンターは、3〜5秒のローリングウィンドウで音声を処理し、オーバーラップするコンテキストウィンドウを使用して精度を維持しながら、ほぼリアルタイムの出力を提供します。これは技術的にはバッチ処理よりも複雑ですが、ライブ音声入力ワークフローには不可欠です。その結果、アップロードされたファイルだけでなく、ライブ音声入力コンテキストでもOpenAI Whisper 音声認識の精度が得られます。
音声をOpenAIのサーバーに送信し、1分あたりの費用がかかるOpenAI Whisper APIを使用するとは異なり、StarWhisperのローカル実装では、すべての音声をデバイス内に保持します。ローカルWhisper処理のプライバシーとセキュリティの詳細については、オフライン音声認識 Windowsページを参照してください。
OpenAIは、音声1分あたり$0.006のクラウドAPIとしてWhisperを提供しています。一見すると安く思えますが、プロフェッショナルな使用で月4時間であれば$1.44です。しかし、この比較ではいくつかの重要な要素が無視されています。
OpenAI Whisper API ドキュメントがクラウドAPIのリファレンスです。クラウドのコストやプライバシーの影響なしに同じWhisper精度を求めるユーザーにとって、StarWhisperは実用的な代替手段です。
smallモデル(同梱、無料)を使用してください。CPUでほぼリアルタイムの速度、GPUではより高速で処理され、明瞭な音声で94〜96%の精度を提供します。ほとんどの音声入力タスク、メール、メモ、文書には、最小限の修正で十分です。
長時間のファイル書き起こし(講義、インタビュー、ポッドキャスト)でリアルタイムで待機しない場合は、GPU上のlarge-v3(Pro)が適切なツールです。余分なコンテキストは、困難な長い音声(アクセント、ノイズ、技術用語)に役立ちます。ライブ音声入力のデフォルトはsmallのままにしておき、バッチジョブ専用にlarge-v3に切り替えてください。短いクリップでは、large-v3は過度に修正する傾向があります。
非ラテン文字(CJK、アラビア文字、キリル文字)および長時間の多言語録音の場合、smallの多言語パフォーマンスがそれらの文字で低下する可能性があるため、mediumモデルがsmallからの適切なステップアップとなることがよくあります。言語ごとの推奨については、多言語音声認識ガイドを参照してください。
CPU上のmediumモデルは低速(0.3xリアルタイム)ですが、96〜97%の精度を達成します。これは、リアルタイムで待機しないバッチファイル書き起こしにとって許容範囲内です。smallよりも良い精度を求めるCPUユーザーは、積極的に待つのではなく、一括書き起こしを夜間に実行してください。
WindowsマシンでOpenAI Whisper 音声認識、無料で開始
StarWhisperをダウンロードOpenAI Whisperはモデル、つまりオープンソースの音声認識システムです。Whisper APIは、OpenAIのサーバーでモデルを実行し、1分あたりの料金を請求するクラウドサービスです。StarWhisperは、同じモデルをマシン上でローカルに実行し、音声の送信や1分あたりのコストは発生しません。
短いクリップの音声入力やほとんどの音声タイピング作業の場合、Smallモデルが私たちが推奨する実用的なデフォルトです。Large-v3はオープンソースリリースで最大の汎用Whisperモデルですが、短い音声では、より長いセグメントでトレーニングされたため、Smallよりも多くのハルシネーション(幻覚)を起こす傾向があります。長時間の音声や非ラチン文字(CJK、アラビア文字、キリル文字)にはMediumを使用してください。Large-v3は長いファイルの一括書き起こし専用に予約してください。新しい公式Whisperリリースも利用可能になり次第サポートされます。
StarWhisperはPython、CUDAツールキットの設定、コマンドライン操作を必要とせず、ライブ音声入力、ファイル書き起こし、モデル管理、ホットキー制御を備えたGUIを提供します。これは、プロフェッショナルなソフトウェアを使用することと研究コードを実行することの違いです。
Whisperはウェブオーディオ(医療講義、法的手続き、技術コンテンツを含む)でトレーニングされました。一般的な医療および法律用語を合理的に well(適切)に処理します。高度に特殊化された語彙の場合、精度はそれらの用語がトレーニングデータにどの程度頻繁に登場するかによって異なります。まれな技術用語には、編集後の修正が必要な場合があります。