✨ OpenAI Whisper 技術

OpenAI Whisper
デスクトップインターフェース
for Windows

コーディングやコマンドラインなしでOpenAI Whisperを使用。 すべてのWhisperモデルを備えたシンプルなデスクトップインターフェース。オフラインでも、またはOpenAI APIでも動作します。

Windows版をダウンロード
Microsoft Store
  • Windowsによる信頼
  • わずか30秒でセットアップ
その他
"OpenAI Whisper 実行中..."

OpenAI Whisper 音声認識とは何ですか?

OpenAI Whisperは、OpenAIが2022年9月にリリースした自動音声認識(ASR)システムです。インターネットから収集された68万時間の多言語およびマルチタスクの教師ありデータでトレーニングされており、英語と多言語の両方の音声認識で新たなベンチマークを樹立しました。プロフェッショナルな精度に達するためにドメイン固有の微調整を必要とした以前の最先端のASRシステムとは異なり、Whisperのトレーニングデータの規模により、録音条件、アクセント、話し方、言語に対して強い堅牢性を持つ汎用モデルが生まれました。

OpenAI Whisper 音声認識の主な革新は新しいアーキテクチャではなく、標準的なエンコーダ-デコーダTransformerを使用しています。革新点は、トレーニングデータの規模とマルチタスクフレームにあります:このモデルは、96言語にわたる書き起こし、翻訳、言語識別、音声アクティビティ検出で同時にトレーニングされました。このマルチタスクトレーニングにより、より狭い音声分布でトレーニングされたモデルよりもはるかに優れた一般化が生まれます。

StarWhisperは、Pythonの依存関係を排除し、コマンドライン操作なしで非技術ユーザーでもローカルのWhisper処理を利用可能にするC++ランタイムである whisper.cpp を使用して、OpenAI Whisper 音声認識をWindowsデスクトップアプリケーションにパッケージ化しています。このページでは、Whisperの機能、モデルのバリエーション、およびStarWhisperが日常的な使用でそれらをどのように公開しているかについて説明します。

OpenAI Whisper モデルサイズ:どれが必要ですか?

Whisperは、精度と速度のトレードオフが異なる5つのモデルサイズでリリースされています。作業にどのモデルを使用するかを理解することで、どちらの面でも不必要な妥協を避けることができます。

モデル パラメータ 英語 WER CPU速度(概算) StarWhisperプラン
tiny 39M ~14% WER ~10x realtime 無料(同梱)
base 74M ~10% WER ~7x realtime 無料(同梱)
small 244M ~5.5% WER ~1x realtime 無料(同梱)
medium 769M ~3.5% WER ~0.3x realtime Pro
large-v3 1.5B ~2.5% WER ~0.1x realtime Pro

WER = LibriSpeech クリーンテストセットでの単語誤り率。低いほど良いです。CPU速度は最新のデスクトップCPUでの概算値です。GPU速度は、mediumおよびlargeモデルで5〜10倍速くなります。

ほとんどのリアルタイム音声入力使用ケースにおいて、smallモデル(無料で同梱)は94〜96%の精度を達成し、処理速度はほぼリアルタイムの出力に十分な速さであり、GPUユーザーであっても私たちが推奨する実用的なデフォルトです。large-v3モデルは、長いファイルの一括書き起こしに最適であり、その長いセグメントでのトレーニングが計算に見合う価値を持ちます。短い音声入力クリップでは、large-v3は過度に修正を行い、smallよりも多くのハルシネーション(幻覚)を起こす傾向があります。

StarWhisperがOpenAI Whisper 音声認識を提供する方法

1. Python不要、設定の複雑さも不要

公式リポジトリからOpenAI Whisper 音声認識を実行するには、Python 3.9+、PyTorch、ffmpeg、およびGPUドライバーに一致した特定のCUDAツールキットバージョンが必要になることがよくあります。非開発者にとって、これは大きな障壁です。StarWhisperはこれを完全に排除します。whisper.cppランタイムは、インストーラにバンドルされたコンパイル済みのネイティブWindows実行可能ファイルです。StarWhisperをインストールして開き、書き起こします。ターミナル、パッケージマネージャー、バージョンの競合は一切ありません。

2. すべての5つのモデルサイズにアクセス可能

StarWhisperは、インストーラにtiny、base、smallモデルをバンドルしており、すぐに使用できます。Proサブスクライバーは、設定パネルからアプリ内で直接mediumおよびlarge-v3をダウンロードできます。モデルの管理、ダウンロード、切り替え、整合性の確認は、GUIを通じて行われ、手動でのファイル配置や設定は不要です。

3. 自動NVIDIA CUDAアクセラレーション

StarWhisperはNVIDIA GPUを自動的に検出し、whisper.cpp推論を利用可能な場所でCUDAにルーティングします。GPUアクセラレーションにより、OpenAI Whisper 音声認識は、モデルサイズに応じてCPUのみの処理よりも5〜15倍高速になります。CPUではリアルタイムの10倍かかるlarge-v3モデルは、ミッドレンジのNVIDIA GPUでは約1.5〜2倍のリアルタイム速度で実行され、30分の録音が5時間ではなく25分以内で書き起こされることを意味します。

4. ライブ音声入力のためのリアルタイムストリーミング

公式のOpenAI Whisperモデルはリアルタイムストリーミング用に設計されておらず、固定されたチャンクで音声を処理します。StarWhisperのストリーミングセグメンターは、3〜5秒のローリングウィンドウで音声を処理し、オーバーラップするコンテキストウィンドウを使用して精度を維持しながら、ほぼリアルタイムの出力を提供します。これは技術的にはバッチ処理よりも複雑ですが、ライブ音声入力ワークフローには不可欠です。その結果、アップロードされたファイルだけでなく、ライブ音声入力コンテキストでもOpenAI Whisper 音声認識の精度が得られます。

5. 完全なオフライン動作

音声をOpenAIのサーバーに送信し、1分あたりの費用がかかるOpenAI Whisper APIを使用するとは異なり、StarWhisperのローカル実装では、すべての音声をデバイス内に保持します。ローカルWhisper処理のプライバシーとセキュリティの詳細については、オフライン音声認識 Windowsページを参照してください。

OpenAI Whisper 音声認識とクラウドAPIの主な違い

OpenAIは、音声1分あたり$0.006のクラウドAPIとしてWhisperを提供しています。一見すると安く思えますが、プロフェッショナルな使用で月4時間であれば$1.44です。しかし、この比較ではいくつかの重要な要素が無視されています。

OpenAI Whisper API ドキュメントがクラウドAPIのリファレンスです。クラウドのコストやプライバシーの影響なしに同じWhisper精度を求めるユーザーにとって、StarWhisperは実用的な代替手段です。

使用例に適したWhisperモデルの選択

日々の音声入力(高速な応答が必要)

smallモデル(同梱、無料)を使用してください。CPUでほぼリアルタイムの速度、GPUではより高速で処理され、明瞭な音声で94〜96%の精度を提供します。ほとんどの音声入力タスク、メール、メモ、文書には、最小限の修正で十分です。

長時間録音の一括ファイル書き起こし

長時間のファイル書き起こし(講義、インタビュー、ポッドキャスト)でリアルタイムで待機しない場合は、GPU上のlarge-v3(Pro)が適切なツールです。余分なコンテキストは、困難な長い音声(アクセント、ノイズ、技術用語)に役立ちます。ライブ音声入力のデフォルトはsmallのままにしておき、バッチジョブ専用にlarge-v3に切り替えてください。短いクリップでは、large-v3は過度に修正する傾向があります。

非ラテン文字および長時間の多言語コンテンツ

非ラテン文字(CJK、アラビア文字、キリル文字)および長時間の多言語録音の場合、smallの多言語パフォーマンスがそれらの文字で低下する可能性があるため、mediumモデルがsmallからの適切なステップアップとなることがよくあります。言語ごとの推奨については、多言語音声認識ガイドを参照してください。

精度要件のあるCPUのみのマシン

CPU上のmediumモデルは低速(0.3xリアルタイム)ですが、96〜97%の精度を達成します。これは、リアルタイムで待機しないバッチファイル書き起こしにとって許容範囲内です。smallよりも良い精度を求めるCPUユーザーは、積極的に待つのではなく、一括書き起こしを夜間に実行してください。

設定:StarWhisper経由のOpenAI Whisper 音声認識

  1. StarWhisperをダウンロード:starwhisper.aiから。フルインストーラには、すぐに使用できるsmallモデルが含まれています。
  2. 起動して設定: StarWhisperはGPUを自動検出します。デフォルトのモデルはすぐにアクティブになります。基本的な使用には追加のダウンロードは不要です。
  3. Proユーザーの場合: 設定 > モデルに移動し、mediumまたはlarge-v3をダウンロードします。ダウンロードはモデルリポジトリから直接行われます。高速接続での一般的なダウンロード時間は、モデルサイズに応じて2〜10分です。
  4. 動作モードを選択: 録音の場合はファイル書き起こし、ライブ音声の場合は音声入力ウィジェットを有効にします。両方とも同じ現在選択されているWhisperモデルを使用します。
  5. 書き起こし: OpenAI Whisper 音声認識がローカルで実行され、選択した言語で出力を生成します。オプションでタイムスタンプや翻訳も可能です。

WindowsマシンでOpenAI Whisper 音声認識、無料で開始

StarWhisperをダウンロード

FAQ:OpenAI Whisper 音声認識

OpenAI WhisperとOpenAI Whisper APIの違いは何ですか?

OpenAI Whisperはモデル、つまりオープンソースの音声認識システムです。Whisper APIは、OpenAIのサーバーでモデルを実行し、1分あたりの料金を請求するクラウドサービスです。StarWhisperは、同じモデルをマシン上でローカルに実行し、音声の送信や1分あたりのコストは発生しません。

日々使用するべきWhisperモデルはどれですか?

短いクリップの音声入力やほとんどの音声タイピング作業の場合、Smallモデルが私たちが推奨する実用的なデフォルトです。Large-v3はオープンソースリリースで最大の汎用Whisperモデルですが、短い音声では、より長いセグメントでトレーニングされたため、Smallよりも多くのハルシネーション(幻覚)を起こす傾向があります。長時間の音声や非ラチン文字(CJK、アラビア文字、キリル文字)にはMediumを使用してください。Large-v3は長いファイルの一括書き起こし専用に予約してください。新しい公式Whisperリリースも利用可能になり次第サポートされます。

PythonでWhisperを直接実行するのではなくStarWhisperを使用する理由は何ですか?

StarWhisperはPython、CUDAツールキットの設定、コマンドライン操作を必要とせず、ライブ音声入力、ファイル書き起こし、モデル管理、ホットキー制御を備えたGUIを提供します。これは、プロフェッショナルなソフトウェアを使用することと研究コードを実行することの違いです。

OpenAI Whisperは医療や法律の専門用語を処理できますか?

Whisperはウェブオーディオ(医療講義、法的手続き、技術コンテンツを含む)でトレーニングされました。一般的な医療および法律用語を合理的に well(適切)に処理します。高度に特殊化された語彙の場合、精度はそれらの用語がトレーニングデータにどの程度頻繁に登場するかによって異なります。まれな技術用語には、編集後の修正が必要な場合があります。