CUDA、Vulkan、CPUバックエンドを備えたビルド済みインストーラー。コンパイル不要、Python不要、モデルの検索不要。モデルを選択して録音するだけで文字起こしが完了します。完全オフラインで署名付きです。
whisper.cppは、OpenAIのWhisper音声認識モデルのC++移植版であり、Georgi Gerganovによって作成され、GitHubでオープンソースプロジェクトとしてメンテナンスされています。元のWhisperモデルはPythonでリリースされましたが、これがWindowsでの展開における重大な実用上の障壁を生み出していました。Pythonのインストール、仮想環境、PyTorchおよびCUDAツールキットのバージンマッチング、そしてコマンドライン操作です。whisper.cppは、Whisper推論エンジンをネイティブバイナリにコンパイルできるポータブルC++で実装することで、これらすべての依存関係を排除します。
Windowsユーザーにとって、whisper.cppはPythonのインフラストラクチャなしでローカルのWhisper音声認識にアクセスできることを意味します。コンパイル済みのバイナリはWindows上で直接実行され、NVIDIA CUDA GPUアクセラレーションをサポートし、Python実装と同じWhisperモデルの重みを使用します。Windows上のwhisper.cppこそが、StarWhisperを可能にしています。ユーザーにPython環境やコマンドラインツールの管理を要求することなく、ローカルでの文字起こしを強化するエンジンです。
このページでは、Windows上でのwhisper.cppの機能、StarWhisperがそれをどのようにデスクトップアプリケーションにパッケージ化しているか、サポートされているハードウェア構成、そしてWindows上でPythonでWhisperを実行する場合とのwhisper.cppの比較について説明します。
whisper.cppは、5つのWhisperモデルサイズすべてをサポートしています:tiny(39Mパラメータ)、base(74M)、small(244M)、medium(769M)、large-v3(1.5B)。モデルファイルは標準的なGGML形式の重みであり、Hugging Faceモデルリポジトリからダウンロードするか、インストーラーにバンドルすることができます。StarWhisperはフルインストーラーにtiny、base、smallをバンドルしています。mediumとlargeはProモデルのダウンロードとして利用可能です。
whisper.cppにはCUDAサポートが含まれており、mediumおよびlargeモデルにおいてCPUのみの推論と比較して5〜15倍の高速化を提供します。GPU推論には、CUDA Compute Capability 5.0以上を備えたNVIDIA GPUが必要です(基本的にGTX 900シリーズ以降のNVIDIA GPU)。StarWhisperは起動時にNVIDIA GPUを自動検出し、利用可能な場合は自動的に処理をCUDAにルーティングします。
同じモデルファイルで、Whisperがサポートする全96言語を処理できます。言語の指定は実行時のパラメータであり、別々のモデルをダウンロードする必要はありません。whisper.cppはまた、ある言語の音声を文字起こきしながら英語テキストとして出力する、Whisperの翻訳モードも実装しています。StarWhisperは、言語選択と英語への翻訳の両方をユーザー向けのオプションとして公開しています。
whisper.cppは、トランスクリプトテキストと共に単語レベルおよびセグメントレベルのタイムスタンプを生成します。StarWhisperはこれらを使用してSRT字幕ファイルを生成し、文字起こし出力パネルでのタイムスタンプ表示をサポートします。タイムスタンプは、標準的な音声ペースにおいて数百ミリ秒以内の精度です。
whisper.cppは、NVIDIA GPUを搭載していないマシンでのより高速な推論のために、SIMD CPU最適化(AVX、AVX2、利用可能な場合はAVX-512)を実装しています。ROCmを介したAMD GPUのサポートは、一部のビルドで利用可能です。Macビルド用のApple Metalサポートが存在しますが、これはWindowsには関係ありませんが、whisper.cppプロジェクトへのクロスプラットフォーム最適化への投資を示しています。
StarWhisperは、Windows x64用にコンパイル済みのwhisper.cppバイナリを出荷しています。このバイナリは、可能な限り依存関係を静的にリンクしており、ランタイムの依存関係要件を最小限に抑えています。インストールにPython、Conda、pip、またはその他のパッケージマネージャーは必要ありません。ソフトウェアスタック全体が、標準的なWindowsインストーラーを通じて1分以内にインストールされます。
StarWhisperのユーザーインターフェースはElectronで構築されており、クロスプラットフォームのGUIレイヤーを提供します。Electronフロントエンドは、ローカルのIPCメカニズムを通じてwhisper.cppバックエンドプロセスと通信します。ユーザーの観点からは、これは完全に透過的であり、標準的なWindowsアプリケーションとして表示されます。whisper.cppプロセスはGUIとは別に実行されるため、重い文字起こしのワークロードがインターフェースをブロックすることはありません。
CUDA対応のwhisper.cppビルドには、CUDAランタイムライブラリが必要です。StarWhisperは必要なCUDAランタイムファイルをバンドルしているため、ユーザーがCUDAツールキット全体を別途インストールする必要はありません。ユーザーのシステムに存在する必要があるのは、NVIDIA GPUドライバのみです。バンドルされているCUDAランタイムは、過去数年間のすべてのサポートされているNVIDIA GPUドライバと互換性があります。
whisper.cppのモデルファイルはGGML形式であり、~75MB(tiny)から~3GB(large-v3)までの範囲です。StarWhisperは、設定パネルを通じてモデルのダウンロード、保存場所の指定、選択を処理します。ユーザーが生のモデルファイルを操作することはありません。アプリはダウンロード後にモデルファイルの整合性を検証し、モデルファイルが破損または不完全な場合はユーザーに警告します。
Whisperモデルをメモリにロードするには、モデルのサイズとストレージの速度に応じて2〜10秒かかります。StarWhisperは、選択したモデルをロードした状態でwhisper.cppワーカープロセスを永続的に実行し続けるため、個々の文字起こしリクエストでモデルのロード時間が発生することはありません。これが、StarWhisperの高速なリアルタイム応答の背景にあるアーキテクチャです。モデルは常に準備完了状態であり、リクエストごとにロードされるわけではありません。
これらのパフォーマンス推定値は、Windows上のwhisper.cppで処理された60分のオーディオファイルに対するものです:
| モデル | CPUのみ(モダンなデスクトップ) | RTX 3070(GPU) | 必要なRAM |
|---|---|---|---|
| tiny | ~6分 | ~1分 | ~1 GB |
| small | ~60分 | ~4分 | ~2 GB |
| medium | ~200分 | ~15分 | ~5 GB |
| large-v3 | ~600分 | ~40分 | ~10 GB |
推定値は、CPU/GPUの世代、オーディオの特性、システム負荷によって異なります。GPUのRAM要件は推論中のVRAMです。システムRAMの要件はCPU推論の方が低くなります。whisper.cpp GitHubリポジトリには、より幅広いハードウェア構成のコミュニティベンチマークがあります。
デフォルトはsmallモデルにします。混在するディクテーションと会議音声での自動モードのベンチマークでは、短いクリップにおいてsmallが一貫してmediumとlargeを上回りました。mediumとlargeは、短いコンテキストの入力でより多くのハルシネーション(おそらく、より長いセグメントでトレーニングされているため)を発生させます。smallは、モダンなデスクトップCPUでほぼリアルタイムの速度で実行され、GPUなしでラテン文字系言語のクリーンな出力を生成します。
非ラテン文字(CJK、アラビア文字、キリル文字)または長尺の連続オーディオにのみmediumを使用します。精度が速度よりも重要であり、GPUを搭載している場合にのみlarge-v3を使用します。短いディクテーションクリップでは、両方の大きなモデルが、発話されなかったフレーズを挿入する可能性があります。どちらを選ぶべきかわからない場合は、smallのままにしてください。
CUDAアクセラレーションは自動です。8GBのVRAMを搭載したRTX 3060以上は、smallモデルをリアルタイムの8〜10倍、mediumモデルをリアルタイムの3〜4倍で実行します。large-v3モデルは10GBのVRAMを必要とし、それ以外の場合はオーバーフロー分はCPUにフォールバックします。ハイエンドGPUであっても、短いディクテーションではsmallが推奨されるデフォルトのままです。largeは長尺オーディオのバッチ文字起こし用です。
Windows 10/11(64ビット)、8GB RAM、モダンなマルチコアCPU。GPUアクセラレーションの場合:NVIDIA GeForce GTX 1060 6GB以上、および現在のNVIDIAドライバ。SSDはモデルのロード時間を大幅に改善しますが、モデルがメモリにロードされると推論速度への影響は最小限です。
いいえ。StarWhisperにはWindows用のコンパイル済みwhisper.cppバイナリがバンドルされています。Python、Conda、コマンドラインのセットアップは不要です。StarWhisperをインストールすれば、GUIからwhisper.cppをすぐに使用できます。
whisper.cppには実験的なAMD ROCm GPUサポートがありますが、WindowsでのNVIDIA CUDAサポートと比較すると大幅に成熟度が低くなります。StarWhisperは現在、GPUアクセラレーションのためにNVIDIA CUDAをターゲットにしています。AMD GPUのユーザーは、GPUアクセラレーションされたパフォーマンスではなく、CPUレベルのパフォーマンスを期待する必要があります。
はい、実用上は同じです。whisper.cppはPython実装と同じGGML形式のモデルの重みを使用し、同等の精度を達成します。GGMLとPyTorchの浮動小数点精度の違いによりわずかな数値の差異が存在しますが、これらは現実の文字起こし出力では知覚できません。
tiny:~75MB、base:~145MB、small:~465MB、medium:~1.5GB、large-v3:~3GB。tiny + base + smallをバンドルしたStarWhisperのフルインストーラーは約700MBです。追加のモデルは設定パネルからオンデマンドでダウンロードされます。
StarWhisperは、Python、コマンドライン作業、CUDAツールキットのインストールなしで、Windows上でwhisper.cppを利用可能にします。アカウント不要の無料プラン。無制限の使用とより大きなモデルには月額$10のProをご利用ください。