Vorkompilierter Installer mit CUDA-, Vulkan- und CPU-Backends. Kein Kompilieren, kein Python, keine Modellsuche. Wählen Sie ein Modell, klicken Sie auf Aufnahme, erhalten Sie eine Transkription. Vollständig offline und signiert.
whisper.cpp ist ein C++-Port des Spracherkennungsmodells OpenAI Whisper, erstellt von Georgi Gerganov und als Open-Source-Projekt auf GitHub gepflegt. Das ursprüngliche Whisper-Modell wurde in Python veröffentlicht, was erhebliche praktische Hürden für die Bereitstellung unter Windows mit sich bringt: Python-Installation, virtuelle Umgebungen, Abgleich der PyTorch- und CUDA-Toolkit-Versionen sowie Betrieb über die Kommandozeile. whisper.cpp entfernt all diese Abhängigkeiten, indem es die Whisper-Inference-Engine in portierbares C++ implementiert, das zu einem nativen Binary kompiliert wird.
Für Windows-Benutzer bedeutet whisper.cpp, dass die lokale Whisper-Spracherkreibung ohne jede Python-Infrastruktur zugänglich ist. Das kompilierte Binary läuft direkt unter Windows, unterstützt die NVIDIA-CUDA-GPU-Beschleunigung und verwendet dieselben Whisper-Modellgewichte wie die Python-Implementierung. whisper.cpp auf Windows macht StarWhisper erst möglich. Es ist die Engine, die lokale Transkription antreibt, ohne dass Benutzer Python-Umgebungen oder Kommandozeilen-Tools verwalten müssen.
Diese Seite behandelt, was whisper.cpp auf Windows tut, wie StarWhisper es in eine Desktop-Anwendung paketiert, welche Hardwarekonfigurationen unterstützt werden und wie sich whisper.cpp im Vergleich zur Ausführung von Whisper in Python auf Windows verhält.
whisper.cpp unterstützt alle fünf Whisper-Modellgrößen: tiny (39 Mio. Parameter), base (74 Mio.), small (244 Mio.), medium (769 Mio.) und large-v3 (1,5 Mrd.). Die Modelldateien sind Standard-GGML-Format-Gewichte, die aus dem Hugging-Face-Modell-Repository heruntergeladen oder mit Installern gebündelt werden können. StarWhisper bündelt tiny, base und small im vollständigen Installer; medium und large sind als Pro-Modell-Downloads verfügbar.
whisper.cpp enthält CUDA-Unterstützung, die eine 5-15-fache Beschleunigung gegenüber der reinen CPU-Inference für die Modelle medium und large bietet. Die GPU-Inference erfordert eine NVIDIA-GPU mit CUDA Compute Capability 5.0 oder höher (im Wes jede NVIDIA-GPU ab der GTX 900-Serie oder neuer). StarWhisper erkennt NVIDIA-GPUs beim Start automatisch und leitet die Verarbeitung bei Verfügbarkeit automatisch an CUDA weiter.
Die gleiche Modelldatei handhabt alle 96 Sprachen, die Whisper unterstützt. Die Sprachspezifikation ist ein Laufzeitparameter, kein separater Modell-Download. whisper.cpp implementiert auch Whispers Übersetzungsmodus, der Audio in einer Sprache transkribiert und gleichzeitig englischen Text ausgibt. StarWhisper bietet sowohl die Sprachauswahl als auch die Übersetzung ins Englische als benutzerseitige Optionen an.
whisper.cpp erzeugt Wort- und Segment-Zeitstempel neben dem Transkriptionstext. StarWhisper verwendet diese, um SRT-Untertiteldateien zu generieren und die Anzeige von Zeitstempeln im Transkriptionsausgabefeld zu unterstützen. Die Zeitstempel sind auf ein paar hundert Millisekunden genau bei normalem Sprechtempo.
whisper.cpp implementiert SIMD-CPU-Optimierungen (AVX, AVX2, AVX512, falls verfügbar) für schnellere Inferenz auf Maschinen ohne NVIDIA-GPUs. Die AMD-GPU-Unterstützung via ROCm ist in einigen Builds verfügbar. Die Apple-Metal-Unterstützung existiert für Mac-Builds; dies ist für Windows nicht relevant, veranschaulicht aber das plattformübergreifende Optimierungsengagement im whisper.cpp-Projekt.
StarWhisper liefert ein vorkompiliertes whisper.cpp-Binary für Windows x64 aus. Dieses Binary ist, wo möglich, statisch mit seinen Abhängigkeiten verknüpft, wodurch Laufzeit-Abhängigkeiten minimiert werden. Die Installation erfordert kein Python, Conda, pip oder einen Paketmanager. Der gesamten Software-Stack wird über einen Standard-Windows-Installer in unter einer Minute installiert.
Die Benutzeroberfläche von StarWhisper ist mit Electron gebaut, das die plattformübergreifende GUI-Schicht bereitstellt. Das Electron-Frontend kommuniziert mit dem whisper.cpp-Backend-Prozess über einen lokalen IPC-Mechanismus. Aus der Sicht des Benutzers ist dies völlig transparent: Es präsentiert sich als Standard-Windows-Anwendung. Der whisper.cpp-Prozess läuft getrennt von der GUI, sodass schwere Transkriptions-Workloads die Schnittstelle nicht blockieren.
CUDA-fähige Builds von whisper.cpp benötigen CUDA-Laufzeitbibliotheken. StarWhisper bündelt die erforderlichen CUDA-Laufzeitdateien, sodass Benutzer das vollständige CUDA-Toolkit nicht separat installieren müssen. Nur der NVIDIA-GPU-Treiber muss auf dem System des Benutzers vorhanden sein. Die gebündelte CUDA-Runtime ist kompatibel mit allen unterstützten NVIDIA-GPU-Treibern der vergangenen Jahre.
Die Modelldateien von whisper.cpp liegen im GGML-Format und reichen von ca. 75 MB (tiny) bis ca. 3 GB (large-v3). StarWhisper handhabt Modell-Download, Speicherort und Auswahl über das Einstellungsfeld. Benutzer interagieren nicht mit rohen Modelldateien. Die App überprüft die Integrität der Modelldatei nach dem Download und warnt Benutzer, wenn eine Modelldatei beschädigt oder unvollständig ist.
Das Laden eines Whisper-Modells in den Speicher dauert je nach Modellgröße und Speichergeschwindigkeit 2–10 Sekunden. StarWhisper hält den whisper.cpp-Worker-Prozess dauerhaft mit dem geladenen ausgewählten Modell am Laufen, damit einzelne Transkriptionsanfragen keine Ladezeit für das Modell verursachen. Dies ist die Architektur hinter StarWhispers schneller Echtzeitreaktion: Das Modell ist immer einsatzbereit, nicht pro Anfrage geladen.
Diese Leistungsschätzungen gelten für eine 60-minütige Audiodatei, die mit whisper.cpp unter Windows verarbeitet wurde:
| Modell | Nur CPU (moderner Desktop) | RTX 3070 (GPU) | RAM erforderlich |
|---|---|---|---|
| tiny | ~6 Min. | ~1 Min. | ~1 GB |
| small | ~60 Min. | ~4 Min. | ~2 GB |
| medium | ~200 Min. | ~15 Min. | ~5 GB |
| large-v3 | ~600 Min. | ~40 Min. | ~10 GB |
Die Schätzungen variieren je nach CPU/GPU-Generation, Audioeigenschaften und Systemlast. Die GPU-RAM-Anforderungen gelten für VRAM während der Inferenz; die System-RAM-Anforderungen sind bei CPU-Inferenz niedriger. Das whisper.cpp GitHub-Repository enthält Community-Benchmarks für ein breiteres Spektrum an Hardwarekonfigurationen.
Standardmäßig das small-Modell verwenden. In unseren Auto-Mode-Benchmarks über gemischte Diktier- und Meeting-Audio schnitt small bei kurzen Clips konsistent besser ab als medium und large. Medium und large halluzinieren mehr bei kurzen Kontexteingaben (wahrscheinlich weil sie auf längeren Segmenten trainiert wurden). Small läuft auf einem modernen Desktop-PC mit ungefähr Echtzeitgeschwindigkeit und liefert saubere Ausgabe für lateinische Schriftsprachen ohne GPU.
Greifen Sie zu medium nur für nicht-lateinische Schriftsysteme (CJK, Arabisch, Kyrillisch) oder langformige kontinuierliche Audioaufnahmen. Greifen Sie zu large-v3 nur, wenn Genauigkeit wichtiger ist als Geschwindigkeit und Sie eine GPU haben. Bei kurzen Diktierclips sind beide größeren Modelle wahrscheinlich dazu geneigt, Phrasen einzufügen, die nie gesprochen wurden. Wenn Sie nicht sicher sind, bleiben Sie bei small.
CUDA-Beschleunigung ist automatisch. Eine RTX 3060 oder besser mit 8 GB VRAM läuft das small-Modell mit 8–10-facher Echtzeitgeschwindigkeit und das medium-Modell mit 3–4-facher Echtzeitgeschwindigkeit. Das large-v3-Modell benötigt 10 GB VRAM oder fällt für den Überlauf auf die CPU zurück. Selbst auf einer High-End-GPU bleibt small die empfohlene Standardeinstellung für kurzes Diktat; large ist für die Batch-Transkription von Langform-Audio gedacht.
Windows 10/11 (64-Bit), 8 GB RAM, ein beliebiger moderner Multi-Core-CPU. Für GPU-Beschleunigung: NVIDIA GeForce GTX 1060 6 GB oder besser mit aktuellen NVIDIA-Treibern. SSDs verbessern die Modell-Ladezeit erheblich, haben aber minimale Auswirkungen auf die Inferenzgeschwindigkeit, sobald das Modell in den Speicher geladen wurde.
Nein. StarWhisper bündelt ein vorkompiliertes whisper.cpp-Binary für Windows. Kein Python, kein Conda, kein Einrichtung über die Kommandozeile erforderlich. Installieren Sie StarWhisper und whisper.cpp ist über die GUI einsatzbereit.
whisper.cpp verfügt über experimentelle AMD-ROCm-GPU-Unterstützung, aber diese ist unter Windows erheblich weniger ausgereift als die NVIDIA-CUDA-Unterstützung. StarWhisper zielt derzeit auf NVIDIA-CUDA für GPU-Beschleunigung ab. AMD-GPU-Benutzer sollten eher CPU-Level-Leistung als GPU-beschleunigte Leistung erwarten.
Ja, für praktische Zwecke. whisper.cpp verwendet dieselben GGML-Format-Modellgewichte wie die Python-Implementierung und erzielt eine äquivalente Genauigkeit. Geringe numerische Unterschiede bestehen aufgrund von Gleitkomma-Genauigkeitsunterschieden in GGML gegenüber PyTorch, aber diese sind in realen Transkriptionsausgaben nicht wahrnehmbar.
tiny: ~75 MB, base: ~145 MB, small: ~465 MB, medium: ~1,5 GB, large-v3: ~3 GB. Der vollständige StarWhisper-Installer mit tiny + base + small gebündelt ist ca. 700 MB groß. Zusätzliche Modelle werden bei Bedarf über das Einstellungsfeld heruntergeladen.
StarWhisper macht whisper.cpp unter Windows zugänglich ohne Python, Kommandozeilen-Arbeit oder Installation des CUDA-Toolkits. Kostenloser Plan ohne Konto erforderlich. Pro für 10 $/Monat für unbegrenzte Nutzung und größere Modelle.