Nutzen Sie OpenAI Whisper ohne Programmierung oder Kommandozeile. Einfache Desktop-Oberfläche mit allen Whisper-Modellen. Funktioniert offline oder mit OpenAI API.
OpenAI Whisper ist ein System für automatische Spracherkennung (ASR), das von OpenAI im September 2022 veröffentlicht wurde. Es wurde mit 680.000 Stunden mehrsprachiger und multitaufgabenüberwachter Daten trainiert, die aus dem Internet gesammelt wurden, und setzte neue Maßstäbe in der englischen und mehrsprachigen Spracherkennung. Im Gegensatz zu früheren ASR-Systemen des letzten Standes der Technik, die eine domänenspezifische Feinabstimmung erforderten, um professionelle Genauigkeit zu erreichen, hat der Umfang der Trainingsdaten von Whisper ein allgemeines Modell mit einer starken Robustheit über Aufnahmebedingungen, Akzente, Sprechstile und Sprachen hinweg erzeugt.
Die entscheidende Innovation bei OpenAI Whisper Sprachnachtext ist keine neuartige Architektur, es verwendet einen Standard-Encoder-Decoder-Transformer. Die Innovation liegt in der Skalierung der Trainingsdaten und der Multitask-Formulierung: Das Modell wurde gleichzeitig auf Transkription, Übersetzung, Spracherkennung und Sprachaktivitätserkennung über 96 Sprachen hinweg trainiert. Dieses Multitask-Training führt zu einer deutlich besseren Generalisierung als Modelle, die auf engeren Sprachverteilungen trainiert wurden.
StarWhisper verpackt OpenAI Whisper Sprachnachtext in eine Windows-Desktop-Anwendung unter Verwendung von whisper.cpp, einer C++-Laufzeitumgebung, die die Python-Abhängigkeit entfernt und lokale Whisper-Verarbeitung für nicht-technische Benutzer ohne Kommandozeilenarbeit zugänglich macht. Diese Seite erklärt die Fähigkeiten von Whisper, Modellvarianten und wie StarWhisper sie im täglichen Gebrauch zugänglich macht.
Whisper wird in fünf Modellgrößen mit unterschiedlichen Genauigkeits-Geschwindigkeits-Kompromissen veröffentlicht. Das Verständnis, welches Modell für Ihre Arbeit verwendet werden soll, verhindert unnötige Kompromisse in beiden Dimensionen:
| Modell | Parameter | Englisch WER | CPU-Geschwindigkeit (ca.) | StarWhisper Plan |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x Echtzeit | Kostenlos (inklusive) |
| base | 74M | ~10% WER | ~7x Echtzeit | Kostenlos (inklusive) |
| small | 244M | ~5,5% WER | ~1x Echtzeit | Kostenlos (inklusive) |
| medium | 769M | ~3,5% WER | ~0,3x Echtzeit | Pro |
| large-v3 | 1,5B | ~2,5% WER | ~0,1x Echtzeit | Pro |
WER = Word Error Rate auf dem LibriSpeech Clean-Testset. Niedriger ist besser. CPU-Geschwindigkeiten sind Schätzungen auf einem modernen Desktop-CPU; GPU-Geschwindigkeiten sind 5-10x schneller für mittlere und große Modelle.
Für die meisten Anwendungsfälle für Echtzeit-Diktat erreicht das kleine Modell (im kostenlosen Paket enthalten) eine Genauigkeit von 94-96 % mit einer Verarbeitungsgeschwindigkeit, die schnell genug für nahezu echtzeitige Ausgaben ist, und ist das praktische Standardmodell, das wir auch für GPU-Benutzer empfehlen. Das large-v3 Modell ist am besten für die Batch-Transkription von langen Dateien reserviert, wo sein Training auf langen Segmenten seine Rechenleistung rechtfertigt; bei kurzen Diktatausschnitten kann large-v3 überkorrigieren und mehr halluzinieren als small.
Die Ausführung von OpenAI Whisper Sprachnachtext aus dem offiziellen Repository erfordert Python 3.9+, PyTorch, ffmpeg und oft spezifische CUDA-Toolkit-Versionen, die mit Ihrem GPU-Treiber übereinstimmen. Für Nicht-Entwickler ist dies eine erhebliche Hürde. StarWhisper beseitigt dies vollständig. Die whisper.cpp-Laufzeitumgebung ist eine kompilierte native Windows-Executable, die mit dem Installationsprogramm gebündelt ist. Installieren Sie StarWhisper, öffnen Sie es, transkribieren Sie. Kein Terminal, keine Paketmanager, keine Versionskonflikte.
StarWhisper bündelt die Modelle tiny, base und small im Installationsprogramm für die sofortige Nutzung. Über das Bedienfeld "Einstellungen" können Pro-Abonnenten medium und large-v3 direkt innerhalb der App herunterladen. Die Modellverwaltung, Download, Wechsel und Integritätsprüfung wird über die GUI gehandhabt, ohne dass Dateien manuell platziert oder konfiguriert werden müssen.
StarWhisper erkennt NVIDIA-GPUs automatisch und leitet die whisper.cpp-Inferenz an CUDA weiter, wo verfügbar. GPU-Beschleunigung macht OpenAI Whisper Sprachnachtext 5-15x schneller als die rein cpu-basierte Verarbeitung, abhängig von der Modellgröße. Das large-v3 Modell, das auf der CPU 10x Echtzeit dauert, läuft auf einer mittelgroßen NVIDIA GPU mit etwa 1,5-2x Echtzeit, was bedeutet, dass eine 30-minütige Aufnahme in unter 25 Minuten statt fünf Stunden transkribiert wird.
Das offizielle OpenAI Whisper Modell war nicht für Echtzeit-Streaming konzipiert, es verarbeitet Audio in festen Blöcken. Der Streaming-Segmentierer von StarWhisper verarbeitet Audio in 3-5 Sekunden rollenden Fenstern und bietet nahezu Echtzeit-Ausgabe, während die Genauigkeit durch überlappende Kontextfenster erhalten bleibt. Dies ist technisch komplexer als die Batch-Verarbeitung, aber für Live-Diktat-Workflows unerlässlich. Das Ergebnis ist die Genauigkeit von OpenAI Whisper Sprachnachtext in einem Live-Diktat-Kontext, nicht nur für hochgeladene Dateien.
Im Gegensatz zur Verwendung der OpenAI Whisper API (die Audio an die Server von OpenAI sendet und Kosten pro Minute verursacht), hält die lokale Implementierung von StarWhisper alle Audio auf Ihrem Gerät. Siehe die Seite für Offline-Sprachnachtext unter Windows für Details zum Datenschutz und zur Sicherheit der lokalen Whisper-Verarbeitung.
OpenAI bietet Whisper als Cloud-API zu $0,006 pro Minute Audio an. Auf den ersten Blick scheint dies billig zu sein; bei professioneller Nutzung von 4 Stunden/Monat sind es $1,44. Aber dieser Vergleich vernachlässigt mehrere wichtige Faktoren:
Die Dokumentation zur OpenAI Whisper API ist die Referenz für die Cloud-API. Für Benutzer, die dieselbe Whisper-Genauigkeit ohne Cloud-Kosten und Datenschutzrisiken wünschen, ist StarWhisper die praktische Alternative.
Verwenden Sie das small Modell (gebündelt, kostenlos). Es verarbeitet mit ca. Echtzeitgeschwindigkeit auf der CPU, schneller auf der GPU und liefert 94-96% Genauigkeit bei klarer Sprache. Für die meisten Diktataufgaben, E-Mails, Notizen, Dokumente ist dies ausreichend, mit minimalen Korrekturen.
Für die Transkription von langen Dateien (Vorlesungen, Interviews, Podcasts), bei denen Sie nicht in Echtzeit warten, ist large-v3 (Pro) auf GPU das richtige Werkzeug. Der zusätzliche Kontext hilft bei herausforderndem langen Audio (Akzente, Lärm, technischer Wortschatz). Behalten Sie small als Standard für Live-Diktat und wechseln Sie speziell für Batch-Jobs zu large-v3; bei kurzen Clips neigt large-v3 dazu, zu überkorrigieren.
Für nicht-lateinische Schriften (CJK, Arabisch, Kyrillisch) und mehrsprachige Langform-Aufnahmen ist das medium Modell oft der richtige Schritt nach oben von small, da die mehrsprachige Leistung von small bei diesen Schriften abfallen kann. Siehe den Leitfaden für mehrsprachigen Sprachnachtext für Empfehlungen pro Sprache.
Das medium Modell auf der CPU ist langsam (0,3x Echtzeit), erreicht aber eine Genauigkeit von 96-97%, was für Batch-Dateitranskription akzeptabel ist, wenn Sie nicht in Echtzeit warten. Für CPU-Benutzer, die eine bessere Genauigkeit als small wünschen, führen Sie die Batch-Transkription über Nacht statt aktiv zu warten.
OpenAI Whisper Sprachnachtext auf Ihrem Windows-PC, kostenlos starten
StarWhisper herunterladenOpenAI Whisper ist das Modell, ein Open-Source-Spracherkennungssystem. Die Whisper API ist ein Cloud-Dienst, der das Modell auf den Servern von OpenAI ausführt und pro Minute berechnet. StarWhisper führt dasselbe Modell lokal auf Ihrem Computer aus, ohne Audioübertragung und ohne Kosten pro Minute.
Für Diktat kurzer Clips und die meisten Tipp-per-Sprache-Arbeiten ist das Small-Modell das empfohlene praktische Standardmodell. Obwohl Large-v3 das größte allgemeine Whisper-Modell der Open-Source-Version ist, neigt es bei kurzem Audio dazu, mehr zu halluzinieren als Small, da es auf längeren Segmenten trainiert wurde. Verwenden Sie Medium für Langform-Audio oder nicht-lateinische Schriften (CJK, Arabisch, Kyrillisch); behalten Sie Large-v3 für die Batch-Transkription langer Dateien vor. Neue offizielle Whisper-Versionen werden unterstützt, sobald sie verfügbar sind.
StarWhisper erfordert kein Python, keine CUDA-Toolkit-Konfiguration, keine Kommandozeilenarbeit und bietet eine GUI mit Live-Diktat, Dateitranskription, Modellverwaltung und Hotkey-Steuerung. Es ist der Unterschied zwischen der Nutzung professioneller Software und dem Ausführen von Forschungscode.
Whisper wurde mit Web-Audio trainiert, das medizinische Vorlesungen, juristische Verfahren und technische Inhalte umfasst. Es behandelt gängige medizinische und juristische Terminologie recht gut. Für hochspezialisierten Wortschatz hängt die Genauigkeit davon ab, wie häufig diese Begriffe in den Trainingsdaten vorkommen; seltene technische Begriffe können eine Nachbearbeitung erfordern.