Utilisez OpenAI Whisper sans coder ni utiliser la ligne de commande. Interface de bureau simple avec tous les modèles Whisper. Fonctionne hors ligne ou avec l'API OpenAI.
OpenAI Whisper est un système de reconnaissance vocale automatique (ASR) publié par OpenAI en septembre 2022. Entraîné sur 680 000 heures de données multilingues et multitâches supervisées collectées sur Internet, il a établi de nouvelles références en matière de reconnaissance vocale, tant en anglais que dans d'autres langues. Contrairement aux précédents systèmes ASR de pointe qui nécessitaient un réglage fin spécifique à un domaine pour atteindre une précision professionnelle, l'ampleur des données d'entraînement de Whisper a produit un modèle à usage général avec une robustesse forte face aux conditions d'enregistrement, aux accents, aux styles d'élocution et aux langues.
L'innovation clé de la transcription vocale OpenAI Whisper n'est pas une architecture novatrice, elle utilise un Transformer encodeur-décodeur standard. L'innovation réside dans l'échelle des données d'entraînement et la formulation multitâche : le modèle a été entraîné simultanément sur la transcription, la traduction, l'identification de la langue et la détection d'activité vocale dans 96 langues. Cet entraînement multitâche produit une généralisation nettement meilleure que celle des modèles entraînés sur des distributions vocales plus restreintes.
StarWhisper intègre la transcription vocale OpenAI Whisper dans une application de bureau Windows en utilisant whisper.cpp, un runtime C++ qui supprime la dépendance à Python et rend le traitement local de Whisper accessible aux utilisateurs non techniques sans recourir à la ligne de commande. Cette page explique les capacités de Whisper, les variantes du modèle et la manière dont StarWhisper les met à disposition dans une utilisation quotidienne.
Whisper est publié en cinq tailles de modèle avec différents compromis entre précision et vitesse. Comprendre quel modèle utiliser pour votre travail évite des compromis inutiles sur l'une ou l'autre de ces dimensions :
| Modèle | Paramètres | WER Anglais | Vitesse CPU (est.) | Plan StarWhisper |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x temps réel | Gratuit (inclus) |
| base | 74M | ~10% WER | ~7x temps réel | Gratuit (inclus) |
| small | 244M | ~5.5% WER | ~1x temps réel | Gratuit (inclus) |
| medium | 769M | ~3.5% WER | ~0.3x temps réel | Pro |
| large-v3 | 1.5B | ~2.5% WER | ~0.1x temps réel | Pro |
WER = Taux d'erreur par mot (Word Error Rate) sur l'ensemble de test propre LibriSpeech. Plus c'est bas, mieux c'est. Les vitesses CPU sont des estimations sur un processeur de bureau moderne ; les vitesses GPU sont 5 à 10 fois plus rapides pour les modèles medium et large.
Pour la plupart des cas d'utilisation de dictée en temps réel, le modèle small (inclus gratuitement) atteint une précision de 94 à 96 % avec une vitesse de traitement suffisamment rapide pour une sortie quasi temps réel, et c'est le choix par défaut pratique que nous recommandons, même pour les utilisateurs de GPU. Le modèle large-v3 est mieux réservé à la transcription par lots de fichiers longs, où son entraînement sur de longs segments justifie sa puissance de calcul ; sur de courts extraits de dictée, large-v3 peut sur-corriger et halluciner davantage que small.
L'exécution de la transcription vocale OpenAI Whisper à partir du dépôt officiel nécessite Python 3.9+, PyTorch, ffmpeg, et souvent des versions spécifiques du toolkit CUDA correspondant à votre pilote GPU. Pour les non-développeurs, c'est un obstacle majeur. StarWhisper l'élimine entièrement. Le runtime whisper.cpp est un exécutable Windows natif compilé et fourni avec le programme d'installation. Installez StarWhisper, ouvrez-le, transcrivez. Pas de terminal, pas de gestionnaires de paquets, pas de conflits de versions.
StarWhisper intègre les modèles tiny, base et small dans le programme d'installation pour une utilisation immédiate. Depuis le panneau Paramètres, les abonnés Pro peuvent télécharger medium et large-v3 directement dans l'application. La gestion des modèles, le téléchargement, le changement et la vérification de l'intégrité sont gérés via l'interface graphique sans placement manuel de fichiers ni configuration.
StarWhisper détecte automatiquement les GPU NVIDIA et achemine l'inférence whisper.cpp vers CUDA lorsque disponible. L'accélération GPU rend la transcription vocale OpenAI Whisper 5 à 15 fois plus rapide qu'un traitement sur CPU uniquement, selon la taille du modèle. Le modèle large-v3, qui prend 10x le temps réel sur CPU, fonctionne à environ 1,5x à 2x le temps réel sur un GPU NVIDIA de milieu de gamme, ce qui signifie qu'un enregistrement de 30 minutes est transcrit en moins de 25 minutes au lieu de cinq heures.
Le modèle officiel OpenAI Whisper n'a pas été conçu pour la diffusion en temps réel, il traite l'audio par blocs fixes. Le segmenteur de diffusion de StarWhisper gère l'audio dans des fenêtres glissantes de 3 à 5 secondes, fournissant une sortie quasi temps réel tout en maintenant la précision grâce à l'utilisation de fenêtres de contexte qui se chevauchent. C'est techniquement plus complexe que le traitement par lots, mais essentiel pour les flux de travail de dictée en direct. Le résultat est la précision de la transcription vocale OpenAI Whisper dans un contexte de dictée en direct, et pas seulement pour les fichiers téléchargés.
Contrairement à l'utilisation de l'API OpenAI Whisper (qui envoie l'audio sur les serveurs d'OpenAI et entraîne des coûts à la minute), l'implémentation locale de StarWhisper conserve tout l'audio sur votre appareil. Consultez la page sur la transcription vocale hors ligne Windows pour les détails de confidentialité et de sécurité du traitement local de Whisper.
OpenAI propose Whisper sous forme d'API cloud à 0,006 $ par minute d'audio. À première vue, cela semble bon marché ; pour un usage professionnel à 4 heures/mois, cela représente 1,44 $. Mais cette comparaison ignore plusieurs facteurs importants :
La documentation de l'API OpenAI Whisper est la référence pour l'API cloud. Pour les utilisateurs qui souhaitent la même précision de Whisper sans les coûts du cloud et les implications en matière de confidentialité, StarWhisper est l'alternative pratique.
Utilisez le modèle small (inclus, gratuit). Il traite à une vitesse approximativement égale au temps réel sur CPU, plus rapide sur GPU, et offre une précision de 94 à 96 % sur une parole claire. Pour la plupart des tâches de dictée (e-mails, notes, documents), c'est suffisant avec des corrections minimales nécessaires.
Pour la transcription de fichiers longs (cours, interviews, podcasts) où vous n'attendez pas en temps réel, large-v3 (Pro) sur GPU est l'outil approprié. Le contexte supplémentaire aide sur les audios longs et difficiles (accents, bruit, vocabulaire technique). Gardez small comme valeur par défaut pour la dictée en direct et passez à large-v3 spécifiquement pour les traitements par lots ; sur de courts extraits, large-v3 a tendance à sur-corriger.
Pour les écritures non latines (CJK, Arabe, Cyrillique) et les enregistrements multilingues de longue durée, le modèle medium est souvent le bon choix après small, car les performances multilingues de small peuvent chuter sur ces écritures. Consultez le guide de transcription vocale multilingue pour des recommandations par langue.
Le modèle medium sur CPU est lent (0,3x le temps réel) mais atteint une précision de 96 à 97 %, ce qui est acceptable pour la transcription par lots de fichiers où vous n'attendez pas en temps réel. Pour les utilisateurs de CPU qui souhaitent une meilleure précision que small, exécutez la transcription par lots pendant la nuit plutôt que d'attendre activement.
La transcription vocale OpenAI Whisper sur votre machine Windows, gratuite pour commencer
Télécharger StarWhisperOpenAI Whisper est le modèle, un système de reconnaissance vocale open source. L'API Whisper est un service cloud qui exécute le modèle sur les serveurs d'OpenAI et facture à la minute. StarWhisper exécute le même modèle localement sur votre machine, sans transmission audio et sans coût à la minute.
Pour la dictée de courts extraits et la plupart des travaux de saisie vocale, le modèle Small est le choix par défaut pratique que nous recommandons. Bien que Large-v3 soit le plus grand modèle Whisper à usage général dans la version open source, sur les audios courts, il a tendance à halluciner davantage que Small car il a été entraîné sur des segments plus longs. Utilisez Medium pour l'audio long ou les écritures non latines (CJK, Arabe, Cyrillique) ; réservez Large-v3 pour la transcription par lots de fichiers longs. Les nouvelles versions officielles de Whisper seront prises en charge dès qu'elles seront disponibles.
StarWhisper ne nécessite pas de Python, pas de configuration du toolkit CUDA, pas de travail en ligne de commande, et offre une interface graphique avec dictée en direct, transcription de fichiers, gestion des modèles et contrôle par raccourcis clavier. C'est la différence entre utiliser un logiciel professionnel et exécuter du code de recherche.
Whisper a été entraîné sur de l'audio web qui comprend des cours médicaux, des procédures judiciaires et du contenu technique. Il gère raisonnablement bien la terminologie médicale et juridique courante. Pour un vocabulaire très spécialisé, la précision dépend de la fréquence à laquelle ces termes apparaissent dans les données d'entraînement ; les termes techniques rares peuvent nécessiter une post-édition.