Installateur préconstruit avec les backends CUDA, Vulkan et CPU. Pas de compilation, pas de Python, pas de chasse aux modèles. Choisissez un modèle, cliquez sur enregistrer, obtenez une transcription. Entièrement hors ligne et signé.
whisper.cpp est un portage C++ du modèle de reconnaissance vocale Whisper d'OpenAI, créé par Georgi Gerganov et maintenu en tant que projet open source sur GitHub. Le modèle Whisper original a été publié en Python, ce qui crée des barrières pratiques importantes pour le déploiement sur Windows : installation de Python, environnements virtuels, correspondance des versions de PyTorch et de la boîte à outils CUDA, et fonctionnement en ligne de commande. whisper.cpp supprime toutes ces dépendances en implémentant le moteur d'inférence Whisper en C++ portable qui se compile en un binaire natif.
Pour les utilisateurs Windows, whisper.cpp signifie que la reconnaissance vocale Whisper locale est accessible sans aucune infrastructure Python. Le binaire compilé s'exécute directement sur Windows, prend en charge l'accélération GPU NVIDIA CUDA et utilise les mêmes poids de modèle Whisper que l'implémentation Python. whisper.cpp sur Windows est ce qui rend StarWhisper possible. C'est le moteur qui alimente la transcription locale sans obliger les utilisateurs à gérer des environnements Python ou des outils en ligne de commande.
Cette page traite des fonctionnalités de whisper.cpp sur Windows, de la manière dont StarWhisper le package dans une application de bureau, des configurations matérielles prises en charge et de la comparaison entre whisper.cpp et l'exécution de Whisper en Python sur Windows.
whisper.cpp prend en charge les cinq tailles de modèles Whisper : tiny (39M params), base (74M), small (244M), medium (769M) et large-v3 (1.5B). Les fichiers de modèle sont des poids au format standard GGML qui peuvent être téléchargés depuis le dépôt de modèles Hugging Face ou fournis avec les installateurs. StarWhisper inclut tiny, base et small dans l'installateur complet ; medium et large sont disponibles en tant que téléchargements de modèles Pro.
whisper.cpp inclut la prise en charge de CUDA qui fournit une accélération 5 à 15 fois supérieure à l'inférence uniquement sur CPU pour les modèles medium et large. L'inférence GPU nécessite un GPU NVIDIA avec une capacité de calcul CUDA 5.0 ou supérieure (essentiellement n'importe quel GPU NVIDIA de la série GTX 900 ou plus récente). StarWhisper détecte automatiquement les GPU NVIDIA au démarrage et achemine automatiquement le traitement vers CUDA lorsque disponible.
Le même fichier de modèle gère les 96 langues prises en charge par Whisper. La spécification de la langue est un paramètre d'exécution, pas un téléchargement de modèle séparé. whisper.cpp implémente également le mode de traduction de Whisper, qui transcrit l'audio dans une langue tout en produisant du texte en anglais. StarWhisper expose la sélection de la langue et la traduction vers l'anglais comme options pour l'utilisateur.
whisper.cpp produit des horodatages au niveau des mots et des segments ainsi que le texte de la transcription. StarWhisper les utilise pour générer des fichiers de sous-titres SRT et pour prendre en charge l'affichage des horodatages dans le panneau de sortie de transcription. Les horodatages sont précis à quelques centaines de millisecondes près pour le rythme de parole standard.
whisper.cpp implémente des optimisations CPU SIMD (AVX, AVX2, AVX-512 si disponibles) pour une inférence plus rapide sur les machines sans GPU NVIDIA. La prise en charge du GPU AMD via ROCm est disponible dans certaines versions. Le support Apple Metal existe pour les versions Mac ; ce n'est pas pertinent pour Windows mais illustre l'investissement en optimisation multiplateforme dans le projet whisper.cpp.
StarWhisper fournit un binaire whisper.cpp précompilé pour Windows x64. Ce binaire est lié statiquement à ses dépendances lorsque cela est possible, minimisant les exigences de dépendances d'exécution. L'installation ne nécessite pas Python, Conda, pip ou aucun gestionnaire de paquets. L'ensemble de la pile logicielle s'installe via un programme d'installation Windows standard en moins d'une minute.
L'interface utilisateur de StarWhisper est construite avec Electron, qui fournit la couche GUI multiplateforme. Le frontend Electron communique avec le processus backend whisper.cpp via un mécanisme IPC local. Du point de vue de l'utilisateur, c'est totalement transparent : cela se présente comme une application Windows standard. Le processus whisper.cpp s'exécute séparément de l'interface graphique, de sorte que les charges de transcription lourdes ne bloquent pas l'interface.
Les versions de whisper.cpp activées pour CUDA nécessitent des bibliothèques d'exécution CUDA. StarWhisper regroupe les fichiers d'exécution CUDA nécessaires, de sorte que les utilisateurs n'ont pas besoin d'installer la boîte à outils CUDA complète séparément. Seul le pilote GPU NVIDIA doit être présent sur le système de l'utilisateur. Le runtime CUDA inclus est compatible avec tous les pilotes GPU NVIDIA pris en charge des dernières années.
Les fichiers de modèle de whisper.cpp sont au format GGML, allant de ~75 Mo (tiny) à ~3 Go (large-v3). StarWhisper gère le téléchargement, l'emplacement de stockage et la sélection des modèles via le panneau Paramètres. Les utilisateurs n'interagissent pas avec les fichiers de modèle bruts. L'application vérifie l'intégrité du fichier modèle après le téléchargement et alerte les utilisateurs si un fichier modèle est corrompu ou incomplet.
Charger un modèle Whisper en mémoire prend 2 à 10 secondes selon la taille du modèle et la vitesse de stockage. StarWhisper garde le processus worker whisper.cpp en cours d'exécution de manière persistante avec le modèle sélectionné chargé, de sorte que les demandes de transcription individuelles n'entraînent pas de temps de chargement de modèle. C'est l'architecture derrière la réponse rapide en temps réel de StarWhisper : le modèle est toujours prêt, pas chargé à chaque demande.
Ces estimations de performances concernent un fichier audio de 60 minutes traité avec whisper.cpp sur Windows :
| Modèle | CPU Uniquement (PC de bureau moderne) | RTX 3070 (GPU) | RAM Requise |
|---|---|---|---|
| tiny | ~6 min | ~1 min | ~1 Go |
| small | ~60 min | ~4 min | ~2 Go |
| medium | ~200 min | ~15 min | ~5 Go |
| large-v3 | ~600 min | ~40 min | ~10 Go |
Les estimations varient en fonction de la génération de CPU/GPU, des caractéristiques audio et de la charge du système. Les exigences de VRAM GPU sont pour la VRAM pendant l'inférence ; les exigences de RAM système sont inférieures pour l'inférence CPU. Le dépôt GitHub whisper.cpp contient des repères communautaires pour une plus large gamme de configurations matérielles.
Optez par défaut pour le modèle small. Dans nos repères en mode automatique sur des audio mixtes de dictée et de réunions, small a systématiquement surperformé medium et large sur des clips courts. Medium et large hallucinent davantage sur des entrées à contexte court (probablement parce qu'ils ont été entraînés sur des segments plus longs). Small fonctionne à une vitesse approximativement temps réel sur un CPU de bureau moderne et produit un résultat propre sur les langues à script latin sans GPU.
Optez pour medium uniquement pour les scripts non-latins (CJK, arabe, cyrillique) ou pour l'audio continu de longue forme. Optez pour large-v3 uniquement lorsque la précision compte plus que la vitesse et que vous disposez d'un GPU. Sur des clips de dictée courts, les deux modèles plus grands sont susceptibles d'insérer des phrases qui n'ont jamais été prononcées. Si vous ne savez pas lequel choisir, restez sur small.
L'accélération CUDA est automatique. Un RTX 3060 ou supérieur avec 8 Go de VRAM exécute le modèle small à 8-10x le temps réel et le modèle medium à 3-4x le temps réel. Le modèle large-v3 nécessite 10 Go de VRAM ou revient au CPU pour le dépassement. Même sur un GPU haut de gamme, small reste le choix par défaut recommandé pour la dictée courte ; large est pour la transcription par lots de l'audio longue forme.
Windows 10/11 (64 bits), 8 Go de RAM, n'importe quel CPU multicœur moderne. Pour l'accélération GPU : NVIDIA GeForce GTX 1060 6 Go ou supérieur avec les pilotes NVIDIA actuels. Les SSD améliorent considérablement le temps de chargement du modèle mais ont un effet minimal sur la vitesse d'inférence une fois le modèle chargé en mémoire.
Non. StarWhisper inclut un binaire whisper.cpp précompilé pour Windows. Pas de Python, pas de Conda, aucune configuration en ligne de commande requise. Installez StarWhisper et whisper.cpp est prêt à être utilisé via l'interface graphique.
whisper.cpp dispose d'un support expérimental pour GPU AMD ROCm mais il est beaucoup moins mature que le support NVIDIA CUDA sur Windows. StarWhisper cible actuellement NVIDIA CUDA pour l'accélération GPU. Les utilisateurs de GPU AMD doivent s'attendre à des performances de niveau CPU plutôt qu'à des performances accélérées par GPU.
Oui, à toutes fins pratiques. whisper.cpp utilise les mêmes poids de modèle au format GGML que l'implémentation Python et atteint une précision équivalente. Des différences numériques mineures existent en raison des différences de précision à virgule flottante entre GGML et PyTorch, mais elles ne sont pas perceptibles dans la sortie de transcription réelle.
tiny : ~75 Mo, base : ~145 Mo, small : ~465 Mo, medium : ~1,5 Go, large-v3 : ~3 Go. L'installateur complet de StarWhisper avec tiny + base + small inclus fait environ 700 Mo. Les modèles supplémentaires sont téléchargés à la demande depuis le panneau Paramètres.
StarWhisper rend whisper.cpp accessible sur Windows sans Python, travail en ligne de commande, ou installation de la boîte à outils CUDA. Plan gratuit sans compte requis. Pro à 10 $/mois pour une utilisation illimitée et des modèles plus volumineux.