Reconnaissance vocale dans votre langue. Prend en charge le marathi, l'hindi, le gujarati, le tamoul, le malayalam, l'arabe, le japonais et plus de 90 autres langues. Aucun pack linguistique requis.
La reconnaissance vocale multilingue est l'une des capacités les plus surévaluées et les moins satisfaites de la technologie vocale. Les entreprises de logiciels listent « 99 langues prises en charge » sur leurs pages de fonctionnalités tout en cachant le fait que nombre de ces langues fonctionnent beaucoup moins bien en pratique. Pour un professionnel bilingue qui passe de l'espagnol à l'anglais tout au long de la journée, ou pour un chercheur qui transcrit des entretiens en arabe, cet écart peut rendre l'outil inutilisable.
OpenAI Whisper a changé la donne lorsqu'il a été publié en 2022. Entraîné sur 680 000 heures d'audio multilingue collecté sur le Web, c'est le modèle de reconnaissance vocale publiquement disponible le plus largement entraîné en dehors des API des principaux fournisseurs de cloud. La distinction importante est que Whisper est un modèle unique qui gère nativement l'identification de la langue et la transcription ensemble. Il n'y a pas de « Whisper français » et de « Whisper japonais ». Le même modèle gère 96 langues, et l'écart de qualité entre l'anglais et les principales langues mondiales est nettement plus étroit que dans les systèmes plus anciens.
StarWhisper apporte cette capacité de reconnaissance vocale multilingue à Windows dans une application de bureau pratique, sans configuration. Vous n'avez pas besoin de Python, d'une ligne de commande ou de configuration technique. Vous sélectionnez votre langue, appuyez sur le raccourci clavier et parlez. Cette page est un guide réaliste de ce qui fonctionne, de ce qui ne fonctionne pas, et de la façon d'obtenir les meilleurs résultats de la transcription vocale multilingue selon les différentes tailles de modèles et les cas d'utilisation.
Les chercheurs, les professionnels des affaires internationales, les créateurs de contenu et les utilisateurs bilingues ont tous des besoins différents d'un outil de transcription multilingue. Voici les capacités qui comptent vraiment :
Un outil qui gère bien l'anglais mais qui a des difficultés avec votre deuxième langue n'est pas vraiment utile pour un travail multilingue. Vous avez besoin d'un moteur où l'écart de qualité entre vos langues est suffisamment petit pour être exploitable. Les modèles Whisper plus grands fonctionnent généralement mieux sur les principales langues mondiales, mais le résultat dépend toujours de la qualité audio et de la couverture linguistique.
Changer manuellement les paramètres de langue entre les enregistrements est une friction qui tue les flux de travail. Une bonne reconnaissance vocale multilingue devrait identifier la langue parlée à partir de l'audio lui-même, sans que vous ayez à la déclarer à l'avance pour chaque session.
Les équipes internationales ont souvent besoin de comptes rendus de réunion, de transcriptions d'entretiens ou de résultats de recherche en anglais, quelle que soit la langue source. La traduction vocale vers l'anglais intégrée supprime une étape manuelle des flux de travail qui nécessitaient auparavant une transcription puis un outil de traduction distinct.
Les services cloud qui facturent la transcription à la minute ajoutent souvent des suppléments pour les langues autres que l'anglais, ou se contentent d'être moins performants tout en facturant le même tarif. Une tarification forfaitaire qui s'applique de manière égale à toutes les langues est le seul modèle qui rende les flux de travail multilingues économiquement prévisibles.
Les utilisateurs multilingues sont plus susceptibles de travailler entre des pays ayant des lois différentes sur la résidence des données. L'audio commercial français traité sur des serveurs américains soulève des questions relatives au RGPD. Le traitement local hors ligne élimine entièrement ces problèmes de conformité transfrontalière.
La véritable parole bilingue mélange souvent les langues au milieu d'une phrase. « So the meeting was at 3 o'clock, aber wir haben keine Einigung erreicht » est naturel dans les environnements commerciaux allemands. Un moteur multilingue mature gère ces changements de langue sans perdre le fil de la transcription principale.
Les anciennes architectures de reconnaissance vocale maintenaient des modèles acoustiques séparés pour chaque langue. Le japonais nécessitait un modèle japonais, l'arabe nécessitait un modèle arabe, et ainsi de suite. Cela créait un problème de mise à l'échelle combinatoire : prendre en charge 20 langues signifiait 20 modèles, 20 fardeaux de maintenance et une qualité extrêmement variable selon l'investissement reçu par chaque langue.
Whisper fonctionne différemment. Il s'agit d'un seul transformateur encodeur-décodeur entraîné sur des données multilingues simultanément. Le modèle apprend à gérer l'identification de la langue dans le cadre de la transcription, et non comme une étape distincte. Lorsque vous installez StarWhisper et téléchargez le grand modèle, vous disposez d'une reconnaissance vocale multilingue fonctionnelle pour les 96 langues prises en charge dans un seul fichier de 3 Go. Il n'y a pas de module complémentaire français ni de pack linguistique japonais.
Le mode de détection automatique de StarWhisper demande à Whisper d'identifier la langue parlée à partir du segment audio initial avant que la transcription ne commence. Pour les principales langues mondiales, cette identification est généralement fiable et rapide. Vous pouvez enregistrer une note vocale, la transcrire et recevoir un résultat formaté dans la langue source sans ouvrir les paramètres.
La détection automatique est moins fiable pour les langues minoritaires, les dialectes régionaux qui partagent des caractéristiques phonologiques avec des langues plus importantes, et les enregistrements très courts. Dans ces cas, la définition explicite de la langue dans les Paramètres donne des résultats plus constants. La précision de la détection dépend également du modèle : l'identification de la langue par le grand modèle est nettement meilleure que celle du petit modèle, en particulier pour les langues avec peu de données d'entraînement Whisper.
StarWhisper inclut un mode de traduction vers l'anglais qui effectue la transcription et la traduction en une seule passe. Il s'agit d'une fonctionnalité directe du modèle Whisper lui-même, et non d'une étape de post-traitement qui achemine votre texte via une API de traduction distincte. Parlez français, recevez de l'anglais. Parlez japonais, recevez de l'anglais. La qualité de la traduction est forte pour les langues majeures et adéquate pour la plupart des cas d'utilisation professionnels, bien qu'une traduction de qualité publication doive être révisée par un locuteur natif.
Cela compte pour les équipes de recherche internationales, les entreprises multinationales qui standardisent la documentation en anglais et les créateurs de contenu qui veulent comprendre rapidement le contenu audio en langue étrangère. Le pipeline local peut s'exécuter sur votre appareil pour des flux de travail audio en langue source privés.
Le choix du modèle joue un rôle plus important pour la parole multilingue que pour la simple dictée en anglais. Small reste la valeur par défaut pratique pour la dictée en direct dans les langues à écriture latine bien couvertes (allemand, français, espagnol, portugais, italien et similaires). Pour les écritures non latines (CJK, arabe, cyrillique) et pour les langues moins dotées en ressources, le modèle medium est généralement le bon choix supérieur.
Les utilisateurs Pro peuvent accéder aux modèles large-v2 et large-v3, qui sont les plus utiles pour la transcription par lots de longs enregistrements multilingues plutôt que de courts clips en direct. Sur de courts extraits de dictée, les modèles plus grands peuvent surcorriger ; réservez-les aux fichiers où le contexte supplémentaire justifie la puissance de calcul. Les utilisateurs dotés de GPU NVIDIA peuvent traiter l'audio avec le grand modèle beaucoup plus rapidement que les systèmes à processeur uniquement, rendant le contenu multilingue de longue durée plus pratique.
StarWhisper peut traiter la transcription multilingue localement une fois les modèles requis disponibles. La transcription multilingue ne nécessite pas de service cloud de langue distinct pour les flux de travail locaux. Cela compte pour la conformité des données transfrontalières : un avocat allemand transcrivant des conversations avec un client, un journaliste français interrogeant des sources et un chercheur coréen traitant des données d'entretien sensibles peuvent tous bénéficier du traitement local, quelle que soit la langue du contenu. Consultez le guide de la reconnaissance vocale hors ligne pour en savoir plus sur les considérations de confidentialité.
Le paysage de la transcription multilingue comprend trois catégories distinctes, chacune avec de réels compromis.
| Outil | Langues | Traitement | Tarification | Précision hors anglais |
|---|---|---|---|---|
| StarWhisper (large) | 96 langues | 100 % local | 10 $/mois forfaitaire | Variable |
| Google Cloud Speech | 100+ langues | Téléversement cloud | 0,016 $/min+ | Variable |
| Otter.ai | Anglais principal | Téléversement cloud | 16,99 $/mois | Limitée |
| Whisper CLI (brut) | 96 langues | 100 % local | Gratuit | Variable |
| Azure Speech | 100+ langues | Téléversement cloud | 0,017 $/min | Variable |
Le CLI brut de Whisper produit une qualité de transcription identique à StarWhisper puisqu'ils partagent le même modèle sous-jacent. Ce que StarWhisper ajoute, c'est l'expérience utilisateur du bureau Windows, la dictée au microphone en temps réel, le widget flottant, la préconfiguration de l'accélération GPU et l'insertion automatique du texte dans n'importe quelle application. Le choix entre Whisper brut et StarWhisper porte sur la question de savoir si vous voulez un outil ou un flux de travail.
Les benchmarks de précision multilingue de Whisper sont documentés dans l'article original sur Whisper sur arXiv, qui comprend des tableaux détaillés des taux d'erreur par mot par groupe de langues. Les langues européennes avec une bonne couverture d'entraînement Whisper fonctionnent généralement bien avec des modèles locaux plus grands. Pour les langues moins dotées en ressources, les systèmes cloud qui ont investi spécifiquement dans ces langues peuvent encore avoir une longueur d'avance.
Définissez la langue explicitement dans les paramètres de StarWhisper. La sélection explicite est légèrement plus rapide que la détection automatique et évite le cas rare où de courts clips audio sont mal identifiés. Pour les langues à écriture latine bien couvertes (allemand, français, espagnol, portugais, italien), le modèle small est la valeur par défaut pratique. Pour les écritures non latines et les langues moins dotées en ressources, passez au modèle medium. Le grand modèle est mieux réservé à la transcription par lots d'enregistrements de longue durée, où son entraînement sur de longs segments justifie sa puissance de calcul ; sur une courte dictée en direct, les modèles plus petits fonctionnent souvent aussi bien, voire mieux.
Utilisez le mode de détection automatique avec le grand modèle. StarWhisper peut identifier la langue de chaque enregistrement automatiquement. Pour les sessions de dictée en temps réel où vous changez de langue, créez deux profils StarWhisper avec la langue préconfigurée et passez de l'un à l'autre selon vos besoins. C'est plus rapide que de compter sur la détection pour des changements rapides. Consultez la présentation du logiciel de reconnaissance vocale pour en savoir plus sur la configuration du flux de travail.
Activez l'option Traduire vers l'anglais. Cela produit du texte anglais directement à partir de la parole non anglaise sans passer par un service de traduction distinct. Pour la plupart des cas d'utilisation professionnels, la qualité de la traduction est suffisamment bonne pour les notes, les résumés et les documents de travail. Pour les contextes juridiques ou de publication, faites réviser le résultat par un locuteur natif. La qualité de la traduction est la plus élevée pour l'espagnol, le français, l'allemand, le portugais, l'italien et d'autres langues bien représentées dans l'ensemble d'entraînement Whisper.
Le traitement local de StarWhisper peut conserver l'audio sur votre appareil pour les flux de travail hors ligne une fois les modèles disponibles. Cela est pertinent pour le travail sensible au RGPD en Europe, pour la recherche sensible dans des contextes où l'audio ne doit pas traverser les frontières, et pour les contextes professionnels où le sujet nécessite une confidentialité indépendamment de la juridiction légale. Consultez la page sur la reconnaissance vocale hors ligne pour une image complète de la confidentialité.
La configuration de StarWhisper pour une utilisation multilingue prend environ 10 minutes, dont la plupart sont consacrées au téléchargement du modèle. Après cela, aucune configuration continue n'est requise.
Reconnaissance vocale multilingue sur Windows, avec des flux de travail locaux hors ligne
Télécharger StarWhisper gratuitementBien que Whisper gère raisonnablement bien l'alternance codique, des phrases complètes dans une seule langue produisent un résultat plus précis qu'un mélange dense de langues. Si vous dictez des notes et changez naturellement de langue, c'est très bien. Si vous traitez un enregistrement qui alterne entre deux langues par longs blocs, diviser l'audio par section linguistique avant la transcription produit souvent des résultats plus propres.
L'avantage de robustesse de Whisper sur les systèmes plus anciens est le plus important pour l'anglais. Pour les langues autres que l'anglais, le bruit et les artefacts de compression ont un impact négatif plus important sur la précision. Pour les enregistrements avec bruit de fond, l'amélioration de la voix ou le prétraitement de réduction du bruit (même des outils gratuits comme la réduction du bruit d'Audacity) peuvent améliorer de manière significative la précision de la transcription multilingue avant de fournir l'audio à StarWhisper.
La détection automatique est pratique, mais ajoute une petite surcharge de traitement. Si vous passez la majeure partie de votre journée à transcrire dans une seule langue, définissez-la explicitement. Réservez la détection automatique aux situations où vous ne savez vraiment pas dans quelle langue se trouve un enregistrement, ou pour le traitement par lots de fichiers en langues mixtes.
Whisper applique une ponctuation et une capitalisation appropriées à la langue pour la plupart des langues majeures. Les noms communs allemands sont automatiquement capitalisés. Les règles d'espacement françaises pour la ponctuation sont généralement respectées. Le résultat japonais utilise les kanji, hiragana et katakana appropriés. Cependant, pour les documents officiels, une révision finale des conventions spécifiques à chaque langue vaut la peine, en particulier pour les signes de ponctuation moins courants et la capitalisation des noms propres.
StarWhisper prend en charge 96 langues via le moteur Whisper. L'application inclut des préréglages de langue pour plus de 29 langues dans le menu déroulant des paramètres ; d'autres langues peuvent être sélectionnées par leur code ISO. La précision linguistique varie en fonction de la disponibilité des données d'entraînement Whisper, les principales langues mondiales obtenant les meilleurs résultats.
Oui. Le mode de détection automatique identifie la langue parlée à partir des premières secondes de l'audio avant le début de la transcription. La détection est fiable pour les langues majeures. Pour les langues minoritaires ou les dialectes qui partagent des caractéristiques phonologiques avec des langues plus importantes, la sélection manuelle de la langue produit des résultats plus constants.
Non. Whisper est un modèle unique qui gère les 96 langues. Le téléchargement du modèle large-v3 vous donne une capacité multilingue complète dans toutes les langues. Il n'y a pas de fichiers modèles par langue ni de téléchargements de packs linguistiques.
Oui. Activez l'option Traduire vers l'anglais dans les Paramètres pour recevoir du texte anglais à partir de la parole non anglaise. La traduction utilise la capacité de traduction intégrée de Whisper et s'exécute entièrement localement. La qualité est la plus forte pour les principales langues européennes et asiatiques de l'Est. Pour les documents officiels, une révision par un locuteur natif est recommandée.
Pour les langues à écriture latine avec une bonne couverture Whisper (allemand, français, espagnol, portugais, italien et similaires), le modèle small est la valeur par défaut pratique. Pour les écritures non latines (CJK, arabe, cyrillique) et les langues moins dotées en ressources, passez au modèle medium. Le grand modèle est mieux réservé à la transcription par lots de longs enregistrements multilingues ; sur de courts clips, les modèles plus petits le surpassent souvent car ils ont été entraînés sur des segments plus courts.
Oui, pour les flux de travail locaux une fois les modèles requis disponibles. L'audio dans les langues prises en charge peut être traité localement sans service cloud de langue distinct.
Whisper gère raisonnablement bien le mélange de langues à l'intérieur d'une phrase (alternance codique) lorsque les langues sont phonologiquement distinctes. Les termes techniques anglais dans une transcription allemande, ou les phrases françaises dans une interview anglaise, sont généralement transcrits correctement. Pour les enregistrements qui alternent entre deux langues par longues sections, diviser l'audio par section linguistique avant la transcription produit des résultats plus propres.
Une véritable reconnaissance vocale multilingue pour Windows. 96 langues, un seul modèle, flux de travail locaux hors ligne. Gratuit pour commencer, aucun compte requis.