Logiciel professionnel de transcription d'entretiens pour les journalistes, chercheurs, professionnels des RH et équipes juridiques. Enregistrez et transcrivez vos entretiens en temps réel avec une grande précision grâce à l'IA OpenAI Whisper. Fonctionne entièrement hors ligne pour garder vos conversations sensibles privées.
Chaque journaliste, chercheur qualitatif et podcasteur connaît bien cette friction : vous terminez un entretien de deux heures et vous faites face à la réalité fastidieuse de la transcription. La saisie manuelle prend trois à quatre fois la durée de l'enregistrement. Les logiciels de transcription d'entretiens basés sur le cloud coûtent 0,15 $ à 0,30 $ la minute, ce qui signifie qu'un seul entretien d'investigation de 90 minutes coûte entre 22 $ et 45 $ en frais de transcription, avant même que l'édition ne commence. Pour les chercheurs menant des dizaines d'entretiens de participants par étude, ce calcul devient vite prohibitif.
Mais le coût n'est qu'une partie du problème. Le problème le plus urgent est la confidentialité. Une source lanceuse d'alerte, un survivant de traumatisme décrivant des événements sensibles, un initié d'entreprise partageant des informations confidentielles : aucune de ces personnes n'a consenti à ce que sa voix soit téléchargée sur un serveur AWS en Virginie pour qu'un algorithme de startup la traite. Lorsque vous utilisez la transcription dans le cloud, c'est exactement ce qui se passe. L'audio quitte votre machine, voyage sur Internet et reste sur l'infrastructure de quelqu'un d'autre pendant qu'il est traité.
Les protocoles IRB (Comités d'éthique) universitaires signalent de plus en plus la transcription dans le cloud comme un problème de sécurité des données pour la recherche qualitative impliquant des sujets humains. Les journalistes sont confrontés à des pressions similaires de la part des équipes juridiques de leur publication. Les podcasteurs traitant avec des invités célèbres ou des cadres supérieurs ont souvent des accords de confidentialité (NDA) qui compliquent les téléchargements dans le cloud. Le besoin d'un logiciel de transcription d'entretiens fiable, privé et rentable n'a jamais été aussi pressant, et les solutions existantes n'ont jamais été aussi inadéquates.
Otter.ai et Trint facturent des abonnements et imposent des limites strictes sur les minutes de transcription. Rev facture à la minute pour la transcription humaine ou propose un niveau IA de précision inférieure. Dragon NaturallySpeaking a été conçu pour la dictée, pas pour transcrire une conversation préenregistrée. Aucun de ces outils ne fonctionne hors ligne. Ils envoient tous votre audio hors de votre ordinateur. La plupart sont tarifés pour les budgets des entreprises, pas pour les journalistes indépendants ou les chercheurs doctoraux fonctionnant avec des bourses de département.
StarWhisper est basé sur le modèle Whisper d'OpenAI, l'un des systèmes de reconnaissance vocale open source les plus précis jamais publiés, entraîné sur 680 000 heures d'audio multilingue. La différence clé est que StarWhisper exécute Whisper entièrement sur votre machine Windows locale ; aucun audio ne quitte jamais votre appareil.
Comme tout le traitement se fait localement, il n'y a pas de journal de transmission, pas d'enregistrement côté serveur et aucun accord de traitement de données par des tiers à craindre. L'audio de votre entretien reste sur votre disque dur depuis le moment où vous l'enregistrez jusqu'à celui où vous obtenez la transcription. C'est la seule architecture fiable pour protéger les sources confidentielles dans un flux de travail numérique.
Pour 10 $/mois avec Pro (ou 80 $/an), vous pouvez transcrire des heures illimitées. Un journaliste salarié faisant cinq entretiens par semaine génère environ 400 heures d'audio par an. Les services cloud factureraient entre 3 600 $ et 7 200 $ pour ce volume. StarWhisper Pro coûte 120 $. Pour les chercheurs universitaires avec des études d'entretiens de 50 participants, le calcul est tout aussi sans appel.
Le widget flottant de StarWhisper vous permet de dicter directement dans Word, Google Docs, Notion, Scrivener ou votre CMS. Vous pouvez rejouer l'audio de l'entretien tout en dictant des paraphrases, ou utiliser la transcription en temps réel pour capturer les réponses en direct lors d'une conférence de presse ou d'un panel. La transcription apparaît en ligne, dans l'application sur laquelle vous travaillez déjà.
Avec plus de 29 langues prises en charge, dont l'espagnol, le français, l'allemand, le mandarin, l'arabe, le japonais et le portugais, StarWhisper gère les entretiens internationaux sans étape de traduction distincte. Le modèle multilingue de Whisper peut même détecter automatiquement la langue, ce qui est utile pour les chercheurs menant des études comparatives entre plusieurs pays.
Si vous disposez d'un GPU NVIDIA avec prise en charge CUDA, StarWhisper peut traiter l'audio préenregistré beaucoup plus rapidement qu'en temps réel. Un entretien de 60 minutes prend environ 4 à 8 minutes à transcrire sur un GPU de milieu de gamme utilisant le modèle large-v3. Pour les chercheurs qui transcrivent de vastes corpus d'entretiens, c'est un véritable changement de donne. Les machines à processeur uniquement fonctionnent très bien aussi, juste un peu plus lentement.
Voici à quoi ressemble un flux de travail réaliste pour un journaliste d'investigation d'un journal régional utilisant StarWhisper comme principal logiciel de transcription d'entretiens.
8h30, Préparation avant l'entretien. Ouvrez le widget flottant de StarWhisper. Réglez la langue sur le français, sélectionnez le modèle small (le choix par défaut pratique pour la prise de notes en direct sur n'importe quel PC moderne). Le widget se place dans un coin de l'écran, sans gêner.
9h00, Entretien en direct par téléphone. Cliquez sur enregistrer dans StarWhisper. Au fur et à mesure que la source parle, un aperçu de la transcription en temps réel apparaît en ligne. Les citations clés s'affichent immédiatement à l'écran, fini la course effrénée pour noter les phrases exactes. Le journaliste tape ses questions de suivi dans le Bloc-notes pendant que le moteur de transcription gère la capture.
10h15, Nettoyage post-entretien. La transcription brute se trouve dans un fichier texte sur le bureau. Le journaliste l'ouvre dans Word, parcourt rapidement pour repérer les erreurs (généralement 1 à 3 par heure sur un audio clair), les corrige et met en évidence les citations clés. Temps de nettoyage total : 8 minutes pour un entretien de 75 minutes.
10h25, Début de la rédaction. Le journaliste dicte le brouillon de l'article directement dans le CMS en utilisant le mode dictée de StarWhisper. Il parle naturellement, incluant des commandes de mise en forme, et le texte apparaît directement dans le brouillon de l'article. Plus besoin de faire des allers-retours entre le lecteur audio et le clavier.
14h00, Deuxième entretien via appel vidéo. Enregistrez la sortie audio de l'appel vidéo. Après l'appel, glissez le fichier audio dans le mode de transcription de fichiers de StarWhisper. Cliquez sur traiter. Éloignez-vous. Revenez vers une transcription complète 6 minutes plus tard.
Comparée à la transcription manuelle, cette méthode permet d'économiser environ 2,5 à 3 heures par journée d'entretien. Sur une année de travail journalistique régulier, cela représente des semaines de temps récupéré et plusieurs centaines de dollars économisés sur les frais de transcription dans le cloud.
La confidentialité dans la transcription d'entretiens n'est pas un cas particulier, elle est au cœur du travail. Voici comment StarWhisper aborde les principaux scénarios de conformité rencontrés par les professionnels.
Les lois sur la protection des sources journalistiques, nationales et transfrontalières, varient considérablement. Ce qui reste constant, c'est que le téléchargement de données audio vers un service cloud tiers crée une exposition juridique. Le traitement local de StarWhisper signifie qu'il n'y a pas de serveur susceptible de faire l'objet d'une assignation, pas de politique de conservation des données à négocier et aucun journal d'accès tiers. L'audio reste sur votre machine, sous votre contrôle.
Les protocoles IRB universitaires exigent généralement que les enregistrements d'entretiens soient stockés dans des environnements chiffrés et à accès contrôlé. Les services de transcription cloud ne répondent généralement pas à ces exigences sans un accord de traitement des données signé. StarWhisper fonctionne entièrement hors ligne, ce qui signifie que les informations de santé personnelles (PHI) et les informations d'identification personnelle (PII) ne transitent jamais par un réseau tiers. Cela le rend parfaitement compatible avec le RGPD et approprié pour les contextes de recherche universitaire sensibles au HIPAA. Voir aussi : conseils sur la règle de confidentialité HIPAA du HHS.
Les podcasteurs et les interviewers en entreprise enregistrent fréquemment des invités dans le cadre de NDA qui restreignent la distribution du contenu audio. Le téléchargement d'audio soumis à un NDA vers un service de transcription cloud peut en soi constituer une violation. Le traitement exclusivement local avec StarWhisper élimine entièrement ce risque : l'audio de votre invité ne quitte jamais votre poste de travail.
StarWhisper est conçu pour être opérationnel dans les 10 minutes suivant le premier téléchargement. Voici la procédure d'installation optimisée pour les journalistes et les chercheurs :
Pour les chercheurs gérant de vastes corpus d'entretiens, le plan Pro est une nécessité évidente : un traitement illimité sans plafond signifie que vous pouvez traiter les 50 entretiens en un week-end plutôt que de rationner votre allocation mensuelle de minutes avec un fournisseur cloud. Voir aussi notre guide sur les logiciels de transcription professionnels pour plus de conseils sur les flux de travail.
Voici une analyse concrète du retour sur investissement pour deux profils d'utilisateurs typiques : le journaliste en activité et le chercheur qualitatif universitaire.
3 entretiens/semaine × 50 semaines = 150 entretiens/an
Entretien moyen : 60 minutes
Transcription manuelle évitée : ~270 heures/an
Coût cloud évité : ~1 350 $-2 700 $/an
Coût StarWhisper Pro : 120 $/an
40 entretiens pour l'étude de thèse
Entretien moyen : 90 minutes
Transcription manuelle évitée : ~180 heures
Coût cloud évité : 810 $-1 620 $ (ponctuel)
Coût StarWhisper Pro : 10 $-40 $ au total
Le plan gratuit (500 mots/jour) est adéquat pour des besoins de transcription occasionnels : un étudiant interviewant quelques participants, ou un écrivain transcrivant un seul épisode de podcast par semaine. Le plan Pro se rentabilise dès le premier entretien complet pour quiconque exerçant ce travail sérieusement.
"Je couvre le gouvernement local et je fais environ 8 entretiens par semaine. Avant StarWhisper, je passais mes dimanches après-midi à rattraper mon retard sur la transcription. Maintenant, ce temps est redirigé vers l'écriture. La précision sur les appels téléphoniques enregistrés est véritablement meilleure que ce que j'attendais, je corrige peut-être 5 ou 6 mots par heure d'audio."
, Reporter de journal régional, 3 ans d'utilisation
"Mon protocole IRB exigeait que les données d'entretien ne soient jamais téléchargées sur des serveurs tiers. Cela éliminait immédiatement tous les services cloud. StarWhisper était la seule option Windows que j'ai trouvée qui fonctionne réellement entièrement hors ligne. Le modèle large-v3 gère remarquablement bien le discours mixte anglais/espagnol de mes participants."
, Doctorant en sociologie, recherche de thèse
"Je gère un podcast hebdomadaire sur les affaires. Des épisodes de deux heures, 50 épisodes par an. Je payais 240 $/mois pour un service de transcription cloud. StarWhisper Pro à 80 $/an ne scompare même pas, c'est évidemment le bon choix une fois que l'on réalise que la qualité est équivalente."
, Hôte de podcast B2B, industrie technologique
Sur un audio clair (microphone direct, pièce silencieuse), la précision est généralement de 97 à 99 % avec le modèle small ou medium. L'audio téléphonique compressé ou les environnements bruyants font chuter ce taux à 90-95 % selon les conditions. Le modèle large-v3 gère beaucoup mieux l'audio difficile. La plupart des journalistes rapportent corriger 3 à 8 mots par heure sur des entretiens téléphoniques typiques.
Oui. Exportez l'enregistrement au format MP4 ou MP3 et chargez-le dans le mode de transcription de fichiers de StarWhisper. L'audio est extrait et traité localement. Pour les appels Zoom en direct, vous pouvez utiliser un câble audio virtuel pour acheminer l'audio de l'appel vers StarWhisper pour une transcription en temps réel.
Au sein d'une seule langue dominante, Whisper gère bien les mots et noms étrangers occasionnels. Pour les entretiens qui passent réellement d'une langue à l'autre en milieu de phrase, les résultats sont mitigés : vous obtiendrez la langue dominante avec précision et l'autre langue partiellement. Les entretiens purement monolingues dans n'importe laquelle des plus de 29 langues prises en charge par Whisper sont excellents.
Oui. Comme tout le traitement est local, aucune donnée audio ou de transcription n'est transmise à un tiers ni stockée par un tiers. Cela satisfait les exigences de minimisation des données et de stockage local que la plupart des protocoles IRB imposent pour les enregistrements d'entretiens sensibles. Combinez-le avec un chiffrement complet du disque sur votre ordinateur de recherche pour une conformité maximale.
Avec l'accélération GPU (NVIDIA RTX 3060 ou supérieur) et le modèle medium : environ 4 à 6 minutes. Sur une machine à processeur uniquement avec le modèle small : 15 à 25 minutes selon la vitesse du processeur. Le modèle large-v3 sur GPU prend 8 à 12 minutes pour 60 minutes d'audio. Tous les délais concernent la transcription de fichiers préenregistrés, pas la diffusion en direct.
La diarisation des locuteurs (étiquetage automatique des locuteurs) n'est actuellement pas une fonctionnalité intégrée. La transcription est produite sous forme de flux de texte continu avec des horodatages. Pour les entretiens à deux locuteurs, de nombreux utilisateurs étiquettent manuellement en fonction du contexte, un processus qui prend 5 à 10 minutes pour un entretien typique d'une heure compte tenu de la précision de la transcription de base de StarWhisper.
StarWhisper accepte les formats WAV, MP3, M4A, FLAC, OGG et la plupart des conteneurs audio courants. Les fichiers vidéo (MP4, MOV, MKV) sont également pris en charge ; StarWhisper extrait automatiquement la piste audio. Aucune conversion n'est nécessaire avant l'importation.
Le niveau IA de Rev coûte 0,25 $/minute, un entretien de 60 minutes coûte 15 $, et votre audio est téléchargé sur les serveurs de Rev. Le plan gratuit d'Otter.ai est plafonné à 300 minutes/mois. Les deux services nécessitent Internet. StarWhisper Pro à 10 $/mois est illimité, entièrement hors ligne et ne transmet jamais l'audio. Pour les utilisateurs volumineux ou les travaux sensibles à la vie privée, la comparaison n'est pas serrée. Voir aussi notre comparatif des logiciels de transcription professionnels.
Si vous transcrivez des entretiens, que ce soit en tant que journaliste protégeant ses sources, chercheur respectant les protocoles IRB ou podcasteur gérant des enregistrements sous NDA, la question de l'endroit où va votre audio n'est pas optionnelle. StarWhisper vous offre une réponse véritablement compétitive : nulle part ailleurs que sur votre propre disque dur.
Le plan gratuit démarre immédiatement sans compte requis. Si vous vous retrouvez à transcrire plus de quelques entretiens par mois, Pro à 10 $/mois ou 80 $/an sera rentabilisé dès la première semaine. Téléchargez-le, testez-le sur votre prochain enregistrement d'entretien et jugez par vous-même de la qualité de la transcription.
À lire aussi : Logiciel de dictée pour journaliste • Transcription par dictée vocale pour journaliste • Logiciel de transcription professionnel