Use OpenAI Whisper sem codificação ou linha de comando. Interface de desktop simples com todos os modelos Whisper. Funciona offline ou com a API OpenAI.
OpenAI Whisper é um sistema de reconhecimento automático de fala (ASR) lançado pela OpenAI em setembro de 2022. Treinado em 680.000 horas de dados multilíngues e multitarefas supervisionados coletados da internet, ele estabeleceu novos benchmarks tanto no reconhecimento de fala em inglês quanto multilíngue. Ao contrário dos sistemas ASR de ponta anteriores que exigiam ajuste fino específico do domínio para atingir precisão profissional, a escala dos dados de treinamento do Whisper produziu um modelo de propósito geral com forte robustez entre condições de gravação, sotaques, estilos de fala e idiomas.
A inovação chave no OpenAI Whisper fala para texto não é uma arquitetura nova, ele usa um Transformer codificador-decodificador padrão. A inovação está na escala dos dados de treinamento e no enquadramento multitarefa: o modelo foi treinado simultaneamente em transcrição, tradução, identificação de idioma e detecção de atividade de voz em 96 idiomas. Este treinamento multitarefa produz uma generalização significativamente melhor do que modelos treinados em distribuições de fala mais restritas.
O StarWhisper empacota OpenAI Whisper fala para texto em um aplicativo de desktop Windows usando whisper.cpp, um runtime C++ que remove a dependência do Python e torna o processamento local do Whisper acessível a usuários não técnicos sem trabalho de linha de comando. Esta página explica as capacidades do Whisper, variantes de modelo e como o StarWhisper as expõe no uso diário.
Whisper é lançado em cinco tamanhos de modelo com diferentes compensações de precisão-velocidade. Entender qual modelo usar para o seu trabalho evita compromissos desnecessários em qualquer dimensão:
| Modelo | Parâmetros | WER Inglês | Velocidade CPU (est.) | Plano StarWhisper |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x tempo real | Grátis (incluído) |
| base | 74M | ~10% WER | ~7x tempo real | Grátis (incluído) |
| small | 244M | ~5,5% WER | ~1x tempo real | Grátis (incluído) |
| medium | 769M | ~3,5% WER | ~0,3x tempo real | Pro |
| large-v3 | 1.5B | ~2,5% WER | ~0,1x tempo real | Pro |
WER = Taxa de Erro de Palavras no conjunto de teste Limpo LibriSpeech. Menor é melhor. As velocidades de CPU são estimativas em uma CPU de desktop moderna; velocidades de GPU são 5-10x mais rápidas para modelos médios e grandes.
Para a maioria dos casos de uso de ditado em tempo real, o modelo small (incluído gratuitamente) atinge 94-96% de precisão com velocidade de processamento rápida o suficiente para saída quase em tempo real, sendo o padrão prático que recomendamos mesmo para usuários de GPU. O modelo large-v3 é melhor reservado para transcrição em lote de arquivos longos, onde seu treinamento em segmentos longos justifica o custo computacional; em clipes de ditado curtos, large-v3 pode corrigir excessivamente e alucinar mais do que o small.
Executar OpenAI Whisper fala para texto a partir do repositório oficial requer Python 3.9+, PyTorch, ffmpeg e, frequentemente, versões específicas do toolkit CUDA correspondentes ao driver da sua GPU. Para não desenvolvedores, essa é uma barreira significativa. O StarWhisper elimina isso totalmente. O runtime whisper.cpp é um executável nativo Windows compilado incluído no instalador. Instale o StarWhisper, abra-o, transcreva. Sem terminal, sem gerenciadores de pacotes, sem conflitos de versão.
O StarWhisper empacota os modelos tiny, base e small no instalador para uso imediato. A partir do painel Configurações, assinantes Pro podem baixar medium e large-v3 diretamente no aplicativo. O gerenciamento de modelo, download, troca e verificação de integridade é feito através da GUI sem colocação manual de arquivos ou configuração.
O StarWhisper detecta GPUs NVIDIA automaticamente e roteia a inferência do whisper.cpp para CUDA onde disponível. A aceleração da GPU torna OpenAI Whisper fala para texto 5-15x mais rápido do que o processamento apenas por CPU, dependendo do tamanho do modelo. O modelo large-v3, que leva 10x o tempo real na CPU, roda em aproximadamente 1,5-2x o tempo real em uma GPU NVIDIA de gama média, significando que uma gravação de 30 minutos é transcrita em menos de 25 minutos em vez de cinco horas.
O modelo OpenAI Whisper oficial não foi projetado para streaming em tempo real, ele processa áudio em chunks fixos. O segmentador de streaming do StarWhisper lida com o áudio em janelas rolantes de 3-5 segundos, fornecendo saída quase em tempo real, mantendo a precisão usando janelas de contexto sobrepostas. Isso é tecnicamente mais complexo do que o processamento em lote, mas essencial para fluxos de trabalho de ditado ao vivo. O resultado é a precisão de fala para texto OpenAI Whisper em um contexto de ditado ao vivo, não apenas para arquivos enviados.
Ao contrário do uso da API OpenAI Whisper (que envia áudio para os servidores da OpenAI e incorre em custos por minuto), a implementação local do StarWhisper mantém todo o áudio no seu dispositivo. Consulte a página fala para texto offline Windows para detalhes de privacidade e segurança do processamento local Whisper.
A OpenAI oferece o Whisper como uma API de nuvem a $0,006 por minuto de áudio. À primeira vista, isso parece barato; para uso profissional a 4 horas/mês, são $1,44. Mas essa comparação ignora vários fatores importantes:
A documentação da API OpenAI Whisper é a referência para a API de nuvem. Para usuários que desejam a mesma precisão do Whisper sem os custos de nuvem e implicações de privacidade, o StarWhisper é a alternativa prática.
Use o modelo small (incluído, gratuito). Ele processa aproximadamente na velocidade do tempo real na CPU, mais rápido na GPU, e entrega 94-96% de precisão na fala clara. Para a maioria das tarefas de ditado, e-mails, notas, documentos, isso é suficiente com correções mínimas necessárias.
Para transcrição de arquivo em formato longo (conferências, entrevistas, podcasts) onde você não está esperando em tempo real, large-v3 (Pro) na GPU é a ferramenta certa. O contexto extra ajuda em áudios longos desafiadores (sotaques, ruído, vocabulário técnico). Mantenha small como seu padrão de ditado ao vivo e mude para large-v3 especificamente para trabalhos em lote; em clipes curtos, large-v3 tende a corrigir excessivamente.
Para scripts não latinos (CJK, Árabe, Cirílico) e gravações multilíngues de formato longo, o modelo medium é frequentemente o passo correto acima do small, pois o desempenho multilíngue do small pode cair nesses scripts. Consulte o guia fala para texto multilíngue para recomendações por idioma.
O modelo medium na CPU é lento (0,3x tempo real), mas atinge 96-97% de precisão, aceitável para transcrição de arquivo em lote onde você não está esperando em tempo real. Para usuários de CPU que desejam precisão melhor que a do small, execute a transcrição em lote durante a noite em vez de esperar ativamente.
OpenAI Whisper fala para texto na sua máquina Windows, gratuito para começar
Baixar StarWhisperOpenAI Whisper é o modelo, um sistema de reconhecimento de fala de código aberto. A API Whisper é um serviço de nuvem que executa o modelo nos servidores da OpenAI e cobra por minuto. O StarWhisper executa o mesmo modelo localmente na sua máquina, sem transmissão de áudio e sem custo por minuto.
Para ditado de clipes curtos e a maioria do trabalho de digitação por voz, o modelo Small é o padrão prático que recomendamos. Embora Large-v3 seja o maior modelo de propósito geral Whisper no lançamento de código aberto, em áudio curto ele tende a alucinar mais do que o Small porque foi treinado em segmentos mais longos. Use Medium para áudio em formato longo ou scripts não latinos (CJK, Árabe, Cirílico); reserve Large-v3 para transcrição em lote de arquivos longos. Novos lançamentos oficiais do Whisper serão suportados conforme ficarem disponíveis.
O StarWhisper não requer Python, nenhuma configuração de toolkit CUDA, nenhum trabalho de linha de comando e fornece uma GUI com ditado ao vivo, transcrição de arquivos, gerenciamento de modelos e controle de atalhos. É a diferença entre usar software profissional e executar código de pesquisa.
O Whisper foi treinado em áudio da web, que inclui conferências médicas, processos legais e conteúdo técnico. Ele lida com terminologia médica e comum razoavelmente bem. Para vocabulário altamente especializado, a precisão depende da frequência com que esses termos aparecem nos dados de treinamento; termos técnicos raros podem exigir pós-edição.