Instalador pré-criado com backends CUDA, Vulkan e CPU. Sem compilação, sem Python, sem procurar modelos. Escolha um modelo, clique em gravar, obtenha uma transcrição. Totalmente offline e assinado.
whisper.cpp é uma porta em C++ do modelo de reconhecimento de fala Whisper da OpenAI, criado por Georgi Gerganov e mantido como um projeto de código aberto no GitHub. O modelo original Whisper foi lançado em Python, o que cria barreiras práticas significativas para a implantação no Windows: instalação do Python, ambientes virtuais, correspondência de versões do PyTorch e do toolkit CUDA e operação via linha de comando. O whisper.cpp remove todas essas dependências implementando o mecanismo de inferência Whisper em C++ portável que compila para um binário nativo.
Para usuários do Windows, o whisper.cpp significa que o reconhecimento de fala Whisper local é acessível sem qualquer infraestrutura Python. O binário compilado é executado diretamente no Windows, suporta aceleração de GPU NVIDIA CUDA e usa os mesmos pesos do modelo Whisper que a implementação em Python. O whisper.cpp no Windows é o que torna o StarWhisper possível. É o mecanismo que alimenta a transcrição local sem exigir que os usuários gerenciem ambientes Python ou ferramentas de linha de comando.
Esta página aborda o que o whisper.cpp faz no Windows, como o StarWhisper o empacota em um aplicativo de desktop, quais configurações de hardware são suportadas e como o whisper.cpp se compara à execução do Whisper em Python no Windows.
O whisper.cpp suporta todos os cinco tamanhos de modelo Whisper: tiny (39M params), base (74M), small (244M), medium (769M) e large-v3 (1.5B). Os arquivos do modelo são pesos padrão no formato GGML que podem ser baixados do repositório de modelos Hugging Face ou incluídos nos instaladores. O StarWhisper inclui tiny, base e small no instalador completo; medium e large estão disponíveis como downloads de modelo Pro.
O whisper.cpp inclui suporte CUDA que proporciona um aumento de velocidade de 5-15x em relação à inferência apenas em CPU para os modelos médio e grande. A inferência em GPU requer uma GPU NVIDIA com capacidade de computação CUDA 5.0 ou superior (essencialmente qualquer GPU NVIDIA da série GTX 900 ou mais recente). O StarWhisper detecta automaticamente GPUs NVIDIA na inicialização e roteia automaticamente o processamento para CUDA quando disponível.
O mesmo arquivo de modelo gerencia todos os 96 idiomas que o Whisper suporta. A especificação do idioma é um parâmetro de tempo de execução, não um download de modelo separado. O whisper.cpp também implementa o modo de tradução do Whisper, que transcreve áudio em um idioma enquanto produz texto em inglês. O StarWhisper expõe tanto a seleção de idioma quanto a tradução para inglês como opções voltadas para o usuário.
O whisper.cpp produz timestamps em nível de palavra e de segmento junto com o texto da transcrição. O StarWhisper os usa para gerar arquivos de legendas SRT e para suportar a exibição de timestamps no painel de saída de transcrição. Os timestamps são precisos dentro de algumas centenas de milissegundos para o ritmo padrão da fala.
O whisper.cpp implementa otimizações de CPU SIMD (AVX, AVX2, AVX-512, onde disponível) para inferência mais rápida em máquinas sem GPUs NVIDIA. O suporte a GPU AMD via ROCm está disponível em algumas compilações. O suporte a Apple Metal existe para compilações Mac; isso não é relevante para o Windows, mas ilustra o investimento em otimização multiplataforma no projeto whisper.cpp.
O StarWhisper envia um binário whisper.cpp pré-compilado para Windows x64. Este binário é vinculado estaticamente às suas dependências, sempre que possível, minimizando os requisitos de dependência de tempo de execução. A instalação não requer Python, Conda, pip ou qualquer gerenciador de pacotes. Toda a pilha de software é instalada através de um instalador padrão do Windows em menos de um minuto.
A interface do usuário do StarWhisper é construída com Electron, que fornece a camada GUI multiplataforma. O frontend Electron se comunica com o processo backend whisper.cpp através de um mecanismo IPC local. Da perspectiva do usuário, isso é totalmente transparente: apresenta-se como um aplicativo Windows padrão. O processo whisper.cpp é executado separadamente da GUI, para que cargas de trabalho pesadas de transcrição não bloqueiem a interface.
As compilações habilitadas para CUDA do whisper.cpp exigem bibliotecas de runtime CUDA. O StarWhisper inclui os arquivos de runtime CUDA necessários para que os usuários não precisem instalar o toolkit CUDA completo separadamente. Apenas o driver da GPU NVIDIA precisa estar presente no sistema do usuário. O runtime CUDA incluído é compatível com todos os drivers de GPU NVIDIA suportados dos últimos anos.
Os arquivos de modelo do whisper.cpp estão no formato GGML, variando de ~75MB (tiny) a ~3GB (large-v3). O StarWhisper lida com o download, o local de armazenamento e a seleção do modelo através do painel Configurações. Os usuários não interagem com arquivos de modelo brutos. O aplicativo verifica a integridade do arquivo do modelo após o download e alerta os usuários se um arquivo de modelo estiver corrompido ou incompleto.
Carregar um modelo Whisper na memória leva de 2 a 10 segundos, dependendo do tamanho do modelo e da velocidade de armazenamento. O StarWhisper mantém o processo de trabalho whisper.cpp em execução persistente com o modelo selecionado carregado, para que solicitações individuais de transcrição não incorram em tempo de carregamento do modelo. Esta é a arquitetura por trás da resposta rápida em tempo real do StarWhisper: o modelo está sempre pronto, não carregado por solicitação.
Essas estimativas de desempenho são para um arquivo de áudio de 60 minutos processado com whisper.cpp no Windows:
| Modelo | Apenas CPU (desktop moderno) | RTX 3070 (GPU) | RAM Necessária |
|---|---|---|---|
| tiny | ~6 min | ~1 min | ~1 GB |
| small | ~60 min | ~4 min | ~2 GB |
| medium | ~200 min | ~15 min | ~5 GB |
| large-v3 | ~600 min | ~40 min | ~10 GB |
As estimativas variam com a geração de CPU/GPU, características do áudio e carga do sistema. Os requisitos de RAM da GPU são para VRAM durante a inferência; os requisitos de RAM do sistema são menores para inferência em CPU. O repositório GitHub whisper.cpp possui benchmarks da comunidade para uma gama mais ampla de configurações de hardware.
Use o modelo small por padrão. Em nossos benchmarks de modo automático em ditados mistos e áudio de reuniões, o small superou consistentemente o medium e o large em clipes curtos. Medium e large alucinam mais em entradas de contexto curto (provavelmente porque foram treinados em segmentos mais longos). Small é executado aproximadamente em velocidade real em uma CPU de desktop moderno e produz uma saída limpa em idiomas com alfabeto latino sem GPU.
Use o medium apenas para scripts não latinos (CJK, árabe, cirílico) ou áudio contínuo de formato longo. Use o large-v3 apenas quando a precisão é mais importante que a velocidade e você tem uma GPU. Em clipes curtos de ditado, ambos os modelos maiores são propensos a inserir frases que nunca foram faladas. Se você não tem certeza de qual escolher, fique no small.
A aceleração CUDA é automática. Uma RTX 3060 ou superior com 8GB de VRAM executa o modelo small a 8-10x a velocidade real e o modelo medium a 3-4x a velocidade real. O modelo large-v3 requer 10GB de VRAM ou volta para a CPU para o excesso. Mesmo em uma GPU de ponta, o small continua sendo o padrão recomendado para ditado curto; large é para transcrição em lote de áudio de formato longo.
Windows 10/11 (64 bits), 8GB de RAM, qualquer CPU moderna de vários núcleos. Para aceleração de GPU: NVIDIA GeForce GTX 1060 6GB ou superior com drivers NVIDIA atuais. SSDs melhoram significativamente o tempo de carregamento do modelo, mas têm efeito mínimo na velocidade de inferência quando o modelo está carregado na memória.
Não. O StarWhisper inclui um binário whisper.cpp pré-compilado para Windows. Sem Python, sem Conda, sem configuração de linha de comando. Instale o StarWhisper e o whisper.cpp está pronto para uso através da GUI.
O whisper.cpp tem suporte experimental para GPU AMD ROCm, mas é significativamente menos maduro do que o suporte NVIDIA CUDA no Windows. O StarWhisper visa atualmente o NVIDIA CUDA para aceleração de GPU. Os usuários de GPU AMD devem esperar desempenho de nível de CPU em vez de desempenho acelerado por GPU.
Sim, para fins práticos. O whisper.cpp usa os mesmos pesos de modelo no formato GGML que a implementação Python e alcança precisão equivalente. Pequenas diferenças numéricas existem devido a diferenças de precisão de ponto flutuante no GGML versus PyTorch, mas não são perceptíveis na saída de transcrição do mundo real.
tiny: ~75MB, base: ~145MB, small: ~465MB, medium: ~1.5GB, large-v3: ~3GB. O instalador completo do StarWhisper com tiny + base + small incluídos é de aproximadamente 700MB. Modelos adicionais são baixados sob demanda no painel Configurações.
O StarWhisper torna o whisper.cpp acessível no Windows sem Python, trabalho de linha de comando ou instalação do toolkit CUDA. Plano gratuito sem necessidade de conta. Pro por $10/mês para uso ilimitado e modelos maiores.