Funciona con Whisper AI

Whisper.cpp en Windows
Sin la línea de comandos

Instalador precompilado con backends CUDA, Vulkan y CPU. Sin compilación, sin Python, sin búsqueda de modelos. Elija un modelo, haga clic en grabar, obtenga una transcripción. Completamente sin conexión y firmado.

Servicios en la nube (10 horas) $100-150/mes
StarWhisper Pro (Ilimitado) $10/mes
Plan Gratis de StarWhisper $0 (500 palabras/día)
Sin tarifas por minuto | Procesamiento local | Privacidad total
Descargar para Windows
Microsoft Store
  • Confiable por Windows
  • Configuración rápida de 30 segundos
Más
"Whisper.cpp para Windows..."

¿Qué es whisper.cpp y por qué es importante para Windows?

whisper.cpp es un puerto en C++ del modelo de reconocimiento de voz Whisper de OpenAI, creado por Georgi Gerganov y mantenido como un proyecto de código abierto en GitHub. El modelo Whisper original se publicó en Python, lo que crea importantes barreras prácticas para el despliegue en Windows: instalación de Python, entornos virtuales, coincidencia de versiones de PyTorch y CUDA toolkit, y operación por línea de comandos. whisper.cpp elimina todas estas dependencias al implementar el motor de inferencia Whisper en C++ portátil que se compila a un binario nativo.

Para los usuarios de Windows, whisper.cpp significa que el reconocimiento de voz Whisper local es accesible sin ninguna infraestructura de Python. El binario compilado se ejecuta directamente en Windows, admite la aceleración de GPU NVIDIA CUDA y utiliza los mismos pesos del modelo Whisper que la implementación en Python. whisper.cpp en Windows es lo que hace posible StarWhisper. Es el motor que potencia la transcripción local sin requerir que los usuarios gestionen entornos de Python o herramientas de línea de comandos.

Esta página cubre qué hace whisper.cpp en Windows, cómo StarWhisper lo empaqueta en una aplicación de escritorio, qué configuraciones de hardware son compatibles y cómo se compara whisper.cpp con ejecutar Whisper en Python en Windows.

whisper.cpp en Windows: Capacidades técnicas

Los cinco tamaños de modelo Whisper

whisper.cpp admite los cinco tamaños de modelo Whisper: tiny (39M params), base (74M), small (244M), medium (769M) y large-v3 (1.5B). Los archivos de modelo son pesos estándar en formato GGML que se pueden descargar del repositorio de modelos Hugging Face o empaquetarse con los instaladores. StarWhisper incluye tiny, base y small en el instalador completo; medium y large están disponibles como descargas de modelos Pro.

Aceleración GPU NVIDIA CUDA

whisper.cpp incluye soporte CUDA que proporciona una aceleración de 5 a 15 veces respecto a la inferencia solo con CPU para los modelos medium y large. La inferencia con GPU requiere una GPU NVIDIA con CUDA Compute Capability 5.0 o superior (básicamente cualquier GPU NVIDIA de la serie GTX 900 o más reciente). StarWhisper detecta automáticamente las GPU NVIDIA al inicio y enruta el procesamiento a CUDA cuando está disponible.

Soporte multilingüe de 96 idiomas

El mismo archivo de modelo maneja los 96 idiomas que Whisper admite. La especificación del idioma es un parámetro en tiempo de ejecución, no una descarga de modelo separada. whisper.cpp también implementa el modo de traducción de Whisper, que transcribe el audio en un idioma mientras genera texto en inglés. StarWhisper expone tanto la selección de idioma como la traducción al inglés como opciones visibles para el usuario.

Salida de marcas de tiempo

whisper.cpp produce marcas de tiempo a nivel de palabra y de segmento junto con el texto de la transcripción. StarWhisper las utiliza para generar archivos de subtítulos SRT y para admitir la visualización de marcas de tiempo en el panel de salida de transcripción. Las marcas de tiempo son precisas dentro de unos cientos de milisegundos para un ritmo de habla estándar.

Optimizaciones de CPU para hardware sin GPU

whisper.cpp implementa optimizaciones de CPU SIMD (AVX, AVX2, AVX-512 cuando está disponible) para una inferencia más rápida en máquinas sin GPU NVIDIA. La compatibilidad con GPU AMD a través de ROCm está disponible en algunas compilaciones. El soporte de Apple Metal existe para las compilaciones de Mac; esto no es relevante para Windows pero ilustra la inversión en optimización multiplataforma del proyecto whisper.cpp.

Cómo StarWhisper empaqueta whisper.cpp para Windows

1. Binario compilado, no se requiere Python

StarWhisper distribuye un binario whisper.cpp precompilado para Windows x64. Este binario está vinculado estáticamente con sus dependencias cuando es posible, minimizando los requisitos de dependencias en tiempo de ejecución. La instalación no requiere Python, Conda, pip ni ningún gestor de paquetes. Toda la pila de software se instala a través de un instalador estándar de Windows en menos de un minuto.

2. Envoltorio GUI de Electron

La interfaz de usuario de StarWhisper está construida con Electron, que proporciona la capa GUI multiplataforma. El frontend de Electron se comunica con el proceso del backend whisper.cpp a través de un mecanismo IPC local. Desde la perspectiva del usuario, esto es completamente transparente: se presenta como una aplicación estándar de Windows. El proceso whisper.cpp se ejecuta por separado de la GUI, por lo que las cargas de trabajo pesadas de transcripción no bloquean la interfaz.

3. Tiempo de ejecución CUDA incluido

Las compilaciones de whisper.cpp habilitadas para CUDA requieren las bibliotecas de tiempo de ejecución de CUDA. StarWhisper incluye los archivos necesarios del tiempo de ejecución de CUDA para que los usuarios no necesiten instalar el kit de herramientas CUDA completo por separado. Solo es necesario que el controlador de la GPU NVIDIA esté presente en el sistema del usuario. El tiempo de ejecución de CUDA incluido es compatible con todos los controladores de GPU NVIDIA compatibles de los últimos años.

4. Gestión de modelos

Los archivos de modelo de whisper.cpp están en formato GGML y oscilan entre ~75 MB (tiny) y ~3 GB (large-v3). StarWhisper maneja la descarga, la ubicación de almacenamiento y la selección de los modelos a través del panel Configuración. Los usuarios no interactúan con archivos de modelo sin procesar. La aplicación verifica la integridad del archivo del modelo después de la descarga y alerta a los usuarios si un archivo de modelo está dañado o incompleto.

5. Proceso de trabajador persistente

Cargar un modelo Whisper en la memoria tarda entre 2 y 10 segundos dependiendo del tamaño del modelo y la velocidad de almacenamiento. StarWhisper mantiene el proceso de trabajo whisper.cpp ejecutándose persistentemente con el modelo seleccionado cargado, por lo que las solicitudes individuales de transcripción no incurren en tiempo de carga del modelo. Esta es la arquitectura detrás de la rápida respuesta en tiempo real de StarWhisper: el modelo siempre está listo, no cargado por solicitud.

Rendimiento de whisper.cpp en Windows: Puntos de referencia

Estas estimaciones de rendimiento son para un archivo de audio de 60 minutos procesado con whisper.cpp en Windows:

Modelo Solo CPU (escritorio moderno) RTX 3070 (GPU) RAM necesaria
tiny ~6 min ~1 min ~1 GB
small ~60 min ~4 min ~2 GB
medium ~200 min ~15 min ~5 GB
large-v3 ~600 min ~40 min ~10 GB

Las estimaciones varían según la generación de CPU/GPU, las características del audio y la carga del sistema. Los requisitos de RAM de GPU son para VRAM durante la inferencia; los requisitos de RAM del sistema son menores para la inferencia por CPU. El repositorio GitHub de whisper.cpp tiene puntos de referencia de la comunidad para una gama más amplia de configuraciones de hardware.

Elegir hardware para whisper.cpp en Windows

Qué modelo elegir

Use el modelo small de forma predeterminada. En nuestros puntos de referencia en modo automático con dictados mezclados y audio de reuniones, small superó consistentemente a medium y large en clips cortos. Medium y large alucinan más con entradas de contexto corto (probablemente porque se entrenaron en segmentos más largos). Small funciona aproximadamente a velocidad de tiempo real en una CPU de escritorio moderna y produce una salida limpia en idiomas con alfabeto latino sin GPU.

Cuándo usar medium o large

Use medium solo para alfabetos no latinos (CJK, árabe, cirílico) o audio continuo de forma larga. Use large-v3 solo cuando la precisión sea más importante que la velocidad y tenga una GPU. En clips cortos de dictado, es probable que ambos modelos más grandes inserten frases que nunca se pronunciaron. Si no está seguro de cuál elegir, quédese en small.

Si tiene una GPU NVIDIA

La aceleración CUDA es automática. Una RTX 3060 o superior con 8 GB de VRAM ejecuta el modelo small a 8-10x la velocidad de tiempo real y el modelo medium a 3-4x la velocidad de tiempo real. El modelo large-v3 requiere 10 GB de VRAM o recurre a la CPU para el desbordamiento. Incluso en una GPU alta gama, small sigue siendo el valor predeterminado recomendado para dictados cortos; large es para la transcripción por lotes de audio de forma larga.

Especificación mínima recomendada

Windows 10/11 (64 bits), 8 GB de RAM, cualquier CPU multinúcleo moderna. Para aceleración de GPU: NVIDIA GeForce GTX 1060 6 GB o mejor con controladores NVIDIA actuales. Las SSD mejoran significativamente el tiempo de carga del modelo, pero tienen un efecto mínimo en la velocidad de inferencia una vez que el modelo está cargado en la memoria.

Preguntas frecuentes: whisper.cpp en Windows

¿Necesito instalar Python para usar whisper.cpp en Windows?

No. StarWhisper incluye un binario whisper.cpp precompilado para Windows. No se necesita Python, Conda ni configuración de línea de comandos. Instale StarWhisper y whisper.cpp estará listo para usar a través de la interfaz gráfica.

¿La versión de Windows de whisper.cpp admite GPU AMD?

whisper.cpp tiene soporte experimental para GPU AMD ROCm, pero es significativamente menos maduro que el soporte NVIDIA CUDA en Windows. StarWhisper actualmente apunta a NVIDIA CUDA para la aceleración por GPU. Los usuarios de GPU AMD deben esperar un rendimiento de nivel de CPU en lugar de un rendimiento acelerado por GPU.

¿Es whisper.cpp en Windows tan preciso como la implementación de Python Whisper?

Sí, para fines prácticos. whisper.cpp utiliza los mismos pesos de modelo en formato GGML que la implementación de Python y achieves una precisión equivalente. Existen pequeñas diferencias numéricas debido a diferencias de precisión de punto flotante en GGML versus PyTorch, pero estas no son perceptibles en la salida de transcripción del mundo real.

¿Cuánto espacio en disco requieren los modelos whisper.cpp en Windows?

tiny: ~75 MB, base: ~145 MB, small: ~465 MB, medium: ~1.5 GB, large-v3: ~3 GB. El instalador completo de StarWhisper con tiny + base + small incluido es de aproximadamente 700 MB. Los modelos adicionales se descargan a pedido desde el panel Configuración.

whisper.cpp en Windows sin la molestia de la configuración

StarWhisper hace que whisper.cpp sea accesible en Windows sin Python, trabajo de línea de comandos o instalación del kit de herramientas CUDA. Plan gratuito sin necesidad de cuenta. Pro por $10/mes para uso ilimitado y modelos más grandes.

Descargar Gratis Ver la aplicación de escritorio