Usa OpenAI Whisper sin programar ni usar la línea de comandos. Interfaz de escritorio sencilla con todos los modelos de Whisper. Funciona sin conexión o con la API de OpenAI.
OpenAI Whisper es un sistema de reconocimiento automático de voz (ASR) lanzado por OpenAI en septiembre de 2022. Entrenado con 680.000 horas de datos supervisados multilingües y multitarea recopilados de Internet, estableció nuevos puntos de referencia tanto en el reconocimiento de voz en inglés como multilingüe. A diferencia de los sistemas ASR anteriores de vanguardia que requerían un ajuste fino específico de dominio para alcanzar una precisión profesional, la escala de datos de entrenamiento de Whisper produjo un modelo de propósito general con una gran robustez en diversas condiciones de grabación, acentos, estilos de habla e idiomas.
La innovación clave en OpenAI Whisper voz a texto no es una arquitectura novedosa; utiliza un Transformer codificador-decodificador estándar. La innovación radica en la escala de los datos de entrenamiento y el enfoque multitarea: el modelo se entrenó simultáneamente en transcripción, traducción, identificación de idiomas y detección de actividad de voz en 96 idiomas. Este entrenamiento multitarea produce una generalización significativamente mejor que los modelos entrenados en distribuciones de voz más estrechas.
StarWhisper empaqueta OpenAI Whisper voz a texto en una aplicación de escritorio para Windows usando whisper.cpp, un entorno de ejecución en C++ que elimina la dependencia de Python y hace que el procesamiento local de Whisper sea accesible para usuarios no técnicos sin trabajo en línea de comandos. Esta página explica las capacidades de Whisper, las variantes del modelo y cómo StarWhisper las expone en el uso diario.
Whisper se publica en cinco tamaños de modelo con diferentes equilibrios entre precisión y velocidad. Comprender qué modelo usar para tu trabajo evita compromisos innecesarios en cualquiera de las dos dimensiones:
| Modelo | Parámetros | WER en Inglés | Velocidad CPU (aprox.) | Plan StarWhisper |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x tiempo real | Gratis (incluido) |
| base | 74M | ~10% WER | ~7x tiempo real | Gratis (incluido) |
| small | 244M | ~5.5% WER | ~1x tiempo real | Gratis (incluido) |
| medium | 769M | ~3.5% WER | ~0.3x tiempo real | Pro |
| large-v3 | 1.5B | ~2.5% WER | ~0.1x tiempo real | Pro |
WER = Tasa de Error de Palabra en el conjunto de prueba limpio de LibriSpeech. Cuanto más bajo, mejor. Las velocidades de CPU son estimaciones en una CPU de escritorio moderna; las velocidades de GPU son de 5 a 10 veces más rápidas para los modelos medium y large.
Para la mayoría de los casos de uso de dictado en tiempo real, el modelo small (incluido gratis) logra una precisión del 94-96% con una velocidad de procesamiento lo suficientemente rápida para una salida casi en tiempo real, y es el predeterminado práctico que recomendamos incluso para usuarios con GPU. El modelo large-v3 es mejor reservarlo para la transcripción por lotes de archivos largos, donde su entrenamiento en segmentos largos justifica su cómputo; en clips cortos de dictado, large-v3 puede corregir en exceso y alucinar más que small.
Ejecutar OpenAI Whisper voz a texto desde el repositorio oficial requiere Python 3.9+, PyTorch, ffmpeg y, a menudo, versiones específicas del kit de herramientas CUDA que coincidan con el controlador de tu GPU. Para los no desarrolladores, esta es una barrera importante. StarWhisper elimina esto por completo. El entorno de ejecución whisper.cpp es un ejecutable nativo de Windows compilado e incluido en el instalador. Instala StarWhisper, ábrelo, transcribe. Sin terminal, sin gestores de paquetes, sin conflictos de versiones.
StarWhisper incluye los modelos tiny, base y small en el instalador para su uso inmediato. Desde el panel de Configuración, los suscriptores Pro pueden descargar medium y large-v3 directamente dentro de la aplicación. La gestión del modelo, la descarga, el cambio y la verificación de integridad se manejan a través de la interfaz gráfica sin colocación manual de archivos ni configuración.
StarWhisper detecta automáticamente las GPU NVIDIA y enruta la inferencia de whisper.cpp a CUDA cuando esté disponible. La aceleración de GPU hace que OpenAI Whisper voz a texto sea de 5 a 15 veces más rápido que el procesamiento solo con CPU, según el tamaño del modelo. El modelo large-v3, que toma 10x el tiempo real en CPU, se ejecuta aproximadamente a 1.5-2x el tiempo real en una GPU NVIDIA de gama media, lo que significa que una grabación de 30 minutos se transcribe en menos de 25 minutos en lugar de cinco horas.
El modelo oficial de OpenAI Whisper no fue diseñado para la transmisión en tiempo real; procesa el audio en fragmentos fijos. El segmentador de transmisión de StarWhisper maneja el audio en ventanas continuas de 3 a 5 segundos, proporcionando una salida casi en tiempo real mientras mantiene la precisión mediante el uso de ventanas de contexto superpuestas. Esto es técnicamente más complejo que el procesamiento por lotes, pero esencial para los flujos de trabajo de dictado en vivo. El resultado es la precisión de OpenAI Whisper voz a texto en un contexto de dictado en vivo, no solo para archivos subidos.
A diferencia del uso de la API de OpenAI Whisper (que envía el audio a los servidores de OpenAI e incurre en costos por minuto), la implementación local de StarWhisper mantiene todo el audio en tu dispositivo. Consulta la página de voz a texto sin conexión para Windows para ver los detalles de privacidad y seguridad del procesamiento local de Whisper.
OpenAI ofrece Whisper como una API en la nube a $0.006 por minuto de audio. A primera vista esto parece barato; para un uso profesional de 4 horas/mes son $1.44. Pero esta comparación ignora varios factores importantes:
La documentación de la API de OpenAI Whisper es la referencia para la API en la nube. Para los usuarios que desean la misma precisión de Whisper sin los costos de la nube y las implicaciones de privacidad, StarWhisper es la alternativa práctica.
Usa el modelo small (incluido, gratis). Procesa aproximadamente a la velocidad de tiempo real en CPU, más rápido en GPU, y ofrece una precisión del 94-96% en voz clara. Para la mayoría de las tareas de dictado (correos electrónicos, notas, documentos), esto es suficiente con correcciones mínimas necesarias.
Para la transcripción de archivos de formato largo (conferencias, entrevistas, podcasts) donde no estás esperando en tiempo real, large-v3 (Pro) en GPU es la herramienta adecuada. El contexto adicional ayuda en audio largo y desafiante (acentos, ruido, vocabulario técnico). Mantén small como tu predeterminado para dictado en vivo y cambia a large-v3 específicamente para trabajos por lotes; en clips cortos, large-v3 tiende a corregir en exceso.
Para escrituras no latinas (CJK, árabe, cirílico) y grabaciones multilingües de formato largo, el modelo medium suele ser el paso intermedio adecuado desde small, ya que el rendimiento multilingüe de small puede disminuir en esas escrituras. Consulta la guía de voz a texto multilingüe para recomendaciones por idioma.
El modelo medium en CPU es lento (0.3x tiempo real) pero logra una precisión del 96-97%, aceptable para la transcripción por lotes de archivos donde no estás esperando en tiempo real. Para los usuarios de CPU que desan una precisión superior a small, ejecuten la transcripción por lotes durante la noche en lugar de esperar de forma activa.
OpenAI Whisper voz a texto en tu máquina Windows, gratis para empezar
Descargar StarWhisperOpenAI Whisper es el modelo, un sistema de reconocimiento de voz de código abierto. La API de Whisper es un servicio en la nube que ejecuta el modelo en los servidores de OpenAI y cobra por minuto. StarWhisper ejecuta el mismo modelo localmente en tu máquina, sin transmisión de audio y sin costo por minuto.
Para el dictado de clips cortos y la mayoría del trabajo de escritura por voz, el modelo Small es el predeterminado práctico que recomendamos. Aunque Large-v3 es el modelo de propósito general más grande de Whisper en el lanzamiento de código abierto, en audio corto tiende a alucinar más que Small porque fue entrenado con segmentos más largos. Usa Medium para audio largo o escrituras no latinas (CJK, árabe, cirílico); reserva Large-v3 para la transcripción por lotes de archivos largos. Los nuevos lanzamientos oficiales de Whisper serán compatibles a medida que estén disponibles.
StarWhisper no requiere Python, ni configuración del kit de herramientas CUDA, ni trabajo en línea de comandos, y proporciona una interfaz gráfica con dictado en vivo, transcripción de archivos, gestión de modelos y control de teclas de acceso rápido. Es la diferencia entre usar software profesional y ejecutar código de investigación.
Whisper fue entrenado con audio web que incluye conferencias médicas, procedimientos legales y contenido técnico. Maneja la terminología médica y legal común razonablemente bien. Para vocabulario altamente especializado, la precisión depende de la frecuencia con la que esos términos aparecen en los datos de entrenamiento; los términos técnicos raros pueden requerir edición posterior.