Используйте OpenAI Whisper без программирования или командной строки. Простой настольный интерфейс со всеми моделями Whisper. Работает оффлайн или через OpenAI API.
OpenAI Whisper — это система автоматического распознавания речи (ASR), выпущенная OpenAI в сентябре 2022 года. Обученная на 680 000 часах многоязычных и многоцелевых данных под наблюдением, собранных из интернета, она установила новые эталоны в английской и многоязычной распознавании речи. В отличие от предыдущих передовых ASR-систем, требующих специализированной настройки для достижения профессиональной точности, масштаб обучающих данных Whisper позволил создать универсальную модель с высокой надежностью при различных условиях записи, акцентах, стилях речи и языках.
Ключевое новаторство в OpenAI Whisper «Речь в текст» заключается не в новой архитектуре, а используется стандартный кодировщик-декодер Transformer. Инновация — это масштаб обучающих данных и мультизадачная формулировка: модель обучалась одновременно на транскрипции, переводе, идентификации языка и обнаружении голосовой активности на 96 языках. Такое мультизадачное обучение дает значительно лучшую генерализацию, чем модели, обученные на более узких распределениях речи.
StarWhisper упаковывает OpenAI Whisper «Речь в текст» в настольное приложение Windows с помощью whisper.cpp, среды выполнения C++, которая устраняет зависимость от Python и делает локальную обработку Whisper доступной для нетехнических пользователей без работы с командной строкой. На этой странице описаны возможности Whisper, варианты моделей и то, как StarWhisper открывает их для повседневного использования.
Whisper выпущен в пяти размерах моделей с различными компромиссами между точностью и скоростью. Понимание того, какую модель использовать для вашей работы, предотвращает ненужные компромиссы в любом из направлений:
| Модель | Параметры | Английский WER | Скорость CPU (прибл.) | План StarWhisper |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x realtime | Бесплатно (включено) |
| base | 74M | ~10% WER | ~7x realtime | Бесплатно (включено) |
| small | 244M | ~5.5% WER | ~1x realtime | Бесплатно (включено) |
| medium | 769M | ~3.5% WER | ~0.3x realtime | Pro |
| large-v3 | 1.5B | ~2.5% WER | ~0.1x realtime | Pro |
WER = Word Error Rate (коэффициент ошибок в словах) на тестовом наборе LibriSpeech clean. Меньше — лучше. Скорости CPU являются приблизительными для современного процессора; скорости GPU в 5-10 раз быстрее для моделей medium и large.
Для большинства случаев использования прямой диктовки модель small (включена бесплатно) достигает точности 94-96% со скоростью обработки, достаточно высокой для вывода в режиме, близком к реальному времени, и является практическим стандартом, который мы рекомендуем даже пользователям GPU. Модель large-v3 лучше оставить для пакетной транскрипции длинных файлов, где ее обучение на длинных сегментах оправдывает вычислительные затраты; на коротких вставках диктовки large-v3 может переусердствовать с исправлениями и «галлюцинировать» больше, чем small.
Запуск OpenAI Whisper «Речь в текст» из официального репозитория требует Python 3.9+, PyTorch, ffmpeg и часто определенных версий CUDA toolkit, соответствующих драйверу вашего GPU. Для не разработчиков это существенный барьер. StarWhisper полностью устраняет это. Среда выполнения whisper.cpp — это скомпилированный собственный исполняемый файл Windows, включенный в установщик. Установите StarWhisper, откройте его, транскрибируйте. Никакого терминала, менеджеров пакетов, конфликтов версий.
StarWhisper включает модели tiny, base и small в установщик для немедленного использования. Из панели «Настройки» подписчики Pro могут загрузить medium и large-v3 напрямую в приложении. Управление моделями, загрузка, переключение, проверка целостности осуществляется через графический интерфейс без ручного размещения файлов или настройки.
StarWhisper автоматически обнаруживает GPU NVIDIA и перенаправляет вывод whisper.cpp в CUDA, где это доступно. GPU-ускорение делает OpenAI Whisper «Речь в текст» в 5-15 раз быстрее, чем обработка только на CPU, в зависимости от размера модели. Модель large-v3, которая занимает 10x реального времени на CPU, работает примерно с 1.5-2x скоростью реального времени на среднем GPU NVIDIA, что означает, что 30-минутная запись транскрибируется менее чем за 25 минут вместо пяти часов.
Официальная модель OpenAI Whisper не была предназначена для потоковой передачи в реальном времени, она обрабатывает аудио фиксированными кусками. Потоковый сегментатор StarWhisper обрабатывает аудио в скользящих окнах 3–5 секунд, обеспечивая вывод, близкий к реальному времени, сохраняя точность за счет использования перекрывающихся контекстных окон. Это технически сложнее, чем пакетная обработка, но необходимо для рабочих процессов прямой диктовки. Результат — точность OpenAI Whisper «Речь в текст» в контексте прямой диктовки, а не только для загруженных файлов.
В отличие от использования OpenAI Whisper API (который отправляет аудио на серверы OpenAI и влечет затраты за минуту), локальная реализация StarWhisper хранит все аудио на вашем устройстве. Подробнее о конфиденциальности и безопасности локальной обработки см. на странице оффлайн распознавания речи Windows.
OpenAI предлагает Whisper как облачный API по цене $0.006 за минуту аудио. На первый взгляд это кажется дешевым; для профессионального использования 4 часа/месяц это $1.44. Но это сравнение игнорирует несколько важных факторов:
Документация OpenAI Whisper API является справочником для облачного API. Для пользователей, которые хотят той же точности Whisper без облачных затрат и последствий для конфиденциальности, StarWhisper является практичной альтернативой.
Используйте модель small (включена, бесплатно). Она обрабатывает со скоростью примерно реального времени на CPU, быстрее на GPU и обеспечивает точность 94-96% на четкой речи. Для большинства задач диктовки, электронной почты, заметок, документов этого достаточно с минимальными необходимыми правками.
Для транскрипции длинных файлов (лекции, интервью, подкасты), где вы не ждете в реальном времени, large-v3 (Pro) на GPU — это правильный инструмент. Дополнительный контекст помогает со сложным длинным аудио (акценты, шум, технический словарь). Оставьте small как стандарт для прямой диктовки и переключайтесь на large-v3 специально для пакетных задач; на коротких вставках large-v3 склонен к переусердствовать.
Для нелатинских сценариев (CJK, арабский, кириллица) и длинных многоязычных записей модель medium часто является правильным шагом вверх от small, так как многоязычные показатели small могут падать на этих сценариях. См. руководство по многоязычному распознаванию речи для рекомендаций по конкретным языкам.
Модель medium на CPU медленная (0.3x реального времени), но достигает точности 96-97%, что приемлемо для пакетной транскрипции файлов, где вы не ждете в реальном времени. Для пользователей CPU, желающих точности выше, чем small, запускайте пакетную транскрипцию на ночь, а не ожидайте активно.
OpenAI Whisper «Речь в текст» на вашем ПК с Windows, начать бесплатно
Скачать StarWhisperOpenAI Whisper — это модель, система распознавания речи с открытым исходным кодом. Whisper API — это облачный сервис, который запускает модель на серверах OpenAI и взимает плату за минуту. StarWhisper запускает ту же модель локально на вашем компьютере, без передачи аудио и без поминутной оплаты.
Для диктовки коротких вставок и большинства работ голосовым вводом модель Small является практическим стандартом, который мы рекомендуем. Хотя Large-v3 является самой большой универсальной моделью Whisper в выпуске с открытым исходным кодом, на коротком аудио она склонна «галлюцинировать» больше, чем Small, потому что обучалась на более длинных сегментах. Используйте Medium для длинного аудио или нелатинских сценариев (CJK, арабский, кириллица); оставьте Large-v3 для пакетной транскрипции длинных файлов. Новые официальные выпуски Whisper будут поддерживаться по мере их появления.
StarWhisper не требует Python, настройки CUDA toolkit, работы с командной строкой и предоставляет графический интерфейс с прямой диктовкой, транскрибацией файлов, управлением моделями и управлением горячими клавишами. Это разница между использованием профессионального программного обеспечения и запуском исследовательского кода.
Whisper обучался на веб-аудио, которое включает медицинские лекции, юридические proceedings и технический контент. Он достаточно хорошо обрабатывает общую медицинскую и юридическую терминологию. Для высокоспециализированного словарного запаса точность зависит от того, как часто эти термины встречаются в обучающих данных; редким техническим терминам может потребоваться пост-редактирование.