CUDA, Vulkan 및 CPU 백엔드를 지원하는 사전 빌드된 설치 프로그램. 컴파일 불필요, Python 불필요, 모델 검색 불필요. 모델을 선택하고 녹음을 클릭하여 전사 결과를 얻으세요. 완전한 오프라인 및 서명됨.
whisper.cpp는 Georgi Gerganov가 만들고 GitHub에서 오픈 소스 프로젝트로 유지 관리되는 OpenAI의 Whisper 음성 인식 모델의 C++ 포팅 버전입니다. 원래 Whisper 모델은 Python으로 출시되었으며, 이는 Windows 배포에 중요한 실질적 장벽을 만듭니다: Python 설치, 가상 환경, PyTorch 및 CUDA 툴킷 버전 일치, 명령줄 작업이 필요합니다. whisper.cpp는 네이티브 바이너리로 컴파일되는 휴대용 C++로 Whisper 추론 엔진을 구현하여 이러한 모든 종속성을 제거합니다.
Windows 사용자의 경우 whisper.cpp는 Python 인프라 없이 로컬 Whisper 음성 인식에 액세스할 수 있음을 의미합니다. 컴파일된 바이너리는 Windows에서 직접 실행되며, NVIDIA CUDA GPU 가속을 지원하고 Python 구현과 동일한 Whisper 모델 가중치를 사용합니다. Windows의 whisper.cpp가 StarWhisper를 가능하게 합니다. 사용자가 Python 환경이나 명령줄 도구를 관리할 필요 없이 로컬 전사를 지원하는 엔진입니다.
이 페이지에서는 Windows에서 whisper.cpp의 기능, StarWhisper가 이를 데스크톱 애플리케이션으로 패키징하는 방법, 지원되는 하드웨어 구성, Windows에서 Python으로 Whisper를 실행하는 것과 whisper.cpp를 비교한 내용을 다룹니다.
whisper.cpp는 5가지 Whisper 모델 크기인 tiny(39M 파라미터), base(74M), small(244M), medium(769M), large-v3(1.5B)를 모두 지원합니다. 모델 파일은 Hugging Face 모델 리포지토리에서 다운로드하거나 설치 프로그램에 번들로 제공되는 표준 GGML 형식 가중치입니다. StarWhisper는 전체 설치 프로그램에 tiny, base, small을 번들로 제공하며, medium 및 large는 Pro 모델 다운로드로 제공됩니다.
whisper.cpp에는 medium 및 large 모델에 대해 CPU 전용 추론보다 5-15배의 속도 향상을 제공하는 CUDA 지원이 포함되어 있습니다. GPU 추론에는 CUDA Compute Capability 5.0 이상(기본적으로 GTX 900 시리즈 이상의 모든 NVIDIA GPU)을 갖춘 NVIDIA GPU가 필요합니다. StarWhisper는 시작 시 NVIDIA GPU를 자동으로 감지하고 사용 가능한 경우 자동으로 CUDA로 처리를 라우팅합니다.
동일한 모델 파일이 Whisper가 지원하는 96개 언어를 모두 처리합니다. 언어 지정은 별도의 모델 다운로드가 아닌 런타임 매개변수입니다. whisper.cpp는 또한 한 언어로 오디오를 전사하면서 영어 텍스트로 출력하는 Whisper의 번역 모드를 구현합니다. StarWhisper는 언어 선택과 영어 번역을 모두 사용자 옵션으로 노출합니다.
whisper.cpp는 전사 텍스트와 함께 단어 수준 및 세그먼트 수준의 타임스탬프를 생성합니다. StarWhisper는 이를 사용하여 SRT 자막 파일을 생성하고 전사 출력 패널에서 타임스탬프 표시를 지원합니다. 타임스탬프는 표준 음성 속도의 경우 수백 밀리초 이내로 정확합니다.
whisper.cpp는 NVIDIA GPU가 없는 머신에서 더 빠른 추론을 위해 SIMD CPU 최적화(AVX, AVX2, AVX-512(사용 가능한 경우))를 구현합니다. ROCm을 통한 AMD GPU 지원은 일부 빌드에서 사용할 수 있습니다. Apple Metal 지원은 Mac 빌드용으로 존재합니다. 이는 Windows와 관련이 없지만 whisper.cpp 프로젝트의 크로스 플랫폼 최적화 투자를 보여줍니다.
StarWhisper는 Windows x64용으로 사전 컴파일된 whisper.cpp 바이너리를 제공합니다. 이 바이너리는 가능한 경우 종속성에 대해 정적으로 링크되어 런타임 종속성 요구 사항을 최소화합니다. 설치에는 Python, Conda, pip 또는 기타 패키지 관리자가 필요하지 않습니다. 전체 소프트웨어 스택은 1분 안에 표준 Windows 설치 프로그램을 통해 설치됩니다.
StarWhisper의 사용자 인터페이스는 크로스 플랫폼 GUI 계층을 제공하는 Electron으로 구축되었습니다. Electron 프론트엔드는 로컬 IPC 메커니즘을 통해 whisper.cpp 백엔드 프로세스와 통신합니다. 사용자 관점에서 이것은 완전히 투명하며 표준 Windows 애플리케이션으로 표시됩니다. whisper.cpp 프로세스는 GUI와 별도로 실행되므로 무거운 전사 워크로드가 인터페이스를 차단하지 않습니다.
whisper.cpp의 CUDA 지원 빌드에는 CUDA 런타임 라이브러리가 필요합니다. StarWhisper는 필요한 CUDA 런타임 파일을 번들로 제공하므로 사용자는 전체 CUDA 툴킷을 별도로 설치할 필요가 없습니다. 사용자 시스템에는 NVIDIA GPU 드라이버만 있으면 됩니다. 번들로 제공되는 CUDA 런타임은 지난 몇 년간의 지원되는 모든 NVIDIA GPU 드라이버와 호환됩니다.
whisper.cpp의 모델 파일은 ~75MB(tiny)에서 ~3GB(large-v3) 범위의 GGML 형식입니다. StarWhisper는 설정 패널을 통해 모델 다운로드, 저장 위치 및 선택을 처리합니다. 사용자는 원시 모델 파일과 상호 작용하지 않습니다. 앱은 다운로드 후 모델 파일 무결성을 확인하고 모델 파일이 손상되거나 불완전한 경우 사용자에게 경고합니다.
Whisper 모델을 메모리에 로드하는 데는 모델 크기와 저장 속도에 따라 2~10초가 걸립니다. StarWhisper는 선택한 모델이 로드된 상태로 whisper.cpp 작업자 프로세스를 계속 실행하므로 개별 전사 요청 시 모델 로드 시간이 발생하지 않습니다. 이것이 StarWhisper의 빠른 실시간 응답의 기반이 되는 아키텍처입니다. 모델은 요청 시마다 로드되는 것이 아니라 항상 준비되어 있습니다.
다음 성능 추정치는 Windows에서 whisper.cpp로 처리된 60분 분량의 오디오 파일에 대한 것입니다:
| 모델 | CPU 전용 (최신 데스크톱) | RTX 3070 (GPU) | 필요한 RAM |
|---|---|---|---|
| tiny | ~6분 | ~1분 | ~1 GB |
| small | ~60분 | ~4분 | ~2 GB |
| medium | ~200분 | ~15분 | ~5 GB |
| large-v3 | ~600분 | ~40분 | ~10 GB |
추정치는 CPU/GPU 세대, 오디오 특성 및 시스템 부하에 따라 다릅니다. GPU RAM 요구 사항은 추론 중인 VRAM에 대한 것이며, 시스템 RAM 요구 사항은 CPU 추론의 경우 더 낮습니다. whisper.cpp GitHub 리포지토리에는 더 다양한 하드웨어 구성에 대한 커뮤니티 벤치마크가 있습니다.
기본적으로 small 모델을 사용하세요. 혼합된 받아쓰기 및 회의 오디오에 대한 자동 모드 벤치마크에서 small은 짧은 클립에서 medium 및 large보다 일관되게 더 나은 성능을 발휘했습니다. Medium과 large는 짧은 컨텍스트 입력에서 더 많은 환각을 일으킵니다(아마도 더 긴 세그먼트로 학습되었기 때문일 것입니다). Small은 최신 데스크톱 CPU에서 거의 실시간 속도로 실행되며 GPU 없이 라틴 문자 언어에서 깨끗한 출력을 생성합니다.
비 라틴 문자(CJK, 아랍어, 키릴 문자) 또는 긴 형식의 연속 오디오에만 medium을 사용하세요. 정확도가 속도보다 더 중요하고 GPU가 있는 경우에만 large-v3를 사용하세요. 짧은 받아쓰기 클립에서는 두 큰 모델 모두 결코 말해지지 않은 문구를 삽입할 수 있습니다. 어떤 것을 선택해야 할지 확신이 서지 않는다면 small을 유지하세요.
CUDA 가속은 자동입니다. 8GB VRAM을 갖춘 RTX 3060 이상은 small 모델을 실시간의 8-10배 속도로, medium 모델을 실시간의 3-4배 속도로 실행합니다. large-v3 모델은 10GB VRAM이 필요하며, 그렇지 않으면 오버플로우에 대해 CPU로 폴백됩니다. 최고급 GPU에서도 짧은 받아쓰기에는 small이 권장 기본값으로 유지됩니다. large는 긴 형식의 오디오 배치 전사용입니다.
Windows 10/11(64비트), 8GB RAM, 최신 멀티 코어 CPU. GPU 가속의 경우: 현재 NVIDIA 드라이버가 설치된 NVIDIA GeForce GTX 1060 6GB 이상. SSD는 모델 로드 시간을 크게 향상시키지만 모델이 메모리에 로드된 후에는 추론 속도에 미치는 영향이 최소화됩니다.
아니요. StarWhisper는 Windows용으로 사전 컴파일된 whisper.cpp 바이너리를 번들로 제공합니다. Python, Conda 또는 명령줄 설정이 필요하지 않습니다. StarWhisper를 설치하면 GUI를 통해 whisper.cpp를 바로 사용할 수 있습니다.
whisper.cpp에는 실험적인 AMD ROCm GPU 지원이 있지만 Windows에서는 NVIDIA CUDA 지원보다 성숙도가 현저히 떨어집니다. StarWhisper는 현재 GPU 가속을 위해 NVIDIA CUDA를 대상으로 합니다. AMD GPU 사용자는 GPU 가속 성능이 아닌 CPU 수준의 성능을 기대해야 합니다.
실용적인 목적으로는 그렇습니다. whisper.cpp는 Python 구현과 동일한 GGML 형식의 모델 가중치를 사용하며 동등한 정확도를 달성합니다. GGML과 PyTorch 간의 부동 소수점 정밀도 차이로 인해 사소한 수치적 차이가 존재하지만, 이는 실제 전사 출력에서 인식할 수 없습니다.
tiny: ~75MB, base: ~145MB, small: ~465MB, medium: ~1.5GB, large-v3: ~3GB. tiny + base + small이 번들로 제공되는 StarWhisper의 전체 설치 프로그램은 약 700MB입니다. 추가 모델은 설정 패널에서 필요에 따라 다운로드됩니다.