Installer precompilato con supporto CUDA, Vulkan e CPU. Nessuna compilazione, nessun Python e nessuna ricerca manuale dei modelli. Scegli un modello, fai clic su Registra e ottieni una trascrizione. Funziona completamente offline ed è firmato.
whisper.cpp è un porting in C++ del modello di riconoscimento vocale Whisper di OpenAI, creato da Georgi Gerganov e mantenuto come progetto open source su GitHub. Il modello Whisper originale è stato rilasciato in Python, il che crea notevoli barriere pratiche per la distribuzione su Windows: installazione di Python, ambienti virtuali, corrispondenza delle versioni di PyTorch e CUDA toolkit e operazioni da riga di comando. whisper.cpp rimuove tutte queste dipendenze implementando il motore di inferenza Whisper in C++ portabile che si compila in un binario nativo.
Per gli utenti Windows, whisper.cpp significa che il riconoscimento vocale Whisper locale è accessibile senza alcuna infrastruttura Python. Il binario compilato funziona direttamente su Windows, supporta l'accelerazione GPU NVIDIA CUDA e utilizza gli stessi pesi del modello Whisper dell'implementazione Python. whisper.cpp su Windows è ciò che rende possibile StarWhisper. È il motore che alimenta la trascrizione locale senza richiedere agli utenti di gestire ambienti Python o strumenti da riga di comando.
Questa pagina spiega cosa fa whisper.cpp su Windows, come StarWhisper lo trasforma in un'app desktop, quali configurazioni hardware sono supportate e come whisper.cpp si confronta con l'esecuzione di Whisper in Python su Windows.
whisper.cpp supporta tutte e cinque le dimensioni del modello Whisper: tiny (39M parametri), base (74M), small (244M), medium (769M) e large-v3 (1.5B). I file del modello sono pesi standard in formato GGML che possono essere scaricati dal repository di modelli Hugging Face o inclusi negli installer. StarWhisper include tiny, base e small nell'installer completo; medium e large sono disponibili come download di modelli Pro.
whisper.cpp include il supporto CUDA che fornisce un'accelerazione da 5 a 15 volte rispetto all'inferenza solo CPU per i modelli medium e large. L'inferenza GPU richiede una GPU NVIDIA con CUDA Compute Capability 5.0 o superiore (praticamente qualsiasi GPU NVIDIA dalla serie GTX 900 in poi). StarWhisper rileva automaticamente le GPU NVIDIA all'avvio e instrada automaticamente l'elaborazione a CUDA quando disponibile.
Lo stesso file di modello gestisce tutte le 96 lingue supportate da Whisper. La specifica della lingua è un parametro di runtime, non un download di modello separato. whisper.cpp implementa anche la modalità di traduzione di Whisper, che trascrive l'audio in una lingua mentre produce testo in inglese. StarWhisper espone sia la selezione della lingua che la traduzione in inglese come opzioni per l'utente.
whisper.cpp produce timestamp a livello di parola e di segmento insieme al testo della trascrizione. StarWhisper li usa per generare file di sottotitoli SRT e per supportare la visualizzazione dei timestamp nel pannello di output della trascrizione. I timestamp sono accurati entro poche centinaia di millisecondi per un ritmo di parlato standard.
whisper.cpp implementa ottimizzazioni CPU SIMD (AVX, AVX2, AVX-512 dove disponibili) per un'inferenza più veloce su macchine senza GPU NVIDIA. Il supporto GPU AMD tramite ROCm è disponibile in alcune build. Il supporto Apple Metal esiste per le build Mac; questo non è rilevante per Windows ma illustra l'investimento nell'ottimizzazione multipiattaforma del progetto whisper.cpp.
StarWhisper include un binario whisper.cpp precompilato per Windows x64. Questo binario è collegato staticamente alle sue dipendenze dove possibile, riducendo al minimo i requisiti di runtime. L'installazione non richiede Python, Conda, pip o alcun gestore di pacchetti. L'intero stack software si installa tramite un installer Windows standard in meno di un minuto.
L'interfaccia utente di StarWhisper è costruita con Electron, che fornisce il livello GUI multipiattaforma. Il frontend Electron comunica con il processo backend whisper.cpp tramite un meccanismo IPC locale. Dal punto di vista dell'utente, questo è del tutto trasparente: si presenta come una normale applicazione Windows. Il processo whisper.cpp viene eseguito separatamente dalla GUI, quindi i carichi di trascrizione pesanti non bloccano l'interfaccia.
Le build di whisper.cpp con supporto CUDA richiedono le librerie runtime CUDA. StarWhisper include i file runtime CUDA necessari, così gli utenti non devono installare separatamente l'intero toolkit CUDA. È sufficiente che sul sistema sia presente il driver NVIDIA GPU. Il runtime CUDA incluso è compatibile con tutti i driver NVIDIA supportati degli ultimi anni.
I file modello di whisper.cpp sono in formato GGML, da circa 75MB (tiny) a circa 3GB (large-v3). StarWhisper gestisce il download, la posizione di archiviazione e la selezione dei modelli tramite il pannello Impostazioni. Gli utenti non interagiscono con i file modello grezzi. L'app verifica l'integrità del file modello dopo il download e avvisa gli utenti se un file modello è corrotto o incompleto.
Il caricamento di un modello Whisper in memoria richiede da 2 a 10 secondi a seconda delle dimensioni del modello e della velocità di archiviazione. StarWhisper mantiene il processo worker whisper.cpp in esecuzione persistente con il modello selezionato caricato, quindi le singole richieste di trascrizione non comportano tempi di caricamento del modello. Questa è l'architettura alla base della rapida risposta in tempo reale di StarWhisper: il modello è sempre pronto, non caricato per ogni richiesta.
Queste stime di prestazione si riferiscono a un file audio di 60 minuti elaborato con whisper.cpp su Windows:
| Modello | Solo CPU (desktop moderno) | RTX 3070 (GPU) | RAM richiesta |
|---|---|---|---|
| tiny | ~6 min | ~1 min | ~1 GB |
| small | ~60 min | ~4 min | ~2 GB |
| medium | ~200 min | ~15 min | ~5 GB |
| large-v3 | ~600 min | ~40 min | ~10 GB |
Le stime variano in base alla generazione di CPU/GPU, alle caratteristiche audio e al carico di sistema. I requisiti di RAM GPU si riferiscono alla VRAM durante l'inferenza; i requisiti di RAM di sistema sono inferiori per l'inferenza su CPU. Il repository GitHub di whisper.cpp contiene benchmark pubblicati dalla comunità per una gamma più ampia di configurazioni hardware.
Il default è il modello small. Nei nostri benchmark in modalità automatica su audio misto di dettatura vocale e riunioni, small ha costantemente superato medium e large su clip brevi. Medium e large allucinano di più su input a contesto breve (probabilmente perché sono stati addestrati su segmenti più lunghi). Small gira a velocità circa reale su una CPU desktop moderna e produce output pulito su lingue con alfabeto latino senza GPU.
Ricorri a medium solo per alfabeti non latini (CJK, arabo, cirillico) o audio continuo di lunga durata. Ricorri a large-v3 solo quando la precisione conta più della velocità e hai una GPU. Su clip brevi di dettatura, entrambi i modelli più grandi tendono a inserire frasi mai pronunciate. Se non sei sicuro su quale scegliere, resta su small.
L'accelerazione CUDA è automatica. Una RTX 3060 o superiore con 8 GB di VRAM esegue il modello small a 8-10 volte la velocità reale e il modello medium a 3-4 volte la velocità reale. Il modello large-v3 richiede 10 GB di VRAM o usa la CPU per ciò che non entra nella memoria video. Anche su una GPU di fascia alta, small rimane il modello predefinito consigliato per brevi dettature; large è pensato per trascrivere in serie registrazioni di lunga durata.
Windows 10/11 (64-bit), 8GB di RAM, qualsiasi CPU multi-core moderna. Per l'accelerazione GPU: NVIDIA GeForce GTX 1060 6GB o superiore con driver NVIDIA aggiornati. Gli SSD migliorano significativamente il tempo di caricamento del modello ma hanno un effetto minimo sulla velocità di inferenza una volta che il modello è in memoria.
No. StarWhisper include un binario whisper.cpp precompilato per Windows. Niente Python, niente Conda, nessuna configurazione da riga di comando. Installa StarWhisper e whisper.cpp è pronto all'uso tramite l'interfaccia grafica.
whisper.cpp ha un supporto sperimentale per GPU AMD ROCm, ma è molto meno maturo del supporto NVIDIA CUDA su Windows. StarWhisper attualmente punta su NVIDIA CUDA per l'accelerazione GPU. Gli utenti con GPU AMD dovrebbero aspettarsi prestazioni a livello di CPU piuttosto che prestazioni accelerate da GPU.
Sì, ai fini pratici. whisper.cpp utilizza gli stessi pesi del modello in formato GGML dell'implementazione Python e raggiunge una precisione equivalente. Esistono piccole differenze numeriche dovute alle differenze di precisione in virgola mobile tra GGML e PyTorch, ma non sono percettibili nell'output di trascrizione nel mondo reale.
tiny: ~75MB, base: ~145MB, small: ~465MB, medium: ~1.5GB, large-v3: ~3GB. L'installer completo di StarWhisper con tiny + base + small inclusi è di circa 700MB. I modelli aggiuntivi vengono scaricati su richiesta dal pannello Impostazioni.
StarWhisper rende whisper.cpp accessibile su Windows senza Python, lavoro da riga di comando o installazione del toolkit CUDA. Piano gratuito senza bisogno di account. Pro a $10/mese per uso illimitato e modelli più grandi.