Vocova
PrezziBlog

Prodotto

  • Prezzi
  • Blog
  • Strumenti

Soluzioni

  • Per podcaster
  • Per creator video
  • Interviste multilingue

Azienda

  • Chi siamo
  • FAQ
  • Termini di servizio
  • Informativa sulla privacy
  • Contatti

Trascrizione

  • Registratore vocale Chromebook
  • Audio in testo
  • Video in testo
  • Trascrizione podcast
  • Trascrizione interviste
  • Trascrizione lezioni

Registrazioni riunioni

  • Trascrizione Zoom
  • Trascrizione Google Meet

Traduzione

  • Traduzione audio
  • Sottotitoli bilingui
  • Traduzione video

Fonti pubbliche

  • Link video in testo
  • Trascrizione YouTube
  • Trascrizione Apple Podcasts
  • Trascrizione Vimeo
  • Trascrizione Bilibili
  • Trascrizione SoundCloud
  • Trascrizione Dailymotion
  • Trascrizione Reddit
  • Trascrizione Facebook
  • Trascrizione X (Twitter)
  • Trascrizione Instagram
  • Trascrizione TikTok

Lingua

  • Trascrizione giapponese
  • Trascrizione spagnolo
  • Trascrizione in francese
  • Trascrizione tedesca
  • Trascrizione portoghese
  • Trascrizione coreana
  • Trascrizione cinese
  • Trascrizione araba
  • Trascrizione in hindi
  • Trascrizione italiano
  • Trascrizione russo
  • Trascrizione del thai
  • Trascrizione vietnamita
  • Trascrizione turca
  • Trascrizione indonesiano
  • Trascrizione olandese
  • Trascrizione in polacco
  • Trascrizione svedese
  • Trascrizione cantonese
  • Trascrizione in tagalog

Formato

  • Da MP4 a testo
  • Da MP3 a testo
  • WAV in testo
  • Da M4A a testo
  • Da MOV a testo
  • Video in PDF

Sottotitoli

  • Generatore SRT
  • Generatore VTT
  • Generatore di sottotitoli
  • MP4 in SRT

Altri strumenti

  • Convertitore audio
  • Convertitore video
  • Riassuntore di podcast
  • Riassuntore YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
PrezziBlog

Prodotto

  • Prezzi
  • Blog
  • Strumenti

Soluzioni

  • Per podcaster
  • Per creator video
  • Interviste multilingue

Azienda

  • Chi siamo
  • FAQ
  • Termini di servizio
  • Informativa sulla privacy
  • Contatti

Trascrizione

  • Registratore vocale Chromebook
  • Audio in testo
  • Video in testo
  • Trascrizione podcast
  • Trascrizione interviste
  • Trascrizione lezioni

Registrazioni riunioni

  • Trascrizione Zoom
  • Trascrizione Google Meet

Traduzione

  • Traduzione audio
  • Sottotitoli bilingui
  • Traduzione video

Fonti pubbliche

  • Link video in testo
  • Trascrizione YouTube
  • Trascrizione Apple Podcasts
  • Trascrizione Vimeo
  • Trascrizione Bilibili
  • Trascrizione SoundCloud
  • Trascrizione Dailymotion
  • Trascrizione Reddit
  • Trascrizione Facebook
  • Trascrizione X (Twitter)
  • Trascrizione Instagram
  • Trascrizione TikTok

Lingua

  • Trascrizione giapponese
  • Trascrizione spagnolo
  • Trascrizione in francese
  • Trascrizione tedesca
  • Trascrizione portoghese
  • Trascrizione coreana
  • Trascrizione cinese
  • Trascrizione araba
  • Trascrizione in hindi
  • Trascrizione italiano
  • Trascrizione russo
  • Trascrizione del thai
  • Trascrizione vietnamita
  • Trascrizione turca
  • Trascrizione indonesiano
  • Trascrizione olandese
  • Trascrizione in polacco
  • Trascrizione svedese
  • Trascrizione cantonese
  • Trascrizione in tagalog

Formato

  • Da MP4 a testo
  • Da MP3 a testo
  • WAV in testo
  • Da M4A a testo
  • Da MOV a testo
  • Video in PDF

Sottotitoli

  • Generatore SRT
  • Generatore VTT
  • Generatore di sottotitoli
  • MP4 in SRT

Altri strumenti

  • Convertitore audio
  • Convertitore video
  • Riassuntore di podcast
  • Riassuntore YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
PrezziBlog
  1. Blog
  2. Benchmark di precisione di Whisper 2026: abbiamo testato large-v3, turbo e small in 12 lingue

Benchmark di precisione di Whisper 2026: abbiamo testato large-v3, turbo e small in 12 lingue

Un benchmark Whisper riproducibile: abbiamo misurato il tasso di errore di parola di large-v3, large-v3-turbo e small su 12 lingue nel set di test FLEURS. 1.749 trascrizioni, metodologia completa e dati grezzi scaricabili.

Di Jimmy H·18 lug 2026·19 min di lettura·
benchmarksaccuracywerwhisperdata

Abbiamo eseguito 1.749 trascrizioni per misurare quanto sia davvero precisa la trascrizione IA open source nel 2026. Tre modelli Whisper (large-v3, large-v3-turbo e small) hanno trascritto 50 enunciati in ciascuna di 12 lingue del set di test pubblico FLEURS. Il dato principale: large-v3 raggiunge un tasso di errore di parola di circa il 3-6 per cento nelle lingue europee ad alte risorse (spagnolo 2,9%, italiano 3,2%, inglese 4,1%), vicino all'intervallo comunemente citato per la trascrizione umana. In hindi sale al 15,7%, in arabo egiziano al 14,6%. All'interno di un singolo modello, il divario tra la lingua migliore e quella peggiore supera le 5 volte, il che ridimensiona la differenza tra le versioni del modello.

Le medie raccontano solo metà della storia, quindi questo articolo riporta anche ciò che le medie nascondono: in inglese e italiano oltre il 60% delle frasi è tornato perfetto parola per parola, mentre hindi e cantonese si sono fermati al 4%. E quando i modelli più piccoli falliscono sulle lingue difficili, non falliscono con grazia: abbiamo trovato quattro allucinazioni da manuale con ciclo di ripetizione nell'output grezzo, tutte da turbo e small, nessuna da large-v3.

Ogni cifra di questo articolo proviene da un test che abbiamo eseguito noi stessi a luglio 2026, con un seed casuale fisso, uno script pubblicato e risultati grezzi scaricabili. Puoi riprodurre tutto, o verificare il nostro lavoro riga per riga.

Cosa abbiamo testato e come

Quasi tutte le cifre sulla precisione di trascrizione presenti sul web sono copiate da pagine di fornitori o da altri articoli, senza un test dietro. Ecco la nostra configurazione esatta:

VoceImpostazione
Set di testGoogle FLEURS test split (dataset accademico pubblico, parlato letto)
CampionamentoPrimi 50 enunciati del test split mescolato per lingua (shuffle seed 42, deterministico), circa 9 minuti di audio per lingua
ModelliWhisper large-v3, large-v3-turbo e small (conversioni MLX open source)
Inferenzatemperature 0, lingua di origine fissata (nessun rilevamento automatico), nessun condizionamento sul testo precedente
NormalizzazioneCome nel paper di Whisper: EnglishTextNormalizer per l'inglese, BasicTextNormalizer altrove (tramite transformers)
MetricheWER (tasso di errore di parola); per cinese, giapponese e cantonese la metrica principale è il CER (tasso di errore di carattere)
Softwaremlx-whisper 0.4.3, jiwer 4.0.0, transformers 5.11.0, datasets 3.6.0
HardwareApple M3, inferenza MLX, fp16
Data del testLuglio 2026

Abbiamo scelto le 12 lingue per coprire livelli di risorse e sistemi di scrittura, non per lusingare i modelli: sei lingue europee ad alte risorse, tre lingue CJK senza spazi che richiedono la valutazione a livello di carattere, più coreano (agglutinante, con spazi), hindi (devanagari) e arabo egiziano.

Un dettaglio di campionamento per chi verifica il file grezzo: FLEURS include spesso più registrazioni della stessa frase da parlanti diversi, che condividono un id di frase. La nostra logica di ripresa deduplica per id di frase, quindi la cella inglese di large-v3 contiene 49 enunciati invece di 50; ogni altra cella ne contiene 50, per un totale di 1.749 trascrizioni.

Due avvertenze oneste prima della tabella. Primo, FLEURS è parlato letto: audio pulito, ritmo costante, un solo parlante. Riunioni e interviste reali ottengono risultati decisamente peggiori, perché rumore di fondo, accenti e sovrapposizione di parlanti fanno salire i tassi di errore (per passaggi pratici di mitigazione, vedi come trascrivere audio rumoroso). Considera queste cifre come il tetto di ogni lingua, non come una promessa. Secondo, 50 enunciati per lingua sono un campione, non il set completo. Ogni cifra porta un margine di qualche punto percentuale, quindi leggi gli ordini di grandezza e l'ordinamento, non i decimali.

Grafico a barre dei tassi di errore di Whisper large-v3 in 12 lingue su FLEURS, dal 2,9% in spagnolo al 15,7% in hindi

Risultati: 12 lingue, 3 modelli

Le cifre sono in WER %, più basso è meglio. Per giapponese, mandarino e cantonese (contrassegnati con *) la cifra è in CER %, perché queste lingue non separano le parole con spazi.

Lingualarge-v3large-v3-turbosmall
Inglese4,1%4,7%6,6%
Spagnolo2,9%3,3%6,5%
Francese5,8%6,7%14,3%
Tedesco4,6%6,0%12,8%
Italiano3,2%3,9%8,2%
Portoghese6,6%7,2%11,0%
Giapponese *6,6%5,8%16,4%
Coreano14,9%14,5%21,7%
Mandarino *6,7%8,0%19,5%
Cantonese *10,5%43,3%non supportato
Hindi15,7%22,3%42,4%
Arabo (Egitto)14,6%16,1%32,7%

Tre cose spiccano. Il divario tra lingue è molto più ampio del divario tra modelli: spagnolo 2,9% contro hindi 15,7% sullo stesso large-v3. Il modello turbo costa solo 0,3-1,4 punti nelle sei lingue europee, ma 6,6 punti in hindi, e in cantonese crolla dal 10,5% al 43,3% CER. E small si degrada in modo catastrofico fuori dalle lingue ad alte risorse: 42,4% in hindi e 32,7% in arabo lo rendono uno strumento di anteprima, non un risultato consegnabile.

La cella «non supportato» è letterale: il token di lingua cantonese yue è stato introdotto con la generazione large-v3 (la scheda ufficiale del modello elenca «un nuovo token di lingua per il cantonese» tra le modifiche), quindi il modello small di generazione precedente rifiuta la lingua del tutto. Nella nostra esecuzione ha sollevato un errore di lingua non supportata, che è di per sé un dato utile: prima di confrontare la qualità dei modelli, verifica che il modello supporti la tua lingua.

Oltre le medie: la maggior parte delle frasi è perfetta, una coda no

Un tasso di errore medio appiattisce una distribuzione in realtà molto asimmetrica. Per lingua su large-v3, ecco la quota di enunciati trascritti senza errori, la mediana e il 90° percentile:

LinguaEnunciati perfettiMediana90° percentile
Inglese61%0,0%12,5%
Spagnolo54%0,0%7,7%
Francese38%4,3%12,5%
Tedesco56%0,0%14,3%
Italiano62%0,0%10,5%
Portoghese42%3,7%18,8%
Giapponese *36%3,2%15,8%
Coreano34%13,7%35,3%
Mandarino *40%3,0%17,8%
Cantonese *4%9,7%17,6%
Hindi4%14,9%27,5%
Arabo (Egitto)28%10,3%37,5%

Contano due letture. Nelle lingue forti, l'enunciato mediano è privo di errori: la media del 4,1% dell'inglese è prodotta quasi interamente da una minoranza di frasi più difficili, ed è per questo che lì una trascrizione appare quasi perfetta con difetti occasionali da correggere. E la colonna del tasso perfetto separa lingue che la media accomuna: cantonese (10,5%) e arabo (14,6% di media) sembrano più vicini di quanto siano, ma solo il 4% delle frasi cantonesi è tornato impeccabile contro il 28% dell'arabo. Se correggi cercando i tratti sbagliati, il percentile di coda predice il tuo carico di lavoro meglio della media.

Quota di frasi trascritte senza errori da Whisper large-v3: oltre la metà in inglese e italiano contro il 4% in hindi e cantonese

Risultato 1: il divario tra lingue ridimensiona il divario tra modelli

All'interno di large-v3, l'ampiezza tra la lingua migliore (spagnolo, 2,9%) e la peggiore (hindi, 15,7%) supera le 5 volte. Inglese (4,1%) contro arabo egiziano (14,6%) è vicino a 4 volte. Al contrario, all'interno di una singola lingua europea, passare da turbo a large-v3 sposta la cifra di circa un punto (inglese 4,7% a 4,1%, tedesco 6,0% a 4,6%).

L'asimmetria è ancora più netta per small. In inglese resta indietro rispetto a large-v3 di soli 2,5 punti. In francese si degrada dal 5,8% al 14,3% e in hindi dal 15,7% al 42,4%. Lo stesso checkpoint che sembra un compromesso ragionevole in inglese è inutilizzabile in hindi.

La conclusione pratica: che un modello supporti bene la tua lingua conta molto più di quale versione del modello scegli. Se lavori in spagnolo, va bene quasi tutto ciò che è moderno. Se lavori in hindi o cantonese, la scelta del modello decide se la trascrizione è persino utilizzabile.

Risultato 2: quanto ti costa davvero turbo

Sul nostro M3, il throughput tipico è stato di circa 3,8 volte il tempo reale per large-v3, 5,2 volte per turbo e 14,3 volte per small, mediato sulle esecuzioni (le singole esecuzioni variavano con il carico di sistema, e le velocità assolute dipendono dall'hardware; il segnale sono i rapporti). Quindi turbo va circa 1,4 volte più veloce di large-v3.

Nelle sei lingue europee ad alte risorse, quella velocità non costa quasi nulla: turbo resta in media circa 0,8 punti dietro large-v3, e in giapponese e coreano turbo ha addirittura leggermente superato large-v3 nel nostro campione (5,8% vs 6,6% CER, 14,5% vs 14,9% WER). Ecco perché i servizi commerciali di trascrizione sono passati in gran parte a modelli distillati e accelerati.

Ma turbo non è un pasto gratis. L'hindi si degrada di 6,6 punti (22,3% vs 15,7%), l'arabo egiziano di 1,5, e il cantonese crolla dal 10,5% al 43,3% CER, il che è inutilizzabile. La decisione di scambiare precisione per velocità va presa per lingua, non globalmente.

Risultato 3: le lingue senza confini di parola richiedono un altro metro

Cinese, giapponese e cantonese non separano le parole con spazi, quindi un tasso di errore di «parola» dipende interamente da come si divide il testo, e tokenizzatori diversi producono WER molto diverse per trascrizioni identiche. La pratica accademica, incluso lo stesso paper di Whisper, è usare il tasso di errore di carattere (CER) per queste lingue, ed è ciò che riportiamo.

Misurati così, giapponese (6,6% CER) e mandarino (6,7% CER) si collocano nella stessa fascia di qualità delle lingue europee forti su large-v3. Il cantonese è il controesempio più netto di tutto il nostro dataset: 10,5% CER su large-v3, 43,3% su turbo, nessun supporto su small. Una lingua, tre modelli, e il risultato va da utilizzabile a impossibile.

Il coreano merita una nota: il suo 14,9% sembra scarso, ma il coreano è agglutinante e usa convenzioni di spaziatura che gonfiano il WER basato sugli spazi, quindi la sua precisione a livello di carattere è migliore di quanto la cifra suggerisca. Richiede comunque più revisione delle lingue europee, ma non quanta ne implichi una lettura ingenua del WER.

Ciò che conta per valutare qualsiasi fornitore: se uno strumento dichiara «95% di precisione in cinese» senza dire se è WER o CER, su quale audio, con quale normalizzazione, la cifra non porta informazione. Il nostro articolo esplicativo sul WER tratta in dettaglio la meccanica della metrica.

La stessa frase in cantonese trascritta correttamente da Whisper large-v3 mentre large-v3-turbo collassa in un ciclo di ripetizione

Risultato 4: quando i modelli più piccoli falliscono, falliscono tutto in una volta

Le medie suggeriscono che gli errori siano distribuiti uniformemente in una trascrizione. L'output grezzo dice il contrario. Scansionando tutte le 1.749 ipotesi in cerca di output degenere (tasso di errore superiore al 100% o output più del doppio della lunghezza di riferimento), abbiamo trovato esattamente quattro casi: tre da turbo (due in cantonese, uno in hindi) e uno da small (hindi). large-v3 non ne ha prodotto nessuno su tutti i suoi 599 enunciati.

Tutti e quattro sono lo stesso tipo di guasto: un ciclo di ripetizione. Il caso cantonese peggiore ha raggiunto il 372% CER (le inserzioni possono spingere la metrica oltre il 100%): turbo ha trascritto le prime parole in modo plausibile, poi si è bloccato su un singolo carattere e lo ha emesso 46 volte di fila. I guasti in hindi hanno forma identica, una parola stampata più e più volte. Sullo stesso identico enunciato, large-v3 ha prodotto una trascrizione quasi perfetta al 6,9% CER. Le stringhe esatte sono nei dati grezzi (enunciato id 1980 in results.jsonl) se vuoi ispezionarle.

Quel caso cantonese mostra sottovoce un secondo guasto: prima di entrare nel ciclo, turbo era già scivolato dal cinese tradizionale verso caratteri semplificati e scelte lessicali del mandarino, mentre large-v3 è rimasto nella scrittura di riferimento. Per i parlanti cantonesi questo conta quanto il tasso di errore, perché la «trascrizione» scivola verso un'altra lingua scritta.

L'allucinazione nei modelli della famiglia Whisper è documentata oltre il nostro campione: Koenecke et al. (2024) hanno verificato trascrizioni di Whisper e trovato nell'ordine dell'1% di segmenti con contenuto inventato, concentrato attorno a pause e parlato esitante. Il nostro tasso su parlato letto è più basso (4 su 1.749, circa lo 0,2%), il che quadra: audio pulito e continuo dà al modello meno silenzi da riempire. La regola pratica che ne traiamo: i peggiori guasti di trascrizione non sono rumore distribuito uniformemente ma corruzione locale totale, si concentrano nei checkpoint più piccoli sulle lingue più deboli, e una rapida scansione dei token ripetuti ne intercetta la maggior parte.

Come i nostri numeri large-v3 si confrontano con la tabella large-v2 pubblicata

La nostra guida alla precisione per lingua raccoglie i risultati FLEURS di large-v2 pubblicati nel paper di Whisper. Allineandoli alle nostre misurazioni large-v3 di luglio 2026 per le lingue che si sovrappongono (i numeri del paper sono il test split completo, i nostri un campione di 50 enunciati, quindi leggi la direzione, non i decimali):

LinguaPaper large-v2Nostro large-v3Direzione
Spagnolo3,0%2,9%stabile, già forte
Inglese4,2%4,1%stabile, già forte
Italiano4,0%3,2%un po' meglio
Tedesco4,5%4,6%stabile
Francese8,3%5,8%meglio
Giapponese (CER)5,3%6,6%stabile nel rumore
Coreano14,3%14,9%stabile nel rumore
Mandarino (CER)14,7%6,7%dimezzato
Arabo16,0%14,6%un po' meglio
Hindi21,5%15,7%nettamente meglio

Lo schema è coerente con dove sono finiti i dati di addestramento aggiuntivi: le lingue già vicine al loro pavimento sono rimaste ferme, e i grandi guadagni sono andati su mandarino (dimezzato), hindi e francese. Il cantonese non appare affatto nella tabella large-v2, che è la versione più cruda della stessa storia: tra generazioni di modelli, il cambiamento più importante per alcune lingue non è un tasso di errore più basso, ma l'esistenza.

Cosa significano questi numeri per il tuo lavoro

Traducendo i tassi di errore in esperienza percepita: 5% significa un errore ogni 20 parole, una rilettura rapida. 15% significa un errore ogni 7 parole, e l'editing inizia a costare tempo vero. Oltre il 30%, interi passaggi vanno riascoltati, e la trascrizione è al più una bozza.

  • Lingue europee ad alte risorse (inglese, spagnolo, francese, tedesco, italiano, portoghese): large-v3 si attesta tra il 3 e il 7 per cento su parlato pulito, saldamente nel territorio del «fidati della prima bozza, poi scorri». turbo costa meno di 1,5 punti e va bene per il lavoro di routine. small si degrada al 13-14 per cento in francese e tedesco; non usarlo per nulla che consegni.
  • Giapponese, mandarino, coreano: giapponese e mandarino al 6-7 per cento CER su large-v3 sono affidabili come prima bozza, purché tu legga la cifra a livello di carattere. Il WER del coreano sovrastima i suoi errori, ma metti in conto più correzione rispetto al gruppo europeo.
  • Cantonese, hindi, arabo: la zona di attenzione. Hindi e arabo egiziano restano al 15-16 per cento persino su large-v3, un errore ogni 6 o 7 parole, quindi metti in preventivo un editing sostanziale. Il cantonese è praticabile solo su large-v3; scegli la variante sbagliata e il tasso di errore quadruplica.

Ricorda che tutto questo è prestazione al tetto su parlato letto. Le registrazioni reali fanno peggio, e le tre variabili che contano di più sono qualità di registrazione, numero di parlanti e intensità dell'accento. Per materiale con più parlanti, l'attribuzione del parlante è una classe di errore a sé, oltre alla precisione di parola; vedi che cos'è la diarizzazione del parlante per capire come funziona.

Se vuoi il quadro per lingua su un centinaio di lingue anziché le nostre 12, la nostra guida alla precisione per lingua raccoglie la tabella FLEURS pubblicata nel paper di Whisper, suddivisa in fasce da quasi umana a praticamente inutilizzabile. Quella pagina è una raccolta di risultati pubblicati; questa è il benchmark che abbiamo eseguito noi stessi, e le due concordano dove si sovrappongono.

Riproducilo o verifica il nostro lavoro

Tutto ciò che serve per verificare o estendere questo benchmark è pubblico:

  • results.jsonl: tutti i 1.749 risultati per enunciato, con testo di riferimento, output del modello e WER/CER per enunciato
  • results-summary.csv: la tabella aggregata lingua x modello dietro questo articolo
  • bench.py: lo script esatto che ha prodotto i dati, con campionamento deterministico (seed 42)
  • README del pacchetto dati: comandi di installazione, versioni e licenze

Esegui python bench.py --n 50 e, grazie allo shuffle seed fisso, selezioni gli stessi enunciati che abbiamo usato noi; aumenta --n per ampliare il campione (il test split di FLEURS ha circa 350-900 enunciati per lingua). Lo script trasmette FLEURS da Hugging Face, trascrive in locale, valuta con la normalizzazione del paper di Whisper e aggiunge una riga JSONL per enunciato, così le esecuzioni interrotte riprendono senza problemi.

Attribuzione: le trascrizioni di riferimento provengono dal dataset FLEURS di Google (Conneau et al., 2022), ridistribuito con la sua licenza CC-BY-4.0. I pesi del modello Whisper sono di OpenAI, rilasciati sotto Apache 2.0.

Domande frequenti

Whisper è il modello di trascrizione open source più preciso?

È la famiglia aperta più riprodotta e con la più ampia copertura linguistica, per cui è un buon riferimento pubblico. Esistono altre famiglie open source, tra cui le linee MMS e Seamless di Meta e molti fine-tuning specifici per lingua, ma differiscono per copertura linguistica, licenze e convenzioni di valutazione, quindi un confronto equo tra famiglie richiede un proprio test controllato. Abbiamo scelto Whisper perché i pesi sono fissi e pubblici, i risultati riproducibili, e un solo metodo copre tutte le 12 lingue.

Perché non avete testato servizi commerciali come Otter, Rev o HappyScribe?

I termini di servizio commerciali spesso vietano la pubblicazione di risultati di benchmark, i modelli dietro le API sono opachi e cambiano senza preavviso, e una cifra misurata oggi può essere priva di significato il trimestre prossimo. I pesi open source sono congelati, quindi chiunque può rieseguire il nostro identico test all'infinito. Le dichiarazioni di precisione dei fornitori sono sui loro siti; nota quanto raramente rivelino il set di test e la normalizzazione.

Bastano 50 enunciati per lingua?

Bastano per ordini di grandezza e ordinamento, non per test di significatività a grana fine. È esattamente così che presentiamo i risultati. Il test split completo di FLEURS ha circa 350-900 enunciati per lingua, e ampliare il campione è una modifica di un solo parametro nello script pubblicato.

I risultati su parlato letto rappresentano registrazioni reali?

No. Tutto ciò che abbiamo misurato qui è prestazione al tetto: audio pulito, un solo parlante, ritmo costante. Su riunioni, telefonate e interviste reali, aspettati tassi di errore nettamente più alti, con il danno che cresce con rumore, intensità dell'accento e sovrapposizione dei parlanti. Ciò che si trasferisce da questo benchmark al mondo reale è l'ordinamento (una lingua o un modello che vince su parlato pulito di solito vince anche su parlato disordinato), non le percentuali assolute.

Come riproduco esattamente il test?

Scarica bench.py, installa le dipendenze elencate nel README del pacchetto dati ed esegui python bench.py --n 50. Il seed è fisso nello script, il campionamento è deterministico, e i risultati si aggiungono a un file JSONL che riprende dopo un'interruzione. Lo script usa MLX (Apple Silicon); su altro hardware, sostituisci la chiamata di trascrizione con openai-whisper o faster-whisper con le stesse impostazioni.

Questi modelli hanno allucinazioni?

Nel nostro campione di parlato letto, raramente ma in modo catastrofico quando accade: 4 delle 1.749 uscite (circa lo 0,2%) erano cicli di ripetizione, tutte da turbo o small in cantonese e hindi, nessuna da large-v3. Gli audit pubblicati di parlato conversazionale ed esitante riportano tassi più alti, nell'ordine dell'1% dei segmenti (Koenecke et al., 2024). Aspettati di vederne di più su audio reale con lunghe pause, e scansiona le uscite in cerca di token ripetuti.

Quale modello usa Vocova?

Questo benchmark misura modelli open source, non la pipeline di produzione di Vocova, e il punto che solleva è generale: che la tua lingua sia ben supportata conta più del numero di versione del modello. Vocova instrada la trascrizione verso livelli di modello ad alta precisione per il lavoro multilingue e vi aggiunge etichette dei parlanti, traduzione e formati di esportazione. La prova più diretta è un test sul tuo audio nella tua lingua.

Fonti e approfondimenti

  • FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech (Conneau et al., 2022), il dataset da cui provengono tutti i nostri campioni
  • google/fleurs su Hugging Face, distribuzione del dataset e licenza CC-BY-4.0
  • Robust Speech Recognition via Large-Scale Weak Supervision (Radford et al., 2022), il paper di Whisper di cui seguiamo le convenzioni di normalizzazione e CER
  • Scheda del modello openai/whisper-large-v3, documenta il token di lingua cantonese aggiunto in large-v3 e la licenza dei pesi Apache 2.0
  • Careless Whisper: Speech-to-Text Hallucination Harms (Koenecke et al., 2024), l'audit esterno dei tassi di allucinazione di Whisper con cui confrontiamo i nostri conteggi di guasti
  • mlx-whisper su PyPI, il runtime di inferenza usato per questo benchmark
  • jiwer su GitHub, la libreria di scoring WER/CER

Vuoi vedere la trascrizione multilingue sul tuo materiale? Incolla un link audio o video in Vocova e confronta l'output con le aspettative di questo articolo per la tua lingua.

Informazioni sull'autore

J

Jimmy H

Prodotto e Marketing, Vocova

Jimmy è product manager e responsabile marketing di Vocova, uno strumento di trascrizione e sottotitoli basato sull'IA. Lavora concretamente sull'accuratezza del riconoscimento vocale, sulla trascrizione multilingue e sui flussi di sottotitoli e note delle riunioni del prodotto, e scrive le guide di Vocova per sfruttare al meglio la trascrizione con IA.

Vedi il profilo su LinkedIn

Articoli correlati

Leggi di piu
16 apr 2026·15 min

Quanto è accurata la trascrizione IA per lingua? Benchmark WER per lingua (2026)

Leggi di piu
10 feb 2026·14 min

Cos'è il tasso di errore sulle parole (WER)? La metrica che misura l'accuratezza della trascrizione

Leggi di piu
16 feb 2026·22 min

Come trascrivere audio rumoroso e ridurre gli errori da rumore di fondo (2026)

Prodotto

  • Prezzi
  • Blog
  • Strumenti

Soluzioni

  • Per podcaster
  • Per creator video
  • Interviste multilingue

Azienda

  • Chi siamo
  • FAQ
  • Termini di servizio
  • Informativa sulla privacy
  • Contatti

Trascrizione

  • Registratore vocale Chromebook
  • Audio in testo
  • Video in testo
  • Trascrizione podcast
  • Trascrizione interviste
  • Trascrizione lezioni

Registrazioni riunioni

  • Trascrizione Zoom
  • Trascrizione Google Meet

Traduzione

  • Traduzione audio
  • Sottotitoli bilingui
  • Traduzione video

Fonti pubbliche

  • Link video in testo
  • Trascrizione YouTube
  • Trascrizione Apple Podcasts
  • Trascrizione Vimeo
  • Trascrizione Bilibili
  • Trascrizione SoundCloud
  • Trascrizione Dailymotion
  • Trascrizione Reddit
  • Trascrizione Facebook
  • Trascrizione X (Twitter)
  • Trascrizione Instagram
  • Trascrizione TikTok

Lingua

  • Trascrizione giapponese
  • Trascrizione spagnolo
  • Trascrizione in francese
  • Trascrizione tedesca
  • Trascrizione portoghese
  • Trascrizione coreana
  • Trascrizione cinese
  • Trascrizione araba
  • Trascrizione in hindi
  • Trascrizione italiano
  • Trascrizione russo
  • Trascrizione del thai
  • Trascrizione vietnamita
  • Trascrizione turca
  • Trascrizione indonesiano
  • Trascrizione olandese
  • Trascrizione in polacco
  • Trascrizione svedese
  • Trascrizione cantonese
  • Trascrizione in tagalog

Formato

  • Da MP4 a testo
  • Da MP3 a testo
  • WAV in testo
  • Da M4A a testo
  • Da MOV a testo
  • Video in PDF

Sottotitoli

  • Generatore SRT
  • Generatore VTT
  • Generatore di sottotitoli
  • MP4 in SRT

Altri strumenti

  • Convertitore audio
  • Convertitore video
  • Riassuntore di podcast
  • Riassuntore YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt