Vocova
PreciosBlog

Producto

  • Precios
  • Blog
  • Herramientas

Soluciones

  • Para podcasters
  • Para creadores de video
  • Entrevistas multilingües

Empresa

  • Acerca de
  • Preguntas frecuentes
  • Términos de servicio
  • Política de privacidad
  • Contacto

Transcripción

  • Grabadora de voz para Chromebook
  • Audio a texto
  • Video a texto
  • Transcripción de podcasts
  • Transcripción de entrevistas
  • Transcripción de clases

Grabaciones de reuniones

  • Transcripción de Zoom
  • Transcripción de Google Meet

Traducción

  • Traducción de audio
  • Subtítulos bilingües
  • Traducción de video

Fuentes públicas

  • Enlace de video a texto
  • Transcripción de YouTube
  • Transcripción de Apple Podcasts
  • Transcripción de Vimeo
  • Transcripción de Bilibili
  • Transcripción de SoundCloud
  • Transcripción de Dailymotion
  • Transcripción de Reddit
  • Transcripción de Facebook
  • Transcripción de X (Twitter)
  • Transcripción de Instagram
  • Transcripción de TikTok

Idioma

  • Transcripción de japonés
  • Transcripción en español
  • Transcripción en francés
  • Transcripción en alemán
  • Transcripción en portugués
  • Transcripción de coreano
  • Transcripción en chino
  • Transcripción de árabe
  • Transcripción de hindi
  • Transcripción de italiano
  • Transcripción en ruso
  • Transcripción de tailandés
  • Transcripción al vietnamita
  • Transcripción de turco
  • Transcripción en indonesio
  • Transcripción en neerlandés
  • Transcripción en polaco
  • Transcripción de sueco
  • Transcripción en cantonés
  • Transcripción en tagalo

Formato

  • MP4 a texto
  • MP3 a texto
  • WAV a texto
  • M4A a texto
  • MOV a texto
  • Video a PDF

Subtítulos

  • Generador SRT
  • Generador VTT
  • Generador de subtítulos
  • MP4 a SRT

Más herramientas

  • Convertidor de audio
  • Convertidor de video
  • Resumidor de podcasts
  • Resumidor de YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
PreciosBlog

Producto

  • Precios
  • Blog
  • Herramientas

Soluciones

  • Para podcasters
  • Para creadores de video
  • Entrevistas multilingües

Empresa

  • Acerca de
  • Preguntas frecuentes
  • Términos de servicio
  • Política de privacidad
  • Contacto

Transcripción

  • Grabadora de voz para Chromebook
  • Audio a texto
  • Video a texto
  • Transcripción de podcasts
  • Transcripción de entrevistas
  • Transcripción de clases

Grabaciones de reuniones

  • Transcripción de Zoom
  • Transcripción de Google Meet

Traducción

  • Traducción de audio
  • Subtítulos bilingües
  • Traducción de video

Fuentes públicas

  • Enlace de video a texto
  • Transcripción de YouTube
  • Transcripción de Apple Podcasts
  • Transcripción de Vimeo
  • Transcripción de Bilibili
  • Transcripción de SoundCloud
  • Transcripción de Dailymotion
  • Transcripción de Reddit
  • Transcripción de Facebook
  • Transcripción de X (Twitter)
  • Transcripción de Instagram
  • Transcripción de TikTok

Idioma

  • Transcripción de japonés
  • Transcripción en español
  • Transcripción en francés
  • Transcripción en alemán
  • Transcripción en portugués
  • Transcripción de coreano
  • Transcripción en chino
  • Transcripción de árabe
  • Transcripción de hindi
  • Transcripción de italiano
  • Transcripción en ruso
  • Transcripción de tailandés
  • Transcripción al vietnamita
  • Transcripción de turco
  • Transcripción en indonesio
  • Transcripción en neerlandés
  • Transcripción en polaco
  • Transcripción de sueco
  • Transcripción en cantonés
  • Transcripción en tagalo

Formato

  • MP4 a texto
  • MP3 a texto
  • WAV a texto
  • M4A a texto
  • MOV a texto
  • Video a PDF

Subtítulos

  • Generador SRT
  • Generador VTT
  • Generador de subtítulos
  • MP4 a SRT

Más herramientas

  • Convertidor de audio
  • Convertidor de video
  • Resumidor de podcasts
  • Resumidor de YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
PreciosBlog
  1. Blog
  2. Benchmark de precisión de Whisper 2026: probamos large-v3, turbo y small en 12 idiomas

Benchmark de precisión de Whisper 2026: probamos large-v3, turbo y small en 12 idiomas

Un benchmark de Whisper reproducible: medimos la tasa de error de palabra de large-v3, large-v3-turbo y small en 12 idiomas sobre el conjunto de prueba FLEURS. 1.749 transcripciones, metodología completa y datos brutos descargables.

Por Jimmy H·18 jul 2026·20 min de lectura·
benchmarksaccuracywerwhisperdata

Ejecutamos 1.749 transcripciones para medir qué tan precisa es realmente la transcripción con IA de código abierto en 2026. Tres modelos Whisper (large-v3, large-v3-turbo y small) transcribieron 50 enunciados en cada uno de 12 idiomas del conjunto de prueba público FLEURS. El titular: large-v3 alcanza una tasa de error de palabra de entre el 3 y el 6 por ciento aproximadamente en idiomas europeos con muchos recursos (español 2,9 %, italiano 3,2 %, inglés 4,1 %), cerca del rango que suele citarse para la transcripción humana. En hindi sube al 15,7 % y en árabe egipcio al 14,6 %. Dentro de un mismo modelo, la brecha entre el mejor y el peor idioma es más de 5 veces, lo que empequeñece la diferencia entre versiones del modelo.

Los promedios cuentan solo la mitad de la historia, así que este artículo también reporta lo que los promedios ocultan: en inglés e italiano, más del 60 % de los enunciados volvieron perfectos palabra por palabra, mientras que hindi y cantonés lograron un 4 %. Y cuando los modelos más pequeños fallan en idiomas difíciles, no fallan con elegancia: encontramos cuatro alucinaciones de bucle de repetición de manual en la salida bruta, todas de turbo y small, ninguna de large-v3.

Cada cifra de este artículo proviene de una prueba que ejecutamos nosotros mismos en julio de 2026, con una semilla aleatoria fija, un script publicado y resultados brutos descargables. Puedes reproducirlo todo o comprobar nuestro trabajo línea por línea.

Qué probamos y cómo

Casi todas las cifras de precisión de transcripción que hay en la web están copiadas de páginas de proveedores o de otros artículos, sin una prueba detrás. Esta es nuestra configuración exacta:

ElementoConfiguración
Conjunto de pruebaGoogle FLEURS test split (conjunto académico público, habla leída)
MuestreoPrimeros 50 enunciados del test split barajado por idioma (shuffle seed 42, determinista), unos 9 minutos de audio por idioma
ModelosWhisper large-v3, large-v3-turbo y small (conversiones MLX de código abierto)
Inferenciatemperature 0, idioma de origen fijado (sin autodetección), sin condicionamiento con texto previo
NormalizaciónIgual que el paper de Whisper: EnglishTextNormalizer para inglés, BasicTextNormalizer para el resto (vía transformers)
MétricasWER (tasa de error de palabra); para chino, japonés y cantonés la métrica principal es CER (tasa de error de carácter)
Softwaremlx-whisper 0.4.3, jiwer 4.0.0, transformers 5.11.0, datasets 3.6.0
HardwareApple M3, inferencia MLX, fp16
Fecha de pruebaJulio de 2026

Elegimos los 12 idiomas para abarcar niveles de recursos y sistemas de escritura, no para favorecer a los modelos: seis idiomas europeos con muchos recursos, tres idiomas CJK sin espacios que exigen puntuación a nivel de carácter, más coreano (aglutinante, con espacios), hindi (devanagari) y árabe egipcio.

Un detalle de muestreo para quien audite el archivo bruto: FLEURS suele incluir varias grabaciones de la misma frase por distintos hablantes, que comparten un id de frase. Nuestra lógica de reanudación elimina duplicados por id de frase, así que la celda de inglés en large-v3 contiene 49 enunciados en vez de 50; todas las demás contienen 50, para un total de 1.749 transcripciones.

Dos advertencias honestas antes de la tabla. Primero, FLEURS es habla leída: audio limpio, ritmo constante, un solo hablante. Las reuniones y entrevistas reales rinden bastante peor, porque el ruido de fondo, los acentos y la superposición de hablantes disparan las tasas de error (para pasos prácticos de mitigación, consulta cómo transcribir audio con ruido). Trata estas cifras como el techo de cada idioma, no como una promesa. Segundo, 50 enunciados por idioma son una muestra, no el conjunto completo. Cada cifra tiene un margen de unos pocos puntos porcentuales, así que lee las magnitudes y el orden, no los decimales.

Gráfico de barras de las tasas de error de Whisper large-v3 en 12 idiomas en FLEURS, del 2,9% en español al 15,7% en hindi

Resultados: 12 idiomas, 3 modelos

Las cifras son WER %, menos es mejor. Para japonés, mandarín y cantonés (marcados con *) la cifra es CER %, porque estos idiomas no separan las palabras con espacios.

Idiomalarge-v3large-v3-turbosmall
Inglés4,1 %4,7 %6,6 %
Español2,9 %3,3 %6,5 %
Francés5,8 %6,7 %14,3 %
Alemán4,6 %6,0 %12,8 %
Italiano3,2 %3,9 %8,2 %
Portugués6,6 %7,2 %11,0 %
Japonés *6,6 %5,8 %16,4 %
Coreano14,9 %14,5 %21,7 %
Mandarín *6,7 %8,0 %19,5 %
Cantonés *10,5 %43,3 %no compatible
Hindi15,7 %22,3 %42,4 %
Árabe (Egipto)14,6 %16,1 %32,7 %

Destacan tres cosas. La brecha entre idiomas es mucho mayor que la brecha entre modelos: español 2,9 % frente a hindi 15,7 % en el mismo large-v3. El modelo turbo cuesta solo de 0,3 a 1,4 puntos en los seis idiomas europeos, pero 6,6 puntos en hindi, y en cantonés se desploma del 10,5 % al 43,3 % CER. Y small se degrada catastróficamente fuera de los idiomas con muchos recursos: 42,4 % en hindi y 32,7 % en árabe lo convierten en una herramienta de vista previa, no en un entregable.

La celda «no compatible» es literal: el token de idioma cantonés yue se introdujo con la generación large-v3 (la ficha oficial del modelo enumera «un nuevo token de idioma para cantonés» entre los cambios), así que el modelo small de generación anterior rechaza el idioma de plano. En nuestra ejecución lanzó un error de idioma no compatible, lo cual es en sí un dato útil: antes de comparar la calidad de los modelos, comprueba si el modelo siquiera admite tu idioma.

Más allá de los promedios: la mayoría de las frases son perfectas, una cola no

Una tasa de error media aplana una distribución que en realidad está muy sesgada. Por idioma en large-v3, esta es la proporción de enunciados transcritos sin errores, la mediana y el percentil 90:

IdiomaEnunciados perfectosMedianaPercentil 90
Inglés61 %0,0 %12,5 %
Español54 %0,0 %7,7 %
Francés38 %4,3 %12,5 %
Alemán56 %0,0 %14,3 %
Italiano62 %0,0 %10,5 %
Portugués42 %3,7 %18,8 %
Japonés *36 %3,2 %15,8 %
Coreano34 %13,7 %35,3 %
Mandarín *40 %3,0 %17,8 %
Cantonés *4 %9,7 %17,6 %
Hindi4 %14,9 %27,5 %
Árabe (Egipto)28 %10,3 %37,5 %

Importan dos lecturas. En los idiomas fuertes, el enunciado mediano no tiene errores: el promedio del 4,1 % del inglés lo produce casi por completo una minoría de frases más difíciles, por eso allí un transcript se siente casi perfecto con fallos ocasionales que corregir. Y la columna de tasa perfecta separa idiomas que el promedio mete en el mismo saco: cantonés (10,5 %) y árabe (14,6 % de media) parecen más cercanos de lo que son, pero solo el 4 % de las frases en cantonés volvieron impecables frente al 28 % en árabe. Si revisas buscando los tramos malos, el percentil de la cola predice tu carga de trabajo mejor que la media.

Proporción de frases transcritas sin errores por Whisper large-v3: más de la mitad en inglés e italiano frente al 4% en hindi y cantonés

Hallazgo 1: la brecha entre idiomas empequeñece la brecha entre modelos

Dentro de large-v3, el rango entre el mejor idioma (español, 2,9 %) y el peor (hindi, 15,7 %) es más de 5 veces. Inglés (4,1 %) frente a árabe egipcio (14,6 %) es casi 4 veces. En cambio, dentro de un mismo idioma europeo, pasar de turbo a large-v3 mueve la cifra en torno a un punto (inglés 4,7 % a 4,1 %, alemán 6,0 % a 4,6 %).

La asimetría es aún más marcada en small. En inglés queda solo 2,5 puntos por detrás de large-v3. En francés se degrada del 5,8 % al 14,3 % y en hindi del 15,7 % al 42,4 %. El mismo checkpoint que parece un compromiso razonable en inglés es inservible en hindi.

La conclusión práctica: que un modelo admita bien tu idioma importa mucho más que qué versión del modelo elijas. Si trabajas en español, casi cualquier cosa moderna sirve. Si trabajas en hindi o cantonés, la elección del modelo decide si el transcript es siquiera utilizable.

Hallazgo 2: lo que turbo te cuesta de verdad

En nuestro M3, el rendimiento típico fue de unas 3,8 veces el tiempo real para large-v3, 5,2 veces para turbo y 14,3 veces para small, promediado entre ejecuciones (cada ejecución varió con la carga del sistema, y las velocidades absolutas dependen del hardware; la señal son las proporciones). Así que turbo corre unas 1,4 veces más rápido que large-v3.

En los seis idiomas europeos con muchos recursos, esa velocidad casi no cuesta nada: turbo queda de media unos 0,8 puntos por detrás de large-v3, y en japonés y coreano turbo incluso superó ligeramente a large-v3 en nuestra muestra (5,8 % vs. 6,6 % CER, 14,5 % vs. 14,9 % WER). Por eso los servicios comerciales de transcripción se han pasado en general a modelos destilados y acelerados.

Pero turbo no es gratis. Hindi se degrada 6,6 puntos (22,3 % vs. 15,7 %), el árabe egipcio 1,5, y el cantonés se desploma del 10,5 % al 43,3 % CER, algo inservible. La decisión de cambiar precisión por velocidad hay que tomarla por idioma, no de forma global.

Hallazgo 3: los idiomas sin límites de palabra necesitan otra regla

El chino, el japonés y el cantonés no separan las palabras con espacios, así que una tasa de error de «palabra» depende por completo de cómo dividas el texto, y distintos tokenizadores producen WER muy diferentes para transcripts idénticos. La práctica académica, incluido el propio paper de Whisper, es usar la tasa de error de carácter (CER) para estos idiomas, y eso es lo que reportamos.

Medidos así, el japonés (6,6 % CER) y el mandarín (6,7 % CER) están en la misma banda de calidad que los idiomas europeos fuertes en large-v3. El cantonés es el contraejemplo más nítido de todo nuestro conjunto de datos: 10,5 % CER en large-v3, 43,3 % en turbo, ningún soporte en small. Un idioma, tres modelos, y el resultado va de utilizable a imposible.

El coreano merece una nota: su 14,9 % parece malo, pero el coreano es aglutinante y usa convenciones de espaciado que inflan la WER basada en espacios, así que su precisión a nivel de carácter es mejor de lo que sugiere la cifra. Aún necesita más revisión que los idiomas europeos, pero no tanta como implica una lectura ingenua de la WER.

La lección para evaluar a cualquier proveedor: si una herramienta afirma «95 % de precisión en chino» sin decir si es WER o CER, en qué audio, con qué normalización, la cifra no aporta información. Nuestro artículo explicativo de la WER detalla la mecánica de la métrica.

La misma frase en cantonés transcrita correctamente por Whisper large-v3 mientras large-v3-turbo colapsa en un bucle de repetición

Hallazgo 4: cuando los modelos más pequeños fallan, fallan de golpe

Los promedios sugieren que los errores se reparten de forma uniforme por un transcript. La salida bruta dice lo contrario. Al revisar las 1.749 hipótesis en busca de salida degenerada (tasa de error superior al 100 % o salida de más del doble de la longitud de referencia), encontramos exactamente cuatro casos: tres de turbo (dos en cantonés, uno en hindi) y uno de small (hindi). large-v3 no produjo ninguno en sus 599 enunciados.

Los cuatro son el mismo modo de fallo: un bucle de repetición. El peor caso en cantonés alcanzó un 372 % CER (las inserciones pueden llevar la métrica más allá del 100 %): turbo transcribió las primeras palabras de forma plausible, luego se enganchó a un único carácter y lo emitió 46 veces seguidas. Los fallos en hindi tienen la misma forma, una palabra estampada una y otra vez. En ese mismo enunciado, large-v3 produjo un transcript casi perfecto con 6,9 % CER. Las cadenas exactas están en los datos brutos (enunciado id 1980 en results.jsonl) si quieres inspeccionarlas.

Ese caso en cantonés muestra en voz baja un segundo fallo: antes de entrar en el bucle, turbo ya se había desviado del chino tradicional hacia caracteres simplificados y elecciones léxicas del mandarín, mientras que large-v3 se mantuvo en la escritura de referencia. Para los hablantes de cantonés esto importa tanto como la tasa de error, porque el «transcript» se desliza hacia otra lengua escrita.

La alucinación en los modelos de la familia Whisper está documentada más allá de nuestra muestra: Koenecke et al. (2024) auditaron transcripciones de Whisper y hallaron del orden del 1 % de segmentos con contenido inventado, concentrado en torno a pausas y habla disfluente. Nuestra tasa en habla leída es menor (4 de 1.749, en torno al 0,2 %), lo que encaja: el audio limpio y continuo da al modelo menos silencios que rellenar. La regla práctica que extraemos de ambos: los peores fallos de transcripción no son ruido uniformemente distribuido sino corrupción local total, se concentran en checkpoints más pequeños con idiomas más débiles, y una revisión rápida en busca de tokens repetidos atrapa la mayoría.

Cómo se comparan nuestras cifras de large-v3 con la tabla publicada de large-v2

Nuestra guía de precisión por idioma recopila los resultados FLEURS de large-v2 publicados en el paper de Whisper. Al alinearlos con nuestras mediciones de large-v3 de julio de 2026 para los idiomas coincidentes (las cifras del paper son el test split completo, las nuestras una muestra de 50 enunciados, así que lee la dirección, no los decimales):

IdiomaPaper large-v2Nuestro large-v3Dirección
Español3,0 %2,9 %estable, ya fuerte
Inglés4,2 %4,1 %estable, ya fuerte
Italiano4,0 %3,2 %algo mejor
Alemán4,5 %4,6 %estable
Francés8,3 %5,8 %mejor
Japonés (CER)5,3 %6,6 %estable dentro del ruido
Coreano14,3 %14,9 %estable dentro del ruido
Mandarín (CER)14,7 %6,7 %reducido a la mitad
Árabe16,0 %14,6 %algo mejor
Hindi21,5 %15,7 %notablemente mejor

El patrón concuerda con adónde fueron los datos de entrenamiento adicionales: los idiomas que ya estaban cerca de su suelo se quedaron quietos, y las grandes mejoras cayeron en mandarín (reducido a la mitad), hindi y francés. El cantonés no aparece en absoluto en la tabla de large-v2, que es la versión más contundente de la misma historia: entre generaciones de modelos, el cambio más importante para algunos idiomas no es una tasa de error menor, sino la existencia.

Qué significan estas cifras para tu trabajo

Traduciendo las tasas de error a experiencia percibida: 5 % significa un error cada 20 palabras, una revisión rápida. 15 % significa un error cada 7 palabras, y la edición empieza a costar tiempo de verdad. Por encima del 30 %, pasajes enteros hay que volver a escucharlos, y el transcript es un borrador en el mejor de los casos.

  • Idiomas europeos con muchos recursos (inglés, español, francés, alemán, italiano, portugués): large-v3 se sitúa entre el 3 y el 7 por ciento en habla limpia, claramente en el terreno de «confía en el primer borrador y luego ojéalo». turbo cuesta menos de 1,5 puntos y sirve para el trabajo rutinario. small se degrada al 13-14 por ciento en francés y alemán; no lo uses para nada que entregues.
  • Japonés, mandarín, coreano: japonés y mandarín al 6-7 por ciento CER en large-v3 son de fiar como primer borrador, siempre que leas la cifra como de nivel de carácter. La WER del coreano exagera sus errores, pero prevé más corrección que en el grupo europeo.
  • Cantonés, hindi, árabe: la zona de precaución. Hindi y árabe egipcio se quedan en el 15-16 por ciento incluso en large-v3, un error cada 6 o 7 palabras, así que presupuesta una edición sustancial. El cantonés solo es viable en large-v3; elige la variante equivocada y la tasa de error se cuadruplica.

Recuerda que todo esto es rendimiento techo en habla leída. Las grabaciones reales rinden peor, y las tres variables que más importan son la calidad de grabación, el número de hablantes y la intensidad del acento. En material con varios hablantes, la atribución de hablante es una clase de error aparte, además de la precisión de palabra; consulta qué es la diarización de hablantes para ver cómo funciona.

Si quieres el panorama por idioma en unos 100 idiomas en lugar de nuestros 12, nuestra guía de precisión por idioma recopila la tabla FLEURS publicada en el paper de Whisper, escalonada de casi humana a prácticamente inservible. Esa página es una recopilación de resultados publicados; esta es el benchmark que ejecutamos nosotros mismos, y ambas coinciden donde se solapan.

Reprodúcelo o comprueba nuestro trabajo

Todo lo necesario para verificar o ampliar este benchmark es público:

  • results.jsonl: los 1.749 resultados por enunciado, con texto de referencia, salida del modelo y WER/CER por enunciado
  • results-summary.csv: la tabla agregada idioma x modelo que hay detrás de este artículo
  • bench.py: el script exacto que produjo los datos, con muestreo determinista (seed 42)
  • README del paquete de datos: comandos de instalación, versiones y licencias

Ejecuta python bench.py --n 50 y, gracias al shuffle seed fijo, seleccionas los mismos enunciados que nosotros; aumenta --n para ampliar la muestra (el test split de FLEURS tiene entre 350 y 900 enunciados por idioma). El script transmite FLEURS desde Hugging Face, transcribe en local, puntúa con la normalización del paper de Whisper y añade una línea JSONL por enunciado, así que las ejecuciones interrumpidas se reanudan sin problemas.

Atribución: las transcripciones de referencia provienen del conjunto FLEURS de Google (Conneau et al., 2022), redistribuido bajo su licencia CC-BY-4.0. Los pesos del modelo Whisper son de OpenAI, publicados bajo Apache 2.0.

Preguntas frecuentes

¿Es Whisper el modelo de transcripción de código abierto más preciso?

Es la familia abierta más reproducida y con mayor cobertura de idiomas, por lo que sirve de buena referencia pública. Existen otras familias de código abierto, como las líneas MMS y Seamless de Meta y muchos ajustes finos específicos por idioma, pero difieren en cobertura de idiomas, licencias y convenciones de evaluación, así que una comparación justa entre familias necesita su propia prueba controlada. Elegimos Whisper porque los pesos son fijos y públicos, los resultados son reproducibles y un solo método cubre los 12 idiomas.

¿Por qué no probasteis servicios comerciales como Otter, Rev o HappyScribe?

Los términos de servicio comerciales suelen restringir la publicación de resultados de benchmark, los modelos tras las API son opacos y cambian sin aviso, y una cifra medida hoy puede ser irrelevante el próximo trimestre. Los pesos de código abierto están congelados, así que cualquiera puede repetir nuestra prueba exacta indefinidamente. Las afirmaciones de precisión de los proveedores están en sus webs; fíjate en lo poco que revelan el conjunto de prueba y la normalización.

¿Bastan 50 enunciados por idioma?

Bastan para magnitudes y orden, no para pruebas de significancia de grano fino. Así es exactamente como presentamos los resultados. El test split completo de FLEURS tiene entre 350 y 900 enunciados por idioma, y ampliar la muestra es un cambio de un solo parámetro en el script publicado.

¿Los resultados de habla leída representan grabaciones reales?

No. Todo lo que medimos aquí es rendimiento techo: audio limpio, de un solo hablante, con ritmo constante. En reuniones, llamadas y entrevistas reales, espera tasas de error notablemente más altas, y el daño crece con el ruido, la intensidad del acento y la superposición de hablantes. Lo que se transfiere de este benchmark al mundo real es el orden (un idioma o modelo que gana en habla limpia suele ganar también en habla ruidosa), no los porcentajes absolutos.

¿Cómo reproduzco exactamente la prueba?

Descarga bench.py, instala las dependencias listadas en el README del paquete de datos y ejecuta python bench.py --n 50. La semilla está fija en el script, el muestreo es determinista y los resultados se añaden a un archivo JSONL que se reanuda tras una interrupción. El script usa MLX (Apple Silicon); en otro hardware, cambia la llamada de transcripción por openai-whisper o faster-whisper con los mismos ajustes.

¿Alucinan estos modelos?

En nuestra muestra de habla leída, rara vez, pero de forma catastrófica cuando ocurre: 4 de 1.749 salidas (en torno al 0,2 %) fueron bucles de repetición, todas de turbo o small en cantonés y hindi, ninguna de large-v3. Las auditorías publicadas de habla conversacional y disfluente reportan tasas más altas, del orden del 1 % de los segmentos (Koenecke et al., 2024). Espera más de esto en audio real con pausas largas, y revisa las salidas en busca de tokens repetidos.

¿Qué modelo usa Vocova?

Este benchmark mide modelos de código abierto, no el pipeline de producción de Vocova, y su conclusión es general: que tu idioma esté bien admitido importa más que el número de versión del modelo. Vocova dirige la transcripción a niveles de modelo de alta precisión para el trabajo multilingüe y añade etiquetas de hablante, traducción y formatos de exportación. La prueba más directa es una ejecución con tu propio audio en tu propio idioma.

Fuentes y lecturas adicionales

  • FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech (Conneau et al., 2022), el conjunto del que provienen todas nuestras muestras
  • google/fleurs en Hugging Face, distribución del conjunto y licencia CC-BY-4.0
  • Robust Speech Recognition via Large-Scale Weak Supervision (Radford et al., 2022), el paper de Whisper cuyas convenciones de normalización y CER seguimos
  • Ficha del modelo openai/whisper-large-v3, documenta el token de idioma cantonés añadido en large-v3 y la licencia de pesos Apache 2.0
  • Careless Whisper: Speech-to-Text Hallucination Harms (Koenecke et al., 2024), la auditoría externa de las tasas de alucinación de Whisper con la que comparamos nuestros recuentos de fallos
  • mlx-whisper en PyPI, el motor de inferencia usado para este benchmark
  • jiwer en GitHub, la biblioteca de puntuación WER/CER

¿Quieres ver la transcripción multilingüe con tu propio material? Pega un enlace de audio o vídeo en Vocova y compara la salida con lo que este artículo espera para tu idioma.

Sobre el autor

J

Jimmy H

Producto y Marketing, Vocova

Jimmy es el responsable de producto y marketing en Vocova, una herramienta de transcripción y subtítulos con IA. Trabaja de forma práctica en la precisión del reconocimiento de voz, la transcripción multilingüe y los flujos de subtítulos y notas de reuniones del producto, y escribe las guías de Vocova para sacar el máximo partido a la transcripción con IA.

Ver perfil en LinkedIn

Artículos relacionados

Leer más
16 abr 2026·16 min

¿Qué tan precisa es la transcripción con IA por idioma? Benchmarks WER por lengua (2026)

Leer más
10 feb 2026·15 min

¿Qué es la tasa de error de palabras (WER)? La métrica que mide la precisión de transcripción

Leer más
16 feb 2026·22 min

Cómo transcribir audio con ruido y reducir errores por ruido de fondo (2026)

Producto

  • Precios
  • Blog
  • Herramientas

Soluciones

  • Para podcasters
  • Para creadores de video
  • Entrevistas multilingües

Empresa

  • Acerca de
  • Preguntas frecuentes
  • Términos de servicio
  • Política de privacidad
  • Contacto

Transcripción

  • Grabadora de voz para Chromebook
  • Audio a texto
  • Video a texto
  • Transcripción de podcasts
  • Transcripción de entrevistas
  • Transcripción de clases

Grabaciones de reuniones

  • Transcripción de Zoom
  • Transcripción de Google Meet

Traducción

  • Traducción de audio
  • Subtítulos bilingües
  • Traducción de video

Fuentes públicas

  • Enlace de video a texto
  • Transcripción de YouTube
  • Transcripción de Apple Podcasts
  • Transcripción de Vimeo
  • Transcripción de Bilibili
  • Transcripción de SoundCloud
  • Transcripción de Dailymotion
  • Transcripción de Reddit
  • Transcripción de Facebook
  • Transcripción de X (Twitter)
  • Transcripción de Instagram
  • Transcripción de TikTok

Idioma

  • Transcripción de japonés
  • Transcripción en español
  • Transcripción en francés
  • Transcripción en alemán
  • Transcripción en portugués
  • Transcripción de coreano
  • Transcripción en chino
  • Transcripción de árabe
  • Transcripción de hindi
  • Transcripción de italiano
  • Transcripción en ruso
  • Transcripción de tailandés
  • Transcripción al vietnamita
  • Transcripción de turco
  • Transcripción en indonesio
  • Transcripción en neerlandés
  • Transcripción en polaco
  • Transcripción de sueco
  • Transcripción en cantonés
  • Transcripción en tagalo

Formato

  • MP4 a texto
  • MP3 a texto
  • WAV a texto
  • M4A a texto
  • MOV a texto
  • Video a PDF

Subtítulos

  • Generador SRT
  • Generador VTT
  • Generador de subtítulos
  • MP4 a SRT

Más herramientas

  • Convertidor de audio
  • Convertidor de video
  • Resumidor de podcasts
  • Resumidor de YouTube
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt