Benchmark de précision de Whisper 2026 : nous avons testé large-v3, turbo et small dans 12 langues
Un benchmark Whisper reproductible : nous avons mesuré le taux d'erreur sur les mots de large-v3, large-v3-turbo et small dans 12 langues sur le jeu de test FLEURS. 1 749 transcriptions, méthodologie complète et données brutes téléchargeables.
Nous avons réalisé 1 749 transcriptions pour mesurer la précision réelle de la transcription par IA open source en 2026. Trois modèles Whisper (large-v3, large-v3-turbo et small) ont transcrit 50 énoncés dans chacune de 12 langues du jeu de test public FLEURS. L'essentiel : large-v3 atteint un taux d'erreur sur les mots d'environ 3 à 6 pour cent dans les langues européennes à hautes ressources (espagnol 2,9 %, italien 3,2 %, anglais 4,1 %), proche de la fourchette souvent citée pour la transcription humaine. En hindi il grimpe à 15,7 %, en arabe égyptien à 14,6 %. Au sein d'un même modèle, l'écart entre la meilleure et la pire langue dépasse 5 fois, ce qui éclipse la différence entre versions du modèle.
Les moyennes ne racontent que la moitié de l'histoire, cet article rapporte donc aussi ce que les moyennes masquent : en anglais et en italien, plus de 60 % des phrases sont revenues parfaites au mot près, alors que le hindi et le cantonais atteignent 4 %. Et quand les modèles plus petits échouent sur les langues difficiles, ils n'échouent pas en douceur : nous avons repéré quatre hallucinations en boucle de répétition d'école dans la sortie brute, toutes issues de turbo et small, aucune de large-v3.
Chaque chiffre de cet article provient d'un test que nous avons mené nous-mêmes en juillet 2026, avec une graine aléatoire fixe, un script publié et des résultats bruts téléchargeables. Vous pouvez tout reproduire, ou vérifier notre travail ligne par ligne.
Ce que nous avons testé et comment
Presque tous les chiffres de précision de transcription sur le web sont copiés de pages de fournisseurs ou d'autres articles, sans test derrière. Voici notre configuration exacte :
| Élément | Réglage |
|---|---|
| Jeu de test | Google FLEURS test split (jeu académique public, parole lue) |
| Échantillonnage | Les 50 premiers énoncés du test split mélangé par langue (shuffle seed 42, déterministe), environ 9 minutes d'audio par langue |
| Modèles | Whisper large-v3, large-v3-turbo et small (conversions MLX open source) |
| Inférence | temperature 0, langue source fixée (pas d'auto-détection), sans conditionnement sur le texte précédent |
| Normalisation | Comme dans l'article Whisper : EnglishTextNormalizer pour l'anglais, BasicTextNormalizer ailleurs (via transformers) |
| Métriques | WER (taux d'erreur sur les mots) ; pour le chinois, le japonais et le cantonais, la métrique principale est le CER (taux d'erreur sur les caractères) |
| Logiciels | mlx-whisper 0.4.3, jiwer 4.0.0, transformers 5.11.0, datasets 3.6.0 |
| Matériel | Apple M3, inférence MLX, fp16 |
| Date du test | Juillet 2026 |
Nous avons choisi les 12 langues pour couvrir des niveaux de ressources et des systèmes d'écriture, pas pour flatter les modèles : six langues européennes à hautes ressources, trois langues CJC sans espaces qui exigent un score au niveau du caractère, plus le coréen (agglutinant, avec espaces), le hindi (dévanagari) et l'arabe égyptien.
Un détail d'échantillonnage pour qui audite le fichier brut : FLEURS inclut souvent plusieurs enregistrements de la même phrase par des locuteurs différents, partageant un id de phrase. Notre logique de reprise déduplique par id de phrase, si bien que la cellule anglais large-v3 contient 49 énoncés au lieu de 50 ; toutes les autres en contiennent 50, pour un total de 1 749 transcriptions.
Deux mises en garde honnêtes avant le tableau. D'abord, FLEURS est de la parole lue : audio propre, rythme régulier, un seul locuteur. Les réunions et entretiens réels obtiennent des scores bien pires, car le bruit de fond, les accents et le chevauchement de locuteurs font grimper les taux d'erreur (pour des mesures pratiques d'atténuation, voir comment transcrire un audio bruité). Traitez ces chiffres comme le plafond de chaque langue, pas comme une promesse. Ensuite, 50 énoncés par langue est un échantillon, pas le jeu de test complet. Chaque chiffre porte une marge de quelques points de pourcentage, lisez donc les ordres de grandeur et le classement, pas les décimales.

Résultats : 12 langues, 3 modèles
Les chiffres sont en WER %, plus bas est meilleur. Pour le japonais, le mandarin et le cantonais (marqués *), le chiffre est en CER %, car ces langues ne séparent pas les mots par des espaces.
| Langue | large-v3 | large-v3-turbo | small |
|---|---|---|---|
| Anglais | 4,1 % | 4,7 % | 6,6 % |
| Espagnol | 2,9 % | 3,3 % | 6,5 % |
| Français | 5,8 % | 6,7 % | 14,3 % |
| Allemand | 4,6 % | 6,0 % | 12,8 % |
| Italien | 3,2 % | 3,9 % | 8,2 % |
| Portugais | 6,6 % | 7,2 % | 11,0 % |
| Japonais * | 6,6 % | 5,8 % | 16,4 % |
| Coréen | 14,9 % | 14,5 % | 21,7 % |
| Mandarin * | 6,7 % | 8,0 % | 19,5 % |
| Cantonais * | 10,5 % | 43,3 % | non pris en charge |
| Hindi | 15,7 % | 22,3 % | 42,4 % |
| Arabe (Égypte) | 14,6 % | 16,1 % | 32,7 % |
Trois choses ressortent. L'écart entre langues est bien plus grand que l'écart entre modèles : espagnol 2,9 % contre hindi 15,7 % sur le même large-v3. Le modèle turbo ne coûte que 0,3 à 1,4 point dans les six langues européennes, mais 6,6 points en hindi, et en cantonais il s'effondre de 10,5 % à 43,3 % CER. Et small se dégrade de façon catastrophique hors des langues à hautes ressources : 42,4 % en hindi et 32,7 % en arabe en font un outil d'aperçu, pas un livrable.
La cellule « non pris en charge » est à prendre au pied de la lettre : le token de langue cantonaise yue a été introduit avec la génération large-v3 (la fiche officielle du modèle mentionne « un nouveau token de langue pour le cantonais » parmi les changements), si bien que le modèle small de génération antérieure rejette la langue purement et simplement. Lors de notre exécution, il a levé une erreur de langue non prise en charge, ce qui est en soi un point de donnée utile : avant de comparer la qualité des modèles, vérifiez que le modèle prend seulement en charge votre langue.
Au-delà des moyennes : la plupart des phrases sont parfaites, une queue ne l'est pas
Un taux d'erreur moyen aplatit une distribution en réalité très asymétrique. Par langue sur large-v3, voici la part d'énoncés transcrits sans erreur, la médiane et le 90e centile :
| Langue | Énoncés parfaits | Médiane | 90e centile |
|---|---|---|---|
| Anglais | 61 % | 0,0 % | 12,5 % |
| Espagnol | 54 % | 0,0 % | 7,7 % |
| Français | 38 % | 4,3 % | 12,5 % |
| Allemand | 56 % | 0,0 % | 14,3 % |
| Italien | 62 % | 0,0 % | 10,5 % |
| Portugais | 42 % | 3,7 % | 18,8 % |
| Japonais * | 36 % | 3,2 % | 15,8 % |
| Coréen | 34 % | 13,7 % | 35,3 % |
| Mandarin * | 40 % | 3,0 % | 17,8 % |
| Cantonais * | 4 % | 9,7 % | 17,6 % |
| Hindi | 4 % | 14,9 % | 27,5 % |
| Arabe (Égypte) | 28 % | 10,3 % | 37,5 % |
Deux lectures comptent. Dans les langues fortes, l'énoncé médian est sans erreur : la moyenne de 4,1 % de l'anglais est produite presque entièrement par une minorité de phrases plus difficiles, c'est pourquoi une transcription y semble quasi parfaite avec des défauts occasionnels à corriger. Et la colonne du taux parfait sépare des langues que la moyenne met dans le même sac : le cantonais (10,5 %) et l'arabe (14,6 % de moyenne) semblent plus proches qu'ils ne le sont, mais seulement 4 % des phrases cantonaises sont revenues impeccables contre 28 % en arabe. Si vous relisez en cherchant les passages fautifs, le centile de queue prédit votre charge de travail mieux que la moyenne.

Constat 1 : l'écart entre langues éclipse l'écart entre modèles
Au sein de large-v3, l'amplitude entre la meilleure langue (espagnol, 2,9 %) et la pire (hindi, 15,7 %) dépasse 5 fois. Anglais (4,1 %) contre arabe égyptien (14,6 %) approche les 4 fois. En revanche, au sein d'une même langue européenne, passer de turbo à large-v3 déplace le chiffre d'environ un point (anglais 4,7 % à 4,1 %, allemand 6,0 % à 4,6 %).
L'asymétrie est encore plus marquée pour small. En anglais, il n'est que 2,5 points derrière large-v3. En français il se dégrade de 5,8 % à 14,3 %, et en hindi de 15,7 % à 42,4 %. Le même checkpoint qui ressemble à un compromis raisonnable en anglais est inutilisable en hindi.
La conclusion pratique : que le modèle prenne bien en charge votre langue importe bien plus que la version du modèle que vous choisissez. Si vous travaillez en espagnol, presque tout ce qui est moderne convient. Si vous travaillez en hindi ou en cantonais, le choix du modèle décide si la transcription est seulement utilisable.
Constat 2 : ce que turbo vous coûte vraiment
Sur notre M3, le débit typique était d'environ 3,8 fois le temps réel pour large-v3, 5,2 fois pour turbo et 14,3 fois pour small, moyenné sur les exécutions (chaque exécution variait selon la charge système, et les vitesses absolues dépendent du matériel ; le signal, ce sont les rapports). turbo tourne donc environ 1,4 fois plus vite que large-v3.
Dans les six langues européennes à hautes ressources, cette vitesse ne coûte presque rien : turbo est en moyenne à environ 0,8 point derrière large-v3, et en japonais et coréen turbo a même légèrement devancé large-v3 dans notre échantillon (5,8 % contre 6,6 % CER, 14,5 % contre 14,9 % WER). C'est pourquoi les services commerciaux de transcription sont largement passés aux modèles distillés et accélérés.
Mais turbo n'est pas gratuit. Le hindi se dégrade de 6,6 points (22,3 % contre 15,7 %), l'arabe égyptien de 1,5, et le cantonais s'effondre de 10,5 % à 43,3 % CER, ce qui est inutilisable. La décision d'échanger de la précision contre de la vitesse doit se prendre par langue, pas globalement.
Constat 3 : les langues sans frontières de mots exigent une autre règle
Le chinois, le japonais et le cantonais ne séparent pas les mots par des espaces, si bien qu'un taux d'erreur sur les « mots » dépend entièrement de la façon dont on découpe le texte, et différents tokeniseurs produisent des WER très différents pour des transcriptions identiques. La pratique académique, y compris l'article Whisper lui-même, est d'utiliser le taux d'erreur sur les caractères (CER) pour ces langues, et c'est ce que nous rapportons.
Mesurés ainsi, le japonais (6,6 % CER) et le mandarin (6,7 % CER) se situent dans la même bande de qualité que les langues européennes fortes sur large-v3. Le cantonais est le contre-exemple le plus net de tout notre jeu de données : 10,5 % CER sur large-v3, 43,3 % sur turbo, aucune prise en charge sur small. Une langue, trois modèles, et le résultat va d'utilisable à impossible.
Le coréen mérite une note : ses 14,9 % semblent médiocres, mais le coréen est agglutinant et utilise des conventions d'espacement qui gonflent le WER basé sur les espaces, si bien que sa précision au niveau du caractère est meilleure que le chiffre ne le laisse penser. Il demande tout de même plus de relecture que les langues européennes, mais pas autant qu'une lecture naïve du WER le suggère.
À retenir pour évaluer n'importe quel fournisseur : si un outil affirme « 95 % de précision en chinois » sans dire s'il s'agit de WER ou de CER, sur quel audio, avec quelle normalisation, le chiffre n'apporte aucune information. Notre article explicatif du WER détaille la mécanique de la métrique.

Constat 4 : quand les modèles plus petits échouent, ils échouent d'un coup
Les moyennes suggèrent que les erreurs sont réparties uniformément dans une transcription. La sortie brute dit le contraire. En balayant les 1 749 hypothèses à la recherche de sortie dégénérée (taux d'erreur supérieur à 100 % ou sortie de plus du double de la longueur de référence), nous avons trouvé exactement quatre cas : trois de turbo (deux en cantonais, un en hindi) et un de small (hindi). large-v3 n'en a produit aucun sur ses 599 énoncés.
Les quatre relèvent du même mode d'échec : une boucle de répétition. Le pire cas cantonais a atteint 372 % CER (les insertions peuvent pousser la métrique au-delà de 100 %) : turbo a transcrit les premiers mots de façon plausible, puis s'est verrouillé sur un seul caractère et l'a émis 46 fois de suite. Les échecs en hindi ont la même forme, un mot estampillé encore et encore. Sur ce même énoncé, large-v3 a produit une transcription quasi parfaite à 6,9 % CER. Les chaînes exactes figurent dans les données brutes (énoncé id 1980 dans results.jsonl) si vous voulez les inspecter.
Ce cas cantonais révèle discrètement un second échec : avant d'entrer dans la boucle, turbo avait déjà dérivé du chinois traditionnel vers des caractères simplifiés et des choix lexicaux du mandarin, tandis que large-v3 restait dans l'écriture de référence. Pour les locuteurs du cantonais, cela compte autant que le taux d'erreur, car la « transcription » glisse vers une autre langue écrite.
L'hallucination dans les modèles de la famille Whisper est documentée au-delà de notre échantillon : Koenecke et al. (2024) ont audité des transcriptions Whisper et trouvé de l'ordre de 1 % de segments contenant du contenu inventé, concentré autour des pauses et de la parole hésitante. Notre taux sur parole lue est plus bas (4 sur 1 749, environ 0,2 %), ce qui colle : un audio propre et continu offre au modèle moins de silences à combler. La règle pratique tirée des deux : les pires échecs de transcription ne sont pas un bruit uniformément réparti mais une corruption locale totale, ils se concentrent dans les checkpoints plus petits sur les langues plus faibles, et un balayage rapide des tokens répétés en attrape la plupart.
Comment nos chiffres large-v3 se comparent au tableau large-v2 publié
Notre guide de précision par langue compile les résultats FLEURS de large-v2 publiés dans l'article Whisper. En les alignant sur nos mesures large-v3 de juillet 2026 pour les langues qui se recoupent (les chiffres de l'article portent sur le test split complet, les nôtres sur un échantillon de 50 énoncés, lisez donc la direction, pas les décimales) :
| Langue | Article large-v2 | Notre large-v3 | Direction |
|---|---|---|---|
| Espagnol | 3,0 % | 2,9 % | stable, déjà fort |
| Anglais | 4,2 % | 4,1 % | stable, déjà fort |
| Italien | 4,0 % | 3,2 % | un peu meilleur |
| Allemand | 4,5 % | 4,6 % | stable |
| Français | 8,3 % | 5,8 % | meilleur |
| Japonais (CER) | 5,3 % | 6,6 % | stable dans le bruit |
| Coréen | 14,3 % | 14,9 % | stable dans le bruit |
| Mandarin (CER) | 14,7 % | 6,7 % | réduit de moitié |
| Arabe | 16,0 % | 14,6 % | un peu meilleur |
| Hindi | 21,5 % | 15,7 % | nettement meilleur |
Le schéma correspond à l'endroit où sont allées les données d'entraînement supplémentaires : les langues déjà proches de leur plancher n'ont pas bougé, et les gros gains ont porté sur le mandarin (réduit de moitié), le hindi et le français. Le cantonais n'apparaît pas du tout dans le tableau large-v2, ce qui est la version la plus brutale de la même histoire : entre générations de modèles, le changement le plus important pour certaines langues n'est pas un taux d'erreur plus bas, mais l'existence.
Ce que ces chiffres signifient pour votre travail
En traduisant les taux d'erreur en expérience ressentie : 5 % signifie une erreur toutes les 20 mots, une relecture rapide. 15 % signifie une erreur toutes les 7 mots, et l'édition commence à coûter du temps réel. Au-delà de 30 %, des passages entiers doivent être réécoutés, et la transcription est un brouillon au mieux.
- Langues européennes à hautes ressources (anglais, espagnol, français, allemand, italien, portugais) : large-v3 se situe entre 3 et 7 pour cent sur parole propre, solidement dans le registre « faire confiance au premier jet, puis survoler ». turbo coûte moins de 1,5 point et convient au travail courant. small se dégrade à 13-14 pour cent en français et en allemand ; ne l'utilisez pour rien que vous livrez.
- Japonais, mandarin, coréen : japonais et mandarin à 6-7 pour cent CER sur large-v3 sont fiables comme premier jet, tant que vous lisez le chiffre au niveau du caractère. Le WER du coréen surestime ses erreurs, mais prévoyez plus de correction que pour le groupe européen.
- Cantonais, hindi, arabe : la zone de prudence. Le hindi et l'arabe égyptien restent à 15-16 pour cent même sur large-v3, une erreur toutes les 6 ou 7 mots, prévoyez donc une édition substantielle. Le cantonais n'est viable que sur large-v3 ; choisissez la mauvaise variante et le taux d'erreur quadruple.
Rappelez-vous que tout ceci est une performance plafond sur parole lue. Les enregistrements réels obtiennent de moins bons scores, et les trois variables qui comptent le plus sont la qualité d'enregistrement, le nombre de locuteurs et la force de l'accent. Pour du matériel à plusieurs locuteurs, l'attribution de locuteur est une classe d'erreur distincte qui s'ajoute à la précision sur les mots ; voir ce qu'est la diarisation des locuteurs pour comprendre son fonctionnement.
Si vous voulez le panorama par langue sur une centaine de langues plutôt que nos 12, notre guide de précision par langue compile le tableau FLEURS publié dans l'article Whisper, classé de quasi humain à pratiquement inutilisable. Cette page est une compilation de résultats publiés ; celle-ci est le benchmark que nous avons mené nous-mêmes, et les deux concordent là où elles se recoupent.
Reproduisez-le ou vérifiez notre travail
Tout ce qu'il faut pour vérifier ou étendre ce benchmark est public :
- results.jsonl : les 1 749 résultats par énoncé, avec texte de référence, sortie du modèle et WER/CER par énoncé
- results-summary.csv : le tableau agrégé langue x modèle derrière cet article
- bench.py : le script exact qui a produit les données, avec échantillonnage déterministe (seed 42)
- README du paquet de données : commandes d'installation, versions et licences
Lancez python bench.py --n 50 et, grâce au shuffle seed fixe, vous sélectionnez les mêmes énoncés que nous ; augmentez --n pour agrandir l'échantillon (le test split de FLEURS compte environ 350 à 900 énoncés par langue). Le script diffuse FLEURS depuis Hugging Face, transcrit en local, note avec la normalisation de l'article Whisper et ajoute une ligne JSONL par énoncé, si bien que les exécutions interrompues reprennent proprement.
Attribution : les transcriptions de référence proviennent du jeu FLEURS de Google (Conneau et al., 2022), redistribué sous sa licence CC-BY-4.0. Les poids du modèle Whisper sont d'OpenAI, publiés sous Apache 2.0.
Foire aux questions
Whisper est-il le modèle de transcription open source le plus précis ?
C'est la famille ouverte la plus reproduite et la plus large en langues, ce qui en fait une bonne référence publique. D'autres familles open source existent, dont les lignes MMS et Seamless de Meta et de nombreux réglages fins par langue, mais elles diffèrent en couverture linguistique, licences et conventions d'évaluation, si bien qu'une comparaison équitable entre familles exige son propre test contrôlé. Nous avons choisi Whisper parce que les poids sont figés et publics, les résultats reproductibles, et qu'une seule méthode couvre les 12 langues.
Pourquoi ne pas avoir testé des services commerciaux comme Otter, Rev ou HappyScribe ?
Les conditions d'utilisation commerciales restreignent souvent la publication de résultats de benchmark, les modèles derrière les API sont opaques et changent sans préavis, et un chiffre mesuré aujourd'hui peut être sans valeur le trimestre prochain. Les poids open source sont figés, donc n'importe qui peut relancer notre test exact indéfiniment. Les affirmations de précision des fournisseurs sont sur leurs sites ; notez à quel point ils divulguent rarement le jeu de test et la normalisation.
50 énoncés par langue, est-ce suffisant ?
Suffisant pour les ordres de grandeur et le classement, pas pour des tests de signification fins. C'est exactement ainsi que nous présentons les résultats. Le test split complet de FLEURS compte environ 350 à 900 énoncés par langue, et agrandir l'échantillon est un changement d'un seul paramètre dans le script publié.
Les résultats sur parole lue représentent-ils des enregistrements réels ?
Non. Tout ce que nous avons mesuré ici est une performance plafond : audio propre, un seul locuteur, rythme régulier. Sur des réunions, appels et entretiens réels, attendez-vous à des taux d'erreur nettement plus élevés, les dégâts croissant avec le bruit, la force de l'accent et le chevauchement des locuteurs. Ce qui se transfère de ce benchmark au monde réel, c'est le classement (une langue ou un modèle qui gagne sur parole propre gagne généralement aussi sur parole difficile), pas les pourcentages absolus.
Comment reproduire exactement le test ?
Téléchargez bench.py, installez les dépendances listées dans le README du paquet de données, et lancez python bench.py --n 50. La graine est figée dans le script, l'échantillonnage est déterministe, et les résultats s'ajoutent à un fichier JSONL qui reprend après interruption. Le script utilise MLX (Apple Silicon) ; sur un autre matériel, remplacez l'appel de transcription par openai-whisper ou faster-whisper avec les mêmes réglages.
Ces modèles hallucinent-ils ?
Dans notre échantillon de parole lue, rarement mais de façon catastrophique quand cela arrive : 4 des 1 749 sorties (environ 0,2 %) étaient des boucles de répétition, toutes de turbo ou small en cantonais et hindi, aucune de large-v3. Les audits publiés de parole conversationnelle et hésitante rapportent des taux plus élevés, de l'ordre de 1 % des segments (Koenecke et al., 2024). Attendez-vous à en voir davantage sur de l'audio réel avec de longues pauses, et balayez les sorties à la recherche de tokens répétés.
Quel modèle Vocova utilise-t-il ?
Ce benchmark mesure des modèles open source, pas le pipeline de production de Vocova, et son enseignement est général : que votre langue soit bien prise en charge compte plus que le numéro de version du modèle. Vocova achemine la transcription vers des paliers de modèle à haute précision pour le travail multilingue et y ajoute étiquettes de locuteur, traduction et formats d'export. La preuve la plus directe est un test sur votre propre audio dans votre propre langue.
Sources et lectures complémentaires
- FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech (Conneau et al., 2022), le jeu de données d'où proviennent tous nos échantillons
- google/fleurs sur Hugging Face, distribution du jeu et licence CC-BY-4.0
- Robust Speech Recognition via Large-Scale Weak Supervision (Radford et al., 2022), l'article Whisper dont nous suivons les conventions de normalisation et de CER
- Fiche du modèle openai/whisper-large-v3, documente le token de langue cantonaise ajouté dans large-v3 et la licence de poids Apache 2.0
- Careless Whisper: Speech-to-Text Hallucination Harms (Koenecke et al., 2024), l'audit externe des taux d'hallucination de Whisper auquel nous comparons nos décomptes d'échecs
- mlx-whisper sur PyPI, le moteur d'inférence utilisé pour ce benchmark
- jiwer sur GitHub, la bibliothèque de scoring WER/CER
Envie de voir la transcription multilingue sur votre propre matériel ? Collez un lien audio ou vidéo dans Vocova et comparez la sortie aux attentes de cet article pour votre langue.
