Vocova
가격블로그

제품

  • 가격
  • 블로그
  • 도구

솔루션

  • 팟캐스터를 위한 Vocova
  • 영상 크리에이터용
  • 다국어 인터뷰

회사

  • 소개
  • FAQ
  • 서비스 약관
  • 개인정보 보호정책
  • 문의

전사

  • Chromebook 음성 녹음기
  • 오디오를 텍스트로
  • 비디오를 텍스트로
  • 팟캐스트 전사
  • 인터뷰 전사
  • 강의 전사

회의 녹화

  • Zoom 전사
  • Google Meet 전사

번역

  • 오디오 번역
  • 이중 언어 자막
  • 동영상 번역

공개 콘텐츠

  • 동영상 링크 텍스트 변환
  • YouTube 전사
  • Apple Podcasts 전사
  • Vimeo 전사
  • 비리비리 전사
  • SoundCloud 텍스트 변환
  • Dailymotion 텍스트 변환
  • Reddit 텍스트 변환
  • Facebook 텍스트 변환
  • X (Twitter) 전사
  • Instagram 텍스트 변환
  • TikTok 전사

언어

  • 일본어 전사
  • 스페인어 전사
  • 프랑스어 전사
  • 독일어 전사
  • 포르투갈어 전사
  • 한국어 전사
  • 중국어 전사
  • 아랍어 전사
  • 힌디어 전사
  • 이탈리아어 전사
  • 러시아어 전사
  • 태국어 전사
  • 베트남어 전사
  • 터키어 전사
  • 인도네시아어 전사
  • 네덜란드어 전사
  • 폴란드어 전사
  • 스웨덴어 전사
  • 광둥어 전사
  • 타갈로그어 전사

형식

  • MP4를 텍스트로
  • MP3를 텍스트로
  • WAV를 텍스트로
  • M4A를 텍스트로
  • MOV를 텍스트로
  • 동영상 PDF 변환

자막

  • SRT 생성기
  • VTT 생성기
  • 자막 생성기
  • MP4 SRT 변환

더 많은 도구

  • 오디오 변환기
  • 동영상 변환기
  • 팟캐스트 요약기
  • YouTube 요약기
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
가격블로그

제품

  • 가격
  • 블로그
  • 도구

솔루션

  • 팟캐스터를 위한 Vocova
  • 영상 크리에이터용
  • 다국어 인터뷰

회사

  • 소개
  • FAQ
  • 서비스 약관
  • 개인정보 보호정책
  • 문의

전사

  • Chromebook 음성 녹음기
  • 오디오를 텍스트로
  • 비디오를 텍스트로
  • 팟캐스트 전사
  • 인터뷰 전사
  • 강의 전사

회의 녹화

  • Zoom 전사
  • Google Meet 전사

번역

  • 오디오 번역
  • 이중 언어 자막
  • 동영상 번역

공개 콘텐츠

  • 동영상 링크 텍스트 변환
  • YouTube 전사
  • Apple Podcasts 전사
  • Vimeo 전사
  • 비리비리 전사
  • SoundCloud 텍스트 변환
  • Dailymotion 텍스트 변환
  • Reddit 텍스트 변환
  • Facebook 텍스트 변환
  • X (Twitter) 전사
  • Instagram 텍스트 변환
  • TikTok 전사

언어

  • 일본어 전사
  • 스페인어 전사
  • 프랑스어 전사
  • 독일어 전사
  • 포르투갈어 전사
  • 한국어 전사
  • 중국어 전사
  • 아랍어 전사
  • 힌디어 전사
  • 이탈리아어 전사
  • 러시아어 전사
  • 태국어 전사
  • 베트남어 전사
  • 터키어 전사
  • 인도네시아어 전사
  • 네덜란드어 전사
  • 폴란드어 전사
  • 스웨덴어 전사
  • 광둥어 전사
  • 타갈로그어 전사

형식

  • MP4를 텍스트로
  • MP3를 텍스트로
  • WAV를 텍스트로
  • M4A를 텍스트로
  • MOV를 텍스트로
  • 동영상 PDF 변환

자막

  • SRT 생성기
  • VTT 생성기
  • 자막 생성기
  • MP4 SRT 변환

더 많은 도구

  • 오디오 변환기
  • 동영상 변환기
  • 팟캐스트 요약기
  • YouTube 요약기
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt
Vocova
가격블로그
  1. 블로그
  2. Whisper 정확도 벤치마크 2026: large-v3, turbo, small을 12개 언어로 테스트

Whisper 정확도 벤치마크 2026: large-v3, turbo, small을 12개 언어로 테스트

재현 가능한 Whisper 벤치마크: large-v3, large-v3-turbo, small의 단어 오류율을 FLEURS 테스트 세트의 12개 언어에서 측정했습니다. 1,749건의 전사, 완전한 방법론, 내려받을 수 있는 원시 데이터 포함.

글 Jimmy H·2026년 7월 18일·21분 읽기·
benchmarksaccuracywerwhisperdata

오픈소스 AI 전사가 2026년에 실제로 얼마나 정확한지 측정하기 위해 1,749건의 전사를 실행했습니다. 세 가지 Whisper 모델(large-v3, large-v3-turbo, small)이 공개 데이터셋 FLEURS의 12개 언어 각각에서 50개 발화를 전사했습니다. 핵심은 이렇습니다. large-v3는 고자원 유럽 언어에서 약 3~6퍼센트의 단어 오류율에 도달하며(스페인어 2.9%, 이탈리아어 3.2%, 영어 4.1%), 이는 사람 전사에서 흔히 인용되는 범위에 가깝습니다. 힌디어에서는 15.7%, 이집트 아랍어에서는 14.6%까지 올라갑니다. 한 모델 안에서 최고 언어와 최저 언어의 격차는 5배가 넘어, 모델 버전 간 차이를 훨씬 압도합니다.

평균은 이야기의 절반에 불과하므로, 이 글은 평균이 감추는 것도 보고합니다. 영어와 이탈리아어에서는 60%가 넘는 문장이 단어 하나까지 완벽하게 돌아온 반면, 힌디어와 광둥어는 4%였습니다. 그리고 작은 모델이 어려운 언어에서 실패할 때, 그 실패는 우아하지 않습니다. 원시 출력에서 교과서적인 반복 루프 환각을 정확히 4건 찾았는데, 모두 turbo와 small에서 나왔고 large-v3에서는 하나도 없었습니다.

이 글의 모든 수치는 2026년 7월에 저희가 직접 실행한 테스트에서 나온 것입니다. 고정된 난수 시드, 공개된 스크립트, 내려받을 수 있는 원시 결과를 동반합니다. 전부 재현하거나, 저희 작업을 한 줄씩 확인할 수 있습니다.

무엇을 어떻게 테스트했는가

웹에 있는 전사 정확도 수치는 거의 전부 벤더 페이지나 다른 글에서, 뒷받침하는 테스트 없이 복사된 것입니다. 다음은 저희의 정확한 설정입니다.

항목설정
테스트 세트Google FLEURS test split(공개 학술 데이터셋, 낭독 음성)
표본 추출언어별 셔플된 test split의 앞 50개 발화(shuffle seed 42, 결정적), 언어당 약 9분 분량의 음성
모델Whisper large-v3, large-v3-turbo, small(오픈소스 MLX 변환본)
추론temperature 0, 원본 언어 고정(자동 감지 없음), 이전 텍스트 조건화 없음
정규화Whisper 논문과 동일: 영어는 EnglishTextNormalizer, 그 외는 BasicTextNormalizer(transformers 경유)
지표WER(단어 오류율). 중국어, 일본어, 광둥어는 주 지표를 CER(문자 오류율)로 함
소프트웨어mlx-whisper 0.4.3, jiwer 4.0.0, transformers 5.11.0, datasets 3.6.0
하드웨어Apple M3, MLX 추론, fp16
테스트 일자2026년 7월

12개 언어는 모델에 유리하도록이 아니라 자원 수준과 문자 체계를 아우르도록 골랐습니다. 고자원 유럽 언어 6개, 문자 단위 채점이 필요한 공백 없는 CJK 언어 3개, 여기에 한국어(교착어, 공백 있음), 힌디어(데바나가리), 이집트 아랍어입니다.

원시 파일을 감사하는 분을 위한 표본 추출 세부 사항: FLEURS는 같은 문장을 서로 다른 화자가 녹음한 여러 음성을 포함하고 하나의 문장 id를 공유하는 경우가 많습니다. 저희의 재개 로직은 문장 id로 중복을 제거하므로, 영어 large-v3 셀은 50개가 아니라 49개 발화를 담습니다. 나머지 셀은 모두 50개로, 총 1,749건의 전사입니다.

표 앞에 정직한 두 가지 유의점. 첫째, FLEURS는 낭독 음성입니다. 깨끗한 음성, 일정한 속도, 화자 1명. 실제 회의와 인터뷰는 훨씬 나쁜 점수를 냅니다. 배경 소음, 억양, 화자 겹침이 오류율을 끌어올리기 때문입니다(실무적 완화 방법은 잡음이 많은 음성을 전사하는 방법 참조). 이 수치는 각 언어의 상한이지 약속이 아니라고 여기세요. 둘째, 언어당 50개 발화는 표본이지 전체 세트가 아닙니다. 개별 수치는 몇 퍼센트포인트의 여유를 가지므로, 소수점이 아니라 크기와 순위를 읽으세요.

FLEURS에서 12개 언어에 대한 Whisper large-v3 오류율 막대 차트, 스페인어 2.9%부터 힌디어 15.7%까지

결과: 12개 언어, 3개 모델

수치는 WER %이며 낮을수록 좋습니다. 일본어, 중국어(표준중국어), 광둥어(* 표시)는 이 언어들이 단어를 공백으로 나누지 않으므로 CER %입니다.

언어large-v3large-v3-turbosmall
영어4.1%4.7%6.6%
스페인어2.9%3.3%6.5%
프랑스어5.8%6.7%14.3%
독일어4.6%6.0%12.8%
이탈리아어3.2%3.9%8.2%
포르투갈어6.6%7.2%11.0%
일본어 *6.6%5.8%16.4%
한국어14.9%14.5%21.7%
표준중국어 *6.7%8.0%19.5%
광둥어 *10.5%43.3%미지원
힌디어15.7%22.3%42.4%
아랍어(이집트)14.6%16.1%32.7%

세 가지가 두드러집니다. 언어 간 격차가 모델 간 격차보다 훨씬 큽니다. 같은 large-v3에서 스페인어 2.9% 대 힌디어 15.7%입니다. turbo 모델은 유럽 6개 언어에서는 0.3~1.4포인트만 대가를 치르지만, 힌디어에서는 6.6포인트이고, 광둥어에서는 10.5%에서 43.3% CER로 붕괴합니다. 그리고 small은 고자원 언어 밖에서 파국적으로 저하되어, 힌디어 42.4%와 아랍어 32.7%는 그것을 결과물이 아닌 미리보기 도구로 만듭니다.

「미지원」 셀은 말 그대로입니다. 광둥어 yue 언어 토큰은 large-v3 세대에서 도입되었으므로(공식 모델 카드는 변경 사항으로 「광둥어를 위한 새 언어 토큰」을 나열합니다), 이전 세대의 small 모델은 이 언어를 아예 거부합니다. 저희 실행에서는 미지원 언어 오류가 발생했는데, 이것 자체가 유용한 데이터 포인트입니다. 모델 품질을 비교하기 전에, 애초에 모델이 당신의 언어를 지원하는지 확인하세요.

평균 너머: 대부분의 문장은 완벽하고, 꼬리는 그렇지 않다

평균 오류율은 실제로는 매우 치우친 분포를 평평하게 만듭니다. large-v3의 언어별로, 오류 없이 전사된 발화의 비율, 중앙값, 90번째 백분위수를 보입니다.

언어오류 없는 발화중앙값90번째 백분위수
영어61%0.0%12.5%
스페인어54%0.0%7.7%
프랑스어38%4.3%12.5%
독일어56%0.0%14.3%
이탈리아어62%0.0%10.5%
포르투갈어42%3.7%18.8%
일본어 *36%3.2%15.8%
한국어34%13.7%35.3%
표준중국어 *40%3.0%17.8%
광둥어 *4%9.7%17.6%
힌디어4%14.9%27.5%
아랍어(이집트)28%10.3%37.5%

두 가지 읽기가 중요합니다. 강한 언어에서는 중앙값 발화가 오류 없음입니다. 영어의 4.1% 평균은 거의 전부 소수의 어려운 문장에서 나오며, 그래서 거기서의 전사는 이따금 고칠 흠을 안고도 거의 완벽하게 느껴집니다. 그리고 완벽률 열은 평균이 한데 묶는 언어들을 갈라놓습니다. 광둥어(10.5%)와 아랍어(평균 14.6%)는 실제보다 가까워 보이지만, 완벽하게 돌아온 광둥어 문장은 4%뿐인 반면 아랍어는 28%입니다. 나쁜 부분을 훑어 교정한다면, 꼬리 백분위수가 평균보다 당신의 작업량을 더 잘 예측합니다.

Whisper large-v3가 오류 없이 전사한 문장 비율: 영어와 이탈리아어는 절반 이상, 힌디어와 광둥어는 4%

발견 1: 언어 간 격차가 모델 간 격차를 압도한다

large-v3 안에서 최고 언어(스페인어, 2.9%)와 최저 언어(힌디어, 15.7%)의 폭은 5배가 넘습니다. 영어(4.1%) 대 이집트 아랍어(14.6%)는 4배에 가깝습니다. 반면 하나의 유럽 언어 안에서는 turbo에서 large-v3로 올려도 수치가 약 1포인트만 움직입니다(영어 4.7%→4.1%, 독일어 6.0%→4.6%).

small에서는 이 비대칭이 더욱 날카롭습니다. 영어에서는 large-v3에 겨우 2.5포인트 뒤질 뿐이지만, 프랑스어에서는 5.8%에서 14.3%로, 힌디어에서는 15.7%에서 42.4%로 저하됩니다. 영어에서는 합리적인 절충으로 보이는 같은 체크포인트가 힌디어에서는 쓸 수 없습니다.

실무적 결론은 이렇습니다. 모델이 당신의 언어를 잘 지원하는지가 어떤 버전의 모델을 고르는지보다 훨씬 중요합니다. 스페인어로 작업한다면 현대적인 것이라면 거의 무엇이든 괜찮습니다. 힌디어나 광둥어로 작업한다면, 모델 선택이 전사가 애초에 쓸 만한지를 결정합니다.

발견 2: turbo가 실제로 당신에게 치르게 하는 대가

저희 M3에서 전형적인 처리량은 large-v3가 실시간의 약 3.8배, turbo가 5.2배, small이 14.3배였으며 실행 전반의 평균입니다(개별 실행은 시스템 부하에 따라 달랐고 절대 속도는 하드웨어에 의존합니다. 신호는 비율입니다). 즉 turbo는 large-v3보다 약 1.4배 빠르게 돕니다.

고자원 유럽 6개 언어에서 이 속도는 거의 대가가 없습니다. turbo는 평균적으로 large-v3에 약 0.8포인트 뒤질 뿐이고, 저희 표본에서 일본어와 한국어는 turbo가 large-v3를 근소하게 앞서기까지 했습니다(5.8% 대 6.6% CER, 14.5% 대 14.9% WER). 상용 전사 서비스가 대체로 증류·가속 모델로 옮겨간 이유가 여기 있습니다.

하지만 turbo는 공짜가 아닙니다. 힌디어는 6.6포인트 저하되고(22.3% 대 15.7%), 이집트 아랍어는 1.5포인트, 광둥어는 10.5%에서 43.3% CER로 붕괴하여 쓸 수 없습니다. 정확도를 속도와 맞바꾸는 결정은 전면적으로가 아니라 언어별로 내려야 합니다.

발견 3: 단어 경계가 없는 언어에는 다른 잣대가 필요하다

중국어, 일본어, 광둥어는 단어를 공백으로 나누지 않으므로, 「단어」 오류율은 텍스트를 어떻게 나누느냐에 전적으로 달려 있고, 토크나이저가 다르면 동일한 전사에서도 크게 다른 WER이 나옵니다. Whisper 논문 자체를 포함한 학계 관행은 이 언어들에 문자 오류율(CER)을 쓰는 것이며, 저희가 보고하는 것도 그것입니다.

그렇게 측정하면 일본어(6.6% CER)와 중국어(6.7% CER)는 large-v3에서 강한 유럽 언어들과 같은 품질 대역에 놓입니다. 광둥어는 저희 전체 데이터셋에서 가장 선명한 반례입니다. large-v3에서 10.5% CER, turbo에서 43.3%, small에서는 지원조차 없습니다. 한 언어, 세 모델에서 결과가 쓸 만함부터 불가능까지 걸칩니다.

한국어에는 각주가 필요합니다. 14.9%는 나빠 보이지만, 한국어는 교착어이며 공백 기반 WER을 부풀리는 띄어쓰기 관행을 씁니다. 그래서 문자 단위 정확도는 수치가 시사하는 것보다 낫습니다. 그래도 유럽 언어보다 더 많은 교정이 필요하지만, WER의 순진한 해석이 함의하는 만큼은 아닙니다.

어떤 벤더를 평가하든 새겨둘 교훈은 이렇습니다. 어떤 도구가 「중국어 95% 정확도」를 주장하면서 그것이 WER인지 CER인지, 어떤 음성에서, 어떤 정규화로 측정했는지 말하지 않는다면, 그 수치는 아무런 정보도 담고 있지 않습니다. 지표의 원리는 저희 WER 설명글에서 자세히 다룹니다.

같은 광둥어 문장을 Whisper large-v3는 정확히 전사하지만 large-v3-turbo는 반복 루프에 빠지는 모습

발견 4: 작은 모델은 실패할 때 한꺼번에 실패한다

평균은 오류가 전사 전체에 고르게 뿌려져 있는 듯 보이게 합니다. 원시 출력은 그 반대를 말합니다. 1,749개 가설 전부를 퇴화한 출력(오류율 100% 초과, 또는 참조 길이의 2배가 넘는 출력)에 대해 훑은 결과, 정확히 4건을 찾았습니다. turbo 3건(광둥어 2건, 힌디어 1건)과 small 1건(힌디어)입니다. large-v3는 599개 발화 전부에서 하나도 내지 않았습니다.

네 건 모두 같은 실패 방식, 반복 루프입니다. 최악의 광둥어 사례는 372% CER에 이르렀습니다(삽입은 지표를 100% 너머로 밀 수 있습니다). turbo는 처음 몇 단어를 그럴듯하게 전사한 뒤 하나의 문자에 갇혀 그것을 46번 연속으로 출력했습니다. 힌디어 실패도 형태가 똑같아, 한 단어가 거듭 찍혀 있었습니다. 바로 그 같은 발화에서 large-v3는 6.9% CER의 거의 완벽한 전사를 생성했습니다. 정확한 문자열은 원시 데이터에 있습니다(results.jsonl의 발화 id 1980). 살펴보고 싶다면 확인하세요.

그 광둥어 사례는 조용히 두 번째 실패도 보여줍니다. 루프에 들어가기 전에 turbo는 이미 번체 중국어에서 간체자와 표준중국어 어휘 선택으로 표류한 반면, large-v3는 참조의 문자 체계에 머물렀습니다. 광둥어 화자에게 이것은 오류율만큼 중요합니다. 「전사」가 다른 문어로 미끄러지고 있기 때문입니다.

Whisper 계열 모델의 환각은 저희 표본을 넘어 기록되어 있습니다. Koenecke et al. (2024)는 Whisper 전사를 감사해 약 1%의 세그먼트에, 멈춤과 비유창한 발화 주변에 집중된 형태로 지어낸 내용이 담겼음을 발견했습니다. 낭독 음성인 저희의 비율은 더 낮으며(1,749건 중 4건, 약 0.2%), 이는 맞아떨어집니다. 깨끗하고 연속적인 음성은 모델이 채울 침묵을 덜 줍니다. 둘에서 얻는 실무 규칙은 이렇습니다. 최악의 전사 실패는 고르게 분포한 잡음이 아니라 국소적인 완전한 오염이며, 약한 언어에서 작은 체크포인트에 집중되고, 반복 토큰을 재빨리 훑으면 대부분을 잡아냅니다.

저희 large-v3 수치는 공개된 large-v2 표와 어떻게 비교되는가

저희 언어별 정확도 가이드는 Whisper 논문이 공개한 large-v2 FLEURS 결과를 정리합니다. 겹치는 언어에 대해 그것을 저희의 2026년 7월 large-v3 측정과 나란히 둡니다(논문 수치는 전체 test split, 저희는 50개 발화 표본이므로 소수점이 아니라 방향을 읽으세요).

언어논문 large-v2저희 large-v3방향
스페인어3.0%2.9%유지, 이미 강함
영어4.2%4.1%유지, 이미 강함
이탈리아어4.0%3.2%다소 개선
독일어4.5%4.6%유지
프랑스어8.3%5.8%개선
일본어(CER)5.3%6.6%오차 범위 내 유지
한국어14.3%14.9%오차 범위 내 유지
표준중국어(CER)14.7%6.7%절반으로
아랍어16.0%14.6%다소 개선
힌디어21.5%15.7%뚜렷하게 개선

이 패턴은 추가 학습 데이터가 어디로 갔는지와 일치합니다. 이미 자기 하한 근처에 있던 언어는 제자리에 머물렀고, 큰 개선은 표준중국어(절반으로), 힌디어, 프랑스어에 떨어졌습니다. 광둥어는 large-v2 표에 아예 등장하지 않는데, 이것이 같은 이야기의 가장 노골적인 형태입니다. 모델 세대 사이에서 어떤 언어에게 가장 중요한 변화는 더 낮은 오류율이 아니라 존재 그 자체입니다.

이 수치가 당신의 작업에 의미하는 것

오류율을 체감으로 옮기면, 5%는 20단어마다 오류 하나로 빠른 교정으로 충분합니다. 15%는 7단어마다 하나로, 편집이 실제 시간을 잡아먹기 시작합니다. 30%를 넘으면 문단 전체를 다시 들어야 하고, 전사는 잘해야 초안입니다.

  • 고자원 유럽 언어(영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어): large-v3는 깨끗한 음성에서 37퍼센트에 자리하며, 「초안을 믿고 나서 훑어보는」 영역에 확실히 들어갑니다. turbo는 1.5포인트 미만의 대가로 일상 작업에 충분합니다. small은 프랑스어와 독일어에서 1314퍼센트까지 저하됩니다. 납품하는 것에는 쓰지 마세요.
  • 일본어, 표준중국어, 한국어: large-v3에서 6~7퍼센트 CER의 일본어와 중국어는, 수치를 문자 단위로 읽는 한 초안으로 신뢰할 수 있습니다. 한국어의 WER은 오류를 과장하지만, 유럽 그룹보다 더 많은 교정을 예상하세요.
  • 광둥어, 힌디어, 아랍어: 주의 구역입니다. 힌디어와 이집트 아랍어는 large-v3에서도 1516퍼센트, 67단어마다 오류 하나이므로 실질적인 편집을 잡아두세요. 광둥어는 large-v3에서만 실용적이며, 잘못된 변형을 고르면 오류율이 네 배가 됩니다.

이 모든 것이 낭독 음성에서의 상한 성능임을 기억하세요. 실제 녹음은 더 나쁜 점수를 내며, 가장 중요한 세 변수는 녹음 품질, 화자 수, 억양 강도입니다. 다화자 자료에서 화자 귀속은 단어 정확도에 더해지는 별개의 오류 부류입니다. 작동 방식은 화자 분할이란을 참조하세요.

저희 12개가 아니라 약 100개 언어의 언어별 그림을 원한다면, 저희 언어별 정확도 가이드가 Whisper 논문의 공개 FLEURS 표를 거의 사람 수준부터 사실상 쓸 수 없음까지 단계별로 정리합니다. 그 페이지는 공개된 결과의 집약이고, 이 페이지는 저희가 직접 실행한 벤치마크이며, 둘은 겹치는 부분에서 일치합니다.

재현하거나 저희 작업을 확인하세요

이 벤치마크를 검증하거나 확장하는 데 필요한 모든 것이 공개되어 있습니다.

  • results.jsonl: 1,749건 전부의 발화 단위 결과. 참조 텍스트, 모델 출력, 발화별 WER/CER 포함
  • results-summary.csv: 이 글의 뒤에 있는 언어 x 모델 집계표
  • bench.py: 데이터를 생성한 정확한 스크립트. 결정적 표본 추출(seed 42)
  • 데이터 패키지 README: 설치 명령, 버전, 라이선스

python bench.py --n 50을 실행하면 고정된 shuffle seed 덕분에 저희와 같은 발화가 선택됩니다. --n을 늘리면 표본을 키울 수 있습니다(FLEURS test split은 언어당 약 350~900개 발화). 스크립트는 Hugging Face에서 FLEURS를 스트리밍하고, 로컬에서 전사하고, Whisper 논문의 정규화로 채점하고, 발화마다 JSONL 한 줄을 덧붙이므로 중단된 실행이 깔끔하게 재개됩니다.

출처: 참조 전사는 Google의 FLEURS 데이터셋(Conneau et al., 2022)에서 오며 CC-BY-4.0 라이선스로 재배포합니다. Whisper 모델 가중치는 OpenAI의 것으로 Apache 2.0으로 공개되었습니다.

자주 묻는 질문

Whisper가 가장 정확한 오픈소스 전사 모델인가요?

가장 많이 재현되고 언어 폭이 넓은 오픈 계열이라, 좋은 공개 기준선이 됩니다. Meta의 MMS 및 Seamless 계열과 여러 언어별 미세조정을 포함해 다른 오픈소스 계열도 있지만, 언어 커버리지, 라이선스, 평가 관행이 서로 달라, 계열 간 공정한 비교에는 자체적인 통제된 테스트가 필요합니다. 저희가 Whisper를 고른 것은 가중치가 고정되어 공개되어 있고, 결과가 재현 가능하며, 하나의 방법으로 12개 언어 전부를 다룰 수 있기 때문입니다.

왜 Otter, Rev, HappyScribe 같은 상용 서비스를 테스트하지 않았나요?

상용 이용약관은 벤치마크 결과 공개를 제한하는 경우가 많고, API 뒤의 모델은 불투명하며 예고 없이 바뀌고, 오늘 측정한 수치가 다음 분기에는 무의미할 수 있습니다. 오픈소스 가중치는 동결되어 있어 누구나 저희의 정확한 테스트를 무기한 재실행할 수 있습니다. 벤더의 정확도 주장은 각사 사이트에 있지만, 테스트 세트와 정규화를 얼마나 드물게 공개하는지 눈여겨보세요.

언어당 50개 발화면 충분한가요?

크기와 순위에는 충분하지만, 정밀한 유의성 검정에는 충분하지 않습니다. 저희는 정확히 그렇게 결과를 제시합니다. FLEURS 전체 test split은 언어당 약 350~900개 발화이며, 표본을 키우는 것은 공개 스크립트의 매개변수 하나를 바꾸는 일입니다.

낭독 음성 결과가 실제 녹음을 대표하나요?

아니요. 여기서 측정한 모든 것은 상한 성능입니다. 깨끗하고, 화자 1명, 일정한 속도의 음성입니다. 실제 회의, 통화, 인터뷰에서는 소음, 억양 강도, 화자 겹침이 커질수록 손상이 커지며, 뚜렷하게 높은 오류율을 예상하세요. 이 벤치마크에서 현실 세계로 옮겨지는 것은 순위(깨끗한 음성에서 이기는 언어나 모델은 대개 어수선한 음성에서도 이깁니다)이지 절대 퍼센트가 아닙니다.

테스트를 정확히 어떻게 재현하나요?

bench.py를 내려받고, 데이터 패키지 README에 나열된 의존성을 설치한 뒤 python bench.py --n 50을 실행하세요. 시드는 스크립트에 고정되어 있고, 표본 추출은 결정적이며, 결과는 중단 후 재개되는 JSONL 파일에 덧붙습니다. 스크립트는 MLX(Apple Silicon)를 씁니다. 다른 하드웨어에서는 전사 호출을 같은 설정의 openai-whisper 또는 faster-whisper로 바꾸세요.

이 모델들은 환각을 일으키나요?

저희 낭독 음성 표본에서는 드물지만 일어날 때는 파국적입니다. 1,749개 출력 중 4개(약 0.2%)가 반복 루프였고, 모두 turbo 또는 small의 광둥어와 힌디어였으며 large-v3에서는 없었습니다. 대화체와 비유창한 발화에 대한 공개 감사는 더 높은 비율, 세그먼트의 약 1%를 보고합니다(Koenecke et al., 2024). 긴 멈춤이 있는 실제 음성에서는 이것이 더 나타날 것으로 보고, 출력에서 반복 토큰을 훑으세요.

Vocova는 어떤 모델을 쓰나요?

이 벤치마크는 오픈소스 모델을 측정하는 것이지 Vocova의 프로덕션 파이프라인이 아니며, 그것이 던지는 요점은 일반적입니다. 당신의 언어가 잘 지원되는지가 모델 버전 번호보다 중요합니다. Vocova는 다국어 작업을 위해 전사를 고정확도 모델 계층으로 라우팅하고 그 위에 화자 레이블, 번역, 내보내기 형식을 더합니다. 가장 직접적인 증거는 당신 자신의 언어로 된 당신 자신의 음성으로 한 테스트 실행입니다.

출처 및 더 읽을거리

  • FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech(Conneau et al., 2022), 저희 표본 전부의 출처가 되는 데이터셋
  • Hugging Face의 google/fleurs, 데이터셋 배포 및 CC-BY-4.0 라이선스
  • Robust Speech Recognition via Large-Scale Weak Supervision(Radford et al., 2022), 저희가 정규화와 CER 관행을 따르는 Whisper 논문
  • openai/whisper-large-v3 모델 카드, large-v3에 추가된 광둥어 언어 토큰과 Apache 2.0 가중치 라이선스를 기록
  • Careless Whisper: Speech-to-Text Hallucination Harms(Koenecke et al., 2024), 저희 실패 건수를 비교하는 대상인 Whisper 환각률의 외부 감사
  • PyPI의 mlx-whisper, 이 벤치마크에 쓴 추론 런타임
  • GitHub의 jiwer, WER/CER 채점 라이브러리

당신 자신의 자료로 다국어 전사를 보고 싶나요? 오디오나 비디오 링크를 Vocova에 붙여넣고, 출력을 이 글이 당신의 언어에 대해 제시하는 기대치와 견주어 보세요.

작성자 소개

J

Jimmy H

프로덕트 & 마케팅, Vocova

Jimmy는 AI 전사·자막 도구 Vocova의 프로덕트 매니저이자 마케팅 리드입니다. 음성 인식 정확도, 다국어 전사, 그리고 제품이 지원하는 자막 및 회의 메모 워크플로를 직접 다루며, AI 전사를 제대로 활용하는 방법에 관한 Vocova 가이드를 작성합니다.

LinkedIn 프로필 보기

관련 글

자세히 보기
2026년 4월 16일·18분

언어별 AI 전사 정확도는 얼마나 될까? 언어별 WER 벤치마크 (2026)

자세히 보기
2026년 2월 10일·16분

단어 오류율(WER)이란? 전사 정확도를 측정하는 지표

자세히 보기
2026년 2월 16일·24분

소음이 있는 오디오를 전사하고 배경 소음 오류를 줄이는 방법 (2026)

제품

  • 가격
  • 블로그
  • 도구

솔루션

  • 팟캐스터를 위한 Vocova
  • 영상 크리에이터용
  • 다국어 인터뷰

회사

  • 소개
  • FAQ
  • 서비스 약관
  • 개인정보 보호정책
  • 문의

전사

  • Chromebook 음성 녹음기
  • 오디오를 텍스트로
  • 비디오를 텍스트로
  • 팟캐스트 전사
  • 인터뷰 전사
  • 강의 전사

회의 녹화

  • Zoom 전사
  • Google Meet 전사

번역

  • 오디오 번역
  • 이중 언어 자막
  • 동영상 번역

공개 콘텐츠

  • 동영상 링크 텍스트 변환
  • YouTube 전사
  • Apple Podcasts 전사
  • Vimeo 전사
  • 비리비리 전사
  • SoundCloud 텍스트 변환
  • Dailymotion 텍스트 변환
  • Reddit 텍스트 변환
  • Facebook 텍스트 변환
  • X (Twitter) 전사
  • Instagram 텍스트 변환
  • TikTok 전사

언어

  • 일본어 전사
  • 스페인어 전사
  • 프랑스어 전사
  • 독일어 전사
  • 포르투갈어 전사
  • 한국어 전사
  • 중국어 전사
  • 아랍어 전사
  • 힌디어 전사
  • 이탈리아어 전사
  • 러시아어 전사
  • 태국어 전사
  • 베트남어 전사
  • 터키어 전사
  • 인도네시아어 전사
  • 네덜란드어 전사
  • 폴란드어 전사
  • 스웨덴어 전사
  • 광둥어 전사
  • 타갈로그어 전사

형식

  • MP4를 텍스트로
  • MP3를 텍스트로
  • WAV를 텍스트로
  • M4A를 텍스트로
  • MOV를 텍스트로
  • 동영상 PDF 변환

자막

  • SRT 생성기
  • VTT 생성기
  • 자막 생성기
  • MP4 SRT 변환

더 많은 도구

  • 오디오 변환기
  • 동영상 변환기
  • 팟캐스트 요약기
  • YouTube 요약기
Vocova

© 2026 NOWGIC LTD. All rights reserved.

Featured on Product Hunt