단어 오류율(WER)이란? 음성 AI의 받아쓰기 정확도를 재는 방법
TL;DR
단어 오류율(Word Error Rate, WER)은 음성 인식 결과를 사람이 만든 정답 전사와 비교해, 대체·삽입·삭제된 단어 수를 정답 단어 수로 나눈 오류 지표입니다. 값이 낮을수록 받아쓰기가 정확하며 0이면 두 문장이 일치합니다. 다만 전사 정규화 방식, 언어, 소음, 고유명사와 사용 환경이 다르면 WER 숫자만 단순 비교해서는 안 됩니다.
핵심 3줄 요약
- 핵심 1
WER은 음성 AI가 틀린 단어의 비율을 봅니다. 대체, 삽입, 삭제 오류를 모두 더해 사람이 작성한 정답 전사의 단어 수로 나눕니다. - 핵심 2
낮을수록 좋지만 하나의 보편적인 합격선은 없습니다. 같은 오디오, 같은 정답 전사, 같은 정규화 규칙으로 비교해야 숫자의 의미가 생깁니다. - 핵심 3
WER만으로 실제 사용 품질을 모두 판단할 수는 없습니다. 사람 이름·제품명 같은 핵심어, 문장 부호, 화자 구분, 처리 속도와 사람 검토 비용도 함께 봐야 합니다.
이 글에서 다룰 내용
- 단어 오류율의 한 문장 정의
- 회의 녹취로 이해하는 쉬운 계산 예시
- 대체, 삽입, 삭제 오류가 뜻하는 것
- CER, 정확도, 문장 오류율, 음성 인식과의 차이
- 회의록·자막·상담 기록에서 WER을 쓰는 방법
- 숫자를 비교할 때 놓치기 쉬운 정규화와 데이터 조건
- 자주 묻는 질문과 공식 출처
단어 오류율을 한 문장으로 정의하면 무엇인가요?
단어 오류율은 음성 인식 시스템이 만든 전사문을 사람이 작성한 정답 전사와 비교해, 대체·삽입·삭제 오류의 합을 정답 단어 수로 나눈 값입니다.
Google Cloud는 WER을 음성 인식 정확도를 비교하는 업계 표준 방법으로 설명하고, 값이 낮을수록 시스템이 더 정확하다고 안내합니다. NIST의 OpenASR 평가 계획도 사람의 정답 전사와 시스템 출력을 비교해 삭제, 삽입, 대체 오류를 합산하는 공식을 사용합니다.
계산식은 다음과 같습니다.
WER = (대체 오류 수 + 삽입 오류 수 + 삭제 오류 수) / 정답 전사의 전체 단어 수
WER을 백분율로 표시하려면 계산한 값에 100을 곱합니다. 결과가 0이면 단어 단위로 정답과 완전히 일치합니다. 오류가 많을수록 값이 커지며 삽입 오류가 매우 많으면 100%를 넘을 수도 있습니다.
한 줄 정리: WER은 음성 AI가 정답 문장의 단어를 얼마나 바꾸고, 더하고, 빠뜨렸는지를 한 숫자로 보여 줍니다.
쉬운 예시로 계산해 볼까요?
감자나라ai님이 회의 녹음 파일을 음성 인식 도구로 받아썼다고 가정해 보겠습니다.
사람이 확인한 정답 전사는 “오늘 오후 세 시에 고객 상담 회의를 시작합니다”입니다. 전체 8단어입니다.
음성 AI는 “오늘 오후 네 시에 고객 회의를 시작합니다”라고 적었습니다. ‘세’를 ‘네’로 바꾼 대체 오류가 1개이고, ‘상담’을 빠뜨린 삭제 오류가 1개입니다. 새로 끼워 넣은 단어는 없으므로 삽입 오류는 0개입니다.
WER = (대체 1 + 삽입 0 + 삭제 1) / 정답 8 = 0.25
백분율로는 25%입니다. 단어 두 개가 틀렸다는 사실뿐 아니라 어떤 종류의 오류였는지도 남겨야 원인을 찾기 쉽습니다. 시간 표현을 자주 바꾸면 숫자·시간 인식 설정을, 특정 업무 용어를 계속 빠뜨리면 도메인 어휘와 음질을 우선 점검할 수 있습니다.
쉬운 예시: WER 25%는 이 예시의 정답 8단어를 기준으로 대체·삽입·삭제 오류가 합계 2개였다는 뜻입니다.
세 가지 오류는 어떻게 구분하나요?
대체 오류(Substitution)
정답의 한 단어를 다른 단어로 적은 경우입니다. ‘세 시’를 ‘네 시’로 받아쓰거나 사람 이름을 비슷한 일반 단어로 바꾼 사례가 여기에 해당합니다.
삽입 오류(Insertion)
정답 전사에는 없는 단어를 음성 AI가 추가한 경우입니다. 배경 소음이나 겹치는 말소리를 실제 발화로 잘못 해석하면 생길 수 있습니다.
삭제 오류(Deletion)
정답 전사에 있는 단어를 결과에서 빠뜨린 경우입니다. 목소리가 작거나 발음이 겹치고 음질이 나쁠 때 중요한 말이 사라질 수 있습니다.
Microsoft Speech 문서도 WER을 이 세 오류의 합으로 계산하며, 파일별 결과에서 오류 유형을 나눠 들어 보고 개선 지점을 찾도록 안내합니다.
핵심 인사이트: 같은 WER이라도 오류 구성이 다르면 대응도 달라집니다. 전체 점수와 함께 대체·삽입·삭제 건수를 따로 기록하세요.
음성 AI를 사용할 때 왜 중요한가요?
첫째, 여러 음성 인식 모델이나 설정을 같은 기준으로 비교할 수 있습니다. 동일한 녹음과 정답 전사를 사용하면 어떤 모델이 실제 업무 음성을 더 정확히 받아쓰는지 확인하기 쉽습니다.
둘째, 개선 전후를 숫자로 남길 수 있습니다. 마이크 위치, 소음 제거, 언어 설정, 도메인 용어 목록이나 모델을 바꾼 뒤 WER이 어떻게 달라졌는지 비교합니다.
셋째, 사람 검토 범위를 정하는 데 도움이 됩니다. 회의록 초안처럼 참고용인 작업과 법률·의료·계약 기록처럼 한 단어의 오류도 큰 영향을 주는 작업은 허용 기준이 다릅니다.
넷째, 오류 유형을 운영 문제와 연결할 수 있습니다. 삭제가 많으면 음량과 겹침 발화를, 삽입이 많으면 소음과 다른 사람의 말소리를, 대체가 많으면 고유명사와 전문 용어를 먼저 살펴볼 단서가 됩니다.
다섯째, 음성 AI가 좋아졌다는 홍보 문구를 실제 데이터로 확인할 수 있습니다. 공개 벤치마크의 WER보다 감자나라ai님의 회의실, 고객 통화, 인터뷰와 영상 음성으로 만든 테스트 세트가 실무 판단에는 더 직접적입니다.
헷갈리는 용어와 무엇이 다른가요?
WER과 음성 인식(STT·ASR)
음성 인식은 말소리를 텍스트로 바꾸는 기술이나 작업입니다. WER은 그 결과가 정답 전사와 얼마나 다른지 재는 평가 지표입니다. 기술과 측정값을 같은 말로 보면 안 됩니다.
WER과 문자 오류율(CER)
WER은 단어 단위로 오류를 셉니다. 문자 오류율(Character Error Rate, CER)은 글자 단위로 대체·삽입·삭제를 계산합니다. Hugging Face는 단어 경계가 명확하지 않은 언어에서는 CER이 더 적합할 수 있다고 설명합니다. 한국어도 평가 목적에 따라 띄어쓰기와 분절 규칙을 먼저 정하고 WER과 CER을 함께 볼 수 있습니다.
WER과 정확도(Accuracy)
일반적인 분류 정확도는 전체 사례 가운데 맞힌 사례의 비율입니다. WER은 문장 안에서 틀린 단어 편집 횟수를 정답 단어 수로 나눕니다. WER을 100%에서 빼 단어 정확도처럼 표현할 수는 있지만, 분류 모델의 정확도와 같은 평가 구조는 아닙니다.
WER과 문장 오류율(Sentence Error Rate)
문장 오류율은 문장 하나에 단어 오류가 하나라도 있으면 그 문장을 오류로 셉니다. WER은 문장 안에서 실제로 몇 단어가 바뀌고 더해지고 빠졌는지 봅니다. 문장 오류율은 완전 일치 여부에 더 엄격합니다.
WER과 화자 분리(Speaker Diarization)
화자 분리는 누가 언제 말했는지 구간과 화자를 나누는 작업입니다. WER이 낮아도 발화자를 잘못 붙일 수 있고, 화자 구분이 맞아도 받아쓴 단어는 틀릴 수 있습니다. 회의록과 상담 기록에서는 두 품질을 따로 평가해야 합니다.
비교 정리: 음성 인식은 변환 작업, WER은 단어 오류 지표, CER은 문자 오류 지표, 문장 오류율은 문장 완전 일치 지표, 화자 분리는 발화자 구분 작업입니다.
실전에서는 어떻게 사용하나요?
회의록 자동화에서
실제 회의실 환경의 녹음과 사람이 검수한 정답 전사를 준비합니다. 참석자 이름, 제품명, 날짜, 금액과 결정 사항처럼 중요한 단어는 WER과 별도로 핵심어 정확도를 확인합니다.
영상 자막을 만들 때
인터뷰, 강의, 야외 촬영처럼 소음과 발화 방식이 다른 파일을 나눠 평가합니다. 전체 WER만 평균내면 특정 촬영 환경에서 생기는 문제를 놓칠 수 있습니다.
고객 상담 통화를 분석할 때
전화 음질, 억양, 겹침 발화와 업무 용어가 실제 분포를 반영하도록 테스트 세트를 구성합니다. 상담원과 고객의 화자 구분, 개인정보 가림과 요약 정확도는 별도 항목으로 둡니다.
모델이나 설정을 비교할 때
같은 오디오, 같은 정답 전사, 같은 언어와 같은 정규화 규칙을 사용합니다. 한쪽만 문장 부호를 지우거나 숫자를 단어로 바꾸면 WER 차이가 모델 성능보다 전처리 차이를 반영할 수 있습니다.
운영 품질을 모니터링할 때
전체 WER과 함께 파일별 분포, 언어·채널·소음 수준별 WER, 대체·삽입·삭제 건수, 처리 시간과 사람 수정 시간을 기록합니다. 평균이 같아도 일부 파일에서 오류가 몰리는지 확인해야 합니다.
실전 팁: 대표 업무 음성으로 고정 테스트 세트를 만들고, 모델이나 설정을 바꿀 때마다 같은 전사 규칙으로 다시 계산하세요.
사용할 때 무엇을 주의해야 하나요?
첫째, 서로 다른 테스트 세트의 WER을 곧바로 비교하지 않습니다. 언어, 화자, 음질, 소음, 발화 길이와 전문 용어가 다르면 같은 모델도 결과가 달라집니다.
둘째, 정답 전사의 품질을 먼저 확인합니다. 사람이 만든 전사에 오탈자나 빠진 발화가 있으면 음성 AI가 맞게 받아써도 오류로 계산될 수 있습니다.
셋째, 정규화 규칙을 고정합니다. 대소문자, 문장 부호, 띄어쓰기, 숫자 표기와 축약어를 어떻게 처리할지 문서화해야 재현 가능한 비교가 됩니다. Hugging Face 자료도 정규화 여부가 WER을 크게 바꿀 수 있다고 설명합니다.
넷째, 전체 숫자만 보지 않습니다. 사람 이름을 다른 이름으로 바꾼 오류와 조사 하나를 틀린 오류가 WER에서는 각각 한 단어 오류로 잡힐 수 있지만 실제 피해는 다릅니다.
다섯째, 100%를 상한으로 단정하지 않습니다. 삽입 오류가 많으면 오류 수가 정답 단어 수보다 커져 WER이 100%를 넘을 수 있습니다.
여섯째, 처리 속도와 사용성을 따로 봅니다. WER이 낮아도 실시간 자막이 너무 늦거나 문장 부호와 화자 라벨이 엉키면 제품 품질은 좋지 않을 수 있습니다.
주의: WER은 음성 AI 비교의 출발점이지 모든 사용 환경에 통하는 합격증이 아닙니다. 데이터 조건과 업무상 중요한 오류를 함께 기록해야 합니다.
자주 묻는 질문
Q1. WER은 낮을수록 좋은가요?
네. 같은 평가 조건에서는 낮을수록 정답 전사와 다른 단어가 적습니다. 0은 단어 단위로 완전히 일치한다는 뜻입니다.
Q2. WER 10%면 음성 인식 정확도가 90%인가요?
WER을 100%에서 뺀 값을 단어 정확도처럼 표현할 수는 있지만 일반적인 분류 정확도와는 계산 구조가 다릅니다. 어떤 오류가 났는지, 정규화 규칙과 테스트 데이터가 무엇인지 함께 봐야 합니다.
Q3. WER이 100%를 넘을 수도 있나요?
그럴 수 있습니다. 시스템이 정답보다 많은 단어를 잘못 삽입하면 대체·삽입·삭제 오류의 합이 정답 단어 수보다 커질 수 있습니다.
Q4. 한국어 음성 인식도 WER로 평가할 수 있나요?
평가할 수 있습니다. 다만 띄어쓰기와 단어 분절, 숫자·영문 표기 같은 정규화 규칙을 정답과 예측에 똑같이 적용해야 합니다. 목적에 따라 문자 오류율도 함께 확인합니다.
Q5. WER 하나만으로 가장 좋은 음성 AI를 고를 수 있나요?
아닙니다. 실제 업무와 같은 데이터의 WER을 기본으로 보고, 핵심어 오류, 화자 구분, 문장 부호, 처리 속도, 비용과 사람 수정 시간을 함께 비교해야 합니다.
출처
마무리
단어 오류율은 음성 AI가 만든 전사와 사람이 확인한 정답을 비교해 대체·삽입·삭제된 단어의 비율을 계산하는 지표입니다. 낮을수록 좋지만 같은 데이터와 같은 정규화 규칙으로 계산했을 때만 공정한 비교가 됩니다.
감자나라ai님이 회의록, 자막이나 상담 녹취 자동화를 검토한다면 세 가지부터 정해 보세요. 실제 업무를 닮은 테스트 음성, 사람이 검수한 정답 전사, 띄어쓰기·숫자·문장 부호를 다루는 정규화 규칙입니다. 여기에 핵심어와 사람 수정 시간까지 기록하면 WER이 실무 의사결정에 쓸 수 있는 지표가 됩니다.
