AI 뉴스 · 음성 전사와 콘텐츠 제작
Grok Voice Transcribe 2.0, 배치 전사 시간당 0.10달러
SpaceXAI가 2026년 9월 18일 음성 전사 모델 2.0을 공개했습니다. 기존 가격을 유지하면서 정확도 개선을 내세웠으며 화자·시간 정보와 Loom 도입 사례를 소개했습니다.
이 글에서 다룰 내용
공개 내용과 전사 모델의 역할, 오류율 해석, 화자·채널·용어 기능, 오디오 시간당 요금, Loom 사례와 검수
녹음을 글로 옮기는 그록 음성 전사, 무엇이 바뀌었나
SpaceXAI(스페이스XAI)가 2026년 9월 18일 Grok Voice Transcribe 2.0을 공개했습니다. 그록 음성 전사는 녹음이나 실시간 음성을 텍스트로 변환하는 speech-to-text 모델입니다. 음성으로 답하는 대화 모델이나 회의 내용을 요약하는 모델 자체는 아닙니다.
이번 업데이트는 기존 가격을 유지하면서 인식 정확도를 개선했다는 점이 핵심입니다. 녹음 파일이나 URL을 전달하는 배치 방식과 실시간 스트리밍을 모두 제공해 녹음 후 처리와 대화 중 처리를 나눠 선택할 수 있습니다.
AI 콘텐츠 제작 관점에서는 녹음 자료를 자막이나 문서 초안으로 옮기는 단계에 활용할 수 있습니다. 인터뷰를 글의 재료로 바꾸거나 영상의 발언을 텍스트로 정리하는 용도입니다. 다만 전사 이후의 요약·편집·게시는 별도 작업입니다.
오류율 20.6%에서 6.8%로, 평가 범위가 중요합니다
SpaceXAI는 자사 실환경 평가에서 1.0보다 정확도가 2배라고 소개합니다. 구체적으로 공개한 수치는 19개 언어의 짧은 음성 명령을 대상으로 한 내부 평가입니다. 이 평가에서 단어 오류율(WER)이 20.6%에서 6.8%로 낮아졌다고 발표했습니다.
20.6%와 6.8%는 정확도가 아니라 오류율입니다. 낮을수록 오류가 적다는 뜻이며 이를 모든 녹음에서 동일한 개선이 보장된다는 의미로 읽어서는 안 됩니다. 짧은 음성 명령의 결과를 긴 회의나 인터뷰 전체의 성능으로 그대로 확장하기도 어렵습니다.
여러 언어를 자동 감지하고 녹음 중 언어가 바뀌는 상황을 처리하는 다국어 전사도 SpaceXAI가 소개한 기능입니다. 다만 이번 원문만으로는 지원 언어 목록의 한국어 포함 여부와 한국어 단독 정확도를 확정할 수 없습니다. 한국어 작업에 도입하려면 지원 여부를 확인하고 실제 사용할 녹음으로 품질을 점검하는 편이 좋습니다.
화자·시간·채널·용어를 따로 다룹니다
전사문을 활용하려면 무엇을 말했는지뿐 아니라 누가 언제 말했는지도 중요합니다. Grok Voice Transcribe 2.0은 화자 구분과 함께 단어별 시작·종료 시각, 신뢰도 점수를 제공합니다. 일반적인 검수 과정에서는 시간 정보를 따라 원음을 다시 듣고 화자 표기가 맞는지 확인하는 데 활용할 수 있습니다.
최대 8개 오디오 채널을 독립적으로 전사하는 기능도 있습니다. 화자 구분과 채널 분리는 서로 다른 기능입니다. 화자 구분은 발언자를 나누는 기능이고, 채널별 전사는 오디오에 분리되어 들어온 각 채널을 따로 처리하는 기능입니다.
요청당 최대 100개의 도메인 용어를 지정하는 key term biasing도 지원합니다. 전문용어나 제품명을 인식할 때 참고하도록 지정하는 방식이지, 사용자 전용 모델을 학습시키는 기능은 아닙니다. 고유명사를 언제나 정확하게 알아듣는다는 보장도 아닙니다.
숫자·날짜·금액·전화번호·이메일을 문자 형식으로 정리하고 ‘um’, ‘uh’ 같은 군더더기 단어를 제거하는 기능도 포함합니다. 음성 에이전트에서 발화가 끝났는지 감지하는 smart turn detection도 제공합니다. 이는 대화 흐름을 다루는 기능이며 모델 자체가 답변을 생성한다는 뜻은 아닙니다.
시간당 0.10달러의 기준과 API 전환 일정
가격은 기존 1.0과 같습니다. 녹음 파일을 처리하는 배치 전사는 오디오 1시간당 0.10달러, 실시간 스트리밍은 오디오 1시간당 0.20달러입니다. 여기서 과금 기준은 처리에 걸린 시간이 아니라 입력한 오디오의 길이입니다.
화자 구분, 타임스탬프, 핵심 용어 지정은 해당 가격에 포함됩니다. 음성 인식 API 비용을 검토할 때는 녹음 후 한꺼번에 처리할지, 실시간으로 텍스트를 받아야 할지를 먼저 구분하면 됩니다. 배치와 스트리밍의 오디오 시간당 요금은 다릅니다.
9월 18일 발표에 따르면 기존 API의 기본 모델은 ‘곧’ 2.0으로 전환될 예정이며 1.0은 ‘향후 몇 주 내’ 지원 종료가 예고됐습니다. 기본 전환이나 지원 종료가 이미 완료된 것은 아닙니다. 전환 기간에 1.0 유지가 필요하다면 공식 안내의 모델 식별자
grok-voice-transcribe-1.0
고정 방법을 확인할 수 있습니다.
Loom 도입 사례와 검수 중심의 활용법
SpaceXAI 공식 발표에 따르면 Atlassian Loom은 기존 솔루션보다 정확하다고 평가해 모든 영상의 전사에 Grok Voice Transcribe 2.0을 사용합니다. 이는 공식 발표에 소개된 도입 사례이며 모든 사용 환경에서 같은 결과가 나온다는 근거는 아닙니다.
녹화한 실행 계획을 전사해 Cursor에 전달하는 개발 흐름도 예시로 소개됐습니다. 말로 설명한 계획을 텍스트로 바꿔 다음 도구에 전달하는 방식입니다. Loom에 자동 코드 수정 기능이 내장됐다거나 두 서비스가 무조건 자동 연동된다는 의미는 아닙니다.
일반적인 콘텐츠 작업에서는 인터뷰 전사문을 기사 초안의 재료로 쓰거나, 영상 녹음을 자막 초안으로 옮길 수 있습니다. 회의록 자동화 역시 전사문을 출발점으로 삼는 방식이 적절합니다. 전사 결과가 곧 사실 확인된 회의록이나 요약은 아닙니다.
검수할 때는 화자 표기와 타임스탬프를 따라 원음을 확인하고 이름·숫자·결정사항을 우선 점검하는 것을 권합니다. 고객 녹음이나 회의 데이터를 업로드하기 전에는 동의 여부와 서비스의 보관 정책도 확인해야 합니다. 전사 비용뿐 아니라 검수에 드는 시간까지 살펴야 실제 제작에 도움이 되는지 판단할 수 있습니다.
한 줄 요약: Grok Voice Transcribe 2.0은 기존 가격으로 전사 정확도 개선을 내세웠으며 한국어 성능 확인과 원음 검수를 전제로 콘텐츠 제작에 활용할 수 있습니다.
참고 출처
2026년 9월 18일 SpaceXAI 공식 발표 기준입니다. 가격·기능·Loom 도입과 내부 평가 수치는 해당 발표에 근거하며, 한국어 성능과 실제 작업 품질은 별도 확인이 필요합니다.
