AI 초보자 QnA
질문
OpenAI API 녹음 파일의 전사문을 완료 전에 볼 수 있나요?
답변
네. 녹음이 끝난 파일을 보내면서
stream=true
를 설정하면 전사 중 도착하는 글 조각을 받을 수 있습니다. 전부 완성된 뒤 한 번에 내려받는 방식과 다릅니다. OpenAI 파일 전사 가이드는
gpt-transcribe
로 이 흐름을 안내합니다.
다만 파일 전사 스트리밍은 지금 마이크로 말하는 소리를 계속 보내는 실시간 전사가 아닙니다. 먼저 녹음 파일을 준비해야 합니다. 중간 글자만 보고 녹취를 확정하지 말고 마지막 완료 이벤트의 전사문을 확인하세요.
짧게 답하면
녹음 파일 준비 → stream 켜기 → delta 표시 → done의 전체 문장 확인 순서입니다. 스트림의 첫 글자가 보였다는 이유만으로 전체 파일을 다 읽었다고 판단하지 않습니다.
stream=true
이미 녹음된 파일을 전사할 때 결과를 여러 이벤트로 받는 설정입니다. 마이크 음성을 실시간으로 보내는 옵션과는 다릅니다.
transcript.text.delta
전사 과정에서 도착하는 부분 글자입니다. 화면에 임시로 보여 주되 최종 원고로 고정하지 않습니다.
transcript.text.done
파일 전사의 최종 전체 텍스트가 담긴 이벤트입니다. 앞서 받은 조각을 다시 뒤에 붙이지 말고 최종본으로 따로 보관합니다.
처음 쓰는 사람 기준으로 설명하면
회의 녹음 파일에서 전사 중인 문장을 미리 보고 싶다고 가정해 보세요. 파일 전사 스트리밍은 녹음이 이미 끝났을 때 쓰는 경로입니다. 녹음 중 자막을 표시해야 한다면 별도의 실시간 전사 세션을 검토하세요.
공식 문서는
stream=true
와
gpt-transcribe
를 함께 쓰는 예시를 제공합니다. Python에서는 파일을 바이너리로 열어
client.audio.transcriptions.create
에 전달하고 이벤트를 순서대로 읽습니다. 화면 표시는 프로그램에서 직접 구현합니다.
부분 글자는
transcript.text.delta
로 오고, 마지막
transcript.text.done
에는 완성된 전사문이 담깁니다. 일반 Responses API의
response.completed
와 이름이 다릅니다. 전사 API 문서는 이벤트를 server-sent events 방식으로 보낸다고 설명합니다. 실제 응답의 이벤트 종류를 확인해 분기하세요.
한 줄 정리: 파일 전사 스트리밍은 완료 전에 글을 미리 보여 주는 방법이며, 저장할 최종 텍스트는 done의 전체 전사문을 기준으로 확인합니다.
바로 따라 해보기
1단계. 짧은 녹음 파일을 준비합니다.
업로드해도 되는 시험 파일을 고르고 원본 파일을 보관하세요. 사람의 목소리나 업무 정보가 들어 있다면 업로드 권한부터 확인합니다. 녹음을 아직 하는 중이라면 파일 전사 대신 실시간 전사 가이드를 읽으세요.
2단계. 전사 스트림을 요청합니다.
POST /v1/audio/transcriptions
에 파일,
model="gpt-transcribe"
,
stream=true
를 보냅니다. 공식 Python 예시처럼 반환된 이벤트를 반복해 읽고 이벤트의 type을 기록하세요. API 키는 화면이나 녹취 로그에 적지 않습니다.
3단계. 부분과 최종 결과를 구분합니다.
transcript.text.delta
는 미리 보기 영역에 표시합니다.
transcript.text.done
이 도착하면 그 이벤트의 text를 전체 녹취로 저장하고 원본을 다시 들으며 이름과 숫자를 대조하세요. 연결이 끊겨 done을 받지 못했다면 부분 표시만 남긴 채 완료로 처리하지 않습니다.
주의할 점
API 문서는
whisper-1
에서 파일 전사 stream 설정이 무시된다고 안내합니다. 모든 모델에 같은 이벤트를 기대하지 마세요. 모델과 결과 형식은 요청 전에 다시 확인합니다.
부분 글자 여러 개를 이어 붙인 뒤 마지막 done의 전체 문장까지 덧붙이면 녹취가 중복됩니다. 임시 표시와 최종 저장 공간을 분리하세요.
브라우저나 앱에서 녹음 중이라고 해서 파일 스트림을 쓰면 실시간 입력이 되는 것은 아닙니다. 실시간 마이크 입력은 Realtime transcription 안내를 따릅니다.
중간 텍스트가 잠시 멈추거나 연결이 종료되자마자 성공이라고 표시합니다. done 이벤트를 받았는지와 저장된 텍스트를 확인하고 원본 녹음도 대조하세요.
웹사이트와 앱 중 무엇부터 쓰면 좋을까요?
이미 저장된 녹음은 API 문서부터
공식 File transcription의 Streaming transcriptions 절에서 예제를 확인하세요. 개발 환경에서 작은 파일로 이벤트 순서를 보고, 최종 전사문이 저장되는지 점검하는 편이 좋습니다.
지금 말하는 소리는 실시간 전사 가이드부터
마이크나 통화처럼 진행 중인 음성은 Realtime transcription 세션을 사용합니다. 파일의 부분 출력과 라이브 입력은 이름만 비슷할 뿐 연결 방법이 다릅니다. 웹사이트 채팅의 음성 입력 버튼과도 구분하세요.
같이 보면 좋은 질문
확인한 공식 자료
OpenAI 공식 가이드 — File transcription — 파일 전사의 stream=true 예시와 delta·done 이벤트, whisper-1 예외를 확인했습니다.
OpenAI API 문서 — Create transcription — Transcriptions API의 stream 입력, SSE 출력 및 이벤트 응답을 확인했습니다.
OpenAI 공식 가이드 — Realtime transcription — 마이크·통화의 진행 중인 오디오는 별도의 실시간 세션을 사용한다는 구분을 확인했습니다.
OpenAI 모델 문서 — GPT Transcribe — 완성된 파일과 파일 스트리밍에 쓰는 전사 모델임을 확인했습니다.
