AI 초보자 QnA
질문
OpenAI API 녹취록에 누가 말했는지 표시할 수 있나요?
답변
네. 화자 구분을 지원하는 전사 모델과 결과 형식을 함께 고르면 발언 구간마다 화자 표시를 받을 수 있습니다. 녹취 문장에 시간만 붙인 것과는 다릅니다.
다만 화자 표시를 실제 참석자 이름으로 바로 믿지 마세요. 먼저 짧고 공개해도 괜찮은 시험 녹음으로 결과를 확인하고, 중요한 발언은 원본을 다시 들어야 합니다.
짧게 답하면
시험 녹음 준비 → 화자 구분 모델 선택 → 구조화된 화자 결과 받기 → 원본과 대조 순서입니다. 2026년 10월 기준 공식 가이드는
gpt-4o-transcribe-diarize
와
diarized_json
을 안내합니다.
일반 전사
무엇을 말했는지 글로 옮깁니다. 일반 전사 모델만으로 화자 표시를 기대하지 마세요.
구간 시간
발언의 시작·종료 위치를 보여 줍니다. 시간 표시만으로 발언자를 알아낼 수는 없습니다.
화자 라벨
구간을 말한 사람별로 묶은 표시입니다. 실제 이름과 발언의 정확성은 따로 확인합니다.
처음 쓰는 사람 기준으로 설명하면
두 사람이 번갈아 말한 회의 파일을 그냥 전사하면 문장은 읽혀도 누가 말했는지 구분하기 어렵습니다. OpenAI의 화자 구분 안내는 전사용 API에서 전용 모델을 선택하고
response_format="diarized_json"
으로 요청하면 각 구간의
speaker
,
start
,
end
를 받을 수 있다고 설명합니다. 구간의
text
도 함께 읽어 발언 내용과 시간을 연결하세요.
30초를 넘는 녹음에는
chunking_strategy="auto"
또는 문서에 나온 음성 활동 감지 설정이 필요합니다. 처음에는 30초 이내의 비민감 시험 파일로 형식부터 확인하고, 긴 파일을 다룰 때 자르기 설정을 추가하세요. 파일 전사는
POST /v1/audio/transcriptions
경로를 사용합니다.
이 모델은 2027년 2월 26일 API 제공 종료 예정으로 표시되어 있습니다. 공식 문서에는 다른 전사 모델이 대체 후보로 적혀 있지만 화자 라벨 출력까지 동일하다고 단정하지 마세요. 오래 쓸 기능을 만들기 전에는 지원 모델과 결과 형식을 다시 확인해야 합니다.
한 줄 정리: 단어별 시간표가 아니라 발언자별 구간이 목표라면 전용 모델과
diarized_json
을 함께 고르세요.
바로 따라 해보기
1단계. 공개 가능한 시험 녹음을 준비합니다.
화자가 번갈아 말하는 짧은 파일을 고르세요. 녹음과 외부 API 업로드가 허용된 자료인지 먼저 확인하고 실제 회의의 이름·연락처·계약 내용은 연습에 쓰지 않습니다.
2단계. 모델과 출력 형식을 맞춥니다.
파일 전사 요청에
model="gpt-4o-transcribe-diarize"
와
response_format="diarized_json"
을 지정하세요. 30초가 넘으면
chunking_strategy="auto"
도 넣습니다. API 키는 코드와 녹음 파일에 넣지 않습니다.
3단계. 구간과 실제 소리를 비교합니다.
반환된
segments
의 화자 표시, 문장, 시작·종료 시간을 읽고 해당 구간을 다시 재생하세요. 라벨이 서로 뒤바뀌었거나 말이 겹친 곳은 검토 표시를 남기고 확인 후에만 이름을 붙입니다.
주의할 점
이 결과는 사람의 신원을 확인하는 기록이 아닙니다. 낯선 목소리가 같은 라벨에 묶이거나 짧은 맞장구가 다른 사람에게 붙을 수 있으므로 인용·회의록·담당자 배정 전에 사람이 원본을 듣고 고쳐야 합니다.
일반
json
이나
text
만 받고 화자 구간이 없다고 모델 오류로 판단합니다. 화자 표시가 필요한 출력 형식을 먼저 확인하세요.긴 녹음을 한 구간으로 보내 놓고 화자 전환이 정확하다고 믿습니다. 30초 초과 입력에서는 자르기 옵션을 확인하세요.
제공 종료 예정인 모델을 장기 시스템의 유일한 경로로 고정합니다. 대체 모델의 화자 출력 지원 여부를 별도로 시험하고 전환 계획을 세우세요.
웹사이트와 앱 중 무엇부터 쓰면 좋을까요?
설정을 배울 때는 공식 웹 문서
Speech to text의 화자 구분 부분과 Create transcription의 모델·형식 조건을 나란히 읽으세요. 2027년 종료 일정도 확인합니다.
결과를 확인할 때는 API 개발 환경
비민감 파일로 실제 응답의 구간을 살펴보세요. ChatGPT 웹사이트나 모바일 앱의 녹음 메뉴는 여기 설명한 파일 전사용 API 설정과 구별합니다.
같이 보면 좋은 질문
- OpenAI API 녹취록에 시간 표시를 붙일 수 있나요? 시간과 화자 구분을 혼동할 때 읽어 보세요.
- OpenAI API에서 한국어 녹음이 영어로 나오면 어떻게 하나요? 번역과 전사 경로를 구분합니다.
- 화자 분리란 무엇인가요? 기능 자체의 뜻을 먼저 알고 싶을 때 참고하세요.
확인한 공식 자료
OpenAI 공식 가이드 — Speech to text — 화자 구분 모델과 구간별 결과, 긴 녹음 처리 조건을 확인했습니다.
OpenAI API 문서 — Create transcription — 파일 전사 요청 경로와 화자 결과 형식의 지원 범위를 확인했습니다.
OpenAI 공식 문서 — Deprecations — 화자 구분 모델의 제공 종료 예정일과 안내된 대체 후보를 확인했습니다.
