AI 초보자 QnA
질문
OpenAI API 녹취록에 시간 표시를 붙일 수 있나요?
답변
네. 녹음 파일을 전사할 때 단어·구간별 시작과 종료 시간을 함께 받을 수 있습니다. 공식 가이드는 이 용도로
whisper-1
과
timestamp_granularities
설정을 안내합니다.
글만 있는 녹취록에 시간을 추측해서 적게 하는 방법은 아닙니다. 원래 오디오를 보내 시간 정보가 포함된 결과를 받아야 합니다. 이 글은 파일 전사용 API 설정이며 ChatGPT 앱의 녹음·요약 메뉴와는 다릅니다.
짧게 답하면
필요한 시간 단위 정하기 → 모델·결과 형식 설정 → 파일 전사 요청 → 시작·종료 시간 확인 순서로 진행하세요. 특정 발언을 다시 듣거나 자막 편집 위치를 찾을 때 유용합니다.
word
단어별 시간 정보입니다. 반환된 words에서 각 word와 start·end를 함께 확인합니다.
segment
전사 구간별 시간 정보입니다. segments의 text와 start·end를 확인하며, 구간을 화자 이름과 혼동하지 않습니다.
verbose_json
시간 항목을 구조화해서 받는 결과 형식입니다. timestamp_granularities를 쓸 때 필요한 설정입니다.
처음 쓰는 사람 기준으로 설명하면
인터뷰 녹취록에서 특정 문장을 찾았지만 오디오의 어느 부분인지 모른다고 가정해 보세요. 시간 정보가 있으면 그 위치를 다시 재생해 확인하기 쉽습니다. 단어마다 위치가 필요하면 word, 구간 단위로 찾으면 충분하다면 segment부터 시험하세요.
공식 API 문서는
response_format="verbose_json"
을 지정한 뒤 word 또는 segment, 혹은 두 옵션을 함께 요청할 수 있다고 설명합니다. 구간 타임스탬프에는 추가 지연이 없지만 단어 타임스탬프 생성에는 추가 지연이 생깁니다.
File transcription 가이드는
timestamp_granularities[]
가 whisper-1에서만 지원된다고 명시합니다. 일반 전사의 권장 모델과 시간 정보용 모델을 구분하세요. 다른 전사 모델에 같은 옵션을 붙이면 같은 결과가 나온다고 가정하지 않습니다.
한 줄 정리: 시간 표시가 목적이라면 프롬프트 문장보다 모델, response_format, timestamp_granularities의 조합부터 확인하세요.
바로 따라 해보기
1단계. 짧은 시험 녹음과 단위를 정합니다.
개인정보가 없는 짧은 mp3나 wav 파일을 준비하세요. 공식 가이드의 파일 한도는 25 MB입니다. 처음에는 구간 단위로 시험하고, 녹음·업로드 권한과 사용할 API 프로젝트를 확인합니다.
2단계. 시간 옵션을 넣어 전사합니다.
POST /v1/audio/transcriptions
로 파일을 보냅니다. Python SDK의
client.audio.transcriptions.create
에 file과
model="whisper-1"
,
response_format="verbose_json"
,
timestamp_granularities=["segment"]
를 지정하세요. API 키는 코드에 직접 적지 않습니다.
3단계. 글과 시간 항목을 함께 대조합니다.
반환된 segments에서 text, start, end를 읽으세요. start와 end는 초 단위입니다. 원래 오디오의 해당 위치를 재생해 문장과 경계를 확인합니다. word로 요청했다면 words를 읽고, text만 출력해 놓고 시간이 없다고 판단하지 마세요.
주의할 점
시간 정보는 전사 정확도나 화자 신원을 보증하지 않습니다. 화자 라벨이 필요한 경우는 별도의 화자 분리 기능을 확인하세요. 공식 전사 안내가 권하는 대로 이름·숫자·날짜와 소음이 있는 구간을 원본과 대조합니다.
json이나 text 형식으로 요청하면서 단어별 시간이 나오기를 기대합니다. 시간 옵션에는 verbose_json이 필요합니다.
start·end의 초 단위를 밀리초나 시계 시각으로 읽습니다. 재생기와 비교할 때 단위를 맞추고 원본 파일이 같은지도 확인하세요.
시간만 정확해 보이면 전사 문장도 모두 맞다고 믿습니다. 중요한 발언은 문장과 재생 구간을 함께 검토한 뒤 인용하세요.
웹사이트와 앱 중 무엇부터 쓰면 좋을까요?
설정 비교는 공식 웹 문서부터
File transcription의 Timestamps와 Create transcription의 반환 항목을 나란히 읽으세요. SRT·VTT 자막 파일을 바로 받는 선택과 JSON 시간 데이터를 받는 선택은 결과 형식이 다릅니다.
실제 확인은 API 개발 환경에서
키를 안전하게 불러오는 프로그램에서 원문 응답을 확인하세요. ChatGPT 모바일 앱에 시간 표시를 부탁하는 것으로 API 설정을 대신하지 않습니다. whisper-1은 스트리밍을 지원하지 않으므로 파일 처리 결과를 기다려 확인합니다.
확인한 공식 자료
OpenAI 공식 가이드 — File transcription — 타임스탬프용 whisper-1 선택, 요청 예시와 파일 크기·형식을 확인했습니다.
OpenAI API 문서 — Create transcription — verbose_json 조건, word·segment 옵션, 초 단위 반환값과 스트리밍 제한을 확인했습니다.
OpenAI 공식 가이드 — Transcription — 파일·실시간 전사, 화자 라벨·단어 시간·자막의 용도 구분과 품질 점검 기준을 확인했습니다.
