AI 초보자 QnA
질문
OpenAI API가 만든 음성을 MP3 대신 WAV로 저장할 수 있나요?
답변
네. OpenAI Speech API에서 글을 음성으로 만들 때
response_format
을
wav
로 지정하면 WAV 형식으로 받을 수 있습니다. 이 값을 넣지 않으면 기본 출력은 MP3입니다. 파일 이름의 확장자만 바꾸는 일과는 다릅니다.
저장할 곳에서 요구하는 형식을 먼저 확인하고 짧은 대본으로 시험하세요. 이 설정은 새로 만드는 음성 파일의 형식이며, 이미 저장한 MP3를 WAV로 변환하거나 녹음 파일의 전사 결과를 바꾸는 옵션이 아닙니다.
짧게 답하면
용도 확인 → Speech API 생성 요청에
response_format
지정 → 출력 파일 저장 → 실제 파일을 열어 듣기 순서입니다. 일반 재생에는 기본 MP3부터 시험하고, WAV가 필요한 곳에 전달할 때는
wav
를 지정하세요.
MP3
별도 형식 지정 없이 받는 기본 출력입니다. 일반적인 음성 재생용 파일부터 확인하기 좋습니다.
WAV
생성 요청에서 wav를 선택합니다. 헤더가 있는 비압축 오디오라 재생·편집 도구의 요구 사항과 대조하기 쉽습니다.
PCM
WAV와 달리 헤더 없는 원시 샘플입니다. 파일 확장자만 wav로 바꿔도 WAV 파일이 되지 않습니다.
처음 쓰는 사람 기준으로 설명하면
OpenAI의 Audio and voice 안내는 내레이션처럼 글을 읽어 음성을 만들 때 Text to speech를 선택하라고 설명합니다. 이미 녹음된 말을 글자로 옮기는 전사나 음성으로 대화하는 기능과 입력·출력이 다릅니다. 이 글에서는 글 한두 문장을 새 음성 파일로 만드는 Speech API만 다룹니다.
Text to speech 가이드에 따르면 기본 출력은
mp3
이고
opus
,
aac
,
flac
,
wav
,
pcm
도 지원됩니다. Create speech API 참조에도 이 형식 목록이 적혀 있습니다. WAV는 비압축 오디오이며 PCM은 헤더 없이 원시 샘플을 담습니다. WAV를 요구하는 편집기에 PCM 바이트를 그대로 넣으면 읽지 못할 수 있습니다.
파일 형식을 고르는
response_format
과 전송 중 오디오를 받는 방식을 고르는
stream_format
은 다른 항목입니다. MP3를 WAV로 받고 싶다면 생성 요청의 앞 항목을 바꿉니다. 이미 만들어진 파일을 다른 형식으로 변환하는 명령이 아니므로, 파일 이름과 응답의 실제 오디오를 함께 확인하세요.
한 줄 정리:
response_format
은 Speech API의 생성 파일 형식입니다. 전사 결과의 JSON·텍스트 형식이나 재생기의 배속과 섞지 마세요.
바로 따라 해보기
1단계. 사용할 곳의 요구 형식을 확인합니다.
웹사이트에서 바로 들을 일반 음성인지, WAV 입력을 요구하는 편집 도구에 넣을 파일인지 먼저 정하세요. 공개해도 되는 한두 문장의 대본을 준비하고 사용할 모델과 목소리를 공식 문서에서 확인합니다.
2단계. Speech API의 출력 형식을 지정합니다.
같은
model
,
voice
,
input
으로 시험 요청을 만듭니다. 첫 요청은 기본 형식으로 두고, 둘째에는
response_format
을
wav
로 설정하세요. 둘을 덮어쓰지 않도록 서로 다른 파일 이름으로 저장합니다.
3단계. 실제 저장 파일을 확인합니다.
각 파일을 지원하는 재생기에서 열어 끝까지 듣고, 형식 정보도 확인하세요. 파일명에 .wav를 적었다는 사실만으로 내용이 WAV라는 뜻은 아닙니다. 발음과 문장 누락 여부도 원래 대본과 대조합니다.
주의할 점
OpenAI는 빠른 응답이 중요한 경우 WAV나 PCM을 권하지만, 이 설명만으로 모든 파일의 용량이나 음질을 단정하지 마세요. 사용처가 WAV를 요구하면 실제 WAV를 받고, PCM을 쓸 때는 24kHz·16비트·리틀 엔디언 원시 샘플이라는 공식 설명과 처리 도구의 입력 조건을 맞춰야 합니다.
오디오 형식은 기본 MP3 그대로인데 저장 파일의 확장자만 WAV로 바꾸고 변환이 끝났다고 생각합니다.
전사 API의 글자 출력 옵션과 음성 생성 API의 파일 출력 옵션을 같은 설정으로 취급합니다. 요청한 엔드포인트부터 확인하세요.
다른 사람에게 들려줄 음성의 AI 생성 사실을 알리지 않습니다. OpenAI 가이드는 최종 이용자에게 AI가 만든 음성임을 명확히 알리라고 안내합니다.
웹사이트와 앱 중 무엇부터 쓰면 좋을까요?
설정을 배울 때는 공식 웹 문서
Text to speech 가이드에서 기본 MP3와 지원 형식을 읽고 Create speech 참조에서 생성 요청의 response_format 필드를 확인하세요. Audio and voice 안내는 전사와 음성 생성을 구분할 때 참고합니다.
결과를 확인할 때는 재생 앱
API로 내려받은 파일을 재생기에서 직접 열어 보세요. 재생이 안 되면 확장자만 다시 붙이지 말고 응답 형식, 저장된 파일의 내용, 재생기 지원 형식을 차례로 살펴봅니다.
같이 보면 좋은 질문
- OpenAI API 음성의 말하기 속도는 어떻게 바꾸나요? 출력 파일의 빠르기를 조정하려면 형식이 아닌 speed를 살펴보세요.
- TTS란 무엇인가요? 글을 음성으로 바꾸는 기술 자체가 궁금할 때 읽어 보세요.
- 녹음 파일의 전사문을 완료 전에 볼 수 있나요? 녹음에서 글을 받는 흐름은 별도로 확인하세요.
확인한 공식 자료
OpenAI 공식 가이드 — Text to speech — Speech API의 기본 MP3, 지원 출력 형식, PCM과 WAV의 차이 및 AI 생성 음성 고지를 확인했습니다.
OpenAI API 참조 — Create speech — 생성 요청의 response-format 지원 값과 stream-format의 별도 용도를 확인했습니다.
OpenAI 공식 가이드 — Audio and voice — 글에서 음성을 만드는 용도와 녹음 전사·대화형 음성의 구분을 확인했습니다.
