오디오 API
음성 합성(TTS, /api/v1/audio/speech)과 음성 인식(STT, /api/v1/audio/transcriptions)을 지원합니다. 각 모델 문서에서 엔드포인트와 파라미터를 확인하세요. 아래는 음성 합성(TTS) 기준입니다.
엔드포인트
/api/v1/audio/speech공통 요청 파라미터
| 이름 | 타입 | 필수 | 설명 | 기본값 |
|---|---|---|---|---|
model* | string | * 필수 | 사용할 음성 합성(TTS) 모델 ID. 예: "qwen3-tts-flash" | - |
input* | string | * 필수 | 합성할 텍스트. 최대 2,000자. (별칭 text 도 허용) | - |
voice | string | 선택 | 음색. 미지정 시 기본 음색(Cherry)을 사용합니다. | Cherry |
language_type | string | 선택 | 음성 언어를 강제합니다. 미지정 시 입력 텍스트에서 자동 판별합니다. 예: "Korean", "English", "Chinese" | - |
응답 필드
| 이름 | 타입 | 필수 | 설명 | 기본값 |
|---|---|---|---|---|
(body)* | binary | * 필수 | 합성된 오디오 바이너리(Content-Type: audio/wav 등)를 그대로 반환합니다. 파일로 저장해 재생하세요. | - |
X-Characters-Used | number (header) | 선택 | 과금에 사용된 글자수(한글·한자는 1자=2로 가중). | - |
코드 예제
curl -X POST https://billing-ai.doublezero.kr/api/v1/audio/speech \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-flash",
"input": "안녕하세요, 빌링AI 음성 합성입니다.",
"voice": "Cherry"
}' \
--output speech.wav지원 모델 (8개)
alibaba
openai
OpenAI gpt-4o-mini 기반 음성 합성(TTS). 텍스트를 자연스러운 다국어 음성으로 변환하며, instructions 파라미터로 말투·톤을 지시할 수 있습니다. 회사 OpenAI 계정 직접 연동.
입력: 144,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰OpenAI gpt-4o 기반 음성 인식(STT). 오디오 파일을 업로드하면 고정확도 전사 텍스트를 반환합니다. 다국어 인식을 지원합니다. 회사 OpenAI 계정 직접 연동.
입력: 600,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰OpenAI gpt-4o-mini 기반 음성 인식(STT). gpt-4o-transcribe 대비 저지연·저가로 대량 전사에 적합합니다. 다국어 인식을 지원합니다. 회사 OpenAI 계정 직접 연동.
입력: 300,000 cr/100만 토큰, 출력: 1,200,000 cr/100만 토큰GPT Transcribe는 오디오를 텍스트로 변환하는 OpenAI의 저비용 음성 인식(STT) 모델로, 분당 과금 기반의 일반 음성 전사 용도에 적합합니다.
18 cr/건당Google Gemini 2.5 Flash 기반 음성 합성(TTS). 30종 음색과 90개 이상 언어를 지원하며, 자연스러운 스타일 제어가 가능합니다. Vertex AI 직접 연동(GCP 크레딧).
입력: 120,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰Gemini 2.5 Pro 기반의 플래그십 TTS 모델로, 최신 LLM의 자연스러운 억양과 감정 표현을 살린 고품질 음성 합성을 제공합니다. 오디오북, 대화형 에이전트, 고품질 내레이션 등 사실적인 음성이 필요한 용도에 적합합니다.
240,000 cr/건당