빌링AI빌링AI

오디오 API

음성 합성(TTS, /api/v1/audio/speech)과 음성 인식(STT, /api/v1/audio/transcriptions)을 지원합니다. 각 모델 문서에서 엔드포인트와 파라미터를 확인하세요. 아래는 음성 합성(TTS) 기준입니다.

엔드포인트

POST/api/v1/audio/speech

공통 요청 파라미터

이름타입설명
model*string

사용할 음성 합성(TTS) 모델 ID. 예: "qwen3-tts-flash"

input*string

합성할 텍스트. 최대 2,000자. (별칭 text 도 허용)

voicestring

음색. 미지정 시 기본 음색(Cherry)을 사용합니다.

language_typestring

음성 언어를 강제합니다. 미지정 시 입력 텍스트에서 자동 판별합니다. 예: "Korean", "English", "Chinese"

응답 필드

이름타입설명
(body)*binary

합성된 오디오 바이너리(Content-Type: audio/wav 등)를 그대로 반환합니다. 파일로 저장해 재생하세요.

X-Characters-Usednumber (header)

과금에 사용된 글자수(한글·한자는 1자=2로 가중).

코드 예제

curl -X POST https://billing-ai.doublezero.kr/api/v1/audio/speech \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-tts-flash",
    "input": "안녕하세요, 빌링AI 음성 합성입니다.",
    "voice": "Cherry"
  }' \
  --output speech.wav

지원 모델 (8개)