빌링AI빌링AI

텍스트 API

OpenAI 호환 Chat Completions API. 다양한 텍스트 모델을 사용하여 대화형 응답, 코드 생성, 번역 등을 수행합니다.

엔드포인트

POST/api/v1/chat/completions

공통 요청 파라미터

이름타입설명
model*string

사용할 모델 ID

messages*array

대화 메시지 배열. 각 메시지는 role("system" | "user" | "assistant")과 content를 포함합니다.

temperaturenumber

생성 온도 (0~2). 높을수록 다양한 응답을 생성합니다.

max_tokensnumber

최대 출력 토큰 수. 모델별 상한이 다릅니다.

streamboolean

스트리밍 여부. true로 설정하면 토큰 단위로 실시간 전송합니다.

top_pnumber

누적 확률 샘플링. temperature와 함께 사용하지 않는 것을 권장합니다.

응답 필드

이름타입설명
id*string

응답 고유 ID

object*string

"chat.completion" 고정값

created*number

생성 타임스탬프 (Unix epoch)

model*string

실제 사용된 모델 ID

choices*array

생성 결과 배열. 각 항목에 message(role, content)와 finish_reason을 포함합니다.

usage*object

토큰 사용량. prompt_tokens, completion_tokens, total_tokens를 포함합니다.

코드 예제

curl -X POST https://billing-ai.doublezero.kr/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5-6-sol",
    "messages": [
      {"role": "system", "content": "당신은 도움이 되는 AI 어시스턴트입니다."},
      {"role": "user", "content": "안녕하세요"}
    ],
    "temperature": 0.7,
    "max_tokens": 1024
  }'

지원 모델 (49개)

anthropic

Claude Fable 5

Anthropic의 Claude 5 세대 최상위 모델. Opus를 뛰어넘는 최고 수준의 추론 성능과 100만 토큰 컨텍스트를 제공합니다.

입력: 2,400,000 cr/100만 토큰, 출력: 12,000,000 cr/100만 토큰
Claude Opus 4.8

Anthropic Opus 라인의 최신 모델. 향상된 추론 능력과 안정적인 코드 생성을 제공합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰
Claude Opus 4.7

Opus 4.8의 이전 버전. 검증된 고성능 추론과 안정적인 출력을 제공합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰
Claude Opus 4.6

Anthropic Opus 라인의 검증된 플래그십 모델. 100만 토큰 컨텍스트와 높은 추론 능력을 제공합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰
Claude Sonnet 5

Anthropic Claude 5 세대의 Sonnet 모델. 성능과 비용의 균형을 제공합니다.

입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰
Claude Sonnet 4.6

Anthropic의 최신 균형 모델. 성능과 비용의 최적 균형을 제공합니다.

입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰
Claude Opus 4.5

Anthropic의 고성능 모델. 창의적 글쓰기와 복잡한 분석에 탁월합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰
Claude Sonnet 4.5

Anthropic의 균형 모델. 빠른 응답과 정확한 추론을 동시에 제공합니다.

입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰
Claude Haiku 4.5

Anthropic의 경량 모델. 빠른 응답 속도와 비용 효율성이 특징입니다.

입력: 240,000 cr/100만 토큰, 출력: 1,200,000 cr/100만 토큰
Claude Opus 4.1

Anthropic의 프리미엄 추론 모델. 최고 수준의 정확도가 필요한 작업에 적합합니다.

입력: 3,600,000 cr/100만 토큰, 출력: 18,000,000 cr/100만 토큰
Claude Opus 5

Claude Opus 5는 Anthropic의 최상위 플래그십 모델로, 고급 추론과 복잡한 코딩·에이전트 작업에 최적화되어 있습니다. 정밀한 분석과 장문 처리가 필요한 고난도 업무에 적합합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰

openai

GPT-5.5

OpenAI의 최신 플래그십 모델. 뛰어난 추론 능력과 멀티모달 처리를 제공합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 7,200,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 2,400,000 cr/100만 토큰, 장문 출력: 10,800,000 cr/100만 토큰
GPT-5.4

GPT-5 시리즈의 고성능 모델. 뛰어난 추론 능력과 멀티모달 처리를 제공합니다.

입력: 600,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 1,200,000 cr/100만 토큰, 장문 출력: 5,400,000 cr/100만 토큰
GPT-5.6 Sol

OpenAI GPT-5.6 제품군의 플래그십 모델(2026-07 출시). 최고 수준의 추론·코딩·다단계 문제 해결과 100만 토큰 컨텍스트, 프로그래머틱 툴 콜링을 제공합니다.

입력: 1,200,000 cr/100만 토큰, 출력: 7,200,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 2,400,000 cr/100만 토큰, 장문 출력: 10,800,000 cr/100만 토큰
GPT-5.6 Terra

GPT-5.6 제품군의 균형형 모델. 일상 업무에 적합한 성능·속도·비용의 균형을 제공하며 100만 토큰 컨텍스트를 지원합니다.

입력: 600,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 1,200,000 cr/100만 토큰, 장문 출력: 5,400,000 cr/100만 토큰
GPT-5.6 Luna

GPT-5.6 제품군에서 가장 빠르고 저렴한 모델. 대량·저지연 워크로드에 적합하며 100만 토큰 컨텍스트를 지원합니다.

입력: 240,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 480,000 cr/100만 토큰, 장문 출력: 2,160,000 cr/100만 토큰
GPT-5.2

GPT-5.4의 이전 버전. 안정적인 성능과 합리적인 비용을 제공합니다.

입력: 420,000 cr/100만 토큰, 출력: 3,360,000 cr/100만 토큰
GPT-5.1

GPT-5 시리즈의 경량 모델. 비용 효율적이면서도 높은 성능을 유지합니다.

입력: 300,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰

alibaba

Qwen3-Max

Alibaba의 플래그십 대규모 언어 모델(Qwen3.7 세대). 강력한 추론·코딩 능력과 함께 다국어(특히 중국어·한국어) 처리에 강점이 있습니다.

입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰
Qwen3-Plus

Alibaba Qwen3.7의 균형 모델. 비용 대비 우수한 성능으로 일반적인 텍스트·코드 작업에 적합하며 100만 토큰 컨텍스트를 지원합니다.

입력: 288,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰
Qwen3-Flash

Alibaba Qwen3의 경량 고속 모델. 초저비용으로 빠른 응답을 제공하며 100만 토큰 컨텍스트를 지원합니다.

입력: 60,000 cr/100만 토큰, 출력: 480,000 cr/100만 토큰
Qwen3-VL-Plus

Alibaba Qwen3의 비전·멀티모달 모델. 이미지·문서 이해, OCR, 시각 추론을 지원합니다. 텍스트와 이미지를 함께 입력해 분석할 수 있습니다.

입력: 144,000 cr/100만 토큰, 출력: 1,152,000 cr/100만 토큰
Qwen-Turbo

Alibaba Qwen 라인업 최저가 모델. 분류·추출·요약 등 단순·대량 작업에 초저비용으로 빠르게 응답하며 100만 토큰 컨텍스트를 지원합니다.

입력: 12,000 cr/100만 토큰, 출력: 120,000 cr/100만 토큰
Qwen3-Coder-Flash

Alibaba Qwen3의 코딩 특화 경량 모델. 에이전틱 코딩·코드 생성·리팩터링에 가성비가 뛰어나며 100만 토큰 컨텍스트를 지원합니다.

입력: 384,000 cr/100만 토큰, 출력: 2,304,000 cr/100만 토큰
Qwen3.7 Flash

Qwen3 7 Flash는 알리바바 Qwen 계열의 저지연·저비용 경량 텍스트 모델로, 대량 요청과 실시간 채팅 등 비용 효율이 중요한 범용 작업에 적합합니다.

입력: 93,600 cr/100만 토큰, 출력: 744,000 cr/100만 토큰
Qwen3.6-Flash

Qwen3.6 원생 비전-언어 계열의 경량 Flash 모델. 코딩 에이전트·수학/코드 추론이 3.5-Flash 대비 크게 향상됐고, 공간 인식과 객체 탐지 등 시각 능력이 강화됐습니다. 컨텍스트 100만 토큰.

입력: 240,000 cr/100만 토큰, 출력: 960,000 cr/100만 토큰
Qwen3.6-Plus

Qwen3.6 원생 비전-언어 계열의 주력 Plus 모델. 에이전트 코딩·프런트엔드 개발 등 코드 능력과 OCR·객체 인식 같은 멀티모달 성능이 3.5 계열 대비 크게 향상됐습니다. 컨텍스트 100만 토큰.

입력: 480,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰
Qwen3.6-27B

Qwen3.6 계열 27B 원생 비전-언어 Dense 모델. STEM·추론 능력과 에이전트 코딩이 강화됐고, 영상 이해와 문서 OCR, 시각 에이전트 작업에 안정적으로 대응합니다.

입력: 144,000 cr/100만 토큰, 출력: 864,000 cr/100만 토큰
Qwen3.6-35B-A3B

Qwen3.6 계열 35B-A3B 원생 비전-언어 모델. 선형 어텐션과 희소 MoE를 결합한 하이브리드 구조로 추론 효율이 높고, 에이전트 코딩·수학 추론·공간 인식이 3.5 동급 대비 향상됐습니다.

입력: 90,000 cr/100만 토큰, 출력: 540,000 cr/100만 토큰
Qwen3.7-Plus

Qwen3.7 계열의 고성능·고효율 Plus 모델. 강력한 텍스트 능력에 비전-언어 능력을 더해 화면 판독과 GUI 조작, 시각 참조 기반 코드 생성 같은 멀티모달 에이전트 작업을 수행합니다. 컨텍스트 100만 토큰.

입력: 288,000 cr/100만 토큰, 출력: 1,152,000 cr/100만 토큰
Qwen3.7-Max

Qwen3.7 계열에서 규모와 종합 성능이 가장 큰 Max 모델. 에이전트 시대를 겨냥한 플래그십으로 코딩·문서 업무·장기 자율 실행에 강점이 있습니다. 현재 순수 텍스트 입력만 지원하며 컨텍스트는 100만 토큰입니다.

입력: 600,000 cr/100만 토큰, 출력: 1,800,000 cr/100만 토큰
Qwen3.8-Max

Alibaba Qwen 계열의 2.4조 파라미터 MoE 플래그십. 장기 코딩·문서 작업과 법률·금융 등 전문 업무를 end-to-end로 처리하며, 이미지·영상 입력을 이해하는 원생 멀티모달 모델입니다. 컨텍스트 100만 토큰.

입력: 480,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰

google

Gemini 3.1 Pro

Google의 최신 프로 모델. 200만 토큰 컨텍스트로 대규모 문서 처리에 적합합니다.

입력: 480,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 960,000 cr/100만 토큰, 장문 출력: 4,320,000 cr/100만 토큰
Gemini 3.5 Flash

Google의 최신 고속 모델. 향상된 추론 능력과 빠른 응답 속도를 동시에 제공합니다.

입력: 360,000 cr/100만 토큰, 출력: 2,160,000 cr/100만 토큰
Gemini 3.1 Pro CustomTools

Gemini 3.1 Pro의 커스텀 도구 특화 버전. 외부 도구 연동에 최적화되어 있습니다.

입력: 480,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 960,000 cr/100만 토큰, 장문 출력: 4,320,000 cr/100만 토큰
Gemini 3.1 Flash Lite

Google의 초경량 모델. 최저 비용으로 빠른 응답을 제공합니다.

입력: 60,000 cr/100만 토큰, 출력: 360,000 cr/100만 토큰
Gemini 3 Flash

Google의 경량 고속 모델. 빠른 응답이 필요한 실시간 서비스에 적합합니다.

입력: 120,000 cr/100만 토큰, 출력: 720,000 cr/100만 토큰
Gemini 2.5 Pro

Google의 이전 세대 프로 모델. 안정적인 성능과 합리적인 가격을 제공합니다.

입력: 300,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 600,000 cr/100만 토큰, 장문 출력: 3,600,000 cr/100만 토큰
Gemini 2.5 Flash

Google의 경량 모델. 비용 대비 뛰어난 성능을 제공합니다.

입력: 72,000 cr/100만 토큰, 출력: 600,000 cr/100만 토큰
Gemini 2.5 Flash Lite

Google의 최저가 모델. 단순 작업에 최적화된 초저비용 옵션입니다.

입력: 24,000 cr/100만 토큰, 출력: 96,000 cr/100만 토큰
Gemini 3.5 Flash Lite

Gemini 3.5 Flash-Lite는 저지연·저비용에 최적화된 경량 모델로, 대량 텍스트 처리와 실시간 응답이 필요한 서비스에 적합합니다. 텍스트뿐 아니라 이미지·비디오·오디오 입력도 지원하는 균형형 멀티모달 모델입니다.

입력: 79,200 cr/100만 토큰, 출력: 660,000 cr/100만 토큰
Gemini 3.6 Flash

Gemini 3.6 Flash는 빠른 응답과 합리적 비용을 균형 있게 제공하는 멀티모달 Flash 계열 모델로, 대규모 텍스트 처리·대화·요약 등 범용 작업에 적합합니다. 텍스트·이미지·비디오·오디오 입력을 지원해 폭넓은 활용이 가능합니다.

입력: 360,000 cr/100만 토큰, 출력: 1,800,000 cr/100만 토큰