텍스트 API
OpenAI 호환 Chat Completions API. 다양한 텍스트 모델을 사용하여 대화형 응답, 코드 생성, 번역 등을 수행합니다.
엔드포인트
/api/v1/chat/completions공통 요청 파라미터
| 이름 | 타입 | 필수 | 설명 | 기본값 |
|---|---|---|---|---|
model* | string | * 필수 | 사용할 모델 ID | - |
messages* | array | * 필수 | 대화 메시지 배열. 각 메시지는 role("system" | "user" | "assistant")과 content를 포함합니다. | - |
temperature | number | 선택 | 생성 온도 (0~2). 높을수록 다양한 응답을 생성합니다. | 1.0 |
max_tokens | number | 선택 | 최대 출력 토큰 수. 모델별 상한이 다릅니다. | - |
stream | boolean | 선택 | 스트리밍 여부. true로 설정하면 토큰 단위로 실시간 전송합니다. | false |
top_p | number | 선택 | 누적 확률 샘플링. temperature와 함께 사용하지 않는 것을 권장합니다. | - |
응답 필드
| 이름 | 타입 | 필수 | 설명 | 기본값 |
|---|---|---|---|---|
id* | string | * 필수 | 응답 고유 ID | - |
object* | string | * 필수 | "chat.completion" 고정값 | - |
created* | number | * 필수 | 생성 타임스탬프 (Unix epoch) | - |
model* | string | * 필수 | 실제 사용된 모델 ID | - |
choices* | array | * 필수 | 생성 결과 배열. 각 항목에 message(role, content)와 finish_reason을 포함합니다. | - |
usage* | object | * 필수 | 토큰 사용량. prompt_tokens, completion_tokens, total_tokens를 포함합니다. | - |
코드 예제
curl -X POST https://billing-ai.doublezero.kr/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5-6-sol",
"messages": [
{"role": "system", "content": "당신은 도움이 되는 AI 어시스턴트입니다."},
{"role": "user", "content": "안녕하세요"}
],
"temperature": 0.7,
"max_tokens": 1024
}'지원 모델 (49개)
anthropic
Anthropic의 Claude 5 세대 최상위 모델. Opus를 뛰어넘는 최고 수준의 추론 성능과 100만 토큰 컨텍스트를 제공합니다.
입력: 2,400,000 cr/100만 토큰, 출력: 12,000,000 cr/100만 토큰Anthropic Opus 라인의 최신 모델. 향상된 추론 능력과 안정적인 코드 생성을 제공합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰Opus 4.8의 이전 버전. 검증된 고성능 추론과 안정적인 출력을 제공합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰Anthropic Opus 라인의 검증된 플래그십 모델. 100만 토큰 컨텍스트와 높은 추론 능력을 제공합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰Anthropic Claude 5 세대의 Sonnet 모델. 성능과 비용의 균형을 제공합니다.
입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰Anthropic의 최신 균형 모델. 성능과 비용의 최적 균형을 제공합니다.
입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰Anthropic의 고성능 모델. 창의적 글쓰기와 복잡한 분석에 탁월합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰Anthropic의 균형 모델. 빠른 응답과 정확한 추론을 동시에 제공합니다.
입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰Anthropic의 경량 모델. 빠른 응답 속도와 비용 효율성이 특징입니다.
입력: 240,000 cr/100만 토큰, 출력: 1,200,000 cr/100만 토큰Anthropic의 프리미엄 추론 모델. 최고 수준의 정확도가 필요한 작업에 적합합니다.
입력: 3,600,000 cr/100만 토큰, 출력: 18,000,000 cr/100만 토큰Claude Opus 5는 Anthropic의 최상위 플래그십 모델로, 고급 추론과 복잡한 코딩·에이전트 작업에 최적화되어 있습니다. 정밀한 분석과 장문 처리가 필요한 고난도 업무에 적합합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 6,000,000 cr/100만 토큰openai
OpenAI의 최신 플래그십 모델. 뛰어난 추론 능력과 멀티모달 처리를 제공합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 7,200,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 2,400,000 cr/100만 토큰, 장문 출력: 10,800,000 cr/100만 토큰GPT-5 시리즈의 고성능 모델. 뛰어난 추론 능력과 멀티모달 처리를 제공합니다.
입력: 600,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 1,200,000 cr/100만 토큰, 장문 출력: 5,400,000 cr/100만 토큰OpenAI GPT-5.6 제품군의 플래그십 모델(2026-07 출시). 최고 수준의 추론·코딩·다단계 문제 해결과 100만 토큰 컨텍스트, 프로그래머틱 툴 콜링을 제공합니다.
입력: 1,200,000 cr/100만 토큰, 출력: 7,200,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 2,400,000 cr/100만 토큰, 장문 출력: 10,800,000 cr/100만 토큰GPT-5.6 제품군의 균형형 모델. 일상 업무에 적합한 성능·속도·비용의 균형을 제공하며 100만 토큰 컨텍스트를 지원합니다.
입력: 600,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 1,200,000 cr/100만 토큰, 장문 출력: 5,400,000 cr/100만 토큰GPT-5.6 제품군에서 가장 빠르고 저렴한 모델. 대량·저지연 워크로드에 적합하며 100만 토큰 컨텍스트를 지원합니다.
입력: 240,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰. 실제 입력 272,000개 초과 시 해당 요청 전체의 장문 입력: 480,000 cr/100만 토큰, 장문 출력: 2,160,000 cr/100만 토큰GPT-5.4의 이전 버전. 안정적인 성능과 합리적인 비용을 제공합니다.
입력: 420,000 cr/100만 토큰, 출력: 3,360,000 cr/100만 토큰GPT-5 시리즈의 경량 모델. 비용 효율적이면서도 높은 성능을 유지합니다.
입력: 300,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰alibaba
Alibaba의 플래그십 대규모 언어 모델(Qwen3.7 세대). 강력한 추론·코딩 능력과 함께 다국어(특히 중국어·한국어) 처리에 강점이 있습니다.
입력: 720,000 cr/100만 토큰, 출력: 3,600,000 cr/100만 토큰Alibaba Qwen3.7의 균형 모델. 비용 대비 우수한 성능으로 일반적인 텍스트·코드 작업에 적합하며 100만 토큰 컨텍스트를 지원합니다.
입력: 288,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰Alibaba Qwen3의 경량 고속 모델. 초저비용으로 빠른 응답을 제공하며 100만 토큰 컨텍스트를 지원합니다.
입력: 60,000 cr/100만 토큰, 출력: 480,000 cr/100만 토큰Alibaba Qwen3의 비전·멀티모달 모델. 이미지·문서 이해, OCR, 시각 추론을 지원합니다. 텍스트와 이미지를 함께 입력해 분석할 수 있습니다.
입력: 144,000 cr/100만 토큰, 출력: 1,152,000 cr/100만 토큰Alibaba Qwen 라인업 최저가 모델. 분류·추출·요약 등 단순·대량 작업에 초저비용으로 빠르게 응답하며 100만 토큰 컨텍스트를 지원합니다.
입력: 12,000 cr/100만 토큰, 출력: 120,000 cr/100만 토큰Alibaba Qwen3의 코딩 특화 경량 모델. 에이전틱 코딩·코드 생성·리팩터링에 가성비가 뛰어나며 100만 토큰 컨텍스트를 지원합니다.
입력: 384,000 cr/100만 토큰, 출력: 2,304,000 cr/100만 토큰Qwen3 7 Flash는 알리바바 Qwen 계열의 저지연·저비용 경량 텍스트 모델로, 대량 요청과 실시간 채팅 등 비용 효율이 중요한 범용 작업에 적합합니다.
입력: 93,600 cr/100만 토큰, 출력: 744,000 cr/100만 토큰Qwen3.6 원생 비전-언어 계열의 경량 Flash 모델. 코딩 에이전트·수학/코드 추론이 3.5-Flash 대비 크게 향상됐고, 공간 인식과 객체 탐지 등 시각 능력이 강화됐습니다. 컨텍스트 100만 토큰.
입력: 240,000 cr/100만 토큰, 출력: 960,000 cr/100만 토큰Qwen3.6 원생 비전-언어 계열의 주력 Plus 모델. 에이전트 코딩·프런트엔드 개발 등 코드 능력과 OCR·객체 인식 같은 멀티모달 성능이 3.5 계열 대비 크게 향상됐습니다. 컨텍스트 100만 토큰.
입력: 480,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰Qwen3.6 계열 27B 원생 비전-언어 Dense 모델. STEM·추론 능력과 에이전트 코딩이 강화됐고, 영상 이해와 문서 OCR, 시각 에이전트 작업에 안정적으로 대응합니다.
입력: 144,000 cr/100만 토큰, 출력: 864,000 cr/100만 토큰Qwen3.6 계열 35B-A3B 원생 비전-언어 모델. 선형 어텐션과 희소 MoE를 결합한 하이브리드 구조로 추론 효율이 높고, 에이전트 코딩·수학 추론·공간 인식이 3.5 동급 대비 향상됐습니다.
입력: 90,000 cr/100만 토큰, 출력: 540,000 cr/100만 토큰Qwen3.7 계열의 고성능·고효율 Plus 모델. 강력한 텍스트 능력에 비전-언어 능력을 더해 화면 판독과 GUI 조작, 시각 참조 기반 코드 생성 같은 멀티모달 에이전트 작업을 수행합니다. 컨텍스트 100만 토큰.
입력: 288,000 cr/100만 토큰, 출력: 1,152,000 cr/100만 토큰Qwen3.7 계열에서 규모와 종합 성능이 가장 큰 Max 모델. 에이전트 시대를 겨냥한 플래그십으로 코딩·문서 업무·장기 자율 실행에 강점이 있습니다. 현재 순수 텍스트 입력만 지원하며 컨텍스트는 100만 토큰입니다.
입력: 600,000 cr/100만 토큰, 출력: 1,800,000 cr/100만 토큰Alibaba Qwen 계열의 2.4조 파라미터 MoE 플래그십. 장기 코딩·문서 작업과 법률·금융 등 전문 업무를 end-to-end로 처리하며, 이미지·영상 입력을 이해하는 원생 멀티모달 모델입니다. 컨텍스트 100만 토큰.
입력: 480,000 cr/100만 토큰, 출력: 1,440,000 cr/100만 토큰Google의 최신 프로 모델. 200만 토큰 컨텍스트로 대규모 문서 처리에 적합합니다.
입력: 480,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 960,000 cr/100만 토큰, 장문 출력: 4,320,000 cr/100만 토큰Google의 최신 고속 모델. 향상된 추론 능력과 빠른 응답 속도를 동시에 제공합니다.
입력: 360,000 cr/100만 토큰, 출력: 2,160,000 cr/100만 토큰Gemini 3.1 Pro의 커스텀 도구 특화 버전. 외부 도구 연동에 최적화되어 있습니다.
입력: 480,000 cr/100만 토큰, 출력: 2,880,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 960,000 cr/100만 토큰, 장문 출력: 4,320,000 cr/100만 토큰Google의 초경량 모델. 최저 비용으로 빠른 응답을 제공합니다.
입력: 60,000 cr/100만 토큰, 출력: 360,000 cr/100만 토큰Google의 경량 고속 모델. 빠른 응답이 필요한 실시간 서비스에 적합합니다.
입력: 120,000 cr/100만 토큰, 출력: 720,000 cr/100만 토큰Google의 이전 세대 프로 모델. 안정적인 성능과 합리적인 가격을 제공합니다.
입력: 300,000 cr/100만 토큰, 출력: 2,400,000 cr/100만 토큰. 실제 입력 200,000개 초과 시 해당 요청 전체의 장문 입력: 600,000 cr/100만 토큰, 장문 출력: 3,600,000 cr/100만 토큰Google의 경량 모델. 비용 대비 뛰어난 성능을 제공합니다.
입력: 72,000 cr/100만 토큰, 출력: 600,000 cr/100만 토큰Google의 최저가 모델. 단순 작업에 최적화된 초저비용 옵션입니다.
입력: 24,000 cr/100만 토큰, 출력: 96,000 cr/100만 토큰Gemini 3.5 Flash-Lite는 저지연·저비용에 최적화된 경량 모델로, 대량 텍스트 처리와 실시간 응답이 필요한 서비스에 적합합니다. 텍스트뿐 아니라 이미지·비디오·오디오 입력도 지원하는 균형형 멀티모달 모델입니다.
입력: 79,200 cr/100만 토큰, 출력: 660,000 cr/100만 토큰Gemini 3.6 Flash는 빠른 응답과 합리적 비용을 균형 있게 제공하는 멀티모달 Flash 계열 모델로, 대규모 텍스트 처리·대화·요약 등 범용 작업에 적합합니다. 텍스트·이미지·비디오·오디오 입력을 지원해 폭넓은 활용이 가능합니다.
입력: 360,000 cr/100만 토큰, 출력: 1,800,000 cr/100만 토큰deepseek
DeepSeek의 최상위 추론 모델. 복잡한 수학·코딩·다단계 추론에서 강력한 성능을 제공하며, 비용 대비 최고 수준의 추론 효율로 주목받습니다.
입력: 576,000 cr/100만 토큰, 출력: 1,152,000 cr/100만 토큰DeepSeek의 경량 고속 모델. 초저비용으로 빠른 응답을 제공해 분류·추출·요약 등 대량 작업에 적합합니다.
입력: 48,000 cr/100만 토큰, 출력: 96,000 cr/100만 토큰DeepSeek V3 계열의 검증된 범용 모델. 비용 대비 뛰어난 코딩·추론 성능으로 일반 텍스트·코드 작업에 폭넓게 활용됩니다.
입력: 136,800 cr/100만 토큰, 출력: 410,400 cr/100만 토큰zhipu
Zhipu AI의 플래그십 GLM 모델. 추론·코딩·에이전트 작업에서 균형 잡힌 고성능을 제공하며 중국어·한국어 처리에 강점이 있습니다.
입력: 336,000 cr/100만 토큰, 출력: 1,056,000 cr/100만 토큰Zhipu AI GLM-5 계열의 균형 모델. 일반 추론·코드·문서 작업에 안정적인 성능을 제공합니다.
입력: 336,000 cr/100만 토큰, 출력: 1,056,000 cr/100만 토큰Zhipu AI GLM-5.2의 저지연 고속 버전(프리뷰). GLM-5.2 수준의 품질을 더 빠른 응답으로 제공해 실시간·대량 처리에 적합합니다.
입력: 672,000 cr/100만 토큰, 출력: 2,112,000 cr/100만 토큰