추론 API: 빠른 시작 가이드
5분 이내에 무검열 추론 API를 시작하세요. 기본 URL과 API 키를 변경한 후 투명한 토큰 기반 가격으로 오픈 웨이트 모델에서 기존 LLM 코드를 실행하세요.
기본 URL 및 인증
당사의 API는 완전히 OpenAI 호환됩니다. 전환하려면 클라이언트 구성을 업데이트하여 기본 URL을 가리키고 API 키를 제공하세요. 기본 URL은 https://api.llminferenceapi.com/v1입니다. 인증은 표준 Authorization: Bearer 헤더를 통해 처리됩니다. 이메일과 비밀번호만으로 가입하면 즉시 키를 받습니다. 무료 체험을 위해 전화번호나 신용카드가 필요하지 않습니다.
- 기본 URL:
https://api.llminferenceapi.com/v1 - 헤더:
Authorization: Bearer YOUR_API_KEY - 모델 ID:
uncensored
이 설정은 모든 공식 OpenAI SDK 또는 호환 클라이언트 라이브러리에서 작동합니다. 기존 코드 구조를 유지한 채 엔드포인트와 키만 변경하면 됩니다.
첫 번째 요청
채팅 완성 엔드포인트에 첫 번째 호출을 수행하세요. 모델 ID는 uncensored입니다. 이 모델은 GPT나 Claude가 아닌, 합법적인 성인 사용에 대한 콘텐츠 거절 없이 답변하도록 조정된 오픈 웨이트 대형 언어 모델입니다.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'요청 본문에는 표준 messages 배열이 포함됩니다. temperature, max tokens 및 기타 표준 매개변수를 지정할 수 있습니다. API는 토큰 사용량 통계가 포함된 표준 채팅 완성 응답을 반환합니다. 401 오류가 발생하면 키가 유효하지 않습니다. 402 오류는 선불 크레딧이 고갈되었음을 의미합니다.
Python SDK 통합
Python SDK를 사용하는 것은 간단합니다. 기본 URL과 API 키로 클라이언트를 초기화하세요. 코드 구조는 표준 OpenAI 패턴과 동일합니다. 이를 통해 애플리케이션 로직을 수정하지 않고도 llm 프록시 서비스를 대체하여 사용할 수 있습니다.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)model='uncensored' 인수를 전달해야 합니다. 응답 객체에는 생성된 텍스트와 사용량 메트릭이 포함됩니다. 이 방식은 즉시 사용 가능한 OpenAI 호환 API 솔루션을 원하는 개발자에게 이상적입니다. 표준 SDK 외에 추가 종속성이 필요하지 않습니다.
Node.js SDK 사용법
Node.js 개발자의 경우 통합도 마찬가지로 간단합니다. 클라이언트 구성에서 baseURL 및 apiKey을 설정하세요. SDK는 AI 채팅 API 엔드포인트로의 HTTP 요청을 자동으로 처리합니다.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);모델 ID uncensored로 chat.completions.create()를 호출하세요. 응답을 스트리밍하거나 완료된 객체로 처리할 수 있습니다. 이 유연성은 배치 처리와 실시간 사용자 상호작용 모두를 지원합니다. API는 함수 호출을 지원하여 모델이 호출할 함수를 정의할 수 있습니다.
스트리밍 응답
실시간 사용자 경험을 위해 스트리밍을 활성화하세요. 요청에서 stream 매개변수를 true로 설정하세요. API는 부분 응답의 서버 전송 이벤트(SSE) 스트림을 반환합니다.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)각 청크에는 응답의 부분 델타가 포함됩니다. 도착하는 대로 이러한 토큰을 사용자에게 렌더링하여 지각된 지연 시간을 줄일 수 있습니다. 즉각적인 피드백이 예상되는 채팅 인터페이스에서 이는 매우 중요합니다. 스트리밍 응답에는 비스트리밍 요청과 동일한 토큰 사용량 정보가 포함됩니다.
제한, 오류 및 컨텍스트
당사의 API는 입력과 출력을 합쳐 100,000 토큰의 컨텍스트 창을 강제합니다. 이는 긴 문서와 복잡한 대화를 지원합니다. 속도 제한은 키당 분당 300 요청으로 설정됩니다. 이를 초과하면 429 오류가 발생합니다. 요청 본문은 8 MB로 제한됩니다.
일반적인 오류에는 401(유효하지 않은 키), 402(크레딧 부족), 429(속도 제한)이 포함됩니다. 크레딧은 만료되지 않으므로 언제든지 충전할 수 있습니다. 선불 크레딧은 $10부터 시작하며, 더 큰 예치 시 보너스가 제공됩니다. 이 사용량 기반 AI API 모델을 통해 사용한 만큼만 지불하면 됩니다.
API 사양
크레딧을 구매하기 전에 확인할 수 있도록 API의 실제 한도와 기능을 한곳에 정리했습니다.
| 항목 | 내용 |
|---|---|
| 형식 | OpenAI 호환: 어떤 OpenAI SDK든 base URL과 키만 바꾸면 동작 |
| Base URL | https://api.llminferenceapi.com/v1 |
| 인증 | Authorization: Bearer YOUR_KEY |
| 엔드포인트 | POST /v1/chat/completions · GET /v1/models |
| 모델 ID | uncensored |
| 최대 출력 | 64,000 토큰 윈도우의 남은 만큼; max_tokens는 선택 사항(별도 상한 없음) |
| 파라미터 | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| 스트리밍 | 지원 — SSE, 마지막 청크에 토큰 사용량 포함 |
| JSON 모드 | response_format: {"type": "json_object"} |
| 함수 호출 | 지원 — tools, tool_choice; 응답에 tool_calls (스트리밍 포함), 결과는 role: tool로 전송 |
| 컨텍스트 창 | 64,000 토큰 (입력 + 출력) |
| 요청 크기 | 최대 8 MB |
| 속도 제한 | 키당 분당 300회 |
| 동시 요청 | 키당 동시 8개 |
| 응답 헤더 | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| 유효기간 | 유료 크레딧은 만료되지 않으며 구독 없음 |
| 보너스 | $50 이상 +5%, $100 이상 +10% |
| 무료 체험 | $0.50, 7일, 카드 불필요 · 체험 키: 동시 요청 2건, 분당 60건. 첫 충전 후 전체 한도(8건, 300건) 적용 |
| 가격 | 입력 100만 토큰당 $0.25 · 출력 100만 토큰당 $1.00 |
| 충전 | USDT (TRC20) 또는 USDC (Base), $10~$500 사이 원하는 정수 금액 |
| 과금 | 선불 크레딧에서 실제 사용량만큼 차감, 오류·거부는 무료 |
| 로그인 | Google 또는 이메일과 비밀번호 |
| 콘텐츠 | 성인 콘텐츠 허용, 미성년자가 관련된 성적 콘텐츠는 거부 |
| 키 | 계정당 활성 키 1개, 새 키를 만들면 이전 키는 무효 |
오류 코드
오류는 고정된 type을 가진 JSON으로 반환되며, 실패하거나 거부된 요청은 과금되지 않습니다.
| 코드 | 유형 | 의미 |
|---|---|---|
400 | bad_request | 잘못된 JSON, 빈 메시지, 잘못된 파라미터 또는 컨텍스트 초과 |
401 | missing_key · invalid_key · key_revoked | 키 없음·잘못됨·새 키로 교체됨 |
402 | no_credit | 잔액 없음 — 충전하면 즉시 재개 |
403 | content_blocked | 미성년자 관련 성적 콘텐츠 — 거부, 과금 없음 |
404 | not_found | 알 수 없는 엔드포인트 |
413 | request_too_large | 본문 8 MB 초과 |
429 | rate_limited · concurrency | 분당 300회 또는 동시 8개 초과 — 잠시 후 재시도 |
503 | upstream_busy | 모델 혼잡 — 몇 초 후 재시도 |
질문과 답변
이 API는 프로덕션 애플리케이션에 적합한가요?
예, 표준 속도 제한과 안정적인 엔드포인트로 프로덕션용으로 설계되었습니다. 하지만 SLA 보장이나 SOC2와 같은 기업 인증은 제공하지 않습니다. 공식적인 기업 보장보다 무검열 출력과 유연한 가격을 우선시하는 애플리케이션에 가장 적합합니다.
이 모델에서 '무검열'이란 무엇을 의미하나요?
이 모델은 합법적인 성인, 픽션, 보안 연구, 또는 논쟁적인 주제를 거부하지 않습니다. 안전 필터로 인해 다른 모델이 차단할 수 있는 콘텐츠를 생성합니다. 유일한 하드 제한은 미성년자가 등장하는 성적 콘텐츠가 항상 차단된다는 것입니다.
시작하기 위해 신용카드가 필요한가요?
아니요. 이메일과 비밀번호만으로 가입할 수 있습니다. 모든 신규 계정에는 7일 동안 유효한 $0.50의 무료 체험 크레딧이 제공됩니다. 확장할 준비가 되면 나중에 암호화폐(USDT 또는 USDC)로 크레딧을 추가할 수 있습니다.
키는 양식 하나만 작성하면 받을 수 있습니다
계정을 생성하고 키를 복사한 후 기본 URL을 변경하세요. 설정은 이것뿐입니다.
API 키 받기