LLM Inference APIDokumentacja
API inferencyjne: Przewodnik szybkiego startu
Zacznij pracę z naszym API inferencyjnym bez cenzury w mniej niż pięć minut. Zmień bazowy URL i klucz API, a następnie uruchom swój istniejący kod LLM przeciwko naszemu modelowi o otwartych wagach przy przejrzystym cenniku za token.
Bazowy URL i uwierzytelnianie
Nasze API jest w pełni kompatybilne z OpenAI. Aby przełączyć się, zaktualizuj konfigurację klienta, aby wskazywała nasz bazowy URL i podaj swój klucz API. Bazowy URL to https://api.llminferenceapi.com/v1. Uwierzytelnianie obsługiwane jest przez standardowy nagłówek Authorization: Bearer. Otrzymujesz klucz natychmiast po zarejestrowaniu się podając tylko e-mail i hasło — nie jest potrzebny numer telefonu ani karta kredytowa do wersji próbnej.
- Bazowy URL:
https://api.llminferenceapi.com/v1 - Nagłówek:
Authorization: Bearer YOUR_API_KEY - ID modelu:
uncensored
Ta konfiguracja działa z dowolnym oficjalnym SDK OpenAI lub kompatybilną biblioteką klienta. Zachowujesz istniejącą strukturę kodu; zmienia się tylko endpoint i klucz.
Pierwsze zapytanie
Wykonaj pierwsze zapytanie do endpointu chat completions. ID modelu to uncensored. To model o otwartych wagach dużego modelu językowego, dostrojony do odpowiadania bez odmów treści dla prawnego użytku dorosłych, a nie GPT ani Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Treść żądania zawiera standardową tablicę messages. Możesz określić temperaturę, maksymalną liczbę tokenów i inne standardowe parametry. API zwraca standardową odpowiedź chat completion ze statystykami użycia tokenów. Jeśli napotkasz błąd 401, Twój klucz jest nieprawidłowy. Błąd 402 oznacza, że Twój przedpłacony kredyt został wyczerpany.
Integracja z Python SDK
Korzystanie z Python SDK jest proste. Zainicjuj klienta podając nasz bazowy URL i swój klucz API. Struktura kodu odzwierciedla standardowy wzorzec OpenAI. Pozwala to wstawić naszą usługę proxy llm bez przepisywania logiki aplikacji.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Upewnij się, że przekazujesz argument model='uncensored'. Obiekt odpowiedzi zawiera wygenerowany tekst i metryki użycia. To podejście jest idealne dla programistów, którzy chcą gotowego rozwiązania api kompatybilnego z openai. Nie są wymagane dodatkowe zależności poza standardowym SDK.
Użycie Node.js SDK
Dla programistów Node.js integracja jest równie prosta. Ustaw baseURL i apiKey w konfiguracji klienta. SDK obsługuje żądania HTTP do naszych endpointów api czatu ai automatycznie.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Wywołaj chat.completions.create() z ID modelu uncensored. Możesz strumieniować odpowiedzi lub przetwarzać je jako kompletne obiekty. Ta elastyczność wspiera zarówno przetwarzanie wsadowe, jak i interakcje w czasie rzeczywistym. API obsługuje wywoływanie narzędzi, pozwalając zdefiniować funkcje, które model może wywołać.
Strumieniowanie odpowiedzi
Dla doświadczeń w czasie rzeczywistym włącz strumieniowanie. Ustaw parametr stream na true w swoim żądaniu. API zwraca strumień zdarzeń wysłanych przez serwer (SSE) z częściowymi odpowiedziami.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Każdy chunk zawiera częściowy deltę odpowiedzi. Możesz renderować te tokeny użytkownikowi w miarę ich przybywania, co zmniejsza postrzegane opóźnienie. Jest to kluczowe dla interfejsów czatu, gdzie oczekiwana jest natychmiastowa informacja zwrotna. Odpowiedź strumieniowana zawiera te same informacje o użyciu tokenów co zapytania niestrumieniowe.
Limity, błędy i kontekst
Nasze API narzuca okno kontekstu 100 000 tokenów dla sumy wejścia i wyjścia. Wspiera to długie dokumenty i złożone rozmowy. Limit zapytań wynosi 300 zapytań na minutę na klucz. Jeśli go przekroczysz, otrzymasz błąd 429. Treść żądania jest ograniczona do 8 MB.
Typowe błędy to 401 (nieprawidłowy klucz), 402 (niewystarczający kredyt) i 429 (limit zapytań). Kredyty nigdy nie wygasają, więc możesz je doładować, gdy chcesz. Kredyty przedpłacone zaczynają się od $10, z bonusami za większe wpłaty. Ten model ai api z płatnością za użycie zapewnia, że płacisz tylko za to, czego używasz.
Parametry API
Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.
| Element | Wartość |
|---|---|
| Format API | zgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz |
| Base URL | https://api.llminferenceapi.com/v1 |
| Uwierzytelnianie | Authorization: Bearer YOUR_KEY |
| Endpointy | POST /v1/chat/completions · GET /v1/models |
| ID modelu | uncensored |
| Maks. odpowiedź | do reszty okna 64 000 tokenów; max_tokens opcjonalne (bez osobnego limitu) |
| Parametry | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Strumieniowanie | tak — server-sent events; ostatni fragment zawiera zużycie tokenów |
| Tryb JSON | response_format: {"type": "json_object"} |
| Wywoływanie funkcji | tak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool |
| Okno kontekstu | 64 000 tokenów (wejście + odpowiedź) |
| Rozmiar zapytania | do 8 MB |
| Limit zapytań | 300 zapytań na minutę na klucz |
| Równoległe zapytania | do 8 jednocześnie na klucz |
| Nagłówki odpowiedzi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Ważność | opłacony kredyt nie wygasa, bez subskrypcji |
| Bonus | +5% od $50, +10% od $100 |
| Darmowy kredyt | $0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu |
| Cena | $0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia |
| Doładowanie | USDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500 |
| Rozliczenie | przedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe |
| Logowanie | Google albo e-mail i hasło |
| Treści | treści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane |
| Klucze | jeden aktywny klucz na konto; nowy zastępuje stary |
Kody błędów
Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.
| Kod | Typ | Znaczenie |
|---|---|---|
400 | bad_request | błędny JSON, puste wiadomości, zły parametr lub za długi kontekst |
401 | missing_key · invalid_key · key_revoked | brak klucza, zły klucz lub klucz zastąpiony nowym |
402 | no_credit | brak kredytu — doładuj, działa od razu |
403 | content_blocked | treści seksualne z nieletnimi — odmowa, bez opłaty |
404 | not_found | nieznany endpoint |
413 | request_too_large | treść większa niż 8 MB |
429 | rate_limited · concurrency | ponad 300/min lub 8 równolegle — odczekaj i ponów |
503 | upstream_busy | model zajęty — ponów za kilka sekund |
Pytania i odpowiedzi
Czy to API nadaje się do aplikacji produkcyjnych?
Tak, zostało zaprojektowane do użytku produkcyjnego ze standardowymi limitami zapytań i niezawodnymi endpointami. Nie oferuje jednak gwarancji SLA ani certyfikacji enterprise, takich jak SOC2. Najlepsze dla aplikacji, które cenią sobie wyjście bez cenzury i elastyczne ceny ponad formalne gwarancje enterprise.
Co oznacza 'bez cenzury' dla tego modelu?
Model nie odrzuca legalnych tematów dla dorosłych, fikcyjnych, badawczych w zakresie bezpieczeństwa lub kontrowersyjnych. Generuje treści, które inne modele mogłyby zablokować ze względu na filtry bezpieczeństwa. Jedynym twardym limitem jest całkowite blokowanie treści seksualnych z udziałem małoletnich.
Czy potrzebuję karty kredytowej, aby zacząć?
Nie. Możesz się zarejestrować podając tylko e-mail i hasło. Każde nowe konto otrzymuje $0.50 kredytu próbnego ważnego przez 7 dni. Kredyty możesz doładować później używając kryptowalut (USDT lub USDC), gdy będziesz gotowy do skalowania.
Twój klucz jest o jeden formularz stąd
Utwórz konto, skopiuj klucz, zmień bazowy URL. To cały proces konfiguracji.
Pobierz klucz API