PL ▾
Pobierz klucz API

LLM Inference APIDokumentacja

API inferencyjne: Przewodnik szybkiego startu

Zacznij pracę z naszym API inferencyjnym bez cenzury w mniej niż pięć minut. Zmień bazowy URL i klucz API, a następnie uruchom swój istniejący kod LLM przeciwko naszemu modelowi o otwartych wagach przy przejrzystym cenniku za token.

Bazowy URL i uwierzytelnianie

Nasze API jest w pełni kompatybilne z OpenAI. Aby przełączyć się, zaktualizuj konfigurację klienta, aby wskazywała nasz bazowy URL i podaj swój klucz API. Bazowy URL to https://api.llminferenceapi.com/v1. Uwierzytelnianie obsługiwane jest przez standardowy nagłówek Authorization: Bearer. Otrzymujesz klucz natychmiast po zarejestrowaniu się podając tylko e-mail i hasło — nie jest potrzebny numer telefonu ani karta kredytowa do wersji próbnej.

  • Bazowy URL: https://api.llminferenceapi.com/v1
  • Nagłówek: Authorization: Bearer YOUR_API_KEY
  • ID modelu: uncensored

Ta konfiguracja działa z dowolnym oficjalnym SDK OpenAI lub kompatybilną biblioteką klienta. Zachowujesz istniejącą strukturę kodu; zmienia się tylko endpoint i klucz.

Pierwsze zapytanie

Wykonaj pierwsze zapytanie do endpointu chat completions. ID modelu to uncensored. To model o otwartych wagach dużego modelu językowego, dostrojony do odpowiadania bez odmów treści dla prawnego użytku dorosłych, a nie GPT ani Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Treść żądania zawiera standardową tablicę messages. Możesz określić temperaturę, maksymalną liczbę tokenów i inne standardowe parametry. API zwraca standardową odpowiedź chat completion ze statystykami użycia tokenów. Jeśli napotkasz błąd 401, Twój klucz jest nieprawidłowy. Błąd 402 oznacza, że Twój przedpłacony kredyt został wyczerpany.

Integracja z Python SDK

Korzystanie z Python SDK jest proste. Zainicjuj klienta podając nasz bazowy URL i swój klucz API. Struktura kodu odzwierciedla standardowy wzorzec OpenAI. Pozwala to wstawić naszą usługę proxy llm bez przepisywania logiki aplikacji.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Upewnij się, że przekazujesz argument model='uncensored'. Obiekt odpowiedzi zawiera wygenerowany tekst i metryki użycia. To podejście jest idealne dla programistów, którzy chcą gotowego rozwiązania api kompatybilnego z openai. Nie są wymagane dodatkowe zależności poza standardowym SDK.

Użycie Node.js SDK

Dla programistów Node.js integracja jest równie prosta. Ustaw baseURL i apiKey w konfiguracji klienta. SDK obsługuje żądania HTTP do naszych endpointów api czatu ai automatycznie.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Wywołaj chat.completions.create() z ID modelu uncensored. Możesz strumieniować odpowiedzi lub przetwarzać je jako kompletne obiekty. Ta elastyczność wspiera zarówno przetwarzanie wsadowe, jak i interakcje w czasie rzeczywistym. API obsługuje wywoływanie narzędzi, pozwalając zdefiniować funkcje, które model może wywołać.

Strumieniowanie odpowiedzi

Dla doświadczeń w czasie rzeczywistym włącz strumieniowanie. Ustaw parametr stream na true w swoim żądaniu. API zwraca strumień zdarzeń wysłanych przez serwer (SSE) z częściowymi odpowiedziami.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Każdy chunk zawiera częściowy deltę odpowiedzi. Możesz renderować te tokeny użytkownikowi w miarę ich przybywania, co zmniejsza postrzegane opóźnienie. Jest to kluczowe dla interfejsów czatu, gdzie oczekiwana jest natychmiastowa informacja zwrotna. Odpowiedź strumieniowana zawiera te same informacje o użyciu tokenów co zapytania niestrumieniowe.

Limity, błędy i kontekst

Nasze API narzuca okno kontekstu 100 000 tokenów dla sumy wejścia i wyjścia. Wspiera to długie dokumenty i złożone rozmowy. Limit zapytań wynosi 300 zapytań na minutę na klucz. Jeśli go przekroczysz, otrzymasz błąd 429. Treść żądania jest ograniczona do 8 MB.

Typowe błędy to 401 (nieprawidłowy klucz), 402 (niewystarczający kredyt) i 429 (limit zapytań). Kredyty nigdy nie wygasają, więc możesz je doładować, gdy chcesz. Kredyty przedpłacone zaczynają się od $10, z bonusami za większe wpłaty. Ten model ai api z płatnością za użycie zapewnia, że płacisz tylko za to, czego używasz.

Parametry API

Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.

ElementWartość
Format APIzgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz
Base URLhttps://api.llminferenceapi.com/v1
UwierzytelnianieAuthorization: Bearer YOUR_KEY
EndpointyPOST /v1/chat/completions · GET /v1/models
ID modeluuncensored
Maks. odpowiedźdo reszty okna 64 000 tokenów; max_tokens opcjonalne (bez osobnego limitu)
Parametrytemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Strumieniowanietak — server-sent events; ostatni fragment zawiera zużycie tokenów
Tryb JSONresponse_format: {"type": "json_object"}
Wywoływanie funkcjitak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool
Okno kontekstu64 000 tokenów (wejście + odpowiedź)
Rozmiar zapytaniado 8 MB
Limit zapytań300 zapytań na minutę na klucz
Równoległe zapytaniado 8 jednocześnie na klucz
Nagłówki odpowiedziX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Ważnośćopłacony kredyt nie wygasa, bez subskrypcji
Bonus+5% od $50, +10% od $100
Darmowy kredyt$0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu
Cena$0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia
DoładowanieUSDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500
Rozliczenieprzedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe
LogowanieGoogle albo e-mail i hasło
Treścitreści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane
Kluczejeden aktywny klucz na konto; nowy zastępuje stary

Kody błędów

Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.

KodTypZnaczenie
400bad_requestbłędny JSON, puste wiadomości, zły parametr lub za długi kontekst
401missing_key · invalid_key · key_revokedbrak klucza, zły klucz lub klucz zastąpiony nowym
402no_creditbrak kredytu — doładuj, działa od razu
403content_blockedtreści seksualne z nieletnimi — odmowa, bez opłaty
404not_foundnieznany endpoint
413request_too_largetreść większa niż 8 MB
429rate_limited · concurrencyponad 300/min lub 8 równolegle — odczekaj i ponów
503upstream_busymodel zajęty — ponów za kilka sekund

Pytania i odpowiedzi

Czy to API nadaje się do aplikacji produkcyjnych?

Tak, zostało zaprojektowane do użytku produkcyjnego ze standardowymi limitami zapytań i niezawodnymi endpointami. Nie oferuje jednak gwarancji SLA ani certyfikacji enterprise, takich jak SOC2. Najlepsze dla aplikacji, które cenią sobie wyjście bez cenzury i elastyczne ceny ponad formalne gwarancje enterprise.

Co oznacza 'bez cenzury' dla tego modelu?

Model nie odrzuca legalnych tematów dla dorosłych, fikcyjnych, badawczych w zakresie bezpieczeństwa lub kontrowersyjnych. Generuje treści, które inne modele mogłyby zablokować ze względu na filtry bezpieczeństwa. Jedynym twardym limitem jest całkowite blokowanie treści seksualnych z udziałem małoletnich.

Czy potrzebuję karty kredytowej, aby zacząć?

Nie. Możesz się zarejestrować podając tylko e-mail i hasło. Każde nowe konto otrzymuje $0.50 kredytu próbnego ważnego przez 7 dni. Kredyty możesz doładować później używając kryptowalut (USDT lub USDC), gdy będziesz gotowy do skalowania.

Twój klucz jest o jeden formularz stąd

Utwórz konto, skopiuj klucz, zmień bazowy URL. To cały proces konfiguracji.

Pobierz klucz API