NL ▾
API-sleutel aanvragen

LLM Inference APIDocs

Inference API: Snelstartgids

Kom in minder dan vijf minuten van start met onze ongecensureerde inference API. Pas je base URL en API-sleutel aan en voer je bestaande LLM-code uit tegen ons open-weight model met transparante per-token prijzen.

Base URL en Authenticatie

Onze API is volledig OpenAI compatible. Om over te schakelen, pas je je clientconfiguratie aan om te verwijzen naar onze base URL en geef je je API-sleutel op. De base URL is https://api.llminferenceapi.com/v1. Authenticatie wordt afgehandeld via de standaard Authorization: Bearer header. Je ontvangt je sleutel direct na het aanmelden met alleen een e-mailadres en wachtwoord—geen telefoonnummer of creditcard nodig voor de proefversie.

  • Basis-URL: https://api.llminferenceapi.com/v1
  • Koptekst: Authorization: Bearer YOUR_API_KEY
  • Model-ID: uncensored

Deze setup werkt met elke officiële OpenAI SDK of compatibele clientbibliotheek. Je behoudt je bestaande codestructuur; alleen het endpoint en de sleutel veranderen.

Eerste Verzoek

Maak je eerste aanroep naar de chat-completies endpoint. De model-ID is uncensored. Dit model is een open-weight large language model dat is afgestemd op het geven van antwoorden zonder inhoudsrefusies voor wettelijk volwassen gebruik, geen GPT of Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

De request body bevat de standaard messages array. Je kunt temperature, max tokens en andere standaard parameters specificeren. De API retourneert een standaard chat completion response met token usage statistics. Als je een 401 fout tegenkomt, is je sleutel ongeldig. Een 402 fout betekent dat je prepaid credits op zijn.

Python SDK Integratie

Het gebruik van de Python SDK is eenvoudig. Initialiseer de client met onze basis-URL en je API-sleutel. De code-structuur lijkt op het standaard OpenAI-patroon. Hiermee kun je onze llm proxy dienst inwisselen zonder de logica van je applicatie te herschrijven.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Zorg dat je de model='uncensored' parameter doorgeeft. Het response-object bevat de gegenereerde tekst en gebruiksmetrieken. Deze aanpak is ideaal voor ontwikkelaars die een drop-in openai compatible api oplossing willen. Er zijn geen extra afhankelijkheden nodig naast de standaard SDK.

Gebruik van de Node.js SDK

Voor Node.js ontwikkelaars is de integratie net zo eenvoudig. Stel de baseURL en apiKey in je clientconfiguratie in. De SDK verwerkt de HTTP-verzoeken naar onze ai chat api endpoints automatisch.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Roep chat.completions.create() aan met de model-ID uncensored. Je kunt antwoorden streamen of ze als volledige objecten verwerken. Deze flexibiliteit ondersteunt zowel batchverwerking als real-time gebruikersinteracties. De API ondersteunt function calling, zodat je functies kunt definiëren die het model kan aanroepen.

Streaming antwoorden

Schakel streaming in voor realtime gebruikerservaringen. Stel de stream parameter in op true in je verzoek. De API retourneert een Server-Sent Events (SSE)-stream van gedeeltelijke responsen.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Elk chunk bevat een gedeeltelijke delta van de respons. Je kunt deze tokens aan de gebruiker tonen zodra ze aankomen, wat de waargenomen latentie vermindert. Dit is cruciaal voor chatinterfaces waarbij directe feedback wordt verwacht. De streaming-response bevat dezelfde token-gebruiksgegevens als niet-streaming-verzoeken.

Limieten, Fouten en Context

Onze API hanteert een contextvenster van 100.000 tokens voor zowel input als output samen. Dit ondersteunt lange documenten en complexe gesprekken. Rate limiting is ingesteld op 300 verzoeken per minuut per sleutel. Als je dit overschrijdt, ontvang je een 429-fout. Request bodies zijn beperkt tot 8 MB.

Veelvoorkomende fouten zijn 401 (ongeldige sleutel), 402 (onvoldoende credits) en 429 (rate limit). Credits vervallen nooit, dus je kunt opwaarderen wanneer het jou schikt. Prepaid credits beginnen bij $10, met bonussen voor grotere stortingen. Dit pay as you go ai api model zorgt ervoor dat je alleen betaalt voor wat je gebruikt.

API-specificaties

Alle echte limieten en functies van de API op één plek — controleer ze voordat je opwaardeert.

OnderdeelWaarde
API-formaatOpenAI-compatibel: elke OpenAI-SDK werkt — vervang alleen base URL en sleutel
Base URLhttps://api.llminferenceapi.com/v1
AuthenticatieAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
Model-IDuncensored
Max. uitvoertot de rest van het venster van 64.000 tokens; max_tokens optioneel (geen aparte limiet)
Parameterstemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingja — server-sent events; het laatste deel bevat het tokenverbruik
JSON-modusresponse_format: {"type": "json_object"}
Function callingja — tools, tool_choice; antwoorden bevatten tool_calls, ook bij streaming; resultaten als role: tool
Contextvenster64.000 tokens (invoer + uitvoer)
Verzoekgroottetot 8 MB
Rate limit300 verzoeken per minuut per sleutel
Gelijktijdige verzoekentot 8 tegelijk per sleutel
ResponsheadersX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Geldigheidbetaald tegoed verloopt niet, geen abonnement
Bonus+5% vanaf $50, +10% vanaf $100
Gratis proeftegoed$0,50 voor 7 dagen, zonder kaart · Proefsleutel: 2 parallelle verzoeken, 60 per minuut; volledige limieten (8 en 300) na eerste opwaardering
Prijs$0,25 per 1 mln invoertokens · $1,00 per 1 mln uitvoertokens
OpwaarderenUSDT (TRC20) of USDC (Base), elk heel bedrag van $10 tot $500
Afrekeningprepaid tegoed op basis van echt verbruik; fouten en weigeringen zijn gratis
InloggenGoogle of e-mail en wachtwoord
Inhoudinhoud voor volwassenen toegestaan; seksuele inhoud met minderjarigen wordt geweigerd
Sleutelséén actieve sleutel per account; een nieuwe vervangt de oude

Foutcodes

Fouten komen als JSON met een vaste type; mislukte of geweigerde verzoeken kosten niets.

CodeTypeBetekenis
400bad_requestongeldige JSON, lege berichten, verkeerde parameter of context te lang
401missing_key · invalid_key · key_revokedsleutel ontbreekt, is onjuist of is vervangen
402no_creditgeen tegoed — waardeer op en ga direct verder
403content_blockedseksuele inhoud met minderjarigen — geweigerd, niet gerekend
404not_foundonbekend endpoint
413request_too_largebody groter dan 8 MB
429rate_limited · concurrencymeer dan 300/min of 8 tegelijk — wacht en probeer opnieuw
503upstream_busymodel bezet — probeer het over enkele seconden opnieuw

Vragen en antwoorden

Is deze API geschikt voor productieomgevingen?

Ja, deze is ontworpen voor productiegebru met standaard rate limits en betrouwbare endpoints. Het biedt echter geen SLA-garanties of enterprise-certificeringen zoals SOC2. Het is het beste voor applicaties die ongecensureerde output en flexibele prijzen belangrijker vinden dan formele enterprise-garanties.

Wat betekent 'ongecensureerd' voor dit model?

Het model weigert geen wettelijke volwassen, fictieve, security-research of controversiële onderwerpen. Het genereert inhoud die andere modellen mogelijk blokkeren vanwege veiligheidsfilters. De enige harde limiet is dat seksuele inhoud met minderden altijd wordt geblokkeerd.

Heb ik een creditcard nodig om te beginnen?

Nee. Je kunt je aanmelden met alleen een e-mailadres en wachtwoord. Elk nieuw account ontvangt $0,50 aan proeftegoed dat 7 dagen geldig is. Je kunt later credits toevoegen met crypto (USDT of USDC) wanneer je klaar bent om op te schalen.

Je sleutel is nog maar één formulier verwijderd

Maak een account aan, kopieer de sleutel, pas de base URL aan. Dat is de hele setup.

API-sleutel aanvragen