LLM Inference APIDokumentation
Inference-API: Schnellstartanleitung
Starten Sie mit unserer unzensierten Inference-API in weniger als fünf Minuten. Ändern Sie Ihre Basis-URL und Ihren API-Schlüssel und führen Sie Ihren bestehenden LLM-Code gegen unser Open-Weight-Modell mit transparenter Token-Abrechnung aus.
Basis-URL und Authentifizierung
Unsere API ist vollständig OpenAI-kompatibel. Zum Wechseln aktualisierst du die Client-Konfiguration, sodass sie auf unsere Basis-URL zeigt, und gibst deinen API-Schlüssel an. Die Basis-URL ist https://api.llminferenceapi.com/v1. Die Authentifizierung erfolgt über den Standard-Authorization: Bearer-Header. Du erhältst deinen Schlüssel sofort nach der Anmeldung mit E-Mail und Passwort – für die Testversion werden keine Telefonnummer oder Kreditkarte benötigt.
- Basis-URL:
https://api.llminferenceapi.com/v1 - Header:
Authorization: Bearer YOUR_API_KEY - Modell-ID:
uncensored
Dieses Setup funktioniert mit jedem offiziellen OpenAI-SDK oder kompatiblen Client-Bibliothek. Du behältst deine bestehende Code-Struktur bei; nur der Endpunkt und der Schlüssel ändern sich.
Erste Anfrage
Mache deinen ersten Aufruf am Chat-Completion-Endpunkt. Die Modell-ID ist uncensored. Dieses Modell ist ein Open-Weight-Modell, das darauf abgestimmt ist, ohne Inhaltsablehnungen für die legale Nutzung durch Erwachsene zu antworten, und kein GPT oder Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Der Anforderungstext enthält das Standard-messages-Array. Du kannst Temperatur, maximale Token und andere Standardparameter angeben. Die API gibt eine Standard-Chat-Antwort mit Token-Nutzungsstatistiken zurück. Wenn du einen 401-Fehler erhältst, ist dein Schlüssel ungültig. Ein 402-Fehler bedeutet, dass dein Prepaid-Guthaben aufgebraucht ist.
Python SDK-Integration
Die Verwendung des Python SDK ist unkompliziert. Initialisiere den Client mit unserer Basis-URL und deinem API-Schlüssel. Die Code-Struktur spiegelt das Standard-OpenAI-Muster wider. Dies ermöglicht es dir, unseren LLM-Proxy-Dienst einzusetzen, ohne die Anwendungslogik neu zu schreiben.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Stelle sicher, dass du das Argument model='uncensored' übergibst. Das Antwortobjekt enthält den generierten Text und die Nutzungsmetriken. Dieser Ansatz ist ideal für Entwickler, die eine sofort einsetzbare OpenAI-kompatible API-Lösung wünschen. Es sind keine zusätzlichen Abhängigkeiten neben dem Standard-SDK erforderlich.
Node.js SDK-Nutzung
Für Node.js-Entwickler ist die Integration ebenso einfach. Lege die baseURL und apiKey in deiner Client-Konfiguration fest. Das SDK verarbeitet die HTTP-Anfragen an unsere AI-Chat-API-Endpunkte automatisch.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Rufe chat.completions.create() mit der Modell-ID uncensored auf. Du kannst Antworten streamen oder sie als vollständige Objekte verarbeiten. Diese Flexibilität unterstützt sowohl Batch-Verarbeitung als auch Echtzeit-Benutzerinteraktionen. Die API unterstützt Function Calling, sodass du Funktionen definieren kannst, die das Modell aufrufen kann.
Streaming-Antworten
Für Echtzeit-Benutzererfahrungen aktivieren Sie das Streaming. Legen Sie den Parameter stream in Ihrer Anfrage auf true fest. Die API gibt einen Server-Sent Events (SSE)-Stream von Teilantworten zurück.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Jeder Chunk enthält eine partielle Delta der Antwort. Sie können diese Token an den Benutzer rendern, während sie eintreffen, was die wahrgenommene Latenz reduziert. Dies ist kritisch für Chat-Schnittstellen, bei denen sofortiges Feedback erwartet wird. Die Streaming-Antwort enthält dieselben Token-Nutzungsinformationen wie Nicht-Streaming-Anfragen.
Grenzen, Fehler und Kontext
Unsere API erzwingt ein Kontextfenster von 100.000 Token für Eingabe und Ausgabe zusammen. Dies unterstützt lange Dokumente und komplexe Gespräche. Das Ratenlimit ist auf 300 Anfragen pro Minute pro Schlüssel festgelegt. Wenn du dieses überschreitest, erhältst du einen 429-Fehler. Anforderungstexte sind auf 8 MB begrenzt.
Häufige Fehler sind 401 (ungültiger Schlüssel), 402 (unzureichendes Guthaben) und 429 (Ratenlimit). Guthaben verfällt nie, sodass du jederzeit nachladen kannst. Prepaid-Guthaben beginnen bei $10, mit Boni für größere Einzahlungen. Dieses Pay as you go-Modell stellt sicher, dass du nur für das zahlst, was du nutzt.
API-Spezifikation
Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Base-URL | https://api.llminferenceapi.com/v1 |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Modell-ID | uncensored |
| Max. Ausgabe | bis zum Rest des 64.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| JSON-Modus | response_format: {"type": "json_object"} |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| Kontextfenster | 64.000 Tokens (Eingabe + Ausgabe) |
| Anfragegröße | bis 8 MB |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Anmeldung | Google oder E-Mail und Passwort |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
Fehler und Lösungen
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |
Fragen und Antworten
Ist diese API für Produktionsanwendungen geeignet?
Ja, sie ist für den Produktionsbetrieb mit Standard-Ratenlimits und zuverlässigen Endpunkten ausgelegt. Sie bietet jedoch keine SLA-Garantien oder Unternehmenszertifizierungen wie SOC2. Sie eignet sich am besten für Anwendungen, die unzensierte Ausgaben und flexible Preise vor formellen Unternehmensgarantien stellen.
Was bedeutet „unzensiert“ für dieses Modell?
Das Modell lehnt legale erwachsene, fiktive, sicherheitsrelevante oder kontroverse Themen nicht ab. Es generiert Inhalte, die andere Modelle aufgrund von Sicherheitsfiltern blockieren würden. Die einzige harte Grenze ist, dass sexuell explizite Inhalte mit Minderjährigen immer blockiert werden.
Brauche ich eine Kreditkarte zum Starten?
Nein. Sie können sich nur mit E-Mail und Passwort anmelden. Jedes neue Konto erhält $0,50 an Testguthaben, das 7 Tage gültig ist. Sie können später Guthaben per Krypto (USDT oder USDC) aufladen, wenn Sie bereit sind zu skalieren.
Dein Schlüssel ist nur ein Formular entfernt
Erstellen Sie ein Konto, kopieren Sie den Schlüssel, ändern Sie die Basis-URL. Das ist die gesamte Einrichtung.
API-Schlüssel erhalten