DE ▾
API-Schlüssel erhalten

LLM Inference APIDokumentation

Inference-API: Schnellstartanleitung

Starten Sie mit unserer unzensierten Inference-API in weniger als fünf Minuten. Ändern Sie Ihre Basis-URL und Ihren API-Schlüssel und führen Sie Ihren bestehenden LLM-Code gegen unser Open-Weight-Modell mit transparenter Token-Abrechnung aus.

Basis-URL und Authentifizierung

Unsere API ist vollständig OpenAI-kompatibel. Zum Wechseln aktualisierst du die Client-Konfiguration, sodass sie auf unsere Basis-URL zeigt, und gibst deinen API-Schlüssel an. Die Basis-URL ist https://api.llminferenceapi.com/v1. Die Authentifizierung erfolgt über den Standard-Authorization: Bearer-Header. Du erhältst deinen Schlüssel sofort nach der Anmeldung mit E-Mail und Passwort – für die Testversion werden keine Telefonnummer oder Kreditkarte benötigt.

  • Basis-URL: https://api.llminferenceapi.com/v1
  • Header: Authorization: Bearer YOUR_API_KEY
  • Modell-ID: uncensored

Dieses Setup funktioniert mit jedem offiziellen OpenAI-SDK oder kompatiblen Client-Bibliothek. Du behältst deine bestehende Code-Struktur bei; nur der Endpunkt und der Schlüssel ändern sich.

Erste Anfrage

Mache deinen ersten Aufruf am Chat-Completion-Endpunkt. Die Modell-ID ist uncensored. Dieses Modell ist ein Open-Weight-Modell, das darauf abgestimmt ist, ohne Inhaltsablehnungen für die legale Nutzung durch Erwachsene zu antworten, und kein GPT oder Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Der Anforderungstext enthält das Standard-messages-Array. Du kannst Temperatur, maximale Token und andere Standardparameter angeben. Die API gibt eine Standard-Chat-Antwort mit Token-Nutzungsstatistiken zurück. Wenn du einen 401-Fehler erhältst, ist dein Schlüssel ungültig. Ein 402-Fehler bedeutet, dass dein Prepaid-Guthaben aufgebraucht ist.

Python SDK-Integration

Die Verwendung des Python SDK ist unkompliziert. Initialisiere den Client mit unserer Basis-URL und deinem API-Schlüssel. Die Code-Struktur spiegelt das Standard-OpenAI-Muster wider. Dies ermöglicht es dir, unseren LLM-Proxy-Dienst einzusetzen, ohne die Anwendungslogik neu zu schreiben.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Stelle sicher, dass du das Argument model='uncensored' übergibst. Das Antwortobjekt enthält den generierten Text und die Nutzungsmetriken. Dieser Ansatz ist ideal für Entwickler, die eine sofort einsetzbare OpenAI-kompatible API-Lösung wünschen. Es sind keine zusätzlichen Abhängigkeiten neben dem Standard-SDK erforderlich.

Node.js SDK-Nutzung

Für Node.js-Entwickler ist die Integration ebenso einfach. Lege die baseURL und apiKey in deiner Client-Konfiguration fest. Das SDK verarbeitet die HTTP-Anfragen an unsere AI-Chat-API-Endpunkte automatisch.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Rufe chat.completions.create() mit der Modell-ID uncensored auf. Du kannst Antworten streamen oder sie als vollständige Objekte verarbeiten. Diese Flexibilität unterstützt sowohl Batch-Verarbeitung als auch Echtzeit-Benutzerinteraktionen. Die API unterstützt Function Calling, sodass du Funktionen definieren kannst, die das Modell aufrufen kann.

Streaming-Antworten

Für Echtzeit-Benutzererfahrungen aktivieren Sie das Streaming. Legen Sie den Parameter stream in Ihrer Anfrage auf true fest. Die API gibt einen Server-Sent Events (SSE)-Stream von Teilantworten zurück.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Jeder Chunk enthält eine partielle Delta der Antwort. Sie können diese Token an den Benutzer rendern, während sie eintreffen, was die wahrgenommene Latenz reduziert. Dies ist kritisch für Chat-Schnittstellen, bei denen sofortiges Feedback erwartet wird. Die Streaming-Antwort enthält dieselben Token-Nutzungsinformationen wie Nicht-Streaming-Anfragen.

Grenzen, Fehler und Kontext

Unsere API erzwingt ein Kontextfenster von 100.000 Token für Eingabe und Ausgabe zusammen. Dies unterstützt lange Dokumente und komplexe Gespräche. Das Ratenlimit ist auf 300 Anfragen pro Minute pro Schlüssel festgelegt. Wenn du dieses überschreitest, erhältst du einen 429-Fehler. Anforderungstexte sind auf 8 MB begrenzt.

Häufige Fehler sind 401 (ungültiger Schlüssel), 402 (unzureichendes Guthaben) und 429 (Ratenlimit). Guthaben verfällt nie, sodass du jederzeit nachladen kannst. Prepaid-Guthaben beginnen bei $10, mit Boni für größere Einzahlungen. Dieses Pay as you go-Modell stellt sicher, dass du nur für das zahlst, was du nutzt.

API-Spezifikation

Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
Base-URLhttps://api.llminferenceapi.com/v1
AuthentifizierungAuthorization: Bearer YOUR_KEY
EndpunktePOST /v1/chat/completions · GET /v1/models
Modell-IDuncensored
Max. Ausgabebis zum Rest des 64.000-Token-Fensters; max_tokens optional (kein separates Limit)
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
JSON-Modusresponse_format: {"type": "json_object"}
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
Kontextfenster64.000 Tokens (Eingabe + Ausgabe)
Anfragegrößebis 8 MB
Ratenlimit300 Anfragen pro Minute und Schlüssel
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
Bonus+5 % ab $50, +10 % ab $100
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
AnmeldungGoogle oder E-Mail und Passwort
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten

Fehler und Lösungen

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen

Fragen und Antworten

Ist diese API für Produktionsanwendungen geeignet?

Ja, sie ist für den Produktionsbetrieb mit Standard-Ratenlimits und zuverlässigen Endpunkten ausgelegt. Sie bietet jedoch keine SLA-Garantien oder Unternehmenszertifizierungen wie SOC2. Sie eignet sich am besten für Anwendungen, die unzensierte Ausgaben und flexible Preise vor formellen Unternehmensgarantien stellen.

Was bedeutet „unzensiert“ für dieses Modell?

Das Modell lehnt legale erwachsene, fiktive, sicherheitsrelevante oder kontroverse Themen nicht ab. Es generiert Inhalte, die andere Modelle aufgrund von Sicherheitsfiltern blockieren würden. Die einzige harte Grenze ist, dass sexuell explizite Inhalte mit Minderjährigen immer blockiert werden.

Brauche ich eine Kreditkarte zum Starten?

Nein. Sie können sich nur mit E-Mail und Passwort anmelden. Jedes neue Konto erhält $0,50 an Testguthaben, das 7 Tage gültig ist. Sie können später Guthaben per Krypto (USDT oder USDC) aufladen, wenn Sie bereit sind zu skalieren.

Dein Schlüssel ist nur ein Formular entfernt

Erstellen Sie ein Konto, kopieren Sie den Schlüssel, ändern Sie die Basis-URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhalten