API d'inférence : Guide de démarrage
Commencez avec notre API d'inférence sans censure en moins de cinq minutes. Modifiez votre URL de base et votre clé API, puis exécutez votre code LLM existant contre notre modèle à poids ouverts avec une tarification transparente par token.
URL de base et authentification
Notre API est entièrement compatible avec OpenAI. Pour changer, mettez à jour la configuration de votre client pour pointer vers notre URL de base et fournissez votre clé API. L'URL de base est https://api.llminferenceapi.com/v1. L'authentification se fait via l'en-tête standard Authorization: Bearer. Vous recevez votre clé immédiatement après vous être inscrit avec simplement un e-mail et un mot de passe — aucun numéro de téléphone ni carte bancaire requis pour l'essai.
- URL de base :
https://api.llminferenceapi.com/v1 - En-tête :
Authorization: Bearer YOUR_API_KEY - ID du modèle :
uncensored
Cette configuration fonctionne avec n'importe quel SDK officiel OpenAI ou bibliothèque cliente compatible. Vous conservez la structure de votre code existant ; seul l'endpoint et la clé changent.
Première requête
Effectuez votre premier appel vers l'endpoint de complétion de chat. L'ID du modèle est uncensored. Ce modèle est un grand modèle de langage à poids ouverts, ajusté pour répondre sans refus de contenu pour un usage adulte légal, et non GPT ou Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Le corps de la requête inclut le tableau standard messages. Vous pouvez spécifier la température, le nombre maximal de tokens et d'autres paramètres standards. L'API retourne une réponse de complétion de chat standard avec des statistiques d'utilisation des tokens. Si vous rencontrez une erreur 401, votre clé est invalide. Une erreur 402 signifie que vos crédits prépayés sont épuisés.
Intégration SDK Python
L'utilisation du SDK Python est simple. Initialisez le client avec notre URL de base et votre clé API. La structure du code reflète le modèle standard OpenAI. Cela vous permet d'intégrer notre service proxy llm sans réécrire la logique de votre application.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Assurez-vous de passer l'argument model='uncensored'. L'objet de réponse contient le texte généré et les métriques d'utilisation. Cette approche est idéale pour les développeurs qui souhaitent une solution API compatible openai prête à l'emploi. Aucune dépendance supplémentaire n'est requise au-delà du SDK standard.
Utilisation SDK Node.js
Pour les développeurs Node.js, l'intégration est tout aussi simple. Définissez baseURL et apiKey dans la configuration de votre client. Le SDK gère automatiquement les requêtes HTTP vers nos endpoints api de chat ia.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Appelez chat.completions.create() avec l'ID du modèle uncensored. Vous pouvez activer le streaming des réponses ou les gérer comme des objets complets. Cette flexibilité prend en charge à la fois le traitement par lots et les interactions utilisateur en temps réel. L'API prend en charge l'appel de fonctions, vous permettant de définir des fonctions que le modèle peut invoquer.
Réponses en streaming
Pour des expériences utilisateur en temps réel, activez le streaming. Définissez le paramètre stream sur true dans votre requête. L'API retourne un flux d'événements Server-Sent (SSE) de réponses partielles.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Chaque chunk contient un delta partiel de la réponse. Vous pouvez afficher ces tokens à l'utilisateur à mesure qu'ils arrivent, réduisant la latence perçue. C'est critique pour les interfaces de chat où un retour immédiat est attendu. La réponse en streaming inclut les mêmes informations d'utilisation des tokens que les requêtes non en streaming.
Limites, erreurs et contexte
Notre API applique une fenêtre de contexte de 100 000 tokens pour l'entrée et la sortie combinées. Cela prend en charge les longs documents et les conversations complexes. La limite de débit est fixée à 300 requêtes par minute par clé. Si vous dépassez cette limite, vous recevez une erreur 429. Les corps de requête sont limités à 8 Mo.
Les erreurs courantes incluent 401 (clé invalide), 402 (crédits insuffisants) et 429 (limite de débit). Les crédits n'expirent jamais, vous pouvez donc recharger à votre convenance. Les crédits prépayés commencent à 10 $, avec des bonus pour les dépôts plus importants. Ce modèle paiement à l'usage api ia garantit que vous ne payez que ce que vous utilisez.
Fiche technique de l'API
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Base URL | https://api.llminferenceapi.com/v1 |
| Authentification | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| ID du modèle | uncensored |
| Sortie max. | jusqu'au reste de la fenêtre de 64 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Mode JSON | response_format: {"type": "json_object"} |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Fenêtre de contexte | 64 000 tokens (entrée + sortie) |
| Taille | jusqu'à 8 Mo par requête |
| Limite de débit | 300 requêtes par minute et par clé |
| Concurrence | 8 requêtes simultanées par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Connexion | Google ou e-mail et mot de passe |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
Erreurs et solutions
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Cette API est-elle adaptée aux applications de production ?
Oui, elle est conçue pour la production avec des limites de débit standard et des endpoints fiables. Cependant, elle ne propose pas de garanties SLA ni de certifications enterprise comme SOC2. Elle est idéale pour les applications privilégiant les sorties sans censure et une tarification flexible plutôt que des garanties enterprise formelles.
Que signifie « sans censure » pour ce modèle ?
Le modèle ne refuse pas les sujets adultes licites, fictifs, liés à la recherche en sécurité ou controversés. Il génère du contenu que d'autres modèles pourraient bloquer en raison de leurs filtres de sécurité. La seule limite absolue est que le contenu sexuel impliquant des mineurs est toujours bloqué.
Ai-je besoin d'une carte bancaire pour commencer ?
Non. Vous pouvez vous inscrire avec simplement un email et un mot de passe. Chaque nouveau compte reçoit 0,50 $ de crédit d'essai valable 7 jours. Vous pouvez ajouter des crédits plus tard en utilisant des cryptomonnaies (USDT ou USDC) lorsque vous êtes prêt à passer à l'échelle.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.
Obtenir une clé API