Inférence LLM sans censure
Inference API d'inférence sans censure pour les développeurs
Une API d'inférence compatible OpenAI prêt à l’emploi servant un seul modèle à poids ouverts sans censure. Modifiez votre base_url et votre clé, gardez le code.
- Un seul modèle sans censure
- Aucun frais mensuel
- Les crédits n'expirent jamais
Essayez avec une seule requête
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Ce que vous obtenez
Compatibilité intégrée
Fonctionne avec les SDK officiels OpenAI et tout client compatible. Il suffit de mettre à jour votre base_url vers https://api.llminferenceapi.com/v1 et d'échanger votre clé API.
Sortie sans censure
Le modèle répond sans refus de contenu pour les sujets adultes licites, fictionnels ou controversés. Seuls les contenus sexuels impliquant des mineurs sont bloqués.
Hébergement GPU direct
Nous exécutons le modèle sur nos propres serveurs, pas en tant que revendeur. Pas de routage fournisseur, pas de couches cachées, juste de l'inférence directe.
Tarification transparente
Payez uniquement ce que vous utilisez. Les tokens d'entrée coûtent 0,25 $/1M, les tokens de sortie coûtent 1,00 $/1M. Pas d'abonnements ni de dates d'expiration sur les crédits.
Streaming et outils
Prend en charge les événements envoyés par le serveur (SSE) pour le streaming de réponses et les endpoints standard d'appel de fonctions.
Confidentialité d'abord
Les prompts ne sont pas utilisés pour entraîner votre modèle. La création de compte nécessite uniquement une adresse e-mail et un mot de passe.
Comment ça marche
Créer un compte
Inscrivez-vous avec une adresse e-mail et un mot de passe pour obtenir votre clé API instantanément.
Ajouter du crédit
Rechargez avec de la crypto (USDT ou USDC) pour commencer à utiliser le service.
Démarrer l'inférence
Configurez votre code client existant pour pointer vers notre base_url et envoyez des requêtes.
Ce que les gens construisent avec cela
Écriture créative
Générez des histoires et des scripts sans moralisation indésirable ni filtres de contenu limitant vos choix narratifs. Parfait pour la fiction adulte ou l'humour audacieux.
Extraction de données
Analysez de grands documents grâce à une fenêtre de contexte de 100 000 tokens pour extraire des données structurées à partir de textes longs sans perdre le contexte.
Recherche et analyse
Obtenez des réponses sans filtre sur des sujets controversés ou de niche sans que le modèle refuse de s'engager en raison des directives de sécurité standard.
Applications de chat
Créez des interfaces de chat qui semblent naturelles et réactives, prenant en charge les réponses en streaming pour une meilleure expérience utilisateur.
Compatibilité OpenAI intégrée
Arrêtez de réécrire le code d'intégration pour chaque nouveau modèle. Notre API implémente l'endpoint standard /v1/chat/completions, ce qui signifie que vous pouvez passer à notre modèle sans censure en modifiant simplement la base_url et la api_key dans vos clients SDK OpenAI existants. Nous prenons en charge le streaming via Server-Sent Events (SSE) et l'appel de fonctions, donc votre logique existante pour gérer les sorties d'outils ou la génération de texte en temps réel fonctionne directement.
Il ne s'agit pas d'une passerelle multi-modèles ou d'un proxy complexe qui ajoute de la latence. C'est une connexion directe vers nos serveurs GPU exécutant un seul modèle à poids ouverts optimisé. Vous bénéficiez des performances d'un endpoint dédié avec la familiarité du format OpenAI.
Sans censure et sans filtre
Notre modèle est ajusté pour répondre sans refus de contenu pour un usage adulte licite, des récits fictionnels, la recherche en sécurité ou des sujets controversés. Alors que la plupart des modèles standard refuseront poliment de discuter de sujets sensibles ou de générer du contenu mature, notre modèle fournira une réponse directe.
Il existe une limite stricte qui s'applique toujours : les requêtes contenant du contenu sexuel impliquant des mineurs sont bloquées. Tout le reste est possible. Cela le rend idéal pour les applications où vous souhaitez un contrôle total sur la sortie sans que le modèle agisse comme un gardien pour les requêtes légitimes de vos utilisateurs.
Tarification transparente à l'usage
Nous ne vous imposons pas d'abonnements mensuels ni de plans par paliers. Vous payez exactement pour les tokens que vous consommez. Les tokens d'entrée coûtent 0,25 $ par million, et les tokens de sortie coûtent 1,00 $ par million. Lorsque vous rechargez votre compte, ces crédits n'expirent jamais, vous pouvez donc recharger lorsque cela convient à votre budget.
Nous offrons des bonus pour les dépôts plus importants : +5 % de crédit sur les dépôts de 50 $ et +10 % sur les dépôts de 100 $. Les nouveaux comptes commencent avec 0,50 $ de crédit d'essai gratuit valable 7 jours, sans carte de crédit requise. Cette structure garantit que vous ne dépensez que ce que vous utilisez, sans frais cachés pour le streaming ou l'utilisation d'outils.
Ce n'est PAS pour vous
Si vous avez besoin de génération d'images, de traitement audio ou d'embeddings, cette API n'est pas faite pour vous. Nous ne proposons que du texte. Si vous avez besoin d'acheminement de modèles entre plusieurs fournisseurs (comme GPT-4, Claude et Llama en une seule requête), nous ne proposons pas cette fonctionnalité. Nous nous concentrons sur l'expérience optimale pour un seul modèle sans censure. Si vous avez besoin de garanties SLA strictes, de certifications SOC2 ou de la conformité HIPAA out-of-the-box, vous devriez vous tourner vers des fournisseurs de niveau entreprise. Nous sommes un endpoint d'infrastructure simple, pensé pour les développeurs.
Questions et réponses
S'agit-il d'un proxy OpenAI ?
Non. Nous ne revendons pas les modèles d'OpenAI. Nous hébergeons notre propre modèle à poids ouverts sur nos propres serveurs GPU. Il est compatible OpenAI au niveau du format, ce qui signifie qu'il accepte les mêmes structures JSON et commandes SDK, mais le modèle sous-jacent est le nôtre.
Quelle est la taille de la fenêtre de contexte ?
Notre modèle prend en charge une fenêtre de contexte de 100 000 tokens, en comptant à la fois le prompt et la completion. Cela permet de traiter de grands documents ou de conserver l'historique de longues conversations.
Mes prompts sont-ils utilisés pour l'entraînement ?
Non. Nous n'utilisons pas vos données de prompt pour entraîner notre modèle. Vos données restent privées pour vos requêtes d'inférence.
Comment commencer ?
Inscrivez-vous avec une adresse e-mail et un mot de passe sur la page Clé API. Vous recevrez une clé API immédiatement. Vous pouvez commencer à utiliser le crédit d'essai gratuit de 0,50 $ sans ajouter de carte de crédit.
Que se passe-t-il si je dépasse la limite de débit ?
Nous autorisons 300 requêtes par minute par clé API. Si vous dépassez ce seuil, vous recevrez une erreur 429. Vous pouvez régénérer votre clé API à tout moment pour réinitialiser le compteur si nécessaire.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.
Obtenir une clé API