FR ▾
Obtenir une clé API

Inférence LLM sans censure

Inference API d'inférence sans censure pour les développeurs

Une API d'inférence compatible OpenAI prêt à l’emploi servant un seul modèle à poids ouverts sans censure. Modifiez votre base_url et votre clé, gardez le code.

  • Un seul modèle sans censure
  • Aucun frais mensuel
  • Les crédits n'expirent jamais

Essayez avec une seule requête

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Ce que vous obtenez

Compatibilité intégrée

Fonctionne avec les SDK officiels OpenAI et tout client compatible. Il suffit de mettre à jour votre base_url vers https://api.llminferenceapi.com/v1 et d'échanger votre clé API.

Sortie sans censure

Le modèle répond sans refus de contenu pour les sujets adultes licites, fictionnels ou controversés. Seuls les contenus sexuels impliquant des mineurs sont bloqués.

Hébergement GPU direct

Nous exécutons le modèle sur nos propres serveurs, pas en tant que revendeur. Pas de routage fournisseur, pas de couches cachées, juste de l'inférence directe.

Tarification transparente

Payez uniquement ce que vous utilisez. Les tokens d'entrée coûtent 0,25 $/1M, les tokens de sortie coûtent 1,00 $/1M. Pas d'abonnements ni de dates d'expiration sur les crédits.

Streaming et outils

Prend en charge les événements envoyés par le serveur (SSE) pour le streaming de réponses et les endpoints standard d'appel de fonctions.

Confidentialité d'abord

Les prompts ne sont pas utilisés pour entraîner votre modèle. La création de compte nécessite uniquement une adresse e-mail et un mot de passe.

Comment ça marche

  1. Créer un compte

    Inscrivez-vous avec une adresse e-mail et un mot de passe pour obtenir votre clé API instantanément.

  2. Ajouter du crédit

    Rechargez avec de la crypto (USDT ou USDC) pour commencer à utiliser le service.

  3. Démarrer l'inférence

    Configurez votre code client existant pour pointer vers notre base_url et envoyez des requêtes.

Ce que les gens construisent avec cela

Écriture créative

Générez des histoires et des scripts sans moralisation indésirable ni filtres de contenu limitant vos choix narratifs. Parfait pour la fiction adulte ou l'humour audacieux.

Extraction de données

Analysez de grands documents grâce à une fenêtre de contexte de 100 000 tokens pour extraire des données structurées à partir de textes longs sans perdre le contexte.

Recherche et analyse

Obtenez des réponses sans filtre sur des sujets controversés ou de niche sans que le modèle refuse de s'engager en raison des directives de sécurité standard.

Applications de chat

Créez des interfaces de chat qui semblent naturelles et réactives, prenant en charge les réponses en streaming pour une meilleure expérience utilisateur.

Compatibilité OpenAI intégrée

Arrêtez de réécrire le code d'intégration pour chaque nouveau modèle. Notre API implémente l'endpoint standard /v1/chat/completions, ce qui signifie que vous pouvez passer à notre modèle sans censure en modifiant simplement la base_url et la api_key dans vos clients SDK OpenAI existants. Nous prenons en charge le streaming via Server-Sent Events (SSE) et l'appel de fonctions, donc votre logique existante pour gérer les sorties d'outils ou la génération de texte en temps réel fonctionne directement.

Il ne s'agit pas d'une passerelle multi-modèles ou d'un proxy complexe qui ajoute de la latence. C'est une connexion directe vers nos serveurs GPU exécutant un seul modèle à poids ouverts optimisé. Vous bénéficiez des performances d'un endpoint dédié avec la familiarité du format OpenAI.

Sans censure et sans filtre

Notre modèle est ajusté pour répondre sans refus de contenu pour un usage adulte licite, des récits fictionnels, la recherche en sécurité ou des sujets controversés. Alors que la plupart des modèles standard refuseront poliment de discuter de sujets sensibles ou de générer du contenu mature, notre modèle fournira une réponse directe.

Il existe une limite stricte qui s'applique toujours : les requêtes contenant du contenu sexuel impliquant des mineurs sont bloquées. Tout le reste est possible. Cela le rend idéal pour les applications où vous souhaitez un contrôle total sur la sortie sans que le modèle agisse comme un gardien pour les requêtes légitimes de vos utilisateurs.

Tarification transparente à l'usage

Nous ne vous imposons pas d'abonnements mensuels ni de plans par paliers. Vous payez exactement pour les tokens que vous consommez. Les tokens d'entrée coûtent 0,25 $ par million, et les tokens de sortie coûtent 1,00 $ par million. Lorsque vous rechargez votre compte, ces crédits n'expirent jamais, vous pouvez donc recharger lorsque cela convient à votre budget.

Nous offrons des bonus pour les dépôts plus importants : +5 % de crédit sur les dépôts de 50 $ et +10 % sur les dépôts de 100 $. Les nouveaux comptes commencent avec 0,50 $ de crédit d'essai gratuit valable 7 jours, sans carte de crédit requise. Cette structure garantit que vous ne dépensez que ce que vous utilisez, sans frais cachés pour le streaming ou l'utilisation d'outils.

Ce n'est PAS pour vous

Si vous avez besoin de génération d'images, de traitement audio ou d'embeddings, cette API n'est pas faite pour vous. Nous ne proposons que du texte. Si vous avez besoin d'acheminement de modèles entre plusieurs fournisseurs (comme GPT-4, Claude et Llama en une seule requête), nous ne proposons pas cette fonctionnalité. Nous nous concentrons sur l'expérience optimale pour un seul modèle sans censure. Si vous avez besoin de garanties SLA strictes, de certifications SOC2 ou de la conformité HIPAA out-of-the-box, vous devriez vous tourner vers des fournisseurs de niveau entreprise. Nous sommes un endpoint d'infrastructure simple, pensé pour les développeurs.

Questions et réponses

S'agit-il d'un proxy OpenAI ?

Non. Nous ne revendons pas les modèles d'OpenAI. Nous hébergeons notre propre modèle à poids ouverts sur nos propres serveurs GPU. Il est compatible OpenAI au niveau du format, ce qui signifie qu'il accepte les mêmes structures JSON et commandes SDK, mais le modèle sous-jacent est le nôtre.

Quelle est la taille de la fenêtre de contexte ?

Notre modèle prend en charge une fenêtre de contexte de 100 000 tokens, en comptant à la fois le prompt et la completion. Cela permet de traiter de grands documents ou de conserver l'historique de longues conversations.

Mes prompts sont-ils utilisés pour l'entraînement ?

Non. Nous n'utilisons pas vos données de prompt pour entraîner notre modèle. Vos données restent privées pour vos requêtes d'inférence.

Comment commencer ?

Inscrivez-vous avec une adresse e-mail et un mot de passe sur la page Clé API. Vous recevrez une clé API immédiatement. Vous pouvez commencer à utiliser le crédit d'essai gratuit de 0,50 $ sans ajouter de carte de crédit.

Que se passe-t-il si je dépasse la limite de débit ?

Nous autorisons 300 requêtes par minute par clé API. Si vous dépassez ce seuil, vous recevrez une erreur 429. Vous pouvez régénérer votre clé API à tout moment pour réinitialiser le compteur si nécessaire.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.

Obtenir une clé API