Ongecensureerd LLM-inferentie
Ongecensureerd Inferentie-API voor ontwikkelaars
Een drop-in OpenAI-compatible inference API die één ongecensureerd open-weight model serveert. Pas je basis-URL en API-sleutel aan, de code blijft hetzelfde.
- Eén ongekensureerd model
- Geen maandelijkse kosten
- Credits vervallen nooit
Probeer het met één verzoek
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Wat je krijgt
Drop-in compatibiliteit
Werkt met officiële OpenAI SDKs en elke compatibele client. Werk je base_url bij naar https://api.llminferenceapi.com/v1 en vervang je API-sleutel.
Ongecensureerde output
Het model antwoordt zonder inhoudsbeperkingen voor wettelijke volwassen, fictieve of controversiële onderwerpen. Alleen seksuele inhoud met minderjarigen wordt geblokkeerd.
Directe GPU-hosting
We draaien het model op onze eigen servers, niet als doorverkoper. Geen vendor routing, geen verborgen lagen, alleen directe inferentie.
Transparante prijzen
Betaal alleen voor wat je gebruikt. Input tokens zijn $0,25/1M, output tokens zijn $1,00/1M. Geen abonnementen of vervaldatums voor credits.
Streaming & tools
Ondersteunt server-sent events (SSE) voor streaming-responses en standaard tool/function calling endpoints.
Privacy voorop
Prompts worden niet gebruikt om je model te trainen. Account aanmaken vereist alleen een e-mailadres en wachtwoord.
Hoe het werkt
Account aanmaken
Meld je aan met een e-mailadres en wachtwoord om direct je API-sleutel te krijgen.
Tegoed toevoegen
Laad op met crypto (USDT of USDC) om de service te gaan gebruiken.
Inferentie starten
Wijs je bestaande clientcode naar onze base_url en stuur verzoeken.
Wat mensen ermee bouwen
Creatief schrijven
Genereer verhalen en scripts zonder ongewenste moralisering of content filters die je narratieve keuzes beperken. Perfect voor volwassen fictie of scherpe humor.
Gegevensextractie
Verwerk grote documenten met behulp van het 100k contextvenster om gestructureerde data uit lange teksten te extraheren zonder contextverlies.
Onderzoek & analyse
Krijg ongefilterde antwoorden op controversiële of niche onderwerpen zonder dat het model weigert mee te werken vanwege standaard veiligheidsrichtlijnen.
Chattoepassingen
Bouw chatinterfaces die natuurlijk en responsief aanvoelen, met ondersteuning voor streamingresponsen voor een betere gebruikerservaring.
Drop-in OpenAI-compatibiliteit
Stop met het herschrijven van je integratiecode voor elk nieuw model. Onze API implementeert de standaard /v1/chat/completions endpoint, wat betekent dat je naar ons ongecensureerde model kunt schakelen door simpelweg de base_url en api_key in je bestaande OpenAI SDK-clients aan te passen. We ondersteunen streaming via Server-Sent Events (SSE) en function calling, zodat je bestaande logica voor het verwerken van tool-uitvoer of real-time tekstgeneratie direct werkt.
Dit is geen multi-model gateway of een complexe proxy die latentie toevoegt. Het is een directe verbinding met onze GPU-servers die een enkel, geoptimaliseerd open-weight model draaien. Je krijgt de prestaties van een dedicated endpoint met de vertrouwdheid van het OpenAI-formaat.
Ongecensureerd & ongefilterd
Ons model is afgestemd om te antwoorden zonder inhoudsrefusies voor wettelijk volwassen gebruik, fictieve verhalen, security research of controversiële onderwerpen. Terwijl de meeste standaard modellen beleefd weigeren gevoelige onderwerpen te bespreken of volwassen inhoud te genereren, zal ons model een direct antwoord geven.
Er is één harde limiet die altijd geldt: verzoeken met seksuele inhoud met minderjarigen worden geblokkeerd. Alles anders is mogelijk. Dit maakt het ideaal voor toepassingen waar je volledige creatieve controle wilt over de output zonder dat het model als gatekeeper optreedt voor de legitieme verzoeken van je gebruikers.
Transparante pay-as-you-go prijzen
We binden je niet aan maandelijkse abonnementen of getierde plannen. Je betaalt precies voor de tokens die je verbruikt. Input tokens kosten $0,25 per miljoen, en output tokens kosten $1,00 per miljoen. Wanneer je tegoed toevoegt, vervallen die credits nooit, dus je kunt opwaarderen wanneer het past bij je budget.
We bieden bonussen voor grotere stortingen: +5% tegoed op $50 stortingen en +10% op $100 stortingen. Nieuwe accounts beginnen met $0,50 aan trial credit geldig voor 7 dagen, zonder creditcard vereist. Deze structuur zorgt ervoor dat je alleen uitgeeft wat je gebruikt, zonder verborgen kosten voor streaming of tool-gebruik.
Voor wie dit NIET is
Als je beeldgeneratie, audiobewerking of embeddings nodig hebt, is deze API niets voor jou. We serveren alleen tekst. Als je model routing across multiple vendors nodig hebt (zoals GPT-4, Claude en Llama in één call), bieden we dat niet. We focussen op het leveren van de best mogelijke ervaring voor één specifiek ongekensureerd model. Als je strikte SLA-garanties, SOC2-certificeringen of HIPAA-compliance out of the box nodig hebt, moet je kijken naar enterprise-grade providers. Wij zijn een eenvoudige, developer-first inferentie endpoint.
Vragen en antwoorden
Is dit een OpenAI-proxy?
Nee. We verkopen geen modellen van OpenAI. We hosten ons eigen open-weight model op onze eigen GPU-servers. Het is OpenAI-compatibel qua formaat, wat betekent dat het dezelfde JSON-structuren en SDK-opdrachten accepteert, maar het onderliggende model is van ons.
Wat is de grootte van het contextvenster?
Ons model ondersteunt een contextvenster van 100.000 tokens, inclusief zowel de prompt als de completion. Dit maakt het mogelijk om grote documenten te verwerken of lange gespreks geschiedenis bij te houden.
Worden mijn prompts gebruikt voor training?
Nee. We gebruiken je promptgegevens niet om ons model te trainen. Je gegevens blijven privé voor je inference-verzoeken.
Hoe begin ik?
Meld je aan met een e-mailadres en wachtwoord op de pagina API-sleutel ophalen. Je ontvangt direct een API-sleutel. Je kunt beginnen met het gratis proeftegoed van $0,50 zonder een creditcard toe te voegen.
Wat gebeurt er als ik de rate limit bereik?
We staan 300 verzoeken per minuut per API-sleutel toe. Als je dit overschrijdt, ontvang je een 429-fout. Je kunt je API-sleutel op elk moment opnieuw genereren om de teller te resetten indien nodig.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, pas de base URL aan. Dat is de hele setup.
API-sleutel aanvragen