API de Inferência: Guia de início rápido
Comece com nossa API de inferência sem censura em menos de cinco minutos. Altere sua URL base e chave de API, então execute seu código LLM existente contra nosso modelo de pesos abertos com preços transparentes por token.
URL Base e Autenticação
Nossa API é totalmente compatível com OpenAI. Para fazer a troca, atualize a configuração do seu cliente para apontar para nossa URL base e forneça sua chave de API. A URL base é https://api.llminferenceapi.com/v1. A autenticação é feita por meio do cabeçalho padrão Authorization: Bearer. Você recebe sua chave imediatamente após se cadastrar com apenas um e-mail e senha — sem necessidade de número de telefone ou cartão de crédito para o teste.
- URL Base:
https://api.llminferenceapi.com/v1 - Cabeçalho:
Authorization: Bearer YOUR_API_KEY - ID do Modelo:
uncensored
Esta configuração funciona com qualquer SDK oficial da OpenAI ou biblioteca de cliente compatível. Você mantém a estrutura do seu código existente; apenas o endpoint e a chave mudam.
Primeira Requisição
Faça sua primeira chamada para o endpoint de conclusões de chat. O ID do modelo é uncensored. Este modelo é um modelo de linguagem grande de pesos abertos ajustado para responder sem recusas de conteúdo para uso adulto lícito, não é GPT ou Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'O corpo da solicitação inclui o array padrão messages. Você pode especificar temperatura, número máximo de tokens e outros parâmetros padrão. A API retorna uma resposta padrão de conclusão de chat com estatísticas de uso de tokens. Se você encontrar um erro 401, sua chave é inválida. Um erro 402 significa que seus créditos pré-pagos estão esgotados.
Integração com SDK Python
Usar o SDK Python é simples. Inicialize o cliente com nossa URL base e sua chave de API. A estrutura do código reflete o padrão padrão do OpenAI. Isso permite que você substitua nosso serviço de proxy llm sem reescrever a lógica do seu aplicativo.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Certifique-se de passar o argumento model='uncensored'. O objeto de resposta contém o texto gerado e as métricas de uso. Esta abordagem é ideal para desenvolvedores que desejam uma solução de API compatível com openai pronta para usar. Não são necessárias dependências adicionais além do SDK padrão.
Uso do SDK Node.js
Para desenvolvedores Node.js, a integração é igualmente simples. Defina o baseURL e o apiKey na configuração do seu cliente. O SDK cuida das solicitações HTTP para nossos endpoints de api de chat ai automaticamente.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Chame chat.completions.create() com o ID do modelo uncensored. Você pode transmitir respostas ou tratá-las como objetos completos. Essa flexibilidade suporta tanto processamento em lote quanto interações em tempo real com o usuário. A API suporta chamada de funções, permitindo que você defina funções que o modelo pode invocar.
Respostas em Streaming
Para experiências em tempo real com o usuário, ative o streaming. Defina o parâmetro stream como true na sua solicitação. A API retorna um stream de eventos do servidor (SSE) de respostas parciais.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Cada chunk contém um delta parcial da resposta. Você pode renderizar esses tokens para o usuário conforme chegam, reduzindo a latência percebida. Isso é crítico para interfaces de chat onde o feedback imediato é esperado. A resposta em streaming inclui as mesmas informações de uso de tokens que as solicitações sem streaming.
Limites, Erros e Contexto
Nossa API impõe uma janela de contexto de 100.000 tokens para entrada e saída combinadas. Isso suporta documentos longos e conversas complexas. O limite de requisições é definido para 300 requisições por minuto por chave. Se você exceder isso, receberá um erro 429. Os corpos das solicitações são limitados a 8 MB.
Os erros comuns incluem 401 (chave inválida), 402 (créditos insuficientes) e 429 (limite de requisições). Os créditos nunca expiram, então você pode recarregar quando quiser. Créditos pré-pagos começam em US$ 10, com bônus para depósitos maiores. Este modelo de api ai pagamento por uso garante que você pague apenas pelo que usar.
Ficha técnica da API
Uma tabela com cada limite, recurso e preço.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Base URL | https://api.llminferenceapi.com/v1 |
| Autenticação | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| ID do modelo | uncensored |
| Saída máxima | até o restante da janela de 64.000 tokens; max_tokens opcional (sem limite separado) |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Modo JSON | response_format: {"type": "json_object"} |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Janela de contexto | 64.000 tokens (entrada + saída) |
| Tamanho | até 8 MB por requisição |
| Limite de taxa | 300 requisições por minuto por chave |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Validade | crédito pago não expira, sem assinatura |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Login | Google ou e-mail e senha |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
Erros e o que fazer
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
Esta API é adequada para aplicações em produção?
Sim, foi projetada para uso em produção com limites de requisições padrão e endpoints confiáveis. No entanto, não oferece garantias de SLA ou certificações empresariais como SOC2. É ideal para aplicações que priorizam saída sem censura e preços flexíveis em vez de garantias formais de empresa.
O que significa 'sem censura' para este modelo?
O modelo não recusa tópicos adultos lícitos, ficcionais, de pesquisa em segurança ou controversos. Ele gera conteúdo que outros modelos podem bloquear devido a filtros de segurança. O único limite rígido é que conteúdo sexual envolvendo menores é sempre bloqueado.
Preciso de um cartão de crédito para começar?
Não. Você pode entrar com apenas um e-mail e senha. Cada nova conta recebe $0,50 em crédito de teste válido por 7 dias. Você pode adicionar créditos mais tarde usando criptomoedas (USDT ou USDC) quando estiver pronto para escalar.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.
Obter chave de API