PT ▾
Obter chave de API

LLM Inference APIDocs

API de Inferência: Guia de início rápido

Comece com nossa API de inferência sem censura em menos de cinco minutos. Altere sua URL base e chave de API, então execute seu código LLM existente contra nosso modelo de pesos abertos com preços transparentes por token.

URL Base e Autenticação

Nossa API é totalmente compatível com OpenAI. Para fazer a troca, atualize a configuração do seu cliente para apontar para nossa URL base e forneça sua chave de API. A URL base é https://api.llminferenceapi.com/v1. A autenticação é feita por meio do cabeçalho padrão Authorization: Bearer. Você recebe sua chave imediatamente após se cadastrar com apenas um e-mail e senha — sem necessidade de número de telefone ou cartão de crédito para o teste.

  • URL Base: https://api.llminferenceapi.com/v1
  • Cabeçalho: Authorization: Bearer YOUR_API_KEY
  • ID do Modelo: uncensored

Esta configuração funciona com qualquer SDK oficial da OpenAI ou biblioteca de cliente compatível. Você mantém a estrutura do seu código existente; apenas o endpoint e a chave mudam.

Primeira Requisição

Faça sua primeira chamada para o endpoint de conclusões de chat. O ID do modelo é uncensored. Este modelo é um modelo de linguagem grande de pesos abertos ajustado para responder sem recusas de conteúdo para uso adulto lícito, não é GPT ou Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

O corpo da solicitação inclui o array padrão messages. Você pode especificar temperatura, número máximo de tokens e outros parâmetros padrão. A API retorna uma resposta padrão de conclusão de chat com estatísticas de uso de tokens. Se você encontrar um erro 401, sua chave é inválida. Um erro 402 significa que seus créditos pré-pagos estão esgotados.

Integração com SDK Python

Usar o SDK Python é simples. Inicialize o cliente com nossa URL base e sua chave de API. A estrutura do código reflete o padrão padrão do OpenAI. Isso permite que você substitua nosso serviço de proxy llm sem reescrever a lógica do seu aplicativo.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Certifique-se de passar o argumento model='uncensored'. O objeto de resposta contém o texto gerado e as métricas de uso. Esta abordagem é ideal para desenvolvedores que desejam uma solução de API compatível com openai pronta para usar. Não são necessárias dependências adicionais além do SDK padrão.

Uso do SDK Node.js

Para desenvolvedores Node.js, a integração é igualmente simples. Defina o baseURL e o apiKey na configuração do seu cliente. O SDK cuida das solicitações HTTP para nossos endpoints de api de chat ai automaticamente.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Chame chat.completions.create() com o ID do modelo uncensored. Você pode transmitir respostas ou tratá-las como objetos completos. Essa flexibilidade suporta tanto processamento em lote quanto interações em tempo real com o usuário. A API suporta chamada de funções, permitindo que você defina funções que o modelo pode invocar.

Respostas em Streaming

Para experiências em tempo real com o usuário, ative o streaming. Defina o parâmetro stream como true na sua solicitação. A API retorna um stream de eventos do servidor (SSE) de respostas parciais.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Cada chunk contém um delta parcial da resposta. Você pode renderizar esses tokens para o usuário conforme chegam, reduzindo a latência percebida. Isso é crítico para interfaces de chat onde o feedback imediato é esperado. A resposta em streaming inclui as mesmas informações de uso de tokens que as solicitações sem streaming.

Limites, Erros e Contexto

Nossa API impõe uma janela de contexto de 100.000 tokens para entrada e saída combinadas. Isso suporta documentos longos e conversas complexas. O limite de requisições é definido para 300 requisições por minuto por chave. Se você exceder isso, receberá um erro 429. Os corpos das solicitações são limitados a 8 MB.

Os erros comuns incluem 401 (chave inválida), 402 (créditos insuficientes) e 429 (limite de requisições). Os créditos nunca expiram, então você pode recarregar quando quiser. Créditos pré-pagos começam em US$ 10, com bônus para depósitos maiores. Este modelo de api ai pagamento por uso garante que você pague apenas pelo que usar.

Ficha técnica da API

Uma tabela com cada limite, recurso e preço.

ItemValor
Formatocompatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave
Base URLhttps://api.llminferenceapi.com/v1
AutenticaçãoAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
ID do modelouncensored
Saída máximaaté o restante da janela de 64.000 tokens; max_tokens opcional (sem limite separado)
Parâmetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsim — server-sent events; o último bloco traz o uso de tokens
Modo JSONresponse_format: {"type": "json_object"}
Chamada de funçõessim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool
Janela de contexto64.000 tokens (entrada + saída)
Tamanhoaté 8 MB por requisição
Limite de taxa300 requisições por minuto por chave
Concorrência8 requisições ao mesmo tempo por chave
CabeçalhosX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Validadecrédito pago não expira, sem assinatura
Bônus+5% a partir de $50, +10% a partir de $100
Teste grátis$0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga
Preço$0,25 por 1M tokens de entrada · $1,00 por 1M de saída
RecargaUSDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500
Cobrançacrédito pré-pago pelo uso real; erros e recusas são grátis
LoginGoogle ou e-mail e senha
Conteúdoconteúdo adulto permitido; conteúdo sexual com menores é recusado
Chavesuma chave ativa por conta; uma nova substitui a anterior

Erros e o que fazer

Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.

CódigoTipoSignificado
400bad_requestJSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais
401missing_key · invalid_key · key_revokedchave ausente, errada ou substituída
402no_creditsem crédito — recarregue e continue na hora
403content_blockedconteúdo sexual com menores — recusado, sem cobrança
404not_foundendpoint desconhecido
413request_too_largecorpo acima de 8 MB
429rate_limited · concurrencyacima de 300/min ou 8 em paralelo — aguarde e tente de novo
503upstream_busymodelo ocupado — tente em alguns segundos

Perguntas e respostas

Esta API é adequada para aplicações em produção?

Sim, foi projetada para uso em produção com limites de requisições padrão e endpoints confiáveis. No entanto, não oferece garantias de SLA ou certificações empresariais como SOC2. É ideal para aplicações que priorizam saída sem censura e preços flexíveis em vez de garantias formais de empresa.

O que significa 'sem censura' para este modelo?

O modelo não recusa tópicos adultos lícitos, ficcionais, de pesquisa em segurança ou controversos. Ele gera conteúdo que outros modelos podem bloquear devido a filtros de segurança. O único limite rígido é que conteúdo sexual envolvendo menores é sempre bloqueado.

Preciso de um cartão de crédito para começar?

Não. Você pode entrar com apenas um e-mail e senha. Cada nova conta recebe $0,50 em crédito de teste válido por 7 dias. Você pode adicionar créditos mais tarde usando criptomoedas (USDT ou USDC) quando estiver pronto para escalar.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.

Obter chave de API