ES ▾
Obtener clave de API

LLM Inference APIDocs

API de inferencia: Guía de inicio rápido

Comienza con nuestra API de inferencia sin censura en menos de cinco minutos. Cambia tu URL base y clave de API, luego ejecuta tu código LLM existente contra nuestro modelo de pesos abiertos con precios transparentes por token.

URL base y autenticación

Nuestra API es completamente compatible con OpenAI. Para cambiar, actualiza la configuración de tu cliente para apuntar a nuestra URL base y proporciona tu clave de API. La URL base es https://api.llminferenceapi.com/v1. La autenticación se maneja mediante el encabezado estándar Authorization: Bearer. Recibes tu clave inmediatamente después de registrarte con solo un correo electrónico y una contraseña; no se requiere número de teléfono ni tarjeta de crédito para la prueba.

  • URL base: https://api.llminferenceapi.com/v1
  • Encabezado: Authorization: Bearer YOUR_API_KEY
  • ID del modelo: uncensored

Esta configuración funciona con cualquier SDK oficial de OpenAI o biblioteca de clientes compatible. Mantienes la estructura de tu código existente; solo cambian el endpoint y la clave.

Primera solicitud

Realiza tu primera llamada al endpoint de chat completions. El ID del modelo es uncensored. Este modelo es un modelo de lenguaje grande de pesos abiertos ajustado para responder sin rechazos de contenido para uso adulto lícito, no es GPT ni Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

El cuerpo de la solicitud incluye la matriz estándar messages. Puedes especificar temperatura, máximo de tokens y otros parámetros estándar. La API devuelve una respuesta de completado de chat estándar con estadísticas de uso de tokens. Si encuentras un error 401, tu clave no es válida. Un error 402 significa que tus créditos prepago se han agotado.

Integración con SDK de Python

Usar el SDK de Python es sencillo. Inicializa el cliente con nuestra URL base y tu clave de API. La estructura del código refleja el patrón estándar de OpenAI. Esto te permite integrar nuestro servicio de proxy LLM sin reescribir la lógica de tu aplicación.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Asegúrate de pasar el argumento model='uncensored'. El objeto de respuesta contiene el texto generado y las métricas de uso. Este enfoque es ideal para desarrolladores que buscan una solución API compatible con OpenAI lista para usar. No se requieren dependencias adicionales más allá del SDK estándar.

Uso del SDK de Node.js

Para los desarrolladores de Node.js, la integración es igualmente sencilla. Establece baseURL y apiKey en la configuración de tu cliente. El SDK maneja las peticiones HTTP a nuestros endpoints de api de chat de ia automáticamente.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Llama a chat.completions.create() con el ID del modelo uncensored. Puedes transmitir las respuestas o manejarlas como objetos completos. Esta flexibilidad admite tanto el procesamiento por lotes como las interacciones en tiempo real con el usuario. La API admite tool calling, lo que te permite definir funciones que el modelo puede invocar.

Respuestas en streaming

Para experiencias de usuario en tiempo real, habilita el streaming. Establece el parámetro stream en true en tu solicitud. La API devuelve un flujo de Eventos Enviados por el Servidor (SSE) de respuestas parciales.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Cada fragmento contiene un delta parcial de la respuesta. Puedes renderizar estos tokens al usuario a medida que llegan, reduciendo la latencia percibida. Esto es crítico para interfaces de chat donde se espera una retroalimentación inmediata. La respuesta en streaming incluye la misma información de uso de tokens que las solicitudes sin streaming.

Límites, errores y contexto

Nuestra API impone una ventana de contexto de 100.000 tokens para la entrada y la salida combinadas. Esto admite documentos largos y conversaciones complejas. El límite de peticiones se establece en 300 peticiones por minuto por clave. Si excedes este límite, recibirás un error 429. Los cuerpos de las peticiones están limitados a 8 MB.

Los errores comunes incluyen 401 (clave inválida), 402 (créditos insuficientes) y 429 (límite de peticiones). Los créditos no caducan, así que puedes recargar cuando quieras. Los créditos prepago comienzan en $10, con bonificaciones para depósitos más grandes. Este modelo de pago por uso de API de IA asegura que solo pagues por lo que usas.

Ficha técnica de la API

Una tabla con cada límite, función y precio.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
Base URLhttps://api.llminferenceapi.com/v1
AutenticaciónAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
ID del modelouncensored
Salida máximahasta el resto de la ventana de 64.000 tokens; max_tokens opcional (sin límite aparte)
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Modo JSONresponse_format: {"type": "json_object"}
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Ventana de contexto64.000 tokens (entrada + salida)
Tamaño de peticiónhasta 8 MB
Límite de peticiones300 por minuto por clave
Concurrencia8 peticiones a la vez por clave
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Caducidadel crédito pagado no caduca, sin suscripción
Bono+5 % desde $50, +10 % desde $100
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
AccesoGoogle o correo y contraseña
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior

Errores y qué hacer

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos

Preguntas y respuestas

¿Es esta API adecuada para aplicaciones en producción?

Sí, está diseñada para uso en producción con límites de peticiones estándar y endpoints confiables. Sin embargo, no ofrece garantías de SLA ni certificaciones empresariales como SOC2. Es ideal para aplicaciones que priorizan la salida sin censura y precios flexibles sobre garantías empresariales formales.

¿Qué significa 'sin censura' para este modelo?

El modelo no rechaza temas adultos legales, ficticios, de investigación de seguridad o controvertidos. Generará contenido que otros modelos podrían bloquear debido a filtros de seguridad. La única limitación estricta es que el contenido sexual que involucra a menores siempre está bloqueado.

¿Necesito una tarjeta de crédito para empezar?

No. Puedes registrarte solo con un correo electrónico y una contraseña. Cada cuenta nueva recibe $0,50 en crédito de prueba válido por 7 días. Puedes agregar créditos más tarde usando criptomonedas (USDT o USDC) cuando estés listo para escalar.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.

Obtener clave de API