IT ▾
Ottieni la chiave API

LLM Inference APIDocumentazione

API di inferenza: Guida rapida

Inizia con la nostra API di inferenza senza censura in meno di cinque minuti. Modifica il tuo URL di base e la chiave API, quindi esegui il tuo codice LLM esistente sul nostro modello a pesi aperti con prezzi trasparenti per token.

URL di base e autenticazione

La nostra API è completamente compatibile con OpenAI. Per passare, aggiorna la configurazione del client per puntare al nostro URL di base e fornisci la tua chiave API. L'URL di base è https://api.llminferenceapi.com/v1. L'autenticazione viene gestita tramite l'intestazione standard Authorization: Bearer. Ricevi la chiave immediatamente dopo esserti registrato con solo email e password: non sono richiesti numero di telefono o carta di credito per la prova.

  • URL di base: https://api.llminferenceapi.com/v1
  • Intestazione: Authorization: Bearer YOUR_API_KEY
  • ID modello: uncensored

Questa configurazione funziona con qualsiasi SDK ufficiale di OpenAI o libreria client compatibile. Mantieni la struttura del tuo codice esistente; cambiano solo l'endpoint e la chiave.

Prima richiesta

Esegui la tua prima chiamata all'endpoint delle chat completions. L'ID del modello è uncensored. Questo modello è un modello linguistico di grandi dimensioni a pesi aperti ottimizzato per rispondere senza rifiuti di contenuti per l'uso adulto legale, non è GPT o Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Il corpo della richiesta include l'array standard messages. Puoi specificare temperatura, numero massimo di token e altri parametri standard. L'API restituisce una risposta standard di completamento chat con statistiche sull'utilizzo dei token. Se riscontri un errore 401, la tua chiave non è valida. Un errore 402 significa che i tuoi crediti prepagati sono esauriti.

Integrazione SDK Python

Utilizzare l'SDK Python è semplice. Inizializza il client con il nostro URL di base e la tua chiave API. La struttura del codice riflette lo standard pattern OpenAI. Questo ti permette di sostituire il nostro servizio proxy llm senza riscrivere la logica della tua applicazione.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Assicurati di passare l'argomento model='uncensored'. L'oggetto di risposta contiene il testo generato e le metriche di utilizzo. Questo approccio è ideale per gli sviluppatori che desiderano una soluzione API compatibile con OpenAI pronta all'uso. Non sono richieste dipendenze aggiuntive oltre all'SDK standard.

Utilizzo SDK Node.js

Per gli sviluppatori Node.js, l'integrazione è altrettanto semplice. Imposta baseURL e apiKey nella configurazione del tuo client. L'SDK gestisce automaticamente le richieste HTTP ai nostri endpoint ai chat api.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Chiama chat.completions.create() con l'ID del modello uncensored. Puoi eseguire lo streaming delle risposte o gestirle come oggetti completi. Questa flessibilità supporta sia l'elaborazione in batch che le interazioni utente in tempo reale. L'API supporta la chiamata di funzioni, permettendoti di definire funzioni che il modello può invocare.

Risposte in streaming

Per esperienze utente in tempo reale, abilita lo streaming. Imposta il parametro stream su true nella tua richiesta. L'API restituisce uno stream di Server-Sent Events (SSE) di risposte parziali.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Ogni frammento contiene un delta parziale della risposta. Puoi visualizzare questi token all'utente man mano che arrivano, riducendo la latenza percepita. Questo è fondamentale per le interfacce chat dove ci si aspetta un feedback immediato. La risposta in streaming include le stesse informazioni sull'utilizzo dei token delle richieste non in streaming.

Limiti, errori e contesto

La nostra API impone una finestra di contesto di 100.000 token per input e output combinati. Questo supporta documenti lunghi e conversazioni complesse. Il limite di richieste è impostato a 300 richieste al minuto per chiave. Se lo superi, ricevi un errore 429. I corpi delle richieste sono limitati a 8 MB.

Gli errori comuni includono 401 (chiave non valida), 402 (crediti insufficienti) e 429 (limite di richieste). I crediti non scadono mai, quindi puoi ricaricarli quando preferisci. I crediti prepagati partono da 10 $, con bonus per depositi più consistenti. Questo modello di api ai pagamento a consumo assicura che tu paghi solo per ciò che usi.

Scheda tecnica dell'API

Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.

VoceValore
Formatocompatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave
Base URLhttps://api.llminferenceapi.com/v1
AutenticazioneAuthorization: Bearer YOUR_KEY
EndpointPOST /v1/chat/completions · GET /v1/models
ID modellouncensored
Output massimofino al resto della finestra di 64.000 token; max_tokens opzionale (nessun limite separato)
Parametritemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Streamingsì — server-sent events; l'ultimo blocco riporta l'uso dei token
Modalità JSONresponse_format: {"type": "json_object"}
Function callingsì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool
Finestra di contesto64.000 token (input + output)
Dimensionefino a 8 MB per richiesta
Limite di frequenza300 richieste al minuto per chiave
Concorrenza8 richieste contemporanee per chiave
HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Scadenzail credito pagato non scade, nessun abbonamento
Bonus+5% da $50, +10% da $100
Prova gratuita$0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica
Prezzo$0,25 per 1M token in input · $1,00 per 1M in output
RicaricaUSDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500
Fatturazionecredito prepagato in base all'uso reale; errori e rifiuti gratuiti
AccessoGoogle oppure e-mail e password
Contenuticontenuti per adulti consentiti; rifiutati i contenuti sessuali con minori
Chiaviuna chiave attiva per account; una nuova sostituisce la precedente

Codici di errore

Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.

CodiceTipoSignificato
400bad_requestJSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo
401missing_key · invalid_key · key_revokedchiave mancante, errata o sostituita
402no_creditcredito esaurito — ricarica e riparti subito
403content_blockedcontenuti sessuali con minori — rifiutato, non addebitato
404not_foundendpoint sconosciuto
413request_too_largecorpo oltre 8 MB
429rate_limited · concurrencyoltre 300/min o 8 in parallelo — attendi e riprova
503upstream_busymodello occupato — riprova tra pochi secondi

Domande e risposte

Questa API è adatta per applicazioni in produzione?

Sì, è progettata per l'uso in produzione con limiti di richieste standard e endpoint affidabili. Tuttavia, non offre garanzie SLA o certificazioni enterprise come SOC2. È ideale per applicazioni che privilegiano output senza censura e prezzi flessibili rispetto a garanzie enterprise formali.

Cosa significa 'senza censura' per questo modello?

Il modello non rifiuta argomenti legali per adulti, di finzione, di ricerca sulla sicurezza o controversi. Genererà contenuti che altri modelli potrebbero bloccare a causa dei filtri di sicurezza. L'unico limite rigido è che i contenuti sessuali che coinvolgono minori sono sempre bloccati.

Ho bisogno di una carta di credito per iniziare?

No. Puoi iscriverti solo con email e password. Ogni nuovo account riceve $0,50 di credito di prova valido per 7 giorni. Puoi aggiungere crediti in seguito utilizzando criptovalute (USDT o USDC) quando sei pronto a scalare.

La tua chiave è a un modulo di distanza

Crea un account, copia la chiave, cambia l'URL di base. È tutta qui la configurazione.

Ottieni la chiave API