LLM Inference APIDokumen
API Inferensi: Panduan Cepat
Mulailah dengan API inferensi tanpa sensor kami dalam waktu kurang dari lima menit. Ubah URL dasar dan kunci API Anda, lalu jalankan kode LLM Anda yang ada terhadap model bobot terbuka kami dengan harga per token yang transparan.
URL Dasar dan Autentikasi
API kami sepenuhnya kompatibel dengan OpenAI. Untuk beralih, perbarui konfigurasi klien Anda agar mengarah ke URL dasar kami dan berikan kunci API Anda. URL dasar adalah https://api.llminferenceapi.com/v1. Autentikasi ditangani melalui header Authorization: Bearer standar. Anda menerima kunci Anda segera setelah mendaftar hanya dengan email dan kata sandi—tidak diperlukan nomor telepon atau kartu kredit untuk uji coba.
- URL Dasar:
https://api.llminferenceapi.com/v1 - Header:
Authorization: Bearer YOUR_API_KEY - ID Model:
uncensored
Konfigurasi ini berfungsi dengan SDK OpenAI resmi atau pustaka klien kompatibel lainnya. Anda mempertahankan struktur kode yang ada; hanya endpoint dan kunci yang berubah.
Permintaan Pertama
Lakukan panggilan pertama ke endpoint penyelesaian obrolan. ID model adalah uncensored. Model ini adalah model bahasa besar bobot terbuka yang disesuaikan untuk menjawab tanpa penolakan konten untuk penggunaan dewasa yang sah, bukan GPT atau Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Body permintaan mencakup array messages standar. Anda dapat menentukan suhu, jumlah token maksimum, dan parameter standar lainnya. API mengembalikan respons penyelesaian obrolan standar dengan statistik penggunaan token. Jika Anda mengalami kesalahan 401, kunci Anda tidak valid. Kesalahan 402 berarti saldo prabayar Anda telah habis.
Integrasi SDK Python
Menggunakan SDK Python sangat mudah. Inisialisasi klien dengan URL dasar kami dan kunci API Anda. Struktur kode mengikuti pola standar OpenAI. Ini memungkinkan Anda mengganti layanan proxy LLM kami tanpa menulis ulang logika aplikasi Anda.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Pastikan Anda meneruskan argumen model='uncensored'. Objek respons berisi teks yang dihasilkan dan metrik penggunaan. Pendekatan ini sangat ideal untuk pengembang yang menginginkan solusi API kompatibel OpenAI yang siap pakai. Tidak ada dependensi tambahan yang diperlukan selain SDK standar.
Penggunaan SDK Node.js
Untuk pengembang Node.js, integrasinya sama mudahnya. Atur baseURL dan apiKey dalam konfigurasi klien Anda. SDK menangani permintaan HTTP ke endpoint API obrolan AI kami secara otomatis.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Panggil chat.completions.create() dengan ID model uncensored. Anda dapat melakukan streaming respons atau menanganinya sebagai objek lengkap. Fleksibilitas ini mendukung pemrosesan batch dan interaksi pengguna waktu nyata. API mendukung pemanggilan fungsi, memungkinkan Anda mendefinisikan fungsi yang dapat dipanggil oleh model.
Respons Streaming
Untuk pengalaman pengguna secara langsung, aktifkan streaming. Atur parameter stream menjadi true dalam permintaan Anda. API mengembalikan aliran Event yang Dikirim Server (SSE) dari respons parsial.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Setiap bagian berisi delta parsial dari respons. Anda dapat menampilkan token ini kepada pengguna saat tiba, mengurangi latensi yang dirasakan. Ini sangat penting untuk antarmuka obrolan di mana umpan balik segera diharapkan. Respons streaming mencakup informasi penggunaan token yang sama dengan permintaan non-streaming.
Batas, Kesalahan, dan Konteks
API kami menerapkan jendela konteks 100.000 token untuk input dan output secara gabungan. Ini mendukung dokumen panjang dan percakapan kompleks. Batas laju ditetapkan pada 300 permintaan per menit per kunci. Jika Anda melebihi batas ini, Anda akan menerima kesalahan 429. Body permintaan dibatasi hingga 8 MB.
Kesalahan umum termasuk 401 (kunci tidak valid), 402 (kredit tidak mencukupi), dan 429 (batas laju). Kredit tidak pernah kedaluwarsa, sehingga Anda dapat mengisi saldo sesuai kenyamanan Anda. Kredit prabayar dimulai dari $10, dengan bonus untuk deposit yang lebih besar. Model API AI bayar sesuai penggunaan ini memastikan Anda hanya membayar apa yang Anda gunakan.
Spesifikasi API
Semua batas dan fitur API yang sebenarnya di satu tempat — cek dulu sebelum isi saldo.
| Item | Nilai |
|---|---|
| Format | kompatibel OpenAI: SDK OpenAI apa pun bisa dipakai, cukup ganti base URL dan kunci |
| Base URL | https://api.llminferenceapi.com/v1 |
| Autentikasi | Authorization: Bearer YOUR_KEY |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| ID model | uncensored |
| Output maksimal | hingga sisa jendela 64.000 token; max_tokens opsional (tanpa batas terpisah) |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | ya — server-sent events; potongan terakhir berisi penggunaan token |
| Mode JSON | response_format: {"type": "json_object"} |
| Function calling | ya — tools, tool_choice; balasan berisi tool_calls, juga saat streaming; hasil dikirim sebagai role: tool |
| Jendela konteks | 64.000 token (input + output) |
| Ukuran permintaan | hingga 8 MB |
| Batas laju | 300 permintaan per menit per kunci |
| Konkurensi | 8 permintaan bersamaan per kunci |
| Header respons | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Masa berlaku | saldo berbayar tidak kedaluwarsa, tanpa langganan |
| Bonus | +5% mulai $50, +10% mulai $100 |
| Uji coba gratis | $0,50 selama 7 hari, tanpa kartu · Kunci uji coba: 2 permintaan paralel, 60 per menit; batas penuh (8 dan 300) setelah isi saldo pertama |
| Harga | $0,25 per 1 juta token input · $1,00 per 1 juta token output |
| Isi saldo | USDT (TRC20) atau USDC (Base), nominal bulat berapa pun dari $10 sampai $500 |
| Penagihan | saldo prabayar sesuai pemakaian nyata; error dan penolakan gratis |
| Masuk | Google atau email dan kata sandi |
| Konten | konten dewasa diizinkan; konten seksual yang melibatkan anak di bawah umur ditolak |
| Kunci | satu kunci aktif per akun; kunci baru menggantikan yang lama |
Kode error
Error dikirim sebagai JSON dengan type tetap; permintaan gagal atau ditolak tidak ditagih.
| Kode | Tipe | Arti |
|---|---|---|
400 | bad_request | JSON tidak valid, pesan kosong, parameter salah, atau konteks terlalu panjang |
401 | missing_key · invalid_key · key_revoked | kunci tidak ada, salah, atau sudah diganti |
402 | no_credit | saldo habis — isi ulang dan lanjut seketika |
403 | content_blocked | konten seksual dengan anak di bawah umur — ditolak, tidak ditagih |
404 | not_found | endpoint tidak dikenal |
413 | request_too_large | body lebih dari 8 MB |
429 | rate_limited · concurrency | lebih dari 300/menit atau 8 paralel — tunggu lalu coba lagi |
503 | upstream_busy | model sibuk — coba lagi beberapa detik lagi |
Tanya jawab
Apakah API ini cocok untuk aplikasi produksi?
Ya, API ini dirancang untuk penggunaan produksi dengan batas laju standar dan endpoint yang andal. Namun, API ini tidak menawarkan jaminan SLA atau sertifikasi perusahaan seperti SOC2. API ini paling cocok untuk aplikasi yang mengutamakan output tanpa sensor dan harga fleksibel daripada jaminan perusahaan formal.
Apa arti 'tanpa sensor' untuk model ini?
Model ini tidak menolak topik dewasa yang sah, fiksi, penelitian keamanan, atau kontroversial. Model ini akan menghasilkan konten yang mungkin diblokir oleh model lain karena filter keamanan. Satu-satunya batas keras adalah konten seksual yang melibatkan anak di bawah umur selalu diblokir.
Apakah saya memerlukan kartu kredit untuk memulai?
Tidak. Anda dapat mendaftar hanya dengan email dan kata sandi. Setiap akun baru menerima kredit uji coba senilai $0,50 yang berlaku selama 7 hari. Anda dapat menambahkan saldo nanti menggunakan kripto (USDT atau USDC) ketika Anda siap untuk skala besar.
Kunci Anda hanya selangkah lagi dari satu formulir
Buat akun, salin kuncinya, ubah URL dasar. Itu saja seluruh pengaturannya.
Dapatkan kunci API