推理 API:快速入門指南
在五分鐘內開始使用我們的無審查推理 API。修改基礎 URL 和 API 金鑰,然後將現有的 LLM 程式碼針對我們的開放權重模型進行測試,並採用透明的每 token 計價方式。
基礎 URL 與驗證
我們的 API 完全 OpenAI 相容。要進行切換,請更新你的用戶端設定以指向我們的基礎 URL,並提供你的 API 金鑰。基礎 URL 為 https://api.llminferenceapi.com/v1。驗證透過標準 Authorization: Bearer 標頭處理。僅使用電子郵件和密碼註冊後,你將立即獲得金鑰——試用期間無需電話號碼或信用卡。
- 基礎 URL:
https://api.llminferenceapi.com/v1 - 標頭:
Authorization: Bearer YOUR_API_KEY - 模型 ID:
uncensored
此設定適用於任何官方 OpenAI SDK 或相容的客戶端程式庫。你將保留現有的程式碼結構;僅需變更端點和金鑰。
首次請求
對聊天補全端點發出第一個請求。模型 ID 為 uncensored。該模型是一個開放權重大語言模型,經過微調以在法律允許的成人用途下無內容拒絕地回答,它並非 GPT 或 Claude。
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'請求主體包含標準的 messages 陣列。你可以指定 temperature、max_tokens 和其他標準參數。API 會回傳標準的聊天完成回應,並包含 token 使用統計數據。如果遇到 401 錯誤,表示你的金鑰無效。402 錯誤表示你的預付額度已耗盡。
Python SDK 整合
使用 Python SDK 非常簡單。使用我們的基礎 URL 和 API 金鑰初始化客戶端。程式碼結構與標準 OpenAI 模式相同。這允許你在不重寫應用程式邏輯的情況下,替換為我們的 llm 代理 服務。
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)請確保傳遞 model='uncensored' 參數。回應物件包含生成的文字與使用指標。這種方法非常適合想要無縫接軌 與 openai 相容的 api 方案的開發者。除了標準 SDK 外,不需要其他相依套件。
Node.js SDK 用法
對於 Node.js 開發者來說,整合同樣簡單。在客戶端設定中設定 baseURL 和 apiKey。SDK 會自動處理對我們 ai 聊天 api 端點的 HTTP 請求。
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);呼叫 chat.completions.create() 並指定模型 ID uncensored。你可以串流回應或將其作為完整物件處理。這種靈活性支援批次處理與即時使用者互動。API 支援函式呼叫,允許你定義模型可以呼叫的函式。
串流回應
為了提供即時的使用者體驗,請啟用串流。在請求中將 stream 參數設定為 true。API 會回傳伺服器發送事件 (SSE) 的串流,包含部分回應。
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)每個區塊包含回應的部分增量。你可以將這些 token 即時呈現給使用者,以降低感知延遲。這對於需要即時回饋的聊天介面至關重要。串流回應包含與非串流請求相同的 token 使用資訊。
限制、錯誤與上下文
我們的 API 對輸入和輸出的總和實施 100,000 token 的上下文視窗限制。這支援長文件與複雜的對話。速率限制設為每支金鑰每分鐘 300 次請求。如果超過此限制,你會收到 429 錯誤。請求主體限制為 8 MB。
常見錯誤包括 401(金鑰無效)、402(額度不足)和 429(速率限制)。額度永不過期,因此您可以隨時儲值。預付額度最低 $10 起,儲值金額越高享有越多贈額。此 隨用隨付 ai api 模型確保您只需為實際使用的內容付費。
API 技術參數
購買額度前,請先確認介面是否符合你的需求——以下是全部真實參數。
| 項目 | 說明 |
|---|---|
| 介面格式 | 相容 OpenAI:任何 OpenAI SDK 只需更換 base URL 和金鑰 |
| Base URL | https://api.llminferenceapi.com/v1 |
| 驗證 | Authorization: Bearer YOUR_KEY |
| 端點 | POST /v1/chat/completions · GET /v1/models |
| 模型 ID | uncensored |
| 最大輸出 | 不另設輸出上限;提示+回覆共 64,000 個 token 視窗內,max_tokens 可選 |
| 取樣參數 | temperature、top_p、stop、seed、presence_penalty、frequency_penalty |
| 串流輸出 | 支援 SSE,最後一段包含 token 用量 |
| JSON 模式 | response_format: {"type": "json_object"} |
| 函式呼叫 | 支援 tools、tool_choice;回覆包含 tool_calls(串流同樣支援),結果以 role: tool 訊息回傳 |
| 上下文視窗 | 64,000 tokens(輸入與輸出合計) |
| 請求大小 | 每次請求不超過 8 MB |
| 速率限制 | 每把金鑰每分鐘 300 次請求 |
| 並行請求 | 每把金鑰同時最多 8 個請求 |
| 回應標頭 | X-Request-Id、X-Balance-USD、X-RateLimit-Limit-Requests、X-RateLimit-Limit-Concurrency |
| 額度效期 | 付費額度永不過期,無訂閱 |
| 贈送額度 | 滿 $50 送 5%,滿 $100 送 10% |
| 免費試用 | $0.50,有效期 7 天,不需信用卡 · 試用金鑰:2 個並行請求,每分鐘 60 次;首次儲值後恢復完整限額(8 和 300) |
| 價格 | 輸入 $0.25 / 百萬 tokens · 輸出 $1.00 / 百萬 tokens |
| 儲值 | USDT(TRC20)或 USDC(Base),$10–$500 任意整數金額 |
| 計費 | 預付額度,按實際 token 用量扣費;錯誤和拒絕不收費 |
| 登入 | Google 或電子郵件 + 密碼 |
| 內容政策 | 允許成人內容;涉及未成年人的性內容一律拒絕 |
| 金鑰 | 每個帳戶一把有效金鑰;產生新金鑰後舊金鑰失效 |
錯誤代碼
錯誤以 JSON 回傳,type 欄位固定;失敗或被拒絕的請求不計費。
| 狀態碼 | 類型 | 含義 |
|---|---|---|
400 | bad_request | JSON 無效、訊息為空、參數錯誤或超出上下文視窗 |
401 | missing_key · invalid_key · key_revoked | 缺少金鑰、金鑰錯誤或已被新金鑰取代 |
402 | no_credit | 餘額不足——儲值後立即恢復 |
403 | content_blocked | 涉及未成年人的性內容——拒絕且不計費 |
404 | not_found | 未知端點 |
413 | request_too_large | 請求內容超過 8 MB |
429 | rate_limited · concurrency | 超過每分鐘 300 次或 8 個並行——稍後重試 |
503 | upstream_busy | 模型忙碌——幾秒後重試 |
問答
此 API 適合用於生產環境嗎?
是的,它具備標準速率限制與可靠的端點,專為生產環境設計。不過,它不提供 SLA 保證或 SOC2 等企業認證。它最適合重視無審查輸出與彈性定價,而非正式企業保證的應用程式。
此模型的「無審查」代表什麼意思?
該模型不會拒絕合法的成人內容、虛構題材、安全研究或具爭議性的主題。它會生成其他模型可能因安全過濾器而封鎖的內容。唯一的硬性限制是,涉及未成年人的性內容一律會被封鎖。
我需要信用卡才能開始嗎?
不需要。你只需電子郵件和密碼即可註冊。每個新帳戶都會獲得 $0.50 的試用額度,有效期為 7 天。當你準備擴展時,可以稍後使用加密貨幣(USDT 或 USDC)進行儲值。
只差一張表單,即可取得金鑰
建立帳戶、複製金鑰、變更基礎 URL。這就是整個設定過程。
取得 API 金鑰