LLM Inference APITài liệu
API suy luận: Hướng dẫn bắt đầu nhanh
Bắt đầu với API suy luận không kiểm duyệt của chúng tôi trong vòng dưới năm phút. Thay đổi URL cơ sở và khóa API, sau đó chạy mã LLM hiện có của bạn trên mô hình trọng số mở của chúng tôi với giá mỗi token minh bạch.
URL cơ sở và xác thực
API của chúng tôi hoàn toàn tương thích với OpenAI. Để chuyển đổi, bạn hãy cập nhật cấu hình client của mình để trỏ đến URL cơ sở của chúng tôi và cung cấp khóa API của bạn. URL cơ sở là https://api.llminferenceapi.com/v1. Xác thực được xử lý thông qua tiêu đề Authorization: Bearer tiêu chuẩn. Bạn nhận được khóa của mình ngay lập tức sau khi đăng ký chỉ với email và mật khẩu—không cần số điện thoại hay thẻ tín dụng cho bản dùng thử.
- URL cơ sở:
https://api.llminferenceapi.com/v1 - Tiêu đề:
Authorization: Bearer YOUR_API_KEY - ID mô hình:
uncensored
Cấu hình này hoạt động với bất kỳ SDK OpenAI chính thức hoặc thư viện máy khách tương thích nào. Bạn giữ nguyên cấu trúc mã hiện có; chỉ endpoint và khóa thay đổi.
Yêu cầu đầu tiên
Thực hiện cuộc gọi đầu tiên đến endpoint hoàn thành trò chuyện. ID mô hình là uncensored. Mô hình này là một mô hình ngôn ngữ lớn trọng số mở được tinh chỉnh để trả lời mà không từ chối nội dung cho mục đích người lớn hợp pháp, không phải GPT hoặc Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Thân yêu cầu bao gồm mảng messages tiêu chuẩn. Bạn có thể chỉ định nhiệt độ, số token tối đa và các tham số tiêu chuẩn khác. API trả về phản hồi hoàn thành trò chuyện tiêu chuẩn với thống kê sử dụng token. Nếu bạn gặp lỗi 401, khóa của bạn không hợp lệ. Lỗi 402 có nghĩa là tín dụng trả trước của bạn đã hết.
Tích hợp Python SDK
Sử dụng Python SDK rất đơn giản. Khởi tạo máy khách với URL cơ sở của chúng tôi và khóa API của bạn. Cấu trúc mã giống với mẫu OpenAI tiêu chuẩn. Điều này cho phép bạn thay thế dịch vụ llm proxy của chúng tôi mà không cần viết lại logic ứng dụng của mình.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Đảm bảo bạn truyền đối số model='uncensored'. Đối tượng phản hồi chứa văn bản được tạo và số liệu sử dụng. Cách tiếp cận này rất lý tưởng cho các nhà phát triển muốn giải pháp api tương thích openai. Không cần thêm thư viện phụ thuộc nào ngoài SDK tiêu chuẩn.
Sử dụng Node.js SDK
Đối với các nhà phát triển Node.js, việc tích hợp cũng đơn giản như nhau. Đặt baseURL và apiKey trong cấu hình máy khách của bạn. SDK xử lý các yêu cầu HTTP đến các endpoint api trò chuyện ai của chúng tôi một cách tự động.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Gọi chat.completions.create() với ID mô hình uncensored. Bạn có thể truyền phát phản hồi hoặc xử lý chúng dưới dạng các đối tượng hoàn chỉnh. Sự linh hoạt này hỗ trợ cả xử lý hàng loạt và tương tác người dùng theo thời gian thực. API hỗ trợ gọi hàm, cho phép bạn xác định các hàm mà mô hình có thể gọi.
Phản hồi truyền phát
Đối với trải nghiệm người dùng theo thời gian thực, hãy bật truyền phát. Đặt tham số stream thành true trong yêu cầu của bạn. API trả về luồng Sự kiện được gửi bởi máy chủ (SSE) của các phản hồi từng phần.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Mỗi chunk chứa một phần delta của phản hồi. Bạn có thể hiển thị các token này cho người dùng khi chúng đến, giảm độ trễ cảm nhận. Điều này rất quan trọng đối với các giao diện trò chuyện nơi phản hồi ngay lập tức là điều kiện tiên quyết. Phản hồi truyền phát bao gồm cùng thông tin sử dụng token như các yêu cầu không truyền phát.
Giới hạn, Lỗi và Ngữ cảnh
API của chúng tôi áp dụng cửa sổ ngữ cảnh 100.000 token cho cả đầu vào và đầu ra kết hợp. Điều này hỗ trợ các tài liệu dài và các cuộc hội thoại phức tạp. Giới hạn tốc độ được đặt là 300 yêu cầu mỗi phút trên mỗi khóa. Nếu bạn vượt quá giới hạn này, bạn sẽ nhận được lỗi 429. Thân yêu cầu được giới hạn ở 8 MB.
Các lỗi phổ biến bao gồm 401 (khóa không hợp lệ), 402 (không đủ tín dụng) và 429 (giới hạn tốc độ). Tín dụng không bao giờ hết hạn, vì vậy bạn có thể nạp tiền khi thuận tiện. Tín dụng trả trước bắt đầu từ $10, với tiền thưởng cho các khoản gửi lớn hơn. Mô hình trả tiền theo từng lần sử dụng ai api này đảm bảo bạn chỉ trả tiền cho những gì bạn sử dụng.
Thông số API
Toàn bộ giới hạn và tính năng thực tế của API ở một nơi — hãy kiểm tra trước khi nạp tiền.
| Mục | Giá trị |
|---|---|
| Định dạng | tương thích OpenAI: mọi SDK OpenAI đều chạy được, chỉ cần đổi base URL và khóa |
| Base URL | https://api.llminferenceapi.com/v1 |
| Xác thực | Authorization: Bearer YOUR_KEY |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| ID mô hình | uncensored |
| Đầu ra tối đa | tối đa phần còn lại của cửa sổ 64.000 token; max_tokens tùy chọn (không giới hạn riêng) |
| Tham số | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | có — server-sent events; phần cuối chứa lượng token đã dùng |
| Chế độ JSON | response_format: {"type": "json_object"} |
| Gọi hàm | có — tools, tool_choice; phản hồi có tool_calls, kể cả khi streaming; kết quả gửi lại bằng role: tool |
| Cửa sổ ngữ cảnh | 64.000 token (đầu vào + đầu ra) |
| Kích thước yêu cầu | tối đa 8 MB |
| Giới hạn tốc độ | 300 yêu cầu mỗi phút cho mỗi khóa |
| Yêu cầu đồng thời | tối đa 8 cùng lúc cho mỗi khóa |
| Header phản hồi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Thời hạn | tín dụng đã trả không hết hạn, không đăng ký định kỳ |
| Thưởng | +5% từ $50, +10% từ $100 |
| Dùng thử miễn phí | $0,50 trong 7 ngày, không cần thẻ · Khóa dùng thử: 2 yêu cầu song song, 60 yêu cầu/phút; hạn mức đầy đủ (8 và 300) sau lần nạp đầu |
| Giá | $0,25 cho 1 triệu token đầu vào · $1,00 cho 1 triệu token đầu ra |
| Nạp tiền | USDT (TRC20) hoặc USDC (Base), số tiền nguyên bất kỳ từ $10 đến $500 |
| Tính phí | tín dụng trả trước theo mức dùng thực tế; lỗi và từ chối miễn phí |
| Đăng nhập | Google hoặc email và mật khẩu |
| Nội dung | cho phép nội dung người lớn; từ chối nội dung tình dục liên quan đến trẻ vị thành niên |
| Khóa | mỗi tài khoản một khóa đang hoạt động; khóa mới thay thế khóa cũ |
Mã lỗi
Lỗi trả về dạng JSON với type cố định; yêu cầu lỗi hoặc bị từ chối không bị tính phí.
| Mã | Loại | Ý nghĩa |
|---|---|---|
400 | bad_request | JSON sai, tin nhắn trống, tham số sai hoặc vượt cửa sổ ngữ cảnh |
401 | missing_key · invalid_key · key_revoked | thiếu khóa, sai khóa hoặc khóa đã bị thay |
402 | no_credit | hết tín dụng — nạp tiền là dùng tiếp ngay |
403 | content_blocked | nội dung tình dục liên quan trẻ vị thành niên — từ chối, không tính phí |
404 | not_found | endpoint không tồn tại |
413 | request_too_large | nội dung lớn hơn 8 MB |
429 | rate_limited · concurrency | vượt 300/phút hoặc 8 đồng thời — chờ rồi thử lại |
503 | upstream_busy | mô hình đang bận — thử lại sau vài giây |
Hỏi đáp
API này có phù hợp cho ứng dụng sản xuất không?
Có, API được thiết kế để sử dụng trong sản xuất với giới hạn tốc độ tiêu chuẩn và các endpoint đáng tin cậy. Tuy nhiên, API không cung cấp đảm bảo SLA hoặc chứng nhận doanh nghiệp như SOC2. API phù hợp nhất cho các ứng dụng ưu tiên đầu ra không kiểm duyệt và giá cả linh hoạt hơn là các đảm bảo doanh nghiệp chính thức.
Thuật ngữ 'không kiểm duyệt' có ý nghĩa gì đối với mô hình này?
Mô hình không từ chối các chủ đề hợp pháp dành cho người lớn, hư cấu, nghiên cứu bảo mật hoặc gây tranh cãi. Mô hình sẽ tạo ra nội dung mà các mô hình khác có thể chặn do bộ lọc an toàn. Giới hạn cứng duy nhất là nội dung khiêu dâm liên quan đến trẻ vị thành niên luôn bị chặn.
Tôi có cần thẻ tín dụng để bắt đầu không?
Không. Bạn có thể đăng ký chỉ với email và mật khẩu. Mọi tài khoản mới đều nhận được $0.50 tín dụng dùng thử có hiệu lực trong 7 ngày. Bạn có thể thêm tín dụng sau này bằng tiền điện tử (USDT hoặc USDC) khi bạn sẵn sàng mở rộng.
Khóa của bạn chỉ cách một biểu mẫu
Tạo tài khoản, sao chép khóa, thay đổi URL cơ sở. Đó là toàn bộ thiết lập.
Lấy khóa API