Inference API: คู่มือเริ่มต้นใช้งาน
เริ่มต้นใช้งาน inference API แบบไม่เซ็นเซอร์ของเราภายในห้านาที เปลี่ยน URL พื้นฐานและคีย์ API แล้วรันโค้ด LLM ที่มีอยู่ของคุณกับโมเดลแบบเปิดน้ำหนักของเราพร้อมราคาต่อโทเคนที่โปร่งใส
URL พื้นฐานและการตรวจสอบสิทธิ์
API ของเรา เข้ากันได้กับ OpenAI เพียงอัปเดตการตั้งค่าไคลเอนต์ให้ชี้ไปที่ base URL https://api.llminferenceapi.com/v1 และระบุคีย์ API ใช้ header Authorization: Bearer ตามมาตรฐาน รับคีย์ทันทีหลังสมัครด้วยอีเมลและรหัสผ่าน ไม่ต้องใช้เบอร์โทรหรือบัตรเครดิตสำหรับเครดิตทดลองใช้
- URL พื้นฐาน:
https://api.llminferenceapi.com/v1 - ส่วนหัว:
Authorization: Bearer YOUR_API_KEY - รหัสโมเดล:
uncensored
การตั้งค่านี้ใช้งานได้กับ SDK ทางการของ OpenAI หรือไลบรารีไคลเอนต์ที่เข้ากันได้ใดๆ คุณคงโครงสร้างโค้ดเดิมของคุณไว้; มีเพียงเอนด์พอยต์และคีย์เท่านั้นที่เปลี่ยนแปลง
คำขอแรก
ทำการเรียกใช้งานเอนด์พอยต์ chat completions ครั้งแรก รหัสโมเดลคือ uncensored โมเดลนี้เป็นโมเดลภาษาขนาดใหญ่แบบเปิดน้ำหนักที่ปรับแต่งให้ตอบโดยไม่มีการปฏิเสธเนื้อหาสำหรับการใช้งานผู้ใหญ่ที่ถูกต้องตามกฎหมาย ไม่ใช่ GPT หรือ Claude
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'เนื้อหาคำขอประกอบด้วยอาร์เรย์ messages มาตรฐาน คุณสามารถระบุอุณหภูมิ จำนวนโทเคนสูงสุด และพารามิเตอร์มาตรฐานอื่นๆ ได้ API จะส่งคืนการตอบกลับการเสร็จสิ้นการสนทนามาตรฐานพร้อมสถิติการใช้งานโทเคน หากพบข้อผิดพลาด 401 คีย์ของคุณไม่ถูกต้อง ข้อผิดพลาด 402 หมายความว่าเครดิตแบบเติมเงินล่วงหน้าของคุณหมดแล้ว
การผสานรวม Python SDK
การใช้ Python SDK นั้นตรงไปตรงมา เริ่มต้นไคลเอนต์ด้วย base URL และคีย์ API ของเรา โครงสร้างโค้ดสะท้อนรูปแบบมาตรฐานของ OpenAI สิ่งนี้ช่วยให้คุณสลับบริการ llm proxy ของเราได้โดยไม่ต้องเขียนตรรกะแอปพลิเคชันใหม่
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)ตรวจสอบให้แน่ใจว่าคุณส่งอาร์กิวเมนต์ model='uncensored' ออบเจ็กต์การตอบกลับมีข้อความที่สร้างและเมตริกการใช้งาน วิธีนี้เหมาะสำหรับนักพัฒนาที่ต้องการโซลูชัน openai compatible api ที่พร้อมใช้งานทันที ไม่ต้องใช้ dependencies เพิ่มเติมนอกเหนือจาก SDK มาตรฐาน
การใช้งาน Node.js SDK
สำหรับนักพัฒนา Node.js การผสานรวมง่ายเช่นกัน กำหนดค่า baseURL และ apiKey ในการกำหนดค่าไคลเอนต์ของคุณ SDK จัดการคำขอ HTTP ไปยังเอนด์พอยต์ ai chat api ของเราโดยอัตโนมัติ
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);เรียกใช้ chat.completions.create() ด้วย ID โมเดล uncensored คุณสามารถสตรีมการตอบกลับหรือจัดการเป็นออบเจ็กต์ที่สมบูรณ์ได้ ความยืดหยุ่นนี้รองรับทั้งการประมวลผลแบบแบตช์และการโต้ตอบของผู้ใช้แบบเรียลไทม์ API รองรับ function calling ซึ่งอนุญาตให้คุณกำหนดฟังก์ชันที่โมเดลสามารถเรียกใช้ได้
การตอบสนองแบบสตรีมมิง
สำหรับประสบการณ์ผู้ใช้แบบเรียลไทม์ ให้เปิดใช้งานสตรีมมิง ตั้งค่าพารามิเตอร์ stream เป็น true ในคำขอของคุณ API จะส่งสตรีม Server-Sent Events (SSE) ของการตอบกลับบางส่วน
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)แต่ละชิ้นมีเดลตาบางส่วนของการตอบสนอง คุณสามารถแสดงโทเคนเหล่านี้ให้ผู้ใช้เห็นเมื่อมาถึง ซึ่งช่วยลดความล่าช้าที่รับรู้ สิ่งนี้สำคัญสำหรับอินเทอร์เฟซการสนทนาที่คาดหวังการตอบกลับทันที การตอบสนองแบบสตรีมมิงรวมถึงข้อมูลการใช้งานโทเคนเดียวกันกับคำขอที่ไม่ใช่สตรีมมิง
ขีดจำกัด ข้อผิดพลาด และบริบท
API ของเราบังคับใช้หน้าต่างบริบท 100,000 โทเคนสำหรับทั้งอินพุตและเอาต์พุตรวมกัน สิ่งนี้รองรับเอกสารยาวและการสนทนาที่ซับซ้อน ขีดจำกัดอัตราถูกตั้งค่าไว้ที่ 300 คำขอต่อนาทีต่อคีย์ หากคุณเกินสิ่งนี้ คุณจะได้รับข้อผิดพลาด 429 ร่างคำขอถูกจำกัดไว้ที่ 8 MB
ข้อผิดพลาดทั่วไป ได้แก่ 401 (คีย์ไม่ถูกต้อง), 402 (เครดิตไม่เพียงพอ) และ 429 (ขีดจำกัดอัตรา) เครดิตไม่หมดอายุ ดังนั้นคุณสามารถเติมเงินได้ตามความสะดวก เครดิตแบบเติมเงินล่วงหน้าเริ่มต้นที่ $10 พร้อมโบนัสสำหรับการเติมเงินจำนวนมากขึ้น โมเดล pay as you go ai api นี้ช่วยให้คุณมั่นใจว่าคุณจ่ายเฉพาะสิ่งที่ใช้เท่านั้น
ข้อมูลจำเพาะ API
ขีดจำกัดและความสามารถจริงทั้งหมดของ API ในที่เดียว ตรวจสอบก่อนเติมเงิน
| รายการ | ค่า |
|---|---|
| รูปแบบ API | รองรับ OpenAI: ใช้ OpenAI SDK ใดก็ได้ แค่เปลี่ยน base URL และคีย์ |
| Base URL | https://api.llminferenceapi.com/v1 |
| การยืนยันตัวตน | Authorization: Bearer YOUR_KEY |
| เอนด์พอยต์ | POST /v1/chat/completions · GET /v1/models |
| ID โมเดล | uncensored |
| เอาต์พุตสูงสุด | ได้ถึงส่วนที่เหลือของหน้าต่าง 64,000 โทเคน; max_tokens ไม่บังคับ (ไม่มีเพดานแยก) |
| พารามิเตอร์ | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| สตรีมมิง | รองรับ — server-sent events ชิ้นสุดท้ายมีจำนวนโทเคนที่ใช้ |
| โหมด JSON | response_format: {"type": "json_object"} |
| การเรียกใช้ฟังก์ชัน | รองรับ — tools, tool_choice คำตอบมี tool_calls รวมถึงตอนสตรีม ส่งผลลัพธ์กลับด้วย role: tool |
| หน้าต่างบริบท | 64,000 โทเคน (อินพุตรวมเอาต์พุต) |
| ขนาดคำขอ | ไม่เกิน 8 MB |
| ขีดจำกัดอัตรา | 300 คำขอต่อนาทีต่อคีย์ |
| คำขอพร้อมกัน | สูงสุด 8 คำขอพร้อมกันต่อคีย์ |
| เฮดเดอร์ของคำตอบ | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| อายุเครดิต | เครดิตที่ซื้อไม่มีวันหมดอายุ ไม่มีการสมัครรายเดือน |
| โบนัส | +5% เมื่อเติมตั้งแต่ $50, +10% ตั้งแต่ $100 |
| เครดิตทดลองใช้ฟรี | $0.50 ใช้ได้ 7 วัน ไม่ต้องใช้บัตร · คีย์ทดลอง: 2 คำขอพร้อมกัน, 60 ครั้งต่อนาที; ขีดจำกัดเต็ม (8 และ 300) หลังเติมเงินครั้งแรก |
| ราคา | $0.25 ต่อ 1 ล้านโทเคนอินพุต · $1.00 ต่อ 1 ล้านโทเคนเอาต์พุต |
| เติมเงิน | USDT (TRC20) หรือ USDC (Base) จำนวนเต็มใดก็ได้ตั้งแต่ $10 ถึง $500 |
| การคิดเงิน | เครดิตแบบเติมเงินล่วงหน้าตามการใช้งานจริง ข้อผิดพลาดและการปฏิเสธไม่คิดเงิน |
| เข้าสู่ระบบ | Google หรืออีเมลและรหัสผ่าน |
| เนื้อหา | อนุญาตเนื้อหาสำหรับผู้ใหญ่ ปฏิเสธเนื้อหาทางเพศที่เกี่ยวข้องกับผู้เยาว์ |
| คีย์ | หนึ่งบัญชีมีคีย์ที่ใช้งานได้หนึ่งคีย์ คีย์ใหม่จะแทนคีย์เดิม |
รหัสข้อผิดพลาด
ข้อผิดพลาดส่งกลับเป็น JSON พร้อม type ที่คงที่ คำขอที่ล้มเหลวหรือถูกปฏิเสธไม่คิดเงิน
| รหัส | ประเภท | ความหมาย |
|---|---|---|
400 | bad_request | JSON ไม่ถูกต้อง ข้อความว่าง พารามิเตอร์ผิด หรือเกินหน้าต่างบริบท |
401 | missing_key · invalid_key · key_revoked | ไม่มีคีย์ คีย์ผิด หรือคีย์ถูกแทนที่แล้ว |
402 | no_credit | เครดิตหมด เติมเงินแล้วใช้งานต่อได้ทันที |
403 | content_blocked | เนื้อหาทางเพศเกี่ยวกับผู้เยาว์ ถูกปฏิเสธ ไม่คิดเงิน |
404 | not_found | ไม่รู้จักเอนด์พอยต์ |
413 | request_too_large | ขนาดเกิน 8 MB |
429 | rate_limited · concurrency | เกิน 300/นาที หรือ 8 พร้อมกัน รอแล้วลองใหม่ |
503 | upstream_busy | โมเดลไม่ว่าง ลองใหม่ในไม่กี่วินาที |
ถาม-ตอบ
API นี้เหมาะสำหรับแอปพลิเคชันระดับโปรดักชันหรือไม่?
ใช่ ออกแบบมาเพื่อใช้งานโปรดักชันพร้อมขีดจำกัดอัตราและเอนด์พอยต์ที่เชื่อถือได้ แต่ไม่มีการรับประกัน SLA หรือใบรับรององค์กรเช่น SOC2 เหมาะสำหรับแอปพลิเคชันที่ให้ความสำคัญกับเอาต์พุตแบบไม่เซ็นเซอร์และราคาที่ยืดหยุ่นมากกว่าการรับประกันองค์กรอย่างเป็นทางการ
คำว่า 'ไม่เซ็นเซอร์' สำหรับโมเดลนี้หมายถึงอะไร?
โมเดลไม่ปฏิเสธหัวข้อผู้ใหญ่ที่ถูกต้องตามกฎหมาย เรื่องแต่ง การวิจัยความปลอดภัย หรือหัวข้อที่ถกเถียงได้ จะสร้างเนื้อหาที่โมเดลอื่นอาจบล็อกเนื่องจากตัวกรองความปลอดภัย ขีดจำกัดเดียวที่เข้มงวดคือเนื้อหาทางเพศที่เกี่ยวข้องกับเด็กจะถูกบล็อกเสมอ
ฉันจำเป็นต้องใช้บัตรเครดิตเพื่อเริ่มต้นหรือไม่?
ไม่ คุณสามารถสมัครด้วยอีเมลและรหัสผ่านเท่านั้น บัญชีใหม่ทุกบัญชีจะได้รับเครดิตทดลองใช้ $0.50 ที่มีอายุ 7 วัน คุณสามารถเติมเครดิตในภายหลังโดยใช้คริปโต (USDT หรือ USDC) เมื่อคุณพร้อมที่จะขยาย
คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว
สร้างบัญชี คัดลอกคีย์ เปลี่ยน URL พื้นฐาน นั่นคือการตั้งค่าทั้งหมด
รับคีย์ API