TH ▾
รับคีย์ API

LLM Inference APIDocs

Inference API: คู่มือเริ่มต้นใช้งาน

เริ่มต้นใช้งาน inference API แบบไม่เซ็นเซอร์ของเราภายในห้านาที เปลี่ยน URL พื้นฐานและคีย์ API แล้วรันโค้ด LLM ที่มีอยู่ของคุณกับโมเดลแบบเปิดน้ำหนักของเราพร้อมราคาต่อโทเคนที่โปร่งใส

URL พื้นฐานและการตรวจสอบสิทธิ์

API ของเรา เข้ากันได้กับ OpenAI เพียงอัปเดตการตั้งค่าไคลเอนต์ให้ชี้ไปที่ base URL https://api.llminferenceapi.com/v1 และระบุคีย์ API ใช้ header Authorization: Bearer ตามมาตรฐาน รับคีย์ทันทีหลังสมัครด้วยอีเมลและรหัสผ่าน ไม่ต้องใช้เบอร์โทรหรือบัตรเครดิตสำหรับเครดิตทดลองใช้

  • URL พื้นฐาน: https://api.llminferenceapi.com/v1
  • ส่วนหัว: Authorization: Bearer YOUR_API_KEY
  • รหัสโมเดล: uncensored

การตั้งค่านี้ใช้งานได้กับ SDK ทางการของ OpenAI หรือไลบรารีไคลเอนต์ที่เข้ากันได้ใดๆ คุณคงโครงสร้างโค้ดเดิมของคุณไว้; มีเพียงเอนด์พอยต์และคีย์เท่านั้นที่เปลี่ยนแปลง

คำขอแรก

ทำการเรียกใช้งานเอนด์พอยต์ chat completions ครั้งแรก รหัสโมเดลคือ uncensored โมเดลนี้เป็นโมเดลภาษาขนาดใหญ่แบบเปิดน้ำหนักที่ปรับแต่งให้ตอบโดยไม่มีการปฏิเสธเนื้อหาสำหรับการใช้งานผู้ใหญ่ที่ถูกต้องตามกฎหมาย ไม่ใช่ GPT หรือ Claude

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

เนื้อหาคำขอประกอบด้วยอาร์เรย์ messages มาตรฐาน คุณสามารถระบุอุณหภูมิ จำนวนโทเคนสูงสุด และพารามิเตอร์มาตรฐานอื่นๆ ได้ API จะส่งคืนการตอบกลับการเสร็จสิ้นการสนทนามาตรฐานพร้อมสถิติการใช้งานโทเคน หากพบข้อผิดพลาด 401 คีย์ของคุณไม่ถูกต้อง ข้อผิดพลาด 402 หมายความว่าเครดิตแบบเติมเงินล่วงหน้าของคุณหมดแล้ว

การผสานรวม Python SDK

การใช้ Python SDK นั้นตรงไปตรงมา เริ่มต้นไคลเอนต์ด้วย base URL และคีย์ API ของเรา โครงสร้างโค้ดสะท้อนรูปแบบมาตรฐานของ OpenAI สิ่งนี้ช่วยให้คุณสลับบริการ llm proxy ของเราได้โดยไม่ต้องเขียนตรรกะแอปพลิเคชันใหม่

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

ตรวจสอบให้แน่ใจว่าคุณส่งอาร์กิวเมนต์ model='uncensored' ออบเจ็กต์การตอบกลับมีข้อความที่สร้างและเมตริกการใช้งาน วิธีนี้เหมาะสำหรับนักพัฒนาที่ต้องการโซลูชัน openai compatible api ที่พร้อมใช้งานทันที ไม่ต้องใช้ dependencies เพิ่มเติมนอกเหนือจาก SDK มาตรฐาน

การใช้งาน Node.js SDK

สำหรับนักพัฒนา Node.js การผสานรวมง่ายเช่นกัน กำหนดค่า baseURL และ apiKey ในการกำหนดค่าไคลเอนต์ของคุณ SDK จัดการคำขอ HTTP ไปยังเอนด์พอยต์ ai chat api ของเราโดยอัตโนมัติ

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

เรียกใช้ chat.completions.create() ด้วย ID โมเดล uncensored คุณสามารถสตรีมการตอบกลับหรือจัดการเป็นออบเจ็กต์ที่สมบูรณ์ได้ ความยืดหยุ่นนี้รองรับทั้งการประมวลผลแบบแบตช์และการโต้ตอบของผู้ใช้แบบเรียลไทม์ API รองรับ function calling ซึ่งอนุญาตให้คุณกำหนดฟังก์ชันที่โมเดลสามารถเรียกใช้ได้

การตอบสนองแบบสตรีมมิง

สำหรับประสบการณ์ผู้ใช้แบบเรียลไทม์ ให้เปิดใช้งานสตรีมมิง ตั้งค่าพารามิเตอร์ stream เป็น true ในคำขอของคุณ API จะส่งสตรีม Server-Sent Events (SSE) ของการตอบกลับบางส่วน

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

แต่ละชิ้นมีเดลตาบางส่วนของการตอบสนอง คุณสามารถแสดงโทเคนเหล่านี้ให้ผู้ใช้เห็นเมื่อมาถึง ซึ่งช่วยลดความล่าช้าที่รับรู้ สิ่งนี้สำคัญสำหรับอินเทอร์เฟซการสนทนาที่คาดหวังการตอบกลับทันที การตอบสนองแบบสตรีมมิงรวมถึงข้อมูลการใช้งานโทเคนเดียวกันกับคำขอที่ไม่ใช่สตรีมมิง

ขีดจำกัด ข้อผิดพลาด และบริบท

API ของเราบังคับใช้หน้าต่างบริบท 100,000 โทเคนสำหรับทั้งอินพุตและเอาต์พุตรวมกัน สิ่งนี้รองรับเอกสารยาวและการสนทนาที่ซับซ้อน ขีดจำกัดอัตราถูกตั้งค่าไว้ที่ 300 คำขอต่อนาทีต่อคีย์ หากคุณเกินสิ่งนี้ คุณจะได้รับข้อผิดพลาด 429 ร่างคำขอถูกจำกัดไว้ที่ 8 MB

ข้อผิดพลาดทั่วไป ได้แก่ 401 (คีย์ไม่ถูกต้อง), 402 (เครดิตไม่เพียงพอ) และ 429 (ขีดจำกัดอัตรา) เครดิตไม่หมดอายุ ดังนั้นคุณสามารถเติมเงินได้ตามความสะดวก เครดิตแบบเติมเงินล่วงหน้าเริ่มต้นที่ $10 พร้อมโบนัสสำหรับการเติมเงินจำนวนมากขึ้น โมเดล pay as you go ai api นี้ช่วยให้คุณมั่นใจว่าคุณจ่ายเฉพาะสิ่งที่ใช้เท่านั้น

ข้อมูลจำเพาะ API

ขีดจำกัดและความสามารถจริงทั้งหมดของ API ในที่เดียว ตรวจสอบก่อนเติมเงิน

รายการค่า
รูปแบบ APIรองรับ OpenAI: ใช้ OpenAI SDK ใดก็ได้ แค่เปลี่ยน base URL และคีย์
Base URLhttps://api.llminferenceapi.com/v1
การยืนยันตัวตนAuthorization: Bearer YOUR_KEY
เอนด์พอยต์POST /v1/chat/completions · GET /v1/models
ID โมเดลuncensored
เอาต์พุตสูงสุดได้ถึงส่วนที่เหลือของหน้าต่าง 64,000 โทเคน; max_tokens ไม่บังคับ (ไม่มีเพดานแยก)
พารามิเตอร์temperature, top_p, stop, seed, presence_penalty, frequency_penalty
สตรีมมิงรองรับ — server-sent events ชิ้นสุดท้ายมีจำนวนโทเคนที่ใช้
โหมด JSONresponse_format: {"type": "json_object"}
การเรียกใช้ฟังก์ชันรองรับ — tools, tool_choice คำตอบมี tool_calls รวมถึงตอนสตรีม ส่งผลลัพธ์กลับด้วย role: tool
หน้าต่างบริบท64,000 โทเคน (อินพุตรวมเอาต์พุต)
ขนาดคำขอไม่เกิน 8 MB
ขีดจำกัดอัตรา300 คำขอต่อนาทีต่อคีย์
คำขอพร้อมกันสูงสุด 8 คำขอพร้อมกันต่อคีย์
เฮดเดอร์ของคำตอบX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
อายุเครดิตเครดิตที่ซื้อไม่มีวันหมดอายุ ไม่มีการสมัครรายเดือน
โบนัส+5% เมื่อเติมตั้งแต่ $50, +10% ตั้งแต่ $100
เครดิตทดลองใช้ฟรี$0.50 ใช้ได้ 7 วัน ไม่ต้องใช้บัตร · คีย์ทดลอง: 2 คำขอพร้อมกัน, 60 ครั้งต่อนาที; ขีดจำกัดเต็ม (8 และ 300) หลังเติมเงินครั้งแรก
ราคา$0.25 ต่อ 1 ล้านโทเคนอินพุต · $1.00 ต่อ 1 ล้านโทเคนเอาต์พุต
เติมเงินUSDT (TRC20) หรือ USDC (Base) จำนวนเต็มใดก็ได้ตั้งแต่ $10 ถึง $500
การคิดเงินเครดิตแบบเติมเงินล่วงหน้าตามการใช้งานจริง ข้อผิดพลาดและการปฏิเสธไม่คิดเงิน
เข้าสู่ระบบGoogle หรืออีเมลและรหัสผ่าน
เนื้อหาอนุญาตเนื้อหาสำหรับผู้ใหญ่ ปฏิเสธเนื้อหาทางเพศที่เกี่ยวข้องกับผู้เยาว์
คีย์หนึ่งบัญชีมีคีย์ที่ใช้งานได้หนึ่งคีย์ คีย์ใหม่จะแทนคีย์เดิม

รหัสข้อผิดพลาด

ข้อผิดพลาดส่งกลับเป็น JSON พร้อม type ที่คงที่ คำขอที่ล้มเหลวหรือถูกปฏิเสธไม่คิดเงิน

รหัสประเภทความหมาย
400bad_requestJSON ไม่ถูกต้อง ข้อความว่าง พารามิเตอร์ผิด หรือเกินหน้าต่างบริบท
401missing_key · invalid_key · key_revokedไม่มีคีย์ คีย์ผิด หรือคีย์ถูกแทนที่แล้ว
402no_creditเครดิตหมด เติมเงินแล้วใช้งานต่อได้ทันที
403content_blockedเนื้อหาทางเพศเกี่ยวกับผู้เยาว์ ถูกปฏิเสธ ไม่คิดเงิน
404not_foundไม่รู้จักเอนด์พอยต์
413request_too_largeขนาดเกิน 8 MB
429rate_limited · concurrencyเกิน 300/นาที หรือ 8 พร้อมกัน รอแล้วลองใหม่
503upstream_busyโมเดลไม่ว่าง ลองใหม่ในไม่กี่วินาที

ถาม-ตอบ

API นี้เหมาะสำหรับแอปพลิเคชันระดับโปรดักชันหรือไม่?

ใช่ ออกแบบมาเพื่อใช้งานโปรดักชันพร้อมขีดจำกัดอัตราและเอนด์พอยต์ที่เชื่อถือได้ แต่ไม่มีการรับประกัน SLA หรือใบรับรององค์กรเช่น SOC2 เหมาะสำหรับแอปพลิเคชันที่ให้ความสำคัญกับเอาต์พุตแบบไม่เซ็นเซอร์และราคาที่ยืดหยุ่นมากกว่าการรับประกันองค์กรอย่างเป็นทางการ

คำว่า 'ไม่เซ็นเซอร์' สำหรับโมเดลนี้หมายถึงอะไร?

โมเดลไม่ปฏิเสธหัวข้อผู้ใหญ่ที่ถูกต้องตามกฎหมาย เรื่องแต่ง การวิจัยความปลอดภัย หรือหัวข้อที่ถกเถียงได้ จะสร้างเนื้อหาที่โมเดลอื่นอาจบล็อกเนื่องจากตัวกรองความปลอดภัย ขีดจำกัดเดียวที่เข้มงวดคือเนื้อหาทางเพศที่เกี่ยวข้องกับเด็กจะถูกบล็อกเสมอ

ฉันจำเป็นต้องใช้บัตรเครดิตเพื่อเริ่มต้นหรือไม่?

ไม่ คุณสามารถสมัครด้วยอีเมลและรหัสผ่านเท่านั้น บัญชีใหม่ทุกบัญชีจะได้รับเครดิตทดลองใช้ $0.50 ที่มีอายุ 7 วัน คุณสามารถเติมเครดิตในภายหลังโดยใช้คริปโต (USDT หรือ USDC) เมื่อคุณพร้อมที่จะขยาย

คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว

สร้างบัญชี คัดลอกคีย์ เปลี่ยน URL พื้นฐาน นั่นคือการตั้งค่าทั้งหมด

รับคีย์ API