LLM Inference APIالوثائق
واجهة برمجة التطبيقات للاستنتاج: دليل البدء السريع
ابدأ باستخدام واجهة برمجة التطبيقات للاستنتاج بدون رقابة في أقل من خمس دقائق. غيّر عنوان URL الأساسي ومفتاح API، ثم شغّل كود LLM الحالي الخاص بك ضد نموذج مفتوح الأوزان لدينا بأسعار شفافة لكل رمز.
عنوان URL الأساسي والمصادقة
يتمتّع الـ API لدينا بتوافق كامل مع OpenAI. للتبديل، قم بتحديث إعدادات العميل ليُشير إلى عنوان URL الأساسي الخاص بنا وقم بتوفير مفتاح API الخاص بك. عنوان URL الأساسي هو https://api.llminferenceapi.com/v1. تتم المصادقة عبر رأس الـ Authorization: Bearer القياسي. تحصل على المفتاح فوراً بعد إنشاء حسابك باستخدام البريد الإلكتروني وكلمة المرور فقط—لا يتطلب الأمر رقم هاتف أو بطاقة ائتمان للحصول على التجربة المجانية.
- عنوان URL الأساسي:
https://api.llminferenceapi.com/v1 - رأس:
Authorization: Bearer YOUR_API_KEY - معرف النموذج:
uncensored
يعمل هذا الإعداد مع أي SDK رسمي لـ OpenAI أو مكتبة عميل متوافقة. تحتفظ بهيكل الكود الحالي الخاص بك؛ يتغير فقط نقطة النهاية والمفتاح.
الطلب الأول
أرسل أول طلب إلى نقطة النهاية الخاصة بإكمال الدردشة. معرف النموذج هو uncensored. هذا النموذج هو نموذج لغوي كبير مفتوح الأوزان مُضبط للإجابة دون رفض المحتوى للاستخدام القانوني للبالغين، وليس GPT أو Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'يتضمن جسم الطلب مصفوفة messages القياسية. يمكنك تحديد درجة الحرارة، الحد الأقصى للرموز، والمعايير القياسية الأخرى. تعيد الواجهة استجابة إكمال الدردشة القياسية مع إحصائيات استخدام الرموز. إذا واجهت خطأ 401، فإن مفتاحك غير صالح. يعني خطأ 402 أن رصيدك المسبق الدفع قد استنفد.
تكامل SDK لـ Python
استخدام SDK لـ Python أمر مباشر. قم بتهيئة العميل باستخدام عنوان URL الأساسي الخاص بنا ومفتاح API الخاص بك. يعكس هيكل الكود النمط القياسي لـ OpenAI. يتيح لك هذا استبدال خدمة llm proxy الخاصة بنا دون إعادة كتابة منطق التطبيق.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)تأكد من تمرير الوسيطة model='uncensored'. يحتوي كائن الاستجابة على النص المولد ومقاييس الاستخدام. هذا النهج مثالي للمطورين الذين يريدون حل openai compatible api جاهز للاستخدام. لا توجد تبعيات إضافية مطلوبة بالإضافة إلى SDK القياسي.
استخدام SDK لـ Node.js
لمطوري Node.js، التكامل بسيط بنفس القدر. قم بتعيين baseURL و apiKey في تكوين العميل. يتعامل SDK مع طلبات HTTP إلى نقاط نهاية ai chat api الخاصة بنا تلقائيًا.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);استدعاء chat.completions.create() بمعرف النموذج uncensored. يمكنك تفعيل البث المتدفق للاستجابات أو التعامل معها ككائنات كاملة. يدعم هذا المرونة كلًا من المعالجة الدفعية وتفاعلات المستخدمين في الوقت الفعلي. تدعم الواجهة استدعاء الدوال، مما يتيح لك تعريف الدوال التي يمكن للنموذج استدعاؤها.
الاستجابات المتدفقة
لتجارب المستخدم في الوقت الفعلي، فعّل البث المتدفق. قم بتعيين المعلمة stream إلى true في طلبك. تعيد الواجهة تدفق أحداث الملقم المرسلة (SSE) للاستجابات الجزئية.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)يحتوي كل جزء على جزء جزئي من الاستجابة. يمكنك عرض هذه الرموز للمستخدم عند وصولها، مما يقلل من زمن الاستجابة المُدرَك. هذا أمر حاسم لواجهات الدردشة التي يتوقع فيها تقديم الملاحظات الفورية. تتضمن استجابة البث المتدفق نفس معلومات استخدام الرموز مثل الطلبات غير المتدفقة.
الحدود والأخطاء والسياق
تفرض واجهة برمجة التطبيقات الخاصة بنا نافذة سياق بحجم 100,000 رمز لكل من الإدخال والإخراج معًا. يدعم هذا المستندات الطويلة والمحادثات المعقدة. يتم ضبط حدّ المعدل على 300 طلب في الدقيقة لكل مفتاح. إذا تجاوزت هذا، تتلقى خطأ 429. يتم تقييد أحجام الطلبات بـ 8 ميجابايت.
تشمل الأخطاء الشائعة 401 (مفتاح غير صالح)، و402 (عدم كفاية الرصيد)، و429 (حدّ المعدل). لا ينتهي الرصيد المسبق الدفع أبداً، لذا يمكنك شحن الرصيد في الوقت الذي يناسبك. يبدأ رصيد مسبق الدفع من 10 دولارات أمريكية، مع مكافآت للإيداعات الأكبر. يضمن هذا النموذج pay as you go ai api أن تدفع فقط مقابل ما تستخدمه.
مواصفات API
كل الحدود والميزات الفعلية للـ API في مكان واحد — راجعها قبل شحن الرصيد.
| البند | القيمة |
|---|---|
| صيغة API | متوافق مع OpenAI: يعمل أي SDK من OpenAI بتغيير base URL والمفتاح فقط |
| Base URL | https://api.llminferenceapi.com/v1 |
| المصادقة | Authorization: Bearer YOUR_KEY |
| نقاط النهاية | POST /v1/chat/completions · GET /v1/models |
| معرّف النموذج | uncensored |
| أقصى مخرجات | حتى ما تبقى من نافذة 64,000 رمزًا؛ max_tokens اختياري (بلا حد منفصل) |
| المعاملات | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| البث المتدفق | نعم — server-sent events؛ آخر جزء يتضمن استهلاك الرموز |
| وضع JSON | response_format: {"type": "json_object"} |
| استدعاء الدوال | نعم — tools و tool_choice؛ الرد يتضمن tool_calls حتى أثناء البث؛ تُرسل النتائج كرسالة role: tool |
| نافذة السياق | 64,000 رمز (المدخلات والمخرجات معاً) |
| حجم الطلب | حتى 8 MB |
| حدّ المعدل | 300 طلب في الدقيقة لكل مفتاح |
| الطلبات المتزامنة | حتى 8 في الوقت نفسه لكل مفتاح |
| ترويسات الرد | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| الصلاحية | الرصيد المدفوع لا تنتهي صلاحيته، بدون اشتراك |
| مكافأة | +5% من $50، +10% من $100 |
| رصيد تجريبي مجاني | $0.50 لمدة 7 أيام، بدون بطاقة · مفتاح تجريبي: طلبان متوازيان، 60 طلبًا في الدقيقة؛ الحدود الكاملة (8 و300) بعد أول شحن |
| السعر | $0.25 لكل مليون رمز مدخلات · $1.00 لكل مليون رمز مخرجات |
| شحن الرصيد | USDT (TRC20) أو USDC (Base)، أي مبلغ صحيح من $10 إلى $500 |
| الفوترة | رصيد مسبق الدفع حسب الاستهلاك الفعلي؛ الأخطاء والرفض مجانية |
| تسجيل الدخول | Google أو البريد الإلكتروني وكلمة المرور |
| المحتوى | محتوى البالغين مسموح؛ يُرفض أي محتوى جنسي يتعلق بالقاصرين |
| المفاتيح | مفتاح نشط واحد لكل حساب؛ المفتاح الجديد يحل محل القديم |
رموز الأخطاء
تصل الأخطاء بصيغة JSON مع type ثابت؛ الطلبات الفاشلة أو المرفوضة لا تُحتسب.
| الرمز | النوع | المعنى |
|---|---|---|
400 | bad_request | JSON غير صالح أو رسائل فارغة أو معامل خاطئ أو تجاوز نافذة السياق |
401 | missing_key · invalid_key · key_revoked | لا يوجد مفتاح أو المفتاح خاطئ أو تم استبداله |
402 | no_credit | الرصيد فارغ — اشحن وتستأنف الطلبات فوراً |
403 | content_blocked | محتوى جنسي يتعلق بقاصرين — مرفوض دون احتساب |
404 | not_found | نقطة نهاية غير معروفة |
413 | request_too_large | جسم الطلب أكبر من 8 MB |
429 | rate_limited · concurrency | تجاوز 300 في الدقيقة أو 8 متزامنة — انتظر ثم أعد المحاولة |
503 | upstream_busy | النموذج مشغول — أعد المحاولة بعد ثوانٍ |
أسئلة وأجوبة
هل هذه الواجهة مناسبة لتطبيقات الإنتاج؟
نعم، صُمّمت للاستخدام في الإنتاج مع حدود معدل قياسية ونقاط نهاية موثوقة. ومع ذلك، لا تقدم ضمانات SLA أو شهادات مؤسسية مثل SOC2. هي الأفضل للتطبيقات التي تعطي الأولوية للإخراج بدون رقابة والأسعار المرنة على الضمانات المؤسسية الرسمية.
ماذا يعني 'بدون رقابة' بالنسبة لهذا النموذج؟
لا يرفض النموذج المواضيع القانونية للبالغين، أو الخيالية، أو أبحاث الأمن، أو المثيرة للجدل. سيولد محتوى قد تحظره النماذج الأخرى بسبب فلاتر الأمان. الحد الصارم الوحيد هو أن المحتوى الجنسي الذي يتضمن قاصرين يتم حظره دائمًا.
هل أحتاج إلى بطاقة ائتمان للبدء؟
لا. يمكنك تسجيل الدخول باستخدام البريد الإلكتروني وكلمة المرور فقط. يحصل كل حساب جديد على رصيد تجريبي مجاني بقيمة $0.50 صالح لمدة 7 أيام. يمكنك شحن الرصيد لاحقًا باستخدام العملات المشفرة (USDT أو USDC) عندما تكون جاهزًا للتوسع.
مفتاحك على بُعد نموذج واحد
أنشئ حسابًا، انسخ المفتاح، غيّر عنوان URL الأساسي. هذا هو الإعداد بالكامل.
احصل على مفتاح API