LLM Inference APIДокументация
API инференса: Быстрый старт
Начните работу с нашим API инференса без цензуры за пять минут. Измените базовый URL и API-ключ, затем запустите свой существующий код LLM против нашей модели с открытыми весами с прозрачным ценообразованием за токен.
Базовый URL и аутентификация
Наш API полностью совместим с OpenAI. Чтобы перейти, обновите конфигурацию клиента, указав наш базовый URL, и укажите ваш API-ключ. Базовый URL: https://api.llminferenceapi.com/v1. Аутентификация осуществляется с помощью стандартного заголовка Authorization: Bearer. Вы получаете ключ сразу после регистрации по электронной почте и паролю — для пробного периода не требуется номер телефона или кредитная карта.
- Базовый URL:
https://api.llminferenceapi.com/v1 - Заголовок:
Authorization: Bearer YOUR_API_KEY - ID модели:
uncensored
Эта настройка работает с любым официальным SDK OpenAI или совместимой библиотекой клиентов. Вы сохраняете существующую структуру кода; изменяются только эндпоинт и ключ.
Первый запрос
Выполните первый вызов эндпоинта chat completions. ID модели — uncensored. Эта модель — большая языковая модель с открытыми весами, настроенная на ответы без отказов в контенте для законного использования взрослыми, а не GPT или Claude.
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Тело запроса включает стандартный массив messages. Вы можете указать temperature, max_tokens и другие стандартные параметры. API возвращает стандартный ответ chat completion со статистикой использования токенов. Если вы получите ошибку 401, ваш ключ недействителен. Ошибка 402 означает, что ваш предоплаченный баланс исчерпан.
Интеграция Python SDK
Использование Python SDK очень просто. Инициализируйте клиент, указав наш базовый URL и API-ключ. Структура кода соответствует стандартному шаблону OpenAI. Это позволяет заменить ваш сервис на наш llm proxy без переписывания логики приложения.
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Убедитесь, что передаёте аргумент model='uncensored'. Объект ответа содержит сгенерированный текст и метрики использования. Этот подход идеален для разработчиков, которым нужна готовая замена совместимому с OpenAI API. Дополнительные зависимости не требуются, достаточно стандартного SDK.
Использование Node.js SDK
Для разработчиков Node.js интеграция столь же проста. Установите baseURL и apiKey в конфигурации клиента. SDK автоматически обрабатывает HTTP-запросы к нашим эндпоинтам ai chat api.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Вызовите chat.completions.create() с ID модели uncensored. Вы можете использовать потоковую передачу ответов или обрабатывать их как полные объекты. Эта гибкость поддерживает как пакетную обработку, так и взаимодействие с пользователями в реальном времени. API поддерживает вызов функций, позволяя определять функции, которые модель может вызывать.
Потоковая передача ответов
Для взаимодействия с пользователями в реальном времени включите потоковую передачу. Установите параметр stream в значение true в вашем запросе. API возвращает поток Server-Sent Events (SSE) с частичными ответами.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Каждый чанк содержит частичный дельта-ответ. Вы можете выводить эти токены пользователю по мере их поступления, что снижает воспринимаемую задержку. Это критично для интерфейсов чата, где ожидается немедленная обратная связь. Потоковый ответ включает ту же информацию об использовании токенов, что и непотоковые запросы.
Ограничения, ошибки и контекст
Наш API устанавливает контекстное окно на 100 000 токенов как для ввода, так и для вывода в совокупности. Это поддерживает длинные документы и сложные диалоги. Лимит запросов установлен на 300 запросов в минуту на ключ. Если вы превысите этот лимит, вы получите ошибку 429. Тело запроса ограничено 8 МБ.
Распространённые ошибки: 401 (неверный ключ), 402 (недостаточно средств) и 429 (лимит запросов). Предоплаченный баланс не сгорает, поэтому вы можете пополнить его в удобное время. Предоплаченный баланс начинается от $10, с бонусами за крупные пополнения. Эта модель API ИИ с оплатой по факту гарантирует, что вы платите только за то, что используете.
Характеристики API
Все реальные лимиты и возможности API в одном месте — сверьте их до пополнения.
| Параметр | Значение |
|---|---|
| Формат API | совместим с OpenAI: любой OpenAI SDK работает — замените base URL и ключ |
| Base URL | https://api.llminferenceapi.com/v1 |
| Авторизация | Authorization: Bearer YOUR_KEY |
| Эндпоинты | POST /v1/chat/completions · GET /v1/models |
| ID модели | uncensored |
| Максимум ответа | до остатка окна в 64 000 токенов; max_tokens необязателен (отдельного лимита нет) |
| Параметры | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Потоковая передача | да — server-sent events, последний фрагмент содержит расход токенов |
| JSON-режим | response_format: {"type": "json_object"} |
| Вызов функций | да — tools, tool_choice; ответ содержит tool_calls, в том числе в потоке; результат — сообщением role: tool |
| Контекстное окно | 64 000 токенов (вход и ответ вместе) |
| Размер запроса | до 8 МБ |
| Лимит запросов | 300 запросов в минуту на ключ |
| Параллельные запросы | до 8 одновременно на ключ |
| Заголовки ответа | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Срок действия | оплаченный баланс не сгорает, без подписки |
| Бонус | +5% от $50, +10% от $100 |
| Пробный баланс | $0,50 на 7 дней, без карты · Пробный ключ: 2 параллельных запроса, 60 в минуту; полные лимиты (8 и 300) после первого пополнения |
| Цена | $0,25 за 1 млн входных токенов · $1,00 за 1 млн выходных |
| Пополнение | USDT (TRC20) или USDC (Base), любая целая сумма от $10 до $500 |
| Оплата | предоплаченный баланс по фактическому расходу; ошибки и отказы бесплатны |
| Вход | Google или e-mail и пароль |
| Контент | контент для взрослых разрешён; сексуальный контент с несовершеннолетними запрещён |
| Ключи | один активный ключ на аккаунт; новый заменяет старый |
Коды ошибок
Ошибки приходят в JSON с постоянным type; неудачные и отклонённые запросы не оплачиваются.
| Код | Тип | Что значит |
|---|---|---|
400 | bad_request | неверный JSON, пустые сообщения, неверный параметр или превышено окно контекста |
401 | missing_key · invalid_key · key_revoked | нет ключа, ключ неверный или заменён новым |
402 | no_credit | баланс пуст — пополните, работа продолжится сразу |
403 | content_blocked | сексуальный контент с несовершеннолетними — отказ, без оплаты |
404 | not_found | неизвестный эндпоинт |
413 | request_too_large | тело запроса больше 8 МБ |
429 | rate_limited · concurrency | больше 300/мин или 8 параллельно — подождите и повторите |
503 | upstream_busy | модель занята — повторите через несколько секунд |
Вопросы и ответы
Подходит ли этот API для продакшн-приложений?
Да, он предназначен для продакшн-использования со стандартными лимитами запросов и надежными эндпоинтами. Однако он не предлагает гарантий SLA или корпоративных сертификатов, таких как SOC2. Он лучше всего подходит для приложений, которые отдают приоритет выводу без цензуры и гибкому ценообразованию перед формальными корпоративными гарантиями.
Что означает «без цензуры» для этой модели?
Модель не отказывается от законных тем для взрослых, вымышленных сюжетов, исследований в области безопасности или спорных вопросов. Она будет генерировать контент, который другие модели могут заблокировать из-за фильтров безопасности. Единственное жесткое ограничение — контент сексуального характера с участием несовершеннолетних всегда блокируется.
Нужна ли мне кредитная карта, чтобы начать?
Нет. Вы можете войти, указав только электронную почту и пароль. Каждый новый аккаунт получает $0,50 пробного баланса, действительного в течение 7 дней. Вы можете пополнить баланс позже с помощью криптовалюты (USDT или USDC), когда будете готовы масштабироваться.
Ваш ключ — в одной форме от вас
Создайте аккаунт, скопируйте ключ, измените базовый URL. Вот и вся настройка.
Получить API-ключ