RU ▾
Получить API-ключ

LLM Inference APIДокументация

API инференса: Быстрый старт

Начните работу с нашим API инференса без цензуры за пять минут. Измените базовый URL и API-ключ, затем запустите свой существующий код LLM против нашей модели с открытыми весами с прозрачным ценообразованием за токен.

Базовый URL и аутентификация

Наш API полностью совместим с OpenAI. Чтобы перейти, обновите конфигурацию клиента, указав наш базовый URL, и укажите ваш API-ключ. Базовый URL: https://api.llminferenceapi.com/v1. Аутентификация осуществляется с помощью стандартного заголовка Authorization: Bearer. Вы получаете ключ сразу после регистрации по электронной почте и паролю — для пробного периода не требуется номер телефона или кредитная карта.

  • Базовый URL: https://api.llminferenceapi.com/v1
  • Заголовок: Authorization: Bearer YOUR_API_KEY
  • ID модели: uncensored

Эта настройка работает с любым официальным SDK OpenAI или совместимой библиотекой клиентов. Вы сохраняете существующую структуру кода; изменяются только эндпоинт и ключ.

Первый запрос

Выполните первый вызов эндпоинта chat completions. ID модели — uncensored. Эта модель — большая языковая модель с открытыми весами, настроенная на ответы без отказов в контенте для законного использования взрослыми, а не GPT или Claude.

curl https://api.llminferenceapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Тело запроса включает стандартный массив messages. Вы можете указать temperature, max_tokens и другие стандартные параметры. API возвращает стандартный ответ chat completion со статистикой использования токенов. Если вы получите ошибку 401, ваш ключ недействителен. Ошибка 402 означает, что ваш предоплаченный баланс исчерпан.

Интеграция Python SDK

Использование Python SDK очень просто. Инициализируйте клиент, указав наш базовый URL и API-ключ. Структура кода соответствует стандартному шаблону OpenAI. Это позволяет заменить ваш сервис на наш llm proxy без переписывания логики приложения.

from openai import OpenAI

client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Убедитесь, что передаёте аргумент model='uncensored'. Объект ответа содержит сгенерированный текст и метрики использования. Этот подход идеален для разработчиков, которым нужна готовая замена совместимому с OpenAI API. Дополнительные зависимости не требуются, достаточно стандартного SDK.

Использование Node.js SDK

Для разработчиков Node.js интеграция столь же проста. Установите baseURL и apiKey в конфигурации клиента. SDK автоматически обрабатывает HTTP-запросы к нашим эндпоинтам ai chat api.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Вызовите chat.completions.create() с ID модели uncensored. Вы можете использовать потоковую передачу ответов или обрабатывать их как полные объекты. Эта гибкость поддерживает как пакетную обработку, так и взаимодействие с пользователями в реальном времени. API поддерживает вызов функций, позволяя определять функции, которые модель может вызывать.

Потоковая передача ответов

Для взаимодействия с пользователями в реальном времени включите потоковую передачу. Установите параметр stream в значение true в вашем запросе. API возвращает поток Server-Sent Events (SSE) с частичными ответами.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Каждый чанк содержит частичный дельта-ответ. Вы можете выводить эти токены пользователю по мере их поступления, что снижает воспринимаемую задержку. Это критично для интерфейсов чата, где ожидается немедленная обратная связь. Потоковый ответ включает ту же информацию об использовании токенов, что и непотоковые запросы.

Ограничения, ошибки и контекст

Наш API устанавливает контекстное окно на 100 000 токенов как для ввода, так и для вывода в совокупности. Это поддерживает длинные документы и сложные диалоги. Лимит запросов установлен на 300 запросов в минуту на ключ. Если вы превысите этот лимит, вы получите ошибку 429. Тело запроса ограничено 8 МБ.

Распространённые ошибки: 401 (неверный ключ), 402 (недостаточно средств) и 429 (лимит запросов). Предоплаченный баланс не сгорает, поэтому вы можете пополнить его в удобное время. Предоплаченный баланс начинается от $10, с бонусами за крупные пополнения. Эта модель API ИИ с оплатой по факту гарантирует, что вы платите только за то, что используете.

Характеристики API

Все реальные лимиты и возможности API в одном месте — сверьте их до пополнения.

ПараметрЗначение
Формат APIсовместим с OpenAI: любой OpenAI SDK работает — замените base URL и ключ
Base URLhttps://api.llminferenceapi.com/v1
АвторизацияAuthorization: Bearer YOUR_KEY
ЭндпоинтыPOST /v1/chat/completions · GET /v1/models
ID моделиuncensored
Максимум ответадо остатка окна в 64 000 токенов; max_tokens необязателен (отдельного лимита нет)
Параметрыtemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Потоковая передачада — server-sent events, последний фрагмент содержит расход токенов
JSON-режимresponse_format: {"type": "json_object"}
Вызов функцийда — tools, tool_choice; ответ содержит tool_calls, в том числе в потоке; результат — сообщением role: tool
Контекстное окно64 000 токенов (вход и ответ вместе)
Размер запросадо 8 МБ
Лимит запросов300 запросов в минуту на ключ
Параллельные запросыдо 8 одновременно на ключ
Заголовки ответаX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Срок действияоплаченный баланс не сгорает, без подписки
Бонус+5% от $50, +10% от $100
Пробный баланс$0,50 на 7 дней, без карты · Пробный ключ: 2 параллельных запроса, 60 в минуту; полные лимиты (8 и 300) после первого пополнения
Цена$0,25 за 1 млн входных токенов · $1,00 за 1 млн выходных
ПополнениеUSDT (TRC20) или USDC (Base), любая целая сумма от $10 до $500
Оплатапредоплаченный баланс по фактическому расходу; ошибки и отказы бесплатны
ВходGoogle или e-mail и пароль
Контентконтент для взрослых разрешён; сексуальный контент с несовершеннолетними запрещён
Ключиодин активный ключ на аккаунт; новый заменяет старый

Коды ошибок

Ошибки приходят в JSON с постоянным type; неудачные и отклонённые запросы не оплачиваются.

КодТипЧто значит
400bad_requestневерный JSON, пустые сообщения, неверный параметр или превышено окно контекста
401missing_key · invalid_key · key_revokedнет ключа, ключ неверный или заменён новым
402no_creditбаланс пуст — пополните, работа продолжится сразу
403content_blockedсексуальный контент с несовершеннолетними — отказ, без оплаты
404not_foundнеизвестный эндпоинт
413request_too_largeтело запроса больше 8 МБ
429rate_limited · concurrencyбольше 300/мин или 8 параллельно — подождите и повторите
503upstream_busyмодель занята — повторите через несколько секунд

Вопросы и ответы

Подходит ли этот API для продакшн-приложений?

Да, он предназначен для продакшн-использования со стандартными лимитами запросов и надежными эндпоинтами. Однако он не предлагает гарантий SLA или корпоративных сертификатов, таких как SOC2. Он лучше всего подходит для приложений, которые отдают приоритет выводу без цензуры и гибкому ценообразованию перед формальными корпоративными гарантиями.

Что означает «без цензуры» для этой модели?

Модель не отказывается от законных тем для взрослых, вымышленных сюжетов, исследований в области безопасности или спорных вопросов. Она будет генерировать контент, который другие модели могут заблокировать из-за фильтров безопасности. Единственное жесткое ограничение — контент сексуального характера с участием несовершеннолетних всегда блокируется.

Нужна ли мне кредитная карта, чтобы начать?

Нет. Вы можете войти, указав только электронную почту и пароль. Каждый новый аккаунт получает $0,50 пробного баланса, действительного в течение 7 дней. Вы можете пополнить баланс позже с помощью криптовалюты (USDT или USDC), когда будете готовы масштабироваться.

Ваш ключ — в одной форме от вас

Создайте аккаунт, скопируйте ключ, измените базовый URL. Вот и вся настройка.

Получить API-ключ