LLM Inference APIドキュメント
推論API:クイックスタートガイド
5分以内に無検閲の推論APIを使い始めましょう。ベースURLとAPIキーを変更し、透明なトークン単位の価格設定で既存のLLMコードをオープンウェイトモデルで実行してください。
ベースURLと認証
当社のAPIは完全にOpenAI互換です。切り替えるには、クライアントの設定を更新してベースURLを指定し、APIキーを入力してください。ベースURLはhttps://api.llminferenceapi.com/v1です。認証は標準的なAuthorization: Bearerヘッダーで処理されます。メールアドレスとパスワードだけで登録すると、すぐにキーが発行されます。トライアルには電話番号やクレジットカードは不要です。
- ベースURL:
https://api.llminferenceapi.com/v1 - ヘッダー:
Authorization: Bearer YOUR_API_KEY - モデルID:
uncensored
この設定は、公式のOpenAI SDKまたは互換クライアントライブラリのいずれでも動作します。既存のコード構造を維持したまま、エンドポイントとキーのみを変更してください。
最初のリクエスト
チャット補完エンドポイントに最初の呼び出しを行ってください。モデルIDはuncensoredです。このモデルは、法的な成人向け用途においてコンテンツ拒否なしで回答するように調整されたオープンウェイト大規模言語モデルであり、GPTやClaudeではありません。
curl https://api.llminferenceapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'リクエストボディには標準のmessages配列が含まれます。温度、最大トークン数、その他の標準パラメータを指定できます。APIはトークン使用統計を含む標準的なチャット完了レスポンスを返します。401エラーが発生した場合は、キーが無効です。402エラーは、前払いクレジットが枯渇したことを意味します。
Python SDK統合
Python SDKの使用は簡単です。ベースURLとAPIキーでクライアントを初期化してください。コード構造は標準的なOpenAIパターンを反映しています。これにより、アプリケーションロジックを書き換えることなく、当社のllmプロキシサービスに置き換えることができます。
from openai import OpenAI
client = OpenAI(base_url="https://api.llminferenceapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)model='uncensored'引数を渡すことを確認してください。レスポンスオブジェクトには生成されたテキストと使用メトリクスが含まれます。このアプローチは、そのまま置き換え可能なOpenAI互換APIソリューションを求めている開発者に最適です。標準SDK以外に追加の依存関係は必要ありません。
Node.js SDKの使用
Node.js開発者にとって、統合は equally シンプルです。クライアント設定でbaseURLとapiKeyを設定してください。SDKが自動的に当社のai chat apiエンドポイントへのHTTPリクエストを処理します。
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llminferenceapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);モデルIDuncensoredでchat.completions.create()を呼び出してください。レスポンスをストリーミングするか、完了したオブジェクトとして処理できます。この柔軟性はバッチ処理とリアルタイムのユーザーインタラクションの両方をサポートします。APIはツール呼び出しをサポートしており、モデルが呼び出すことができる関数を定義できます。
ストリーミングレスポンス
リアルタイムのユーザー体験のためにストリーミングを有効にしてください。リクエストでstreamパラメータをtrueに設定してください。APIは部分的なレスポンスのServer-Sent Events (SSE)ストリームを返します。
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)各チャンクにはレスポンスの部分的なデルタが含まれます。到着するたびにこれらのトークンをユーザーに表示することで、知覚されるレイテンシを削減できます。即時フィードバックが期待されるチャットインターフェースではこれが重要です。ストリーミングレスポンスには、非ストリーミングリクエストと同じトークン使用情報が含まれます。
制限、エラー、コンテキスト
当APIは、入力と出力の合計で100,000トークンのコンテキストウィンドウを適用します。これは長いドキュメントや複雑な会話をサポートします。レート制限はキーあたり1分あたり300リクエストに設定されています。これを超えると、429エラーが発生します。リクエストボディは8 MBに制限されています。
よくあるエラーには、401(無効なキー)、402(クレジット不足)、429(レート制限)があります。クレジットは期限切れにならないため、都合の良い時にチャージできます。前払いクレジットは$10から開始され、大口入金にはボーナスが付きます。このpay as you go ai apiモデルにより、使用した分だけのみお支払いいただきます。
API 仕様
購入前に確認できるよう、API の実際の制限と機能をすべてまとめました。
| 項目 | 内容 |
|---|---|
| 形式 | OpenAI 互換:どの OpenAI SDK でも base URL とキーを変えるだけで動作 |
| Base URL | https://api.llminferenceapi.com/v1 |
| 認証 | Authorization: Bearer YOUR_KEY |
| エンドポイント | POST /v1/chat/completions · GET /v1/models |
| モデル ID | uncensored |
| 最大出力 | 64,000 トークンのウィンドウの残りまで。max_tokens は任意(個別の上限なし) |
| パラメータ | temperature、top_p、stop、seed、presence_penalty、frequency_penalty |
| ストリーミング | 対応 — SSE、最後のチャンクにトークン使用量 |
| JSON モード | response_format: {"type": "json_object"} |
| 関数呼び出し | 対応 — tools、tool_choice。応答に tool_calls(ストリーミングでも)、結果は role: tool で返送 |
| コンテキスト長 | 64,000 トークン(入力+出力) |
| リクエストサイズ | 最大 8 MB |
| レート制限 | キーごとに毎分 300 リクエスト |
| 同時実行 | キーごとに同時 8 リクエストまで |
| レスポンスヘッダー | X-Request-Id、X-Balance-USD、X-RateLimit-Limit-Requests、X-RateLimit-Limit-Concurrency |
| 有効期限 | 購入クレジットは失効なし、サブスクなし |
| ボーナス | $50 以上で +5%、$100 以上で +10% |
| 無料トライアル | $0.50、7 日間、カード不要 · トライアルキー: 同時2件、毎分60件。初回チャージ後に上限が8件・300件へ拡大 |
| 料金 | 入力 100 万トークン $0.25 · 出力 100 万トークン $1.00 |
| チャージ | USDT(TRC20)または USDC(Base)、$10〜$500 の任意の整数額 |
| 課金 | 前払いクレジットから実使用量で課金。エラーと拒否は無料 |
| ログイン | Google またはメール+パスワード |
| コンテンツ | 成人向けコンテンツ可。未成年者を含む性的コンテンツは拒否 |
| キー | アカウントごとに有効なキーは 1 つ。新しいキーで旧キーは無効 |
エラーコード
エラーは固定の type を持つ JSON で返ります。失敗・拒否されたリクエストは課金されません。
| コード | タイプ | 意味 |
|---|---|---|
400 | bad_request | JSON 不正、メッセージ空、パラメータ誤り、またはコンテキスト超過 |
401 | missing_key · invalid_key · key_revoked | キーなし・誤り・新しいキーに置換済み |
402 | no_credit | 残高ゼロ — チャージすれば即再開 |
403 | content_blocked | 未成年者を含む性的コンテンツ — 拒否、課金なし |
404 | not_found | 不明なエンドポイント |
413 | request_too_large | 本文が 8 MB 超 |
429 | rate_limited · concurrency | 毎分 300 回または同時 8 件を超過 — 待って再試行 |
503 | upstream_busy | モデル混雑 — 数秒後に再試行 |
質問と回答
このAPIは本番環境のアプリケーションに適していますか?
はい、標準のレート制限と信頼性のあるエンドポイントで本番環境向けに設計されています。ただし、SLA保証やSOC2のようなエンタープライズ認証は提供しません。公式なエンタープライズ保証よりも無検閲の出力と柔軟な価格設定を優先するアプリケーションに最適です。
このモデルにおける「無検閲」とは何を意味しますか?
このモデルは、合法的な成人向け、フィクション、セキュリティ研究、または論争的なトピックを拒否しません。安全フィルターにより他のモデルがブロックする可能性のあるコンテンツを生成します。唯一のハード制限は、未成年者を含む性的コンテンツが常にブロックされることです。
開始するにはクレジットカードが必要ですか?
いいえ。メールアドレスとパスワードだけで登録できます。すべての新規アカウントには、7日間有効な$0.50のトライアルクレジットが付与されます。スケーリングの準備ができたら、暗号通貨(USDTまたはUSDC)で後からクレジットを追加できます。
キーはフォーム 1 つで手に入ります
アカウントを作成し、キーをコピーし、ベースURLを変更します。これがセットアップのすべてです。
API キーを取得