LLM Inference APIPreços
API de Inferência: Preços Simples e Transparentes
Créditos pré-pagos alimentam cada requisição em nossa API de inferência com pagamento por uso, com taxas transparentes por token e sem taxas de assinatura ocultas. Seu saldo cobre o uso exatamente, garantindo custos previsíveis do primeiro ao último token.
Sem assinatura. Crédito pré-pago nunca expira.
Calculadora de custos
Exemplos práticos
Resumindo um documento técnico longo
Processar um prompt de 50.000 tokens para gerar um resumo de 1.000 tokens custa $0,0125 para entrada e $0,001 para saída, totalizando $0,0135. Essa carga de trabalho se encaixa bem em nossa janela de contexto de 100k e demonstra processamento em lote de baixo custo.
Sessão de chat de usuário avançado
Uma sessão usando uma janela de contexto de 10.000 tokens com 2.000 tokens de saída custa $0,0025 para entrada e $0,002 para saída. O total é $0,0045, mostrando que mesmo com contexto substancial, o modelo por token permanece econômico para uso interativo.
Geração de conteúdo em alto volume
Gerar 50.000 tokens de saída a partir de um prompt pequeno de 1.000 tokens custa $0,00025 para entrada e $0,05 para saída. O total é $0,05025, ilustrando que os tokens de saída representam a maioria do custo em fluxos de trabalho intensivos em conteúdo.
Preços por Token
Nossa API de inferência cobra estritamente pelo volume de tokens, com tokens de entrada a $0,25 por milhão e tokens de saída a $1,00 por milhão. Essa estrutura reflete a diferença computacional entre ler contexto e gerar texto. Tokens de entrada cobrem a janela de contexto de 100.000 tokens, permitindo que você envie prompts grandes ou históricos de conversas. Tokens de saída são cobrados pela geração do modelo. Como não agrupamos recursos como geração de imagem ou áudio, você paga apenas pelo texto que realmente processa. Este modelo de API de IA pagamento por uso garante que usuários de alto volume não paguem mais do que o necessário por recursos não utilizados. O preço é transparente, sem sobrecarga por requisição ou cobranças mínimas. Você pode calcular seu custo exato multiplicando suas contagens de tokens por essas taxas. Essa abordagem mantém os custos previsíveis para interações curtas e cenários de hospedagem LLM de longa duração.
Créditos Pré-pagos
Cada requisição é deduzida do seu saldo pré-pago, que nunca expira. Você recarrega com um mínimo de $10 usando cripto (USDT ou USDC). Este modelo garante que seu uso nunca exceda o que você carregou, proporcionando controle rigoroso de orçamento. Diferente de serviços de assinatura, você paga apenas pelo que consome, tornando-o um proxy LLM eficiente para cargas de trabalho variáveis. Créditos são aplicados instantaneamente, permitindo acesso imediato à API. Não há taxas mensais ou cobranças recorrentes, então você pode recarregar apenas quando necessário. Essa flexibilidade suporta desenvolvedores que precisam de capacidade de pico ou querem testar o LLM sem censura sem se comprometer com um contrato de longo prazo. Seu saldo permanece disponível indefinidamente, então você pode pausar o uso sem perder seus fundos.
Créditos Bônus
Recompensamos recargas maiores com créditos bônus para estender seu uso. Adicionar $50 concede bônus de 5%, enquanto $100 adiciona 10%. Os bônus são aplicados ao saldo pré-pago e usados para consumo de tokens. Isso reduz o custo por token para usuários avançados que mantêm saldo maior. Os créditos bônus não expiram e seguem as mesmas regras. Essa estrutura suporta uso consistente de gateway LLM sem fricção. Também torna a API de inferência mais econômica para equipes ou indivíduos com necessidades contínuas e previsíveis. Créditos bônus são adicionados automaticamente após recarga bem-sucedida.
Limites e o que está incluído
Mesmo preço para tudo — chamada de funções e modo JSON sem custo extra.
| Item | Valor |
|---|---|
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Saída máxima | até o restante da janela de 64.000 tokens; max_tokens opcional (sem limite separado) |
| Janela de contexto | 64.000 tokens (entrada + saída) |
| Modo JSON | response_format: {"type": "json_object"} |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Limite de taxa | 300 requisições por minuto por chave |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Validade | crédito pago não expira, sem assinatura |
Especificações completas e códigos de erro estão na documentação.
Perguntas e respostas
Os créditos pré-pagos expiram?
Não, seus créditos pré-pagos nunca expiram. Você pode recarregar sua conta a qualquer momento e o saldo permanece disponível indefinidamente até que você o use para requisições na API.
O que acontece se eu exceder meu limite de requisições?
Se você exceder o limite de 300 requisições por minuto, receberá um erro padrão de limite de requisições. Seu saldo pré-pago não é afetado pelos limites de taxa; você simplesmente precisa esperar a janela reiniciar antes de enviar mais requisições.
Posso usar a API para fins comerciais?
Sim, nosso modelo LLM sem censura está disponível para uso adulto legal, incluindo aplicações comerciais. Desde que o conteúdo não envolva sexualidade com menores, você pode usar a API para qualquer finalidade legal, incluindo negócios, pesquisa ou entretenimento.
Como rastrear meu uso de tokens?
Você pode monitorar o uso de tokens diretamente no painel da sua conta. Cada resposta da API inclui contagens de tokens de entrada e saída, permitindo que você verifique seus custos. Você também pode verificar seu saldo restante a qualquer momento para garantir que tenha créditos suficientes para sua próxima requisição.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.
Obter chave de API