PT ▾

Proxy LLM sem censura pronto para usarhttps://api.llmproxyapi.com/v1

Início rápido: integre o proxy LLM

Integre nosso proxy LLM sem censura com uma única alteração na URL base. A compatibilidade drop-in com a OpenAI significa que seu código existente funciona sem modificações.

URL base e autenticação

Substitua sua URL base padrão do OpenAI pelo nosso endpoint. A autenticação é feita via token Bearer no cabeçalho Autorização. Essa abordagem funciona com qualquer biblioteca cliente compatível com OpenAI. Você não precisa alterar a lógica do seu código, apenas os valores de configuração. Nossa API imita a estrutura de interface padrão do OpenAI, garantindo que o código de integração existente permaneça válido. Isso reduz o tempo de integração para minutos em vez de dias. Você pode regenerar sua chave a qualquer momento no seu painel, o que invalida imediatamente a chave antiga. Isso fornece segurança sem exigir lógica complexa de rotação de tokens no seu aplicativo.

Primeira requisição

Envie uma requisição padrão de completions de chat para testar a conectividade. O endpoint aceita payloads JSON com um identificador de modelo e histórico de mensagens. O ID do nosso modelo é "uncensored". Esse identificador diz ao proxy qual modelo sem censura rotear sua requisição. A estrutura da resposta espelha o formato OpenAI, contendo o conteúdo da mensagem do assistente. Você pode verificar a resposta verificando o campo conteúdo na saída JSON. Isso confirma que sua autenticação e estrutura de payload estão corretas. O endpoint suporta ambos os modos de streaming e não-streaming para requisições padrão.

curl https://api.llmproxyapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Integração com SDK Python

Use a biblioteca oficial OpenAI para Python para interagir com nossa API. Defina api_key para sua chave de proxy e base_url para nosso endpoint. O restante do comportamento da biblioteca permanece idêntico ao uso padrão da OpenAI. Isso inclui suporte para clientes assíncronos, tentativas de reconexão e tratamento de erros padrão. Você pode passar os mesmos parâmetros que usaria normalmente, como temperatura e máx. tokens. O proxy cuida do roteamento para o modelo sem censura nos bastidores. Isso permite que você mantenha sua base de código Python existente enquanto ganha acesso às capacidades do nosso modelo.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Integração com SDK Node.js

O SDK Node.js funciona com nossa API substituindo a URL base. Inicialize o cliente com sua chave de API de proxy e o endpoint correto. Todos os outros métodos, como chat.completions.create, funcionam conforme o esperado. Isso inclui o tratamento de objetos de resposta padrão e tipos de erro. Você pode usar as mesmas estruturas de mensagem e parâmetros que usaria com a OpenAI. O proxy garante que a requisição seja processada pelo modelo sem censura. Essa compatibilidade permite que desenvolvedores troquem de provedor rapidamente sem reescrever a lógica do cliente. É ideal para microsserviços que já usam o padrão do SDK da OpenAI.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Respostas em streaming

Ative o streaming definindo o parâmetro stream como true na sua requisição. A API retorna um stream de Server-Sent Events (SSE). Cada chunk contém atualizações parciais de token, permitindo a exibição em tempo real da resposta. Isso é crítico para interfaces de chat e aplicativos que exigem feedback imediato. O stream termina com um chunk final contendo os metadados da resposta completa. Você pode analisar os chunks usando bibliotecas SSE padrão na sua linguagem preferida. Esse recurso funciona perfeitamente com os SDKs da OpenAI, que lidam com a lógica de análise automaticamente. Ele proporciona uma experiência de usuário fluida sem esperar que toda a resposta seja gerada.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limites de taxa e restrições

Nossa API impõe um limite de 300 requisições por minuto por chave. Se você exceder isso, receberá um código de status 429. Certifique-se de implementar lógica de tentativa com backoff exponencial para esses casos. O tamanho do corpo da requisição é limitado a 8 MB. Essa restrição se aplica ao payload JSON total, incluindo prompt e janela de contexto. O preço é baseado no uso: $0,25 por milhão de tokens de entrada e $1,00 por milhão de tokens de saída. Os créditos são pré-pagos e nunca expiram. Se seu saldo for insuficiente, as requisições retornarão um erro 402. Erros de autenticação retornam um status 401. Não há roteamento complexo ou seleção de fornecedor; o modelo é fixo.

Recursos e limites

Uma tabela com cada limite, recurso e preço.

ItemValor
Formatocompatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave
EndpointsPOST /v1/chat/completions · GET /v1/models
ID do modelouncensored
AutenticaçãoAuthorization: Bearer YOUR_KEY
Base URLhttps://api.llmproxyapi.com/v1
Modo JSONresponse_format: {"type": "json_object"}
Janela de contexto64.000 tokens (entrada + saída)
Parâmetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Chamada de funçõessim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool
Saída máximaaté o restante da janela de 64.000 tokens; max_tokens opcional (sem limite separado)
Streamingsim — server-sent events; o último bloco traz o uso de tokens
Concorrência8 requisições ao mesmo tempo por chave
Limite de taxa300 requisições por minuto por chave
CabeçalhosX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Tamanhoaté 8 MB por requisição
RecargaUSDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500
Bônus+5% a partir de $50, +10% a partir de $100
Validadecrédito pago não expira, sem assinatura
Preço$0,25 por 1M tokens de entrada · $1,00 por 1M de saída
Cobrançacrédito pré-pago pelo uso real; erros e recusas são grátis
Teste grátis$0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga
Conteúdoconteúdo adulto permitido; conteúdo sexual com menores é recusado
LoginGoogle ou e-mail e senha
Chavesuma chave ativa por conta; uma nova substitui a anterior

Códigos de erro

Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.

CódigoTipoSignificado
400bad_requestJSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais
401missing_key · invalid_key · key_revokedchave ausente, errada ou substituída
402no_creditsem crédito — recarregue e continue na hora
403content_blockedconteúdo sexual com menores — recusado, sem cobrança
404not_foundendpoint desconhecido
413request_too_largecorpo acima de 8 MB
429rate_limited · concurrencyacima de 300/min ou 8 em paralelo — aguarde e tente de novo
503upstream_busymodelo ocupado — tente em alguns segundos

Perguntas e respostas

Vocês oferecem embeddings ou geração de imagens?

Não, não oferecemos embeddings, geração de imagens, áudio ou vídeo. Nossa API é estritamente para conclusões de chat de texto. Se precisar de embeddings, deve usar um serviço ou modelo separado. Focamos em inferência de texto de alto desempenho com o modelo sem censura.

Este é um serviço oficial da OpenAI?

Não, somos um serviço independente. Somos compatíveis com o formato da API da OpenAI, mas hospedamos nosso próprio modelo sem censura. Não é GPT-4, GPT-3.5 ou qualquer outro modelo da OpenAI. Você pode usar os mesmos SDKs, mas o modelo subjacente é diferente.

O que acontece se eu exceder meu crédito?

As requisições retornarão um erro 402 Pagamento Necessário. Você pode recarregar sua conta a qualquer momento usando criptomoedas (USDT ou USDC). Créditos nunca expiram, então você pode adicionar fundos quando for conveniente. Não há taxa de assinatura mensal, apenas pagamento por uso.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.

Obter chave de API