Início rápido: integre o proxy LLM
Integre nosso proxy LLM sem censura com uma única alteração na URL base. A compatibilidade drop-in com a OpenAI significa que seu código existente funciona sem modificações.
URL base e autenticação
Substitua sua URL base padrão do OpenAI pelo nosso endpoint. A autenticação é feita via token Bearer no cabeçalho Autorização. Essa abordagem funciona com qualquer biblioteca cliente compatível com OpenAI. Você não precisa alterar a lógica do seu código, apenas os valores de configuração. Nossa API imita a estrutura de interface padrão do OpenAI, garantindo que o código de integração existente permaneça válido. Isso reduz o tempo de integração para minutos em vez de dias. Você pode regenerar sua chave a qualquer momento no seu painel, o que invalida imediatamente a chave antiga. Isso fornece segurança sem exigir lógica complexa de rotação de tokens no seu aplicativo.
Primeira requisição
Envie uma requisição padrão de completions de chat para testar a conectividade. O endpoint aceita payloads JSON com um identificador de modelo e histórico de mensagens. O ID do nosso modelo é "uncensored". Esse identificador diz ao proxy qual modelo sem censura rotear sua requisição. A estrutura da resposta espelha o formato OpenAI, contendo o conteúdo da mensagem do assistente. Você pode verificar a resposta verificando o campo conteúdo na saída JSON. Isso confirma que sua autenticação e estrutura de payload estão corretas. O endpoint suporta ambos os modos de streaming e não-streaming para requisições padrão.
curl https://api.llmproxyapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integração com SDK Python
Use a biblioteca oficial OpenAI para Python para interagir com nossa API. Defina api_key para sua chave de proxy e base_url para nosso endpoint. O restante do comportamento da biblioteca permanece idêntico ao uso padrão da OpenAI. Isso inclui suporte para clientes assíncronos, tentativas de reconexão e tratamento de erros padrão. Você pode passar os mesmos parâmetros que usaria normalmente, como temperatura e máx. tokens. O proxy cuida do roteamento para o modelo sem censura nos bastidores. Isso permite que você mantenha sua base de código Python existente enquanto ganha acesso às capacidades do nosso modelo.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integração com SDK Node.js
O SDK Node.js funciona com nossa API substituindo a URL base. Inicialize o cliente com sua chave de API de proxy e o endpoint correto. Todos os outros métodos, como chat.completions.create, funcionam conforme o esperado. Isso inclui o tratamento de objetos de resposta padrão e tipos de erro. Você pode usar as mesmas estruturas de mensagem e parâmetros que usaria com a OpenAI. O proxy garante que a requisição seja processada pelo modelo sem censura. Essa compatibilidade permite que desenvolvedores troquem de provedor rapidamente sem reescrever a lógica do cliente. É ideal para microsserviços que já usam o padrão do SDK da OpenAI.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Respostas em streaming
Ative o streaming definindo o parâmetro stream como true na sua requisição. A API retorna um stream de Server-Sent Events (SSE). Cada chunk contém atualizações parciais de token, permitindo a exibição em tempo real da resposta. Isso é crítico para interfaces de chat e aplicativos que exigem feedback imediato. O stream termina com um chunk final contendo os metadados da resposta completa. Você pode analisar os chunks usando bibliotecas SSE padrão na sua linguagem preferida. Esse recurso funciona perfeitamente com os SDKs da OpenAI, que lidam com a lógica de análise automaticamente. Ele proporciona uma experiência de usuário fluida sem esperar que toda a resposta seja gerada.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limites de taxa e restrições
Nossa API impõe um limite de 300 requisições por minuto por chave. Se você exceder isso, receberá um código de status 429. Certifique-se de implementar lógica de tentativa com backoff exponencial para esses casos. O tamanho do corpo da requisição é limitado a 8 MB. Essa restrição se aplica ao payload JSON total, incluindo prompt e janela de contexto. O preço é baseado no uso: $0,25 por milhão de tokens de entrada e $1,00 por milhão de tokens de saída. Os créditos são pré-pagos e nunca expiram. Se seu saldo for insuficiente, as requisições retornarão um erro 402. Erros de autenticação retornam um status 401. Não há roteamento complexo ou seleção de fornecedor; o modelo é fixo.
Recursos e limites
Uma tabela com cada limite, recurso e preço.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| ID do modelo | uncensored |
| Autenticação | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.llmproxyapi.com/v1 |
| Modo JSON | response_format: {"type": "json_object"} |
| Janela de contexto | 64.000 tokens (entrada + saída) |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Saída máxima | até o restante da janela de 64.000 tokens; max_tokens opcional (sem limite separado) |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Limite de taxa | 300 requisições por minuto por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamanho | até 8 MB por requisição |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Validade | crédito pago não expira, sem assinatura |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
| Login | Google ou e-mail e senha |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
Códigos de erro
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
Vocês oferecem embeddings ou geração de imagens?
Não, não oferecemos embeddings, geração de imagens, áudio ou vídeo. Nossa API é estritamente para conclusões de chat de texto. Se precisar de embeddings, deve usar um serviço ou modelo separado. Focamos em inferência de texto de alto desempenho com o modelo sem censura.
Este é um serviço oficial da OpenAI?
Não, somos um serviço independente. Somos compatíveis com o formato da API da OpenAI, mas hospedamos nosso próprio modelo sem censura. Não é GPT-4, GPT-3.5 ou qualquer outro modelo da OpenAI. Você pode usar os mesmos SDKs, mas o modelo subjacente é diferente.
O que acontece se eu exceder meu crédito?
As requisições retornarão um erro 402 Pagamento Necessário. Você pode recarregar sua conta a qualquer momento usando criptomoedas (USDT ou USDC). Créditos nunca expiram, então você pode adicionar fundos quando for conveniente. Não há taxa de assinatura mensal, apenas pagamento por uso.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.