FR ▾

Proxy LLM sans censure prêt à l’emploihttps://api.llmproxyapi.com/v1

Démarrage rapide : Intégration du proxy LLM

Intégrez notre proxy LLM sans censure en modifiant simplement l'URL de base. La compatibilité OpenAI prêt à l’emploi signifie que votre code existant fonctionne sans modification.

URL de base et authentification

Remplacez votre URL de base OpenAI standard par notre endpoint. L'authentification est gérée via un token Bearer dans l'en-tête Authorization. Cette approche fonctionne avec n'importe quelle bibliothèque cliente compatible OpenAI. Vous n'avez pas besoin de modifier la logique de votre code, uniquement les valeurs de configuration. Notre API imite la structure de l'interface standard OpenAI, garantissant que votre code d'intégration existant reste valide. Cela réduit le temps d'intégration à quelques minutes plutôt qu'à quelques jours. Vous pouvez régénérer votre clé à tout moment depuis votre tableau de bord, ce qui invalide immédiatement l'ancienne clé. Cela offre une sécurité sans nécessiter une logique complexe de rotation de token dans votre application.

Première requête

Envoyez une requête standard de complétion de chat pour tester la connectivité. L'endpoint accepte des charges utiles JSON avec un identifiant de modèle et l'historique des messages. L'ID de notre modèle est « uncensored ». Cet identifiant indique au proxy quel modèle sans censure doit router votre requête. La structure de la réponse imite le format OpenAI, contenant le contenu du message de l'assistant. Vous pouvez vérifier la réponse en examinant le champ content dans la sortie JSON. Cela confirme que votre authentification et la structure de la charge utile sont correctes. L'endpoint prend en charge les modes streaming et non-streaming pour les requêtes standard.

curl https://api.llmproxyapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Intégration SDK Python

Utilisez la bibliothèque Python officielle d'OpenAI pour interagir avec notre API. Définissez api_key à votre clé de proxy et base_url à notre endpoint. Le reste du comportement de la bibliothèque reste identique à l'utilisation standard d'OpenAI. Cela inclut le support des clients asynchrones, des tentatives et de la gestion standard des erreurs. Vous pouvez passer les mêmes paramètres que vous utiliseriez normalement, tels que temperature et max_tokens. Le proxy gère le routage vers le modèle sans censure en arrière-plan. Cela vous permet de conserver votre base de code Python existante tout en accédant aux capacités de notre modèle.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Intégration SDK Node.js

Le SDK Node.js fonctionne avec notre API en remplaçant l'URL de base. Initialisez le client avec votre clé API de proxy et l'endpoint correct. Toutes les autres méthodes, telles que chat.completions.create, fonctionnent comme prévu. Cela inclut la gestion des objets de réponse standard et des types d'erreur. Vous pouvez utiliser les mêmes structures de messages et paramètres que vous utiliseriez avec OpenAI. Le proxy s'assure que la requête est traitée par le modèle sans censure. Cette compatibilité permet aux développeurs de changer de fournisseur rapidement sans réécrire la logique de leur client. C'est idéal pour les microservices qui utilisent déjà le modèle de SDK OpenAI.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Réponses en streaming

Activez le streaming en définissant le paramètre stream à true dans votre requête. L'API retourne un flux Server-Sent Events (SSE). Chaque chunk contient des mises à jour partielles de token, permettant l'affichage en temps réel de la réponse. C'est critique pour les interfaces de chat et les applications nécessitant une rétroaction immédiate. Le flux se termine avec un dernier chunk contenant les métadonnées de réponse complètes. Vous pouvez analyser les chunks en utilisant des bibliothèques SSE standard dans votre langage préféré. Cette fonctionnalité fonctionne sans problème avec les SDK OpenAI, qui gèrent automatiquement la logique d'analyse. Elle offre une expérience utilisateur fluide sans attendre la génération de la réponse entière.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limites de débit et contraintes

Notre API impose une limite de 300 requêtes par minute par clé. Si vous dépassez cette limite, vous recevrez un code d'état 429. Assurez-vous d'implémenter une logique de nouvelle tentative avec une rétrogradation exponentielle pour ces cas. La taille du corps de la requête est plafonnée à 8 Mo. Cette contrainte s'applique à la charge utile JSON totale, y compris le prompt et le contexte. La tarification est basée sur l'utilisation : 0,25 $ par million de tokens d'entrée et 1,00 $ par million de tokens de sortie. Les crédits sont prépayés et n'expirent jamais. Si votre solde est insuffisant, les requêtes retourneront une erreur 402. Les erreurs d'authentification retournent un statut 401. Il n'y a pas de routage complexe ni de sélection de fournisseur ; le modèle est fixe.

Fonctions et limites

Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.

ÉlémentValeur
Formatcompatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé
EndpointsPOST /v1/chat/completions · GET /v1/models
ID du modèleuncensored
AuthentificationAuthorization: Bearer YOUR_KEY
Base URLhttps://api.llmproxyapi.com/v1
Mode JSONresponse_format: {"type": "json_object"}
Fenêtre de contexte64 000 tokens (entrée + sortie)
Paramètrestemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Appel de fonctionsoui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool
Sortie max.jusqu'au reste de la fenêtre de 64 000 tokens ; max_tokens optionnel (pas de plafond distinct)
Streamingoui — server-sent events ; le dernier bloc contient l'usage des tokens
Concurrence8 requêtes simultanées par clé
Limite de débit300 requêtes par minute et par clé
En-têtesX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Taillejusqu'à 8 Mo par requête
RechargeUSDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $
Bonus+5 % dès 50 $, +10 % dès 100 $
Validitéle crédit payé n'expire jamais, sans abonnement
Prix0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie
Facturationcrédit prépayé selon l'usage réel ; erreurs et refus gratuits
Essai gratuit0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge
Contenucontenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé
ConnexionGoogle ou e-mail et mot de passe
Clésune clé active par compte ; une nouvelle remplace l'ancienne

Codes d'erreur

Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.

CodeTypeSignification
400bad_requestJSON invalide, messages vides, mauvais paramètre ou contexte trop long
401missing_key · invalid_key · key_revokedclé absente, erronée ou remplacée
402no_creditplus de crédit — rechargez, la reprise est immédiate
403content_blockedcontenu sexuel impliquant des mineurs — refusé, non facturé
404not_foundendpoint inconnu
413request_too_largecorps supérieur à 8 Mo
429rate_limited · concurrencyau-delà de 300/min ou 8 en parallèle — patientez
503upstream_busymodèle occupé — réessayez dans quelques secondes

Questions et réponses

Proposez-vous des embeddings ou de la génération d'images ?

Non, nous ne proposons pas d'embeddings, de génération d'images, d'audio ou de vidéo. Notre API est strictement dédiée aux complétions de chat textuel. Si vous avez besoin d'embeddings, vous devez utiliser un service ou un modèle distinct. Nous nous concentrons sur l'inférence textuelle haute performance avec le modèle sans censure.

S'agit-il d'un service officiel OpenAI ?

Non, nous sommes un service indépendant. Nous sommes compatibles avec le format de l'API OpenAI, mais nous hébergeons notre propre modèle sans censure. Il ne s'agit pas de GPT-4, GPT-3.5 ou d'un autre modèle OpenAI. Vous pouvez utiliser les mêmes SDK, mais le modèle sous-jacent est différent.

Que se passe-t-il si je dépasse mon crédit ?

Les requêtes renverront une erreur 402 Paiement requis. Vous pouvez recharger votre compte à tout moment en utilisant des cryptomonnaies (USDT ou USDC). Les crédits n'expirent jamais, vous pouvez donc ajouter des fonds lorsque cela vous convient. Il n'y a pas de frais d'abonnement mensuel, uniquement un paiement à l'usage.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.

Obtenir une clé API