Inicio rápido: Integra el proxy LLM
Integra nuestro proxy LLM sin censura con un solo cambio de URL base. La compatibilidad drop-in con OpenAI significa que tu código existente funciona sin modificaciones.
URL base y autenticación
Reemplaza tu URL base estándar de OpenAI con nuestro endpoint. La autenticación se maneja mediante un token Bearer en la cabecera Authorization. Este enfoque funciona con cualquier biblioteca cliente compatible con OpenAI. No necesitas cambiar la lógica de tu código, solo los valores de configuración. Nuestra API imita la estructura de interfaz estándar de OpenAI, asegurando que tu código de integración existente siga siendo válido. Esto reduce el tiempo de integración a minutos en lugar de días. Puedes regenerar tu clave en cualquier momento desde tu panel, lo que invalida inmediatamente la clave anterior. Esto proporciona seguridad sin requerir lógica compleja de rotación de tokens en tu aplicación.
Primera petición
Envía una petición estándar de completación de chat para probar la conectividad. El endpoint acepta cargas útiles JSON con un identificador de modelo e historial de mensajes. Nuestro ID de modelo es "uncensored". Este identificador le dice al proxy a qué modelo sin censura enrutar tu petición. La estructura de la respuesta refleja el formato de OpenAI, conteniendo el contenido del mensaje del asistente. Puedes verificar la respuesta comprobando el campo content en la salida JSON. Esto confirma que tu autenticación y estructura de carga útil son correctas. El endpoint admite tanto modos de streaming como no streaming para peticiones estándar.
curl https://api.llmproxyapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integración con SDK Python
Usa la biblioteca oficial de OpenAI para Python para interactuar con nuestra API. Establece api_key a tu clave de proxy y base_url a nuestro endpoint. El resto del comportamiento de la biblioteca permanece idéntico al uso estándar de OpenAI. Esto incluye soporte para clientes asíncronos, reintentos y manejo de errores estándar. Puedes pasar los mismos parámetros que usarías normalmente, como temperature y max tokens. El proxy maneja el enrutamiento al modelo sin censura detrás de escena. Esto te permite mantener tu base de código Python existente mientras obtienes acceso a las capacidades de nuestro modelo.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integración con SDK Node.js
El SDK de Node.js funciona con nuestra API sobrescribiendo la URL base. Inicializa el cliente con tu clave de API de proxy y el endpoint correcto. Todos los demás métodos, como chat.completions.create, funcionan como se espera. Esto incluye el manejo de objetos de respuesta y tipos de error estándar. Puedes usar las mismas estructuras de mensajes y parámetros que usarías con OpenAI. El proxy asegura que la petición sea procesada por el modelo sin censura. Esta compatibilidad permite a los desarrolladores cambiar de proveedor rápidamente sin reescribir la lógica del cliente. Es ideal para microservicios que ya usan el patrón del SDK de OpenAI.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Respuestas en streaming
Habilita el streaming estableciendo el parámetro stream en true en tu petición. La API devuelve un flujo de Server-Sent Events (SSE). Cada fragmento contiene actualizaciones parciales de tokens, lo que permite la visualización en tiempo real de la respuesta. Esto es crítico para interfaces de chat y aplicaciones que requieren retroalimentación inmediata. El flujo termina con un fragmento final que contiene los metadatos de la respuesta completa. Puedes analizar los fragmentos usando bibliotecas SSE estándar en tu lenguaje preferido. Esta función funciona sin problemas con los SDKs de OpenAI, que manejan la lógica de análisis automáticamente. Proporciona una experiencia de usuario fluida sin esperar a que se genere toda la respuesta.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Límites de peticiones y restricciones
Nuestra API aplica un límite de 300 peticiones por minuto por clave. Si excedes esto, recibirás un código de estado 429. Asegúrate de implementar lógica de reintento con retroceso exponencial para estos casos. El tamaño del cuerpo de la petición está limitado a 8 MB. Esta restricción se aplica a la carga útil JSON total, incluyendo prompt y contexto. El precio se basa en el uso: $0,25 por millón de tokens de entrada y $1,00 por millón de tokens de salida. Los créditos son prepago y no caducan. Si tu saldo es insuficiente, las peticiones devolverán un error 402. Los errores de autenticación devuelven un estado 401. No hay enrutamiento complejo ni selección de proveedor; el modelo es fijo.
Funciones y límites
Una tabla con cada límite, función y precio.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| ID del modelo | uncensored |
| Autenticación | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.llmproxyapi.com/v1 |
| Modo JSON | response_format: {"type": "json_object"} |
| Ventana de contexto | 64.000 tokens (entrada + salida) |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Salida máxima | hasta el resto de la ventana de 64.000 tokens; max_tokens opcional (sin límite aparte) |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Concurrencia | 8 peticiones a la vez por clave |
| Límite de peticiones | 300 por minuto por clave |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Tamaño de petición | hasta 8 MB |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Bono | +5 % desde $50, +10 % desde $100 |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
| Acceso | Google o correo y contraseña |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
Códigos de error
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
¿Ofreces embeddings o generación de imágenes?
No, no ofrecemos embeddings ni generación de imágenes, audio o video. Nuestra API es estrictamente para completados de chat de texto. Si necesitas embeddings, debes usar un servicio o modelo separado. Nos enfocamos en inferencia de texto de alto rendimiento con el modelo sin censura.
¿Es este un servicio oficial de OpenAI?
No, somos un servicio independiente. Somos compatibles con el formato de API de OpenAI, pero alojamos nuestro propio modelo sin censura. No es GPT-4, GPT-3.5 ni ningún otro modelo de OpenAI. Puedes usar los mismos SDK, pero el modelo subyacente es diferente.
¿Qué pasa si excedo mi crédito?
Las peticiones devolverán un error 402 Pago requerido. Puedes recargar tu cuenta en cualquier momento usando criptomonedas (USDT o USDC). Los créditos no caducan, así que puedes añadir fondos cuando te convenga. No hay cuota de suscripción mensual, solo uso pago por uso.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.