Avvio rapido: Integra il proxy LLM
Integra il nostro proxy LLM senza censura con un solo cambiamento dell'URL base. La compatibilità drop-in con OpenAI significa che il tuo codice esistente funziona senza modifiche.
URL base e autenticazione
Sostituisci il tuo URL base standard di OpenAI con il nostro endpoint. L'autenticazione viene gestita tramite un token Bearer nell'intestazione Authorization. Questo approccio funziona con qualsiasi libreria client compatibile con OpenAI. Non è necessario modificare la logica del codice, solo i valori di configurazione. La nostra API imita la struttura dell'interfaccia standard di OpenAI, garantendo che il codice di integrazione esistente rimanga valido. Questo riduce il tempo di integrazione a minuti invece che a giorni. Puoi rigenerare la chiave in qualsiasi momento dal tuo dashboard, il che invalida immediatamente la vecchia chiave. Questo garantisce sicurezza senza richiedere una logica complessa di rotazione dei token nella tua applicazione.
Prima richiesta
Invia una richiesta standard di completamento chat per testare la connettività. L'endpoint accetta payload JSON con un identificatore del modello e la cronologia dei messaggi. Il nostro ID modello è "uncensored". Questo identificatore dice al proxy a quale modello senza censura instradare la tua richiesta. La struttura della risposta riflette il formato OpenAI, contenente il contenuto del messaggio dell'assistente. Puoi verificare la risposta controllando il campo content nell'output JSON. Questo conferma che la tua autenticazione e la struttura del payload sono corrette. L'endpoint supporta sia la modalità streaming che quella non streaming per le richieste standard.
curl https://api.llmproxyapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integrazione SDK Python
Usa la libreria Python ufficiale OpenAI per interagire con la nostra API. Imposta api_key alla tua chiave proxy e base_url al nostro endpoint. Il resto del comportamento della libreria rimane identico all'uso standard di OpenAI. Include supporto per client asincroni, retry e gestione errori standard. Puoi passare gli stessi parametri che useresti normalmente, come temperature e max tokens. Il proxy gestisce il routing al modello senza censura in background. Questo ti permette di mantenere il tuo codice Python esistente mentre accedi alle funzionalità del nostro modello.
from openai import OpenAI
client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integrazione SDK Node.js
L'SDK Node.js funziona con la nostra API sovrascrivendo l'URL di base. Inizializza il client con la tua chiave API proxy e l'endpoint corretto. Tutti gli altri metodi, come chat.completions.create, funzionano come previsto. Include la gestione degli oggetti di risposta standard e dei tipi di errore. Puoi usare le stesse strutture di messaggio e parametri che useresti con OpenAI. Il proxy assicura che la richiesta sia elaborata dal modello senza censura. Questa compatibilità permette agli sviluppatori di cambiare provider rapidamente senza riscrivere la logica del client. È ideale per microservizi che usano già il pattern SDK OpenAI.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Risposte in streaming
Abilita lo streaming impostando il parametro stream su true nella tua richiesta. L'API restituisce uno stream Server-Sent Events (SSE). Ogni chunk contiene aggiornamenti parziali dei token, permettendo la visualizzazione in tempo reale della risposta. Questo è fondamentale per interfacce chat e applicazioni che richiedono feedback immediato. Lo stream termina con un chunk finale contenente i metadati della risposta completa. Puoi analizzare gli chunk usando librerie SSE standard nel tuo linguaggio preferito. Questa funzione funziona perfettamente con gli SDK OpenAI, che gestiscono automaticamente la logica di parsing. Offre un'esperienza utente fluida senza attendere la generazione dell'intera risposta.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limiti di richiesta e vincoli
La nostra API impone un limite di 300 richieste al minuto per chiave. Se lo superi, riceverai un codice di stato 429. Assicurati di implementare una logica di ritentativo con backoff esponenziale per questi casi. La dimensione del corpo della richiesta è limitata a 8 MB. Questo vincolo si applica al payload JSON totale, inclusi prompt e contesto. Il prezzo è basato sull'utilizzo: $0,25 per milione di token di input e $1,00 per milione di token di output. I crediti sono prepagati e non scadono. Se il tuo saldo è insufficiente, le richieste restituiranno un errore 402. Gli errori di autenticazione restituiscono un codice 401. Non c'è routing complesso o selezione del fornitore; il modello è fisso.
Scheda tecnica dell'API
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| ID modello | uncensored |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.llmproxyapi.com/v1 |
| Modalità JSON | response_format: {"type": "json_object"} |
| Finestra di contesto | 64.000 token (input + output) |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Output massimo | fino al resto della finestra di 64.000 token; max_tokens opzionale (nessun limite separato) |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Concorrenza | 8 richieste contemporanee per chiave |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Dimensione | fino a 8 MB per richiesta |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Bonus | +5% da $50, +10% da $100 |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
| Accesso | Google oppure e-mail e password |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |
Domande e risposte
Offrite embeddings o generazione di immagini?
No, non offriamo embeddings, generazione di immagini, audio o video. La nostra API è esclusivamente per completamenti di chat testuali. Se ti servono embeddings, devi usare un servizio o un modello separato. Ci concentriamo sull'inferenza testuale ad alte prestazioni con il modello senza censura.
È un servizio ufficiale di OpenAI?
No, siamo un servizio indipendente. Siamo compatibili con il formato API di OpenAI, ma ospitiamo il nostro modello senza censura. Non è GPT-4, GPT-3.5 o qualsiasi altro modello di OpenAI. Puoi usare gli stessi SDK, ma il modello sottostante è diverso.
Cosa succede se supero il credito?
Le richieste restituiranno un errore 402 Payment Required. Puoi ricaricare il tuo account in qualsiasi momento utilizzando criptovalute (USDT o USDC). Il credito non scade mai, quindi puoi aggiungere fondi quando preferisci. Non ci sono canoni mensili, solo pagamento a consumo.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, cambia l'URL base. È tutta qui la configurazione.