IT ▾

Proxy LLM senza censura pronto all'usohttps://api.llmproxyapi.com/v1

Avvio rapido: Integra il proxy LLM

Integra il nostro proxy LLM senza censura con un solo cambiamento dell'URL base. La compatibilità drop-in con OpenAI significa che il tuo codice esistente funziona senza modifiche.

URL base e autenticazione

Sostituisci il tuo URL base standard di OpenAI con il nostro endpoint. L'autenticazione viene gestita tramite un token Bearer nell'intestazione Authorization. Questo approccio funziona con qualsiasi libreria client compatibile con OpenAI. Non è necessario modificare la logica del codice, solo i valori di configurazione. La nostra API imita la struttura dell'interfaccia standard di OpenAI, garantendo che il codice di integrazione esistente rimanga valido. Questo riduce il tempo di integrazione a minuti invece che a giorni. Puoi rigenerare la chiave in qualsiasi momento dal tuo dashboard, il che invalida immediatamente la vecchia chiave. Questo garantisce sicurezza senza richiedere una logica complessa di rotazione dei token nella tua applicazione.

Prima richiesta

Invia una richiesta standard di completamento chat per testare la connettività. L'endpoint accetta payload JSON con un identificatore del modello e la cronologia dei messaggi. Il nostro ID modello è "uncensored". Questo identificatore dice al proxy a quale modello senza censura instradare la tua richiesta. La struttura della risposta riflette il formato OpenAI, contenente il contenuto del messaggio dell'assistente. Puoi verificare la risposta controllando il campo content nell'output JSON. Questo conferma che la tua autenticazione e la struttura del payload sono corrette. L'endpoint supporta sia la modalità streaming che quella non streaming per le richieste standard.

curl https://api.llmproxyapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Integrazione SDK Python

Usa la libreria Python ufficiale OpenAI per interagire con la nostra API. Imposta api_key alla tua chiave proxy e base_url al nostro endpoint. Il resto del comportamento della libreria rimane identico all'uso standard di OpenAI. Include supporto per client asincroni, retry e gestione errori standard. Puoi passare gli stessi parametri che useresti normalmente, come temperature e max tokens. Il proxy gestisce il routing al modello senza censura in background. Questo ti permette di mantenere il tuo codice Python esistente mentre accedi alle funzionalità del nostro modello.

from openai import OpenAI

client = OpenAI(base_url="https://api.llmproxyapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Integrazione SDK Node.js

L'SDK Node.js funziona con la nostra API sovrascrivendo l'URL di base. Inizializza il client con la tua chiave API proxy e l'endpoint corretto. Tutti gli altri metodi, come chat.completions.create, funzionano come previsto. Include la gestione degli oggetti di risposta standard e dei tipi di errore. Puoi usare le stesse strutture di messaggio e parametri che useresti con OpenAI. Il proxy assicura che la richiesta sia elaborata dal modello senza censura. Questa compatibilità permette agli sviluppatori di cambiare provider rapidamente senza riscrivere la logica del client. È ideale per microservizi che usano già il pattern SDK OpenAI.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.llmproxyapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Risposte in streaming

Abilita lo streaming impostando il parametro stream su true nella tua richiesta. L'API restituisce uno stream Server-Sent Events (SSE). Ogni chunk contiene aggiornamenti parziali dei token, permettendo la visualizzazione in tempo reale della risposta. Questo è fondamentale per interfacce chat e applicazioni che richiedono feedback immediato. Lo stream termina con un chunk finale contenente i metadati della risposta completa. Puoi analizzare gli chunk usando librerie SSE standard nel tuo linguaggio preferito. Questa funzione funziona perfettamente con gli SDK OpenAI, che gestiscono automaticamente la logica di parsing. Offre un'esperienza utente fluida senza attendere la generazione dell'intera risposta.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limiti di richiesta e vincoli

La nostra API impone un limite di 300 richieste al minuto per chiave. Se lo superi, riceverai un codice di stato 429. Assicurati di implementare una logica di ritentativo con backoff esponenziale per questi casi. La dimensione del corpo della richiesta è limitata a 8 MB. Questo vincolo si applica al payload JSON totale, inclusi prompt e contesto. Il prezzo è basato sull'utilizzo: $0,25 per milione di token di input e $1,00 per milione di token di output. I crediti sono prepagati e non scadono. Se il tuo saldo è insufficiente, le richieste restituiranno un errore 402. Gli errori di autenticazione restituiscono un codice 401. Non c'è routing complesso o selezione del fornitore; il modello è fisso.

Scheda tecnica dell'API

Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.

VoceValore
Formatocompatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave
EndpointPOST /v1/chat/completions · GET /v1/models
ID modellouncensored
AutenticazioneAuthorization: Bearer YOUR_KEY
Base URLhttps://api.llmproxyapi.com/v1
Modalità JSONresponse_format: {"type": "json_object"}
Finestra di contesto64.000 token (input + output)
Parametritemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Function callingsì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool
Output massimofino al resto della finestra di 64.000 token; max_tokens opzionale (nessun limite separato)
Streamingsì — server-sent events; l'ultimo blocco riporta l'uso dei token
Concorrenza8 richieste contemporanee per chiave
Limite di frequenza300 richieste al minuto per chiave
HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Dimensionefino a 8 MB per richiesta
RicaricaUSDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500
Bonus+5% da $50, +10% da $100
Scadenzail credito pagato non scade, nessun abbonamento
Prezzo$0,25 per 1M token in input · $1,00 per 1M in output
Fatturazionecredito prepagato in base all'uso reale; errori e rifiuti gratuiti
Prova gratuita$0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica
Contenuticontenuti per adulti consentiti; rifiutati i contenuti sessuali con minori
AccessoGoogle oppure e-mail e password
Chiaviuna chiave attiva per account; una nuova sostituisce la precedente

Codici di errore

Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.

CodiceTipoSignificato
400bad_requestJSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo
401missing_key · invalid_key · key_revokedchiave mancante, errata o sostituita
402no_creditcredito esaurito — ricarica e riparti subito
403content_blockedcontenuti sessuali con minori — rifiutato, non addebitato
404not_foundendpoint sconosciuto
413request_too_largecorpo oltre 8 MB
429rate_limited · concurrencyoltre 300/min o 8 in parallelo — attendi e riprova
503upstream_busymodello occupato — riprova tra pochi secondi

Domande e risposte

Offrite embeddings o generazione di immagini?

No, non offriamo embeddings, generazione di immagini, audio o video. La nostra API è esclusivamente per completamenti di chat testuali. Se ti servono embeddings, devi usare un servizio o un modello separato. Ci concentriamo sull'inferenza testuale ad alte prestazioni con il modello senza censura.

È un servizio ufficiale di OpenAI?

No, siamo un servizio indipendente. Siamo compatibili con il formato API di OpenAI, ma ospitiamo il nostro modello senza censura. Non è GPT-4, GPT-3.5 o qualsiasi altro modello di OpenAI. Puoi usare gli stessi SDK, ma il modello sottostante è diverso.

Cosa succede se supero il credito?

Le richieste restituiranno un errore 402 Payment Required. Puoi ricaricare il tuo account in qualsiasi momento utilizzando criptovalute (USDT o USDC). Il credito non scade mai, quindi puoi aggiungere fondi quando preferisci. Non ci sono canoni mensili, solo pagamento a consumo.

La tua chiave è a un modulo di distanza

Crea un account, copia la chiave, cambia l'URL base. È tutta qui la configurazione.

Ottieni la chiave API