Hoe een ongecensureerd LLM hosten via OpenAI-compatible API
Het hosten van een ongecensureerd LLM biedt een direct, zonder weigering werkend endpoint voor het genereren van volwassen, creatieve of onbeperkte inhoud. Door gebruik te maken van een OpenAI-compatibele architectuur krijg je direct SDK-integratie zonder de overhead van modelrouting of complexe leveranciersbinding.
Bijgewerkt
Belangrijkste punten
- Gebruik een single-model architectuur om routingcomplexiteit te elimineren en consistente ongecensureerde gedrag te garanderen.
- Een OpenAI-compatible endpoint stelt je in staat om je API-sleutel en basis-URL direct te koppelen voor onmiddellijke integratie.
- Transparante facturatie per token met prepaid crypto-tegoed zorgt ervoor dat je alleen betaalt voor daadwerkelijk gebruik, waarbij fouten en weigeringen gratis zijn.
- Privacy wordt gewaarborgd door prompts buiten de trainingsdata te houden, met een harde blokkade op seksuele inhoud van minderjarigen ongeacht de algemene tolerantie van het model.
Waarom een ongecensureerd LLM hosten?
Standaard LLM-API's passen vaak strikte inhoudsfilters toe die wettelijke volwassen thema's, genuanceerde creatieve schrijfkunst of controversiële onderwerpen kunnen weigeren. Het hosten van een ongecensureerd LLM betekent dat jij de inferentielaag controleert, waardoor het model reageert op je prompts zonder willekeurige weigeringen. Dit is cruciaal voor toepassingen die ruwe, ongefilterde tekstgeneratie vereisen, zoals roleplay-engines, creatieve schrijfassistenten of onderzoeksgereedschap dat gevoelige gegevens analyseert.
In tegenstelling tot aggregators die verzoeken door meerdere modellen routeren, bedient een gehost ongecensureerd LLM-API meestal een enkel, afgestemd model. Dit vereenvoudigt debugging en zorgt voor consistent gedrag in je applicatie. Je vermijdt de onvoorspelbaarheid van modelversies of plotselings beleidswijzigingen van grote aanbieders. Het resultaat is een betrouwbare, deterministische tekst-in/tekst-uit service die je invoerparameters respecteert.
De juiste architectuur kiezen
De meest efficiënte architectuur voor ongecensureerde inferentie is een single-model setup. Aggregators introduceren vaak latentie en complexiteit door verzoeken naar verschillende modellen te routeren, wat de ongecensureerde kenmerken van je primaire model kan verdunnen. Door een enkele grote taalmodel te hosten, behoud je volledige controle over de inferentiepijplijn en zorg je ervoor dat de tuning van het model voor contenttolerantie consistent wordt toegepast.
Zoek naar een API die alleen de noodzakelijke endpoints blootlegt: POST /v1/chat/completions voor generatie en GET /v1/models voor metadata. Vermijd diensten die embeddings, image generatie of fine-tuning aanbieden, tenzij je ze nodig hebt, omdat deze onnodige overhead toevoegen. Een gerichte API vermindert latentie en kosten, en biedt een pure tekstgeneratieservice die naadloos integreert met bestaande OpenAI-compatible clients.
API-eindpuntstructuur
Een OpenAI-compatible API volgt een standaard RESTful structuur. Om tekst te genereren, stuur je een POST verzoek naar /v1/chat/completions met je berichten en parameters. De basis-URL is doorgaans iets als https://api.uncensoredgpt.cc/v1. Je moet je API-sleutel opnemen in de Authorization header.
Het GET /v1/models endpoint retourneert een lijst met beschikbare modellen, wat in een single-model setup meestal slechts één vermelding zal bevatten. Dit bevestigt dat de service actief is en klaar om verzoeken te accepteren. Er zijn geen complexe routetabellen of fallback-mechanismen; de API is ontworpen voor directe, voorspelbare interactie.
- POST /v1/chat/completions: Hoofdeindpunt voor tekstgeneratie.
- GET /v1/models: Endpoint om modelbeschikbaarheid te verifiëren.
- Authorization: Bearer token vereist voor alle verzoeken.
Contextvensters verwerken
Een contextvenster van 100.000 tokens staat substantiële input en output binnen een enkel verzoek toe. Deze capaciteit is essentieel voor langdurige contentgeneratie, complexe redeneertaken of het verwerken van grote documenten. Het contextvenster omvat zowel de prompt (input) als de voltooiing (output). Je moet ervoor zorgen dat het totale tokenaantal deze limiet niet overschrijdt.
Houd rekening met de maximale uitvoerlengte. Hoewel het contextvenster 100.000 tokens is, kan de maximale uitvoer per verzoek worden beperkt tot 32.000 tokens. Als je geen max_tokens parameter opgeeft, kan de standaard uitvoerlengte worden beperkt tot 2.048 tokens. Plan je prompts dienovereenkomstig om het nut van de beschikbare context te maximaliseren zonder harde limieten te raken.
Streaming en realtime uitvoer
Streaming wordt ondersteund via Server-Sent Events (SSE). Dit stelt je in staat om tokens in realtime te ontvangen terwijl ze worden gegenereerd, wat de gebruikerservaring voor interactieve toepassingen verbetert. De API streamt tokengebruiksgegevens in het laatste chunk, waardoor accurate facturatiegegevens worden verstrekt, zelfs tijdens streamsessies.
Om streaming in te schakelen, stel je de stream parameter in op true in je verzoek. Het antwoord zal een reeks gebeurtenissen zijn, elk met een gedeeltelijke voltooiing. Dit is ideaal voor chatinterfaces, live codegeneratie en elke situatie waarin latentie belangrijk is. Je kunt deze gebeurtenissen parseren met standaard HTTP-clientbibliotheken.
Toolgebruik en function calling
De API ondersteunt function calling, waardoor het model gestructureerde gegevens kan genereren of externe tools kan aanroepen. Je kunt funtieschema's definiëren in de tools parameter en tool_choice specificeren om te controleren hoe het model ze gebruikt. Dit stelt complexe workflows in staat waarbij de LLM gegevens kan ophalen, berekeningen kan uitvoeren of acties kan triggeren op basis van gebruikersinput.
JSON-modus is ook beschikbaar via de response_format parameter ingesteld op {"type": "json_object"}. Dit zorgt ervoor dat het model geldige JSON uitvoert, wat cruciaal is voor programmatieve integratie. Je kunt parameters aanpassen zoals temperature, top_p en seed om creativiteit en reproduceerbaarheid te controleren. Deze functies maken de API geschikt voor het bouwen van geavanceerde AI-gedreven toepassingen.
Tokenbeheer en facturatie
Facturatie is transparant en gebaseerd op echt tokengebruik. De prijs is $0,25 per 1M input tokens en $1,00 per 1M output tokens. Fouten en weigeringen zijn gratis, wat betekent dat je alleen betaalt voor succesvolle voltooiingen. Er zijn geen maandelijkse kosten of abonnementen; je laadt tegoed vooraf, dat nooit vervalt.
Opwaarderingen worden geaccepteerd via cryptocurrency, specifiek USDT (TRC20) of USDC (Base). Minimale opwaardeerbedragen variëren van $10 tot $500, met bonuscredits voor grotere bedragen. Er worden geen creditcards of PayPal geaccepteerd voor opwaarderingen. Een nieuw account ontvangt $0,50 aan proeftegoed geldig voor 7 dagen, geen kaart vereist. Limieten omvatten 300 verzoeken per minuut en 8 gelijktijdige verzoeken per sleutel.
Privacy en gegevensverwerking
Privacy is een belangrijke overweging voor veel gebruikers. De API gebruikt je prompts niet voor trainingsgegevens, waardoor je input privé blijft. Accountaanmaak vereist alleen een e-mailadres, zonder telefoonnummer. Dit minimaliseert het verzamelen van persoonlijke gegevens terwijl je volledige toegang tot de API krijgt.
Inhoudsbeperkingen zijn minimaal maar specifiek. Het model weigert geen wettelijke volwassen, fictieve of controversiële onderwerpen. Er geldt echter een harde limiet: seksuele inhoud met minderjarigen wordt altijd geblokkeerd. Dit zorgt voor naleving van basiswettelijke normen terwijl een zeer permissieve omgeving voor andere inhoudstypen wordt gehandhaafd.
Aan de slag met je sleutel
Aanmelden is eenvoudig. Je kunt "Doorgaan met Google" gebruiken of een account aanmaken met een e-mailadres en wachtwoord. Eenmaal geregistreerd, wordt je API-sleutel direct weergegeven, zodat je onmiddellijk verzoeken kunt beginnen zonder vertraging. Er is geen telefoonverificatie vereist, en het proces is ontworpen voor snelheid.
Om te integreren, update de basis-URL van je client naar https://api.uncensoredgpt.cc/v1 en stel de API-sleutel in. Gebruik de model-ID "uncensored" voor alle verzoeken. Deze single-model aanpak zorgt voor consistentie en elimineert de complexiteit van routing. Je kunt onmiddellijk beginnen met streamen, functies aanroepen of lange teksten genereren.
Vragen en antwoorden
Is deze API geschikt voor NSFW-inhoud?
Ja, het model is ongecensureerd en weigert geen wettelijke volwassen, fictieve of controversiële onderwerpen. Het is ontworpen om NSFW-inhoud af te handelen zonder willekeurige beperkingen, behalve een harde blokkade voor seksuele inhoud met minderjarigen.
Hoe betaal ik voor de API?
Betalingen worden alleen geaccepteerd via cryptocurrency: USDT (TRC20) of USDC (Base). Er zijn geen opties voor creditcard, PayPal of bankoverschrijving. Opwaarderingen variëren van $10 tot $500, en tegoeden vervallen nooit.
Wat is de grootte van het contextvenster?
Het contextvenster is 100.000 tokens, inclusief zowel de prompt als de completion. De maximale uitvoer per verzoek is 32.000 tokens, of 2.048 als <code>max_tokens</code> niet is opgegeven.
Gebruikt de API mijn data voor training?
Nee, prompts worden niet gebruikt voor training. De service is ontworpen als privé, waarbij alleen een e-mailadres nodig is voor het aanmaken van een account en waarbij je invoergegevens bij jou blijven.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, pas de basis-URL aan. Dat is de hele configuratie.