Comment héberger un LLM sans censure via une API compatible OpenAI
Héberger un LLM sans censure fournit un endpoint d'inférence direct, sans refus, adapté à la génération de contenu adulte, créatif ou non restreint. En utilisant une architecture compatible OpenAI, vous bénéficiez d'une intégration SDK immédiate sans la surcharge du routage de modèles ni la dépendance à un fournisseur.
Mis à jour
Points clés
- Utilisez une architecture à modèle unique pour éliminer la complexité du routage et garantir un comportement sans censure cohérent.
- Un endpoint compatible OpenAI vous permet de remplacer votre clé API et l'URL de base pour une intégration prête à l'emploi immédiate.
- Une facturation transparente par token avec des crédits crypto prépayés garantit que vous ne payez que pour l'utilisation réelle, les erreurs et les refus étant gratuits.
- La confidentialité est préservée en excluant les prompts des données d'entraînement, avec un blocage strict sur le contenu sexuel mineur quelle que soit la tolérance générale du modèle.
Pourquoi héberger un LLM sans censure ?
Les API LLM standard appliquent souvent des filtres de contenu stricts qui peuvent refuser des thèmes adultes légaux, une écriture créative nuancée ou des sujets controversés. Héberger un LLM sans censure signifie que vous contrôlez la couche d'inférence, garantissant que le modèle répond à vos prompts sans refus arbitraires. Cela est crucial pour les applications nécessitant une génération de texte brute et sans filtre, comme les moteurs de jeu de rôle, les assistants d'écriture créative ou les outils de recherche analysant des données sensibles.
Contrairement aux agrégateurs qui acheminent les requêtes via plusieurs modèles, une API LLM sans censeur hébergée sert généralement un seul modèle réglé. Cela simplifie le débogage et garantit un comportement cohérent dans votre application. Vous évitez l'imprévisibilité du versionnement des modèles ou des changements de politique soudains des grands fournisseurs. Le résultat est un service texte en entrée / texte en sortie fiable et déterministe qui respecte vos paramètres d'entrée.
Choisir la bonne architecture
L'architecture la plus efficace pour l'inférence sans censure est une configuration à modèle unique. Les agrégateurs introduisent souvent de la latence et de la complexité en acheminant les requêtes vers divers modèles, ce qui peut diluer les caractéristiques sans censure de votre modèle principal. En hébergeant un seul grand modèle de langage, vous conservez un contrôle total sur le pipeline d'inférence et garantissez que le réglage du modèle pour la tolérance au contenu est appliqué de manière cohérente.
Recherchez une API qui expose uniquement les endpoints nécessaires : POST /v1/chat/completions pour la génération et GET /v1/models pour les métadonnées. Évitez les services proposant des embeddings, la génération d'images ou le fine-tuning à moins que vous n'en ayez besoin, car ils ajoutent une surcharge inutile. Une API ciblée réduit la latence et le coût, fournissant un service de génération de texte pur qui s'intègre sans problème aux clients compatibles OpenAI.
Structure de l'endpoint API
Une API compatible OpenAI suit une structure RESTful standard. Pour générer du texte, vous envoyez une requête POST à /v1/chat/completions avec vos messages et paramètres. L'URL de base est généralement quelque chose comme https://api.uncensoredgpt.cc/v1. Vous devez inclure votre clé API dans l'en-tête Authorization.
L'endpoint GET /v1/models retourne une liste de modèles disponibles, qui dans une configuration à modèle unique listera généralement une seule entrée. Cela confirme que le service est actif et prêt à accepter des requêtes. Il n'y a pas de tables de routage complexes ni de mécanismes de secours ; l'API est conçue pour une interaction directe et prévisible.
- POST /v1/chat/completions : Endpoint principal pour la génération de texte.
- GET /v1/models : Endpoint pour vérifier la disponibilité du modèle.
- Authorization : Jeton Bearer requis pour toutes les requêtes.
Gestion des fenêtres de contexte
Une fenêtre de contexte de 100 000 tokens permet des entrées et sorties substantielles au sein d'une seule requête. Cette capacité est essentielle pour la génération de contenu long, les tâches de raisonnement complexes ou le traitement de grands documents. La fenêtre de contexte inclut à la fois le prompt (entrée) et la complétion (sortie). Vous devez vous assurer que le nombre total de tokens ne dépasse pas cette limite.
Soyez conscient de la longueur maximale de sortie. Bien que la fenêtre de contexte soit de 100 000 tokens, la sortie maximale par requête peut être limitée à 32 000 tokens. Si vous ne spécifiez pas le paramètre max_tokens, la longueur de sortie par défaut peut être limitée à 2 048 tokens. Planifiez vos prompts en conséquence pour maximiser l'utilité du contexte disponible sans atteindre les limites strictes.
Streaming et sortie en temps réel
Le streaming est pris en charge via les Server-Sent Events (SSE). Cela vous permet de recevoir des tokens en temps réel à mesure qu'ils sont générés, améliorant l'expérience utilisateur pour les applications interactives. L'API diffuse les informations d'utilisation des tokens dans le dernier segment, fournissant des données de facturation précises même pendant les sessions de streaming.
Pour activer le streaming, définissez le paramètre stream sur true dans votre requête. La réponse sera une série d'événements, chacun contenant une complétion partielle. C'est idéal pour les interfaces de chat, la génération de code en direct et tout scénario où la latence est importante. Vous pouvez analyser ces événements à l'aide de bibliothèques clientes HTTP standard.
Utilisation des outils et appel de fonctions
L'API prend en charge l'appel de fonctions, permettant au modèle de générer des données structurées ou d'invoquer des outils externes. Vous pouvez définir des schémas de fonctions dans le paramètre tools et spécifier tool_choice pour contrôler la façon dont le modèle décide de les utiliser. Cela permet des flux de travail complexes où le LLM peut récupérer des données, effectuer des calculs ou déclencher des actions en fonction de l'entrée de l'utilisateur.
Le mode JSON est également disponible via le paramètre response_format défini sur {"type": "json_object"}. Cela garantit que le modèle produit du JSON valide, ce qui est crucial pour l'intégration programmatique. Vous pouvez ajuster des paramètres comme temperature, top_p et seed pour contrôler la créativité et la reproductibilité. Ces fonctionnalités rendent l'API adaptée à la création d'applications IA sophistiquées.
Gestion des tokens et facturation
La facturation est transparente et basée sur l'utilisation réelle des tokens. Le prix est de 0,25 $ par 1M de tokens d'entrée et de 1,00 $ par 1M de tokens de sortie. Les erreurs et les refus sont gratuits, ce qui signifie que vous ne payez que pour les complétions réussies. Il n'y a pas de frais mensuels ni d'abonnements ; vous préchargez du crédit, qui n'expire jamais.
Les recharges sont acceptées en cryptomonnaie, spécifiquement USDT (TRC20) ou USDC (Base). Les montants minimums de recharge vont de 10 $ à 500 $, avec des crédits bonus pour les montants plus élevés. Aucune carte bancaire ni PayPal n'est acceptée pour les recharges. Un nouveau compte reçoit 0,50 $ de crédit d'essai valable 7 jours, sans carte requise. Les limites incluent 300 requêtes par minute et 8 requêtes simultanées par clé.
Confidentialité et gestion des données
La confidentialité est une considération clé pour de nombreux utilisateurs. L'API n'utilise pas vos prompts pour les données d'entraînement, garantissant que votre entrée reste privée. La création de compte nécessite uniquement une adresse e-mail, sans numéro de téléphone requis. Cela minimise la collecte de données personnelles tout en fournissant un accès complet à l'API.
Les restrictions de contenu sont minimes mais spécifiques. Le modèle ne refuse pas les sujets adultes légaux, fictifs ou controversés. Cependant, une limite stricte s'applique : le contenu sexuel impliquant des mineurs est toujours bloqué. Cela garantit la conformité aux normes juridiques de base tout en maintenant un environnement très permissif pour les autres types de contenu.
Pour commencer avec votre clé
L'inscription est simple. Vous pouvez utiliser « Continuer avec Google » ou créer un compte avec un e-mail et un mot de passe. Une fois inscrit, votre clé API est affichée immédiatement, vous permettant de commencer à envoyer des requêtes sans délai. Aucune vérification par numéro de téléphone n'est requise, et le processus est conçu pour la rapidité.
Pour intégrer, mettez à jour l'URL de base du client vers https://api.uncensoredgpt.cc/v1 et définissez la clé API. Utilisez l'ID de modèle "uncensored" pour toutes les requêtes. Cette approche à modèle unique garantit la cohérence et élimine la complexité du routage. Vous pouvez commencer à générer en streaming, appeler des fonctions ou générer de longs textes immédiatement.
Questions et réponses
Cette API convient-elle au contenu NSFW ?
Oui, le modèle est sans censure et ne refuse pas les sujets adultes légaux, fictifs ou controversés. Il est conçu pour gérer le contenu NSFW sans restrictions arbitraires, à l'exception d'un blocage strict sur le contenu sexuel impliquant des mineurs.
Comment payer pour l'API ?
Les paiements sont acceptés uniquement en cryptomonnaie : USDT (TRC20) ou USDC (Base). Aucune carte bancaire, PayPal ou virement bancaire n'est disponible. Les recharges vont de 10 $ à 500 $, et les crédits n'expirent jamais.
Quelle est la taille de la fenêtre de contexte ?
La fenêtre de contexte est de 100 000 tokens, ce qui inclut à la fois le prompt et la complétion. Le nombre maximum de tokens par requête est de 32 000, ou 2 048 si <code>max_tokens</code> n'est pas spécifié.
L'API utilise-t-elle mes données pour l'entraînement ?
Non, les prompts ne sont pas utilisés pour l'entraînement. Le service est conçu pour être privé, nécessitant uniquement une adresse e-mail pour la création de compte et garantissant que vos données d'entrée vous appartiennent.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.