ES ▾
Obtener clave de API

Cómo alojar un LLM sin censura mediante una API compatible con OpenAI

Alojar un LLM sin censura proporciona un endpoint de inferencia directo, sin rechazos, adaptado para la generación de contenido adulto, creativo o sin restricciones. Al usar una arquitectura compatible con OpenAI, obtienes integración inmediata con SDK sin la sobrecarga del enrutamiento de modelos ni la dependencia de proveedor.

Actualizado

Puntos clave

  • Usa una arquitectura de modelo único para eliminar la complejidad del enrutamiento y garantizar un comportamiento sin censura consistente.
  • Un endpoint compatible con OpenAI te permite insertar tu clave de API y la URL base para una integración lista para usar inmediata.
  • Una facturación transparente por token con créditos de cripto prepago asegura que solo pagues por el uso real, contando los errores y rechazos como gratuitos.
  • La privacidad se mantiene manteniendo los prompts fuera de los datos de entrenamiento, con un bloqueo estricto del contenido sexual de menores independientemente de la tolerancia general del modelo.

¿Por qué alojar un LLM sin censura?

Las APIs de LLM estándar suelen aplicar filtros estrictos de contenido que pueden rechazar temas adultos legales, escritura creativa matizada o temas controversos. Alojar un LLM sin censura significa que controlas la capa de inferencia, asegurando que el modelo responda a tus prompts sin rechazos arbitrarios. Esto es crítico para aplicaciones que requieren generación de texto sin filtros, como motores de roleplay, asistentes de escritura creativa o herramientas de investigación que analizan datos sensibles.

A diferencia de los agregadores que enrutan peticiones a través de múltiples modelos, una API de LLM sin censura alojada generalmente sirve un único modelo ajustado. Esto simplifica la depuración y garantiza un comportamiento consistente en toda tu aplicación. Evitas la imprevisibilidad del versionado de modelos o cambios repentinos de política de grandes proveedores. El resultado es un servicio fiable y determinista de texto a texto que respeta tus parámetros de entrada.

Elección de la arquitectura adecuada

La arquitectura más eficiente para inferencia sin censura es una configuración de modelo único. Los agregadores a menudo introducen latencia y complejidad al enrutar peticiones a varios modelos, lo que puede diluir las características sin censura de tu modelo principal. Al alojar un único modelo de lenguaje grande, mantienes el control total sobre la tubería de inferencia y aseguras que el ajuste del modelo para la tolerancia al contenido se aplique de manera consistente.

Busca una API que exponga solo los endpoints necesarios: POST /v1/chat/completions para generación y GET /v1/models para metadatos. Evita servicios que ofrezcan embeddings, generación de imágenes o ajuste fino a menos que los necesites, ya que añaden sobrecarga innecesaria. Una API enfocada reduce la latencia y el coste, proporcionando un servicio puro de generación de texto que se integra sin problemas con clientes compatibles con OpenAI.

Estructura del endpoint de API

Una API compatible con OpenAI sigue una estructura RESTful estándar. Para generar texto, envías una petición POST a /v1/chat/completions con tus mensajes y parámetros. La URL base suele ser algo como https://api.uncensoredgpt.cc/v1. Debes incluir tu clave de API en el encabezado Authorization.

El endpoint GET /v1/models devuelve una lista de modelos disponibles, que en una configuración de modelo único generalmente listará solo una entrada. Esto confirma que el servicio está activo y listo para aceptar peticiones. No hay tablas de enrutamiento complejas ni mecanismos de respaldo; la API está diseñada para una interacción directa y predecible.

  • POST /v1/chat/completions: Endpoint principal para la generación de texto.
  • GET /v1/models: Endpoint para verificar la disponibilidad del modelo.
  • Authorization: Token Bearer requerido para todas las peticiones.

Manejo de ventanas de contexto

Una ventana de contexto de 100.000 tokens permite entradas y salidas sustanciales dentro de una sola petición. Esta capacidad es esencial para la generación de contenido extenso, tareas de razonamiento complejo o el procesamiento de documentos grandes. La ventana de contexto incluye tanto el prompt (entrada) como la completion (salida). Debes asegurarte de que el recuento total de tokens no supere este límite.

Ten en cuenta la longitud máxima de la salida. Aunque la ventana de contexto es de 100.000 tokens, la salida máxima por petición puede estar limitada a 32.000 tokens. Si no especificas el parámetro max_tokens, la longitud de la salida predeterminada puede limitarse a 2.048 tokens. Planifica tus prompts en consecuencia para maximizar la utilidad del contexto disponible sin alcanzar los límites estrictos.

Streaming y salida en tiempo real

El streaming es compatible mediante Server-Sent Events (SSE). Esto te permite recibir tokens en tiempo real a medida que se generan, mejorando la experiencia del usuario para aplicaciones interactivas. La API transmite información de uso de tokens en el último fragmento, proporcionando datos de facturación precisos incluso durante sesiones de streaming.

Para habilitar el streaming, establece el parámetro stream en true en tu petición. La respuesta será una serie de eventos, cada uno conteniendo una partial completion. Esto es ideal para interfaces de chat, generación de código en tiempo real y cualquier escenario donde la latencia sea importante. Puedes analizar estos eventos mediante bibliotecas estándar de clientes HTTP.

Uso de herramientas y llamadas a funciones

La API admite llamadas a funciones, permitiendo que el modelo genere datos estructurados o invoque herramientas externas. Puedes definir esquemas de funciones en el parámetro tools y especificar tool_choice para controlar cómo decide el modelo usarlas. Esto habilita flujos de trabajo complejos donde el LLM puede obtener datos, realizar cálculos o desencadenar acciones basadas en la entrada del usuario.

El modo JSON también está disponible mediante el parámetro response_format establecido en {"type": "json_object"}. Esto asegura que el modelo genere JSON válido, lo cual es crucial para la integración programática. Puedes ajustar parámetros como temperature, top_p y seed para controlar la creatividad y la reproducibilidad. Estas características hacen que la API sea adecuada para construir aplicaciones de IA sofisticadas.

Gestión de tokens y facturación

La facturación es transparente y se basa en el uso real de tokens. El precio es de $0,25 por 1M de tokens de entrada y $1,00 por 1M de tokens de salida. Los errores y los rechazos son gratuitos, lo que significa que solo pagas por las completaciones exitosas. No hay tarifas mensuales ni suscripciones; precargas crédito, que no caduca.

Las recargas se aceptan mediante criptomonedas, específicamente USDT (TRC20) o USDC (Base). Las cantidades mínimas de recarga van de $10 a $500, con créditos adicionales para montos mayores. No se aceptan tarjetas de crédito ni PayPal para recargas. Una nueva cuenta recibe $0,50 en crédito de prueba válido por 7 días, sin necesidad de tarjeta. Los límites incluyen 300 peticiones por minuto y 8 peticiones simultáneas por clave.

Privacidad y manejo de datos

La privacidad es una consideración clave para muchos usuarios. La API no usa tus prompts para datos de entrenamiento, asegurando que tu entrada permanezca privada. La creación de la cuenta requiere solo una dirección de correo electrónico, sin necesidad de número de teléfono. Esto minimiza la recopilación de datos personales mientras proporciona acceso completo a la API.

Las restricciones de contenido son mínimas pero específicas. El modelo no rechaza temas adultos lícitos, ficticios o controversos. Sin embargo, se aplica un límite estricto: el contenido sexual con menores siempre está bloqueado. Esto garantiza el cumplimiento de las normas legales básicas mientras se mantiene un entorno altamente permisivo para otros tipos de contenido.

Primeros pasos con tu clave

Registrarse es sencillo. Puedes usar "Continuar con Google" o crear una cuenta con un correo electrónico y contraseña. Una vez registrado, tu clave de API se muestra inmediatamente, permitiéndote comenzar a hacer peticiones sin demora. No se requiere verificación por número de teléfono y el proceso está diseñado para la velocidad.

Para integrar, actualiza la URL base del cliente a https://api.uncensoredgpt.cc/v1 y establece la clave de API. Usa el ID de modelo "uncensored" para todas las peticiones. Este enfoque de un solo modelo garantiza la consistencia y elimina la complejidad del enrutamiento. Puedes empezar a hacer streaming, llamar a funciones o generar textos largos de inmediato.

Preguntas y respuestas

¿Es esta API adecuada para contenido NSFW?

Sí, el modelo es sin censura y no rechaza temas adultos lícitos, ficticios o controversos. Está diseñado para manejar contenido NSFW sin restricciones arbitrarias, excepto por un bloqueo estricto del contenido sexual con menores.

¿Cómo pago por la API?

Los pagos se aceptan solo mediante criptomonedas: USDT (TRC20) o USDC (Base). No hay opciones de tarjeta de crédito, PayPal ni transferencia bancaria. Las recargas van de $10 a $500 y los créditos no caducan.

¿Cuál es el tamaño de la ventana de contexto?

La ventana de contexto es de 100.000 tokens, lo que incluye tanto el prompt como la respuesta. La salida máxima por petición es de 32.000 tokens, o 2.048 si no se especifica <code>max_tokens</code>.

¿La API usa mis datos para entrenamiento?

No, los prompts no se utilizan para entrenamiento. El servicio está diseñado para ser privado, requiere solo un correo electrónico para crear la cuenta y garantiza que tus datos de entrada sigan siendo tuyos.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Esa es toda la configuración.

Obtener clave de API