PT ▾
Obter chave de API

Como hospedar um LLM sem censura via API compatível com OpenAI

Hospedar um LLM sem censura fornece um endpoint de inferência direto, sem recusas, adaptado para geração de conteúdo adulto, criativo ou sem restrições. Ao usar uma arquitetura compatível com OpenAI, você obtém integração imediata com SDKs sem o overhead de roteamento de modelos ou complexidade de lock-in de fornecedor.

Atualizado

Pontos principais

  • Use uma arquitetura de modelo único para eliminar a complexidade de roteamento e garantir comportamento sem censura consistente.
  • Um endpoint compatível com OpenAI permite que você insira sua chave de API e URL base para integração pronta para usar imediata.
  • Faturamento transparente por token com créditos cripto pré-pagos garante que você pague apenas pelo uso real, com erros e recusas contados como gratuitos.
  • A privacidade é mantida ao manter os prompts fora dos dados de treinamento, com uma restrição rígida para conteúdo sexual envolvendo menores de idade, independentemente da tolerância geral do modelo.

Por que hospedar um LLM sem censura?

As APIs de LLM padrão frequentemente aplicam filtros de conteúdo rigorosos que podem recusar temas adultos lícitos, escrita criativa matizada ou tópicos controversos. Hospedar um LLM sem censura significa que você controla a camada de inferência, garantindo que o modelo responda aos seus prompts sem recusas arbitrárias. Isso é crítico para aplicações que exigem geração de texto bruta e sem filtros, como motores de roleplay, assistentes de escrita criativa ou ferramentas de pesquisa que analisam dados sensíveis.

Ao contrário dos agregadores que roteiam requisições por vários modelos, uma API de LLM sem censura hospedada geralmente serve um único modelo ajustado. Isso simplifica a depuração e garante comportamento consistente em toda a sua aplicação. Você evita a imprevisibilidade do versionamento de modelos ou mudanças repentinas de política de grandes provedores. O resultado é um serviço confiável e determinístico de texto-para-texto que respeita seus parâmetros de entrada.

Escolhendo a arquitetura certa

A arquitetura mais eficiente para inferência sem censura é uma configuração de modelo único. Agregadores frequentemente introduzem latência e complexidade ao rotear requisições para vários modelos, o que pode diluir as características sem censura do seu modelo principal. Ao hospedar um único modelo de linguagem grande, você mantém controle total sobre o pipeline de inferência e garante que o ajuste do modelo para tolerância de conteúdo seja aplicado consistentemente.

Procure uma API que exponha apenas os endpoints necessários: POST /v1/chat/completions para geração e GET /v1/models para metadados. Evite serviços que ofereçam embeddings, geração de imagens ou ajuste fino, a menos que você precise deles, pois isso adiciona sobrecarga desnecessária. Uma API focada reduz latência e custo, fornecendo um serviço puro de geração de texto que se integra perfeitamente aos clientes compatíveis com OpenAI existentes.

Estrutura do endpoint da API

Uma API compatível com OpenAI segue uma estrutura RESTful padrão. Para gerar texto, você envia uma requisição POST para /v1/chat/completions com suas mensagens e parâmetros. A URL base é tipicamente algo como https://api.uncensoredgpt.cc/v1. Você deve incluir sua chave de API no cabeçalho Authorization.

O endpoint GET /v1/models retorna uma lista de modelos disponíveis, que em uma configuração de modelo único geralmente listará apenas uma entrada. Isso confirma que o serviço está ativo e pronto para aceitar requisições. Não há tabelas de roteamento complexas ou mecanismos de fallback; a API é projetada para interação direta e previsível.

  • POST /v1/chat/completions: Endpoint principal para geração de texto.
  • GET /v1/models: Endpoint para verificar a disponibilidade do modelo.
  • Authorization: Token Bearer obrigatório para todas as requisições.

Lidando com janelas de contexto

Uma janela de contexto de 100.000 tokens permite entrada e saída substanciais dentro de uma única requisição. Essa capacidade é essencial para geração de conteúdo de longo formato, tarefas de raciocínio complexo ou processamento de grandes documentos. A janela de contexto inclui tanto o prompt (entrada) quanto a conclusão (saída). Você deve garantir que a contagem total de tokens não exceda esse limite.

Esteja ciente do comprimento máximo de saída. Embora a janela de contexto seja de 100.000 tokens, a saída máxima por requisição pode ser limitada a 32.000 tokens. Se você não especificar um parâmetro max_tokens, o comprimento de saída padrão pode ser limitado a 2.048 tokens. Planeje seus prompts de acordo para maximizar a utilidade do contexto disponível sem atingir limites rígidos.

Streaming e saída em tempo real

O streaming é suportado via Server-Sent Events (SSE). Isso permite que você receba tokens em tempo real à medida que são gerados, melhorando a experiência do usuário para aplicações interativas. A API transmite informações de uso de tokens no último bloco, fornecendo dados precisos de cobrança mesmo durante sessões de streaming.

Para habilitar o streaming, defina o parâmetro stream como true em sua requisição. A resposta será uma série de eventos, cada um contendo uma conclusão parcial. Isso é ideal para interfaces de chat, geração de código ao vivo e qualquer cenário onde a latência seja importante. Você pode analisar esses eventos usando bibliotecas padrão de cliente HTTP.

Uso de ferramentas e chamada de funções

A API suporta chamada de funções, permitindo que o modelo gere dados estruturados ou invoque ferramentas externas. Você pode definir esquemas de função no parâmetro tools e especificar tool_choice para controlar como o modelo decide usá-las. Isso permite fluxos de trabalho complexos onde o LLM pode buscar dados, realizar cálculos ou acionar ações com base na entrada do usuário.

O modo JSON também está disponível via parâmetro response_format definido como {"type": "json_object"}. Isso garante que o modelo produza JSON válido, o que é crucial para integração programática. Você pode ajustar parâmetros como temperature, top_p e seed para controlar criatividade e reprodutibilidade. Esses recursos tornam a API adequada para construir aplicações sofisticadas impulsionadas por IA.

Gerenciamento de tokens e faturamento

O faturamento é transparente e baseado no uso real de tokens. O preço é $0,25 por 1M de tokens de entrada e $1,00 por 1M de tokens de saída. Erros e recusas são gratuitos, o que significa que você paga apenas por conclusões bem-sucedidas. Não há mensalidades ou assinaturas; você pré-carrega crédito, que nunca expira.

Recargas são aceitas via criptomoeda, especificamente USDT (TRC20) ou USDC (Base). Os valores mínimos de recarga variam de $10 a $500, com créditos bônus para valores maiores. Não são aceitos cartões de crédito ou PayPal para recargas. Uma nova conta recebe $0,50 em crédito de teste válido por 7 dias, sem necessidade de cartão. Os limites incluem 300 requisições por minuto e 8 requisições simultâneas por chave.

Privacidade e tratamento de dados

A privacidade é uma consideração importante para muitos usuários. A API não usa seus prompts para dados de treinamento, garantindo que sua entrada permaneça privada. A criação de conta requer apenas um endereço de e-mail, sem necessidade de número de telefone. Isso minimiza a coleta de dados pessoais enquanto fornece acesso total à API.

As restrições de conteúdo são mínimas, mas específicas. O modelo não recusa tópicos adultos lícitos, ficcionais ou controversos. No entanto, aplica-se um limite rígido: conteúdo sexual envolvendo menores é sempre bloqueado. Isso garante conformidade com padrões legais básicos enquanto mantém um ambiente altamente permissivo para outros tipos de conteúdo.

Começando com sua chave

O cadastro é simples. Você pode usar "Continuar com Google" ou criar uma conta com e-mail e senha. Uma vez registrado, sua chave de API é exibida imediatamente, permitindo que você comece a fazer requisições sem atraso. Não é necessária verificação por número de telefone, e o processo é projetado para velocidade.

Para integrar, atualize a URL base do seu cliente para https://api.uncensoredgpt.cc/v1 e defina a chave de API. Use o ID do modelo "uncensored" para todas as requisições. Esta abordagem de modelo único garante consistência e elimina a complexidade do roteamento. Você pode começar a transmitir, chamar funções ou gerar textos longos imediatamente.

Perguntas e respostas

Esta API é adequada para conteúdo NSFW?

Sim, o modelo é sem censura e não recusa tópicos adultos lícitos, ficcionais ou controversos. Ele foi projetado para lidar com conteúdo NSFW sem restrições arbitrárias, exceto por um bloqueio rígido em conteúdo sexual envolvendo menores.

Como eu pago pela API?

Os pagamentos são aceitos apenas via criptomoeda: USDT (TRC20) ou USDC (Base). Não há opções de cartão de crédito, PayPal ou transferência bancária. As recargas variam de $10 a $500, e os créditos nunca expiram.

Qual é o tamanho da janela de contexto?

A janela de contexto é de 100.000 tokens, o que inclui tanto o prompt quanto a conclusão. A saída máxima por requisição é de 32.000 tokens, ou 2.048 se <code>max_tokens</code> não for especificado.

A API usa meus dados para treinamento?

Não, os prompts não são usados para treinamento. O serviço é projetado para ser privado, exigindo apenas um e-mail para criação de conta e garantindo que seus dados de entrada permaneçam seus.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave e altere a URL base. Essa é toda a configuração.

Obter chave de API