ES ▾

Uncensored Gemma: Guía de integración para desarrolladores

Actualizado

Uncensored Gemma se refiere a un modelo de lenguaje grande de pesos abiertos optimizado para generación de alta fidelidad y baja resistencia, accesible mediante una interfaz estándar de chat-completions. Esta guía explica cómo integrar esta API solo de texto en tu flujo de trabajo, tratándola como un reemplazo listo para usar para clientes compatibles con OpenAI mientras comprendes los límites de tokens y las estructuras de precios involucradas.

¿Por qué elegir Uncensored Gemma?

Cuando los desarrolladores buscan una experiencia estilo gemma sin censura, a menudo buscan un modelo que evite los filtros de seguridad comunes en las ofertas comerciales. Esta API proporciona un único modelo de alta capacidad ajustado para responder sin rechazos de contenido para uso adulto legal, investigación de seguridad o temas controvertidos. A diferencia de las plataformas que agregan múltiples proveedores, este servicio se centra en un modelo de pesos abiertos específico, garantizando un comportamiento consistente y una latencia predecible.

El modelo no rechaza prompts creativos o analíticos estándar, lo que lo hace adecuado para generar diversos estilos de contenido. Sin embargo, es importante notar que es un modelo de pesos abiertos independiente, no el Gemma de Google, ni está relacionado con el Grok de xAI. Se ejecuta en servidores dedicados y maneja entrada y salida de texto, proporcionando un entorno limpio y predecible para desarrolladores que necesitan la salida cruda del modelo sin la sobrecarga del enrutamiento entre múltiples modelos.

Resumen de compatibilidad de API

La API es totalmente compatible con OpenAI, lo que significa que puedes usar los SDK oficiales de OpenAI o cualquier otro cliente que hable el protocolo de OpenAI. Solo necesitas actualizar la base_url y proporcionar tu clave de API. La estructura del endpoint refleja la interfaz estándar de completaciones de chat, haciendo trivial la migración desde otros proveedores.

  • Endpoints: Solo están disponibles POST /v1/chat/completions y GET /v1/models.
  • Sin funciones adicionales: No hay endpoints de embeddings, generación de imágenes, procesamiento de audio ni ajuste fino.
  • URL base: https://api.grokuncensored.cc/v1
  • ID del modelo: Usa uncensored como identificador del modelo.

Esta simplicidad reduce la complejidad de la integración. No necesitas manejar diferentes esquemas de respuesta para diferentes funciones. El formato de respuesta es consistente, devolviendo contenido de texto y estadísticas de uso de tokens.

Configuración de tu entorno

La integración comienza con la obtención de una clave de API. Regístrate a través de la página Obtener clave de API usando autenticación de Google o un correo electrónico y contraseña. La clave se muestra inmediatamente y no se requiere número de teléfono. Este proceso está diseñado para la velocidad, permitiéndote comenzar las pruebas en minutos.

Una vez que tengas tu clave, configura las variables de entorno. Por ejemplo, en Python:

Asegúrate de que tu URL base apunte a https://api.grokuncensored.cc/v1. También puedes aprovechar el crédito de prueba, que proporciona $0,50 válidos por 7 días, sin necesidad de tarjeta de crédito. Esto te permite verificar la conectividad y la calidad de la respuesta antes de comprometerte con una recarga de criptomonedas.

Realizando tu primera petición

Con tu entorno configurado, puedes enviar una petición. La API acepta matrices de mensajes estándar. Aquí tienes un ejemplo básico usando cURL:

curl https://api.grokuncensored.cc/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

La respuesta contendrá el texto generado y el uso de tokens. Si estableces max_tokens a un valor, la API respetará ese límite. Si no estableces max_tokens, la salida máxima predeterminada es de 2.048 tokens. Para salidas más largas, puedes aumentar esto hasta 32.000 tokens, siempre que el contexto total (prompt + completación) se mantenga dentro de la ventana de 100.000 tokens.

Manejo de respuestas y tokens

Las respuestas se devuelven en formato JSON estándar. El uso de tokens se incluye en el último fragmento de una respuesta de streaming, permitiéndote rastrear los costos en tiempo real. El precio es transparente: $0,25 por 1M de tokens de entrada y $1,00 por 1M de tokens de salida. Los errores y rechazos son gratuitos, por lo que puedes experimentar sin preocuparte por créditos desperdiciados.

Al usar streaming, asegúrate de que tu cliente maneje correctamente los Eventos Enviados por el Servidor (SSE). La API devuelve fragmentos de texto, y el fragmento final contiene el campo usage. Esto permite una conciliación de facturación precisa. Ten en cuenta que el crédito es prepago y los errores no descuentan de tu saldo. Este modelo no es un servicio de embeddings, por lo que no puedes usarlo para búsquedas de vectores directamente; debes manejar los embeddings por separado si es necesario.

Parámetros avanzados

La API admite varios parámetros para controlar la calidad de la generación. Puedes ajustar temperature para la creatividad, top_p para el muestreo de núcleo y seed para la reproducibilidad. Otros parámetros admitidos incluyen stop, presence_penalty y frequency_penalty.

Las llamadas a funciones se admiten mediante los campos tools y tool_choice. Esto permite que el modelo genere salidas estructuradas que pueden ser analizadas por tu aplicación. Además, el modo JSON está disponible mediante response_format: {"type": "json_object"}, asegurando que la salida sea JSON válido. Esto es útil para construir agentes o pipelines de datos estructurados. El modelo es un modelo de pesos abiertos, ajustado para la generación de texto de alta calidad, lo que lo hace adecuado para el seguimiento complejo de instrucciones.

Manejo de errores

Los errores se devuelven en códigos de estado HTTP estándar. Los errores comunes incluyen límites de tasa (429) o claves de API no válidas (401). Los límites de tasa se establecen en 300 peticiones por minuto y 8 peticiones simultáneas por clave. Si superas estos límites, implementa retroceso exponencial en tu cliente.

El cuerpo de la petición está limitado a 8 MB. Si excedes este límite, la petición será rechazada. Asegúrate de que tus prompts estén dentro de estos límites. Dado que la API es solo de texto, no ocurrirán errores relacionados con el procesamiento de medios. Para errores de facturación, como crédito insuficiente, la API devolverá un estado 402. El crédito no caduca, así que puedes recargar cuando quieras. Errores como cargos dobles se pueden resolver a través de la página de Soporte, ya que el crédito no se reembolsa automáticamente.

Comparación con Grok sin censura

Aunque a menudo se discute junto con otros modelos sin censura como grok sin censura, esta API es un servicio independiente. No sirve la Gemma de Google, ni es la API oficial de Grok de xAI. El término gemma sin censura en los resultados de búsqueda a menudo se refiere al comportamiento del modelo de pesos abiertos, que esta API emula estrechamente. Sin embargo, el ID del modelo es simplemente uncensored y no está vinculado a la arquitectura de Google.

A diferencia de la API oficial de Grok, que puede tener precios y límites diferentes, esta API ofrece una tarifa plana de $0,25/$1,00 por millón de tokens. También admite pagos exclusivos con criptomonedas, sin necesidad de tarjeta de crédito para la prueba. Esto la convierte en una alternativa flexible para desarrolladores que prefieren criptomonedas o quieren evitar bloqueos de suscripción. El modelo no es un revendedor de Grok; es un modelo de pesos abiertos distinto.

Conclusión

Esta API proporciona una interfaz robusta y centrada en el desarrollador para un modelo de pesos abiertos sin censura. Al adherirse al protocolo compatible con OpenAI, se integra sin problemas en los flujos de trabajo existentes. El precio es transparente y los límites son generosos para la mayoría de los casos de uso. Ya sea que estés construyendo un chatbot, un agente o una herramienta de generación de contenido, esta API ofrece una alternativa confiable y sin censura. Recuerda que es una API solo de texto, así que planifica tu arquitectura en consecuencia. Para más detalles sobre precios y claves, visita las páginas correspondientes del sitio.

Preguntas y respuestas

¿Es esta API la misma que la de Google Gemma?

No, esta API sirve un modelo de pesos abiertos independiente. No es la Gemma de Google ni está vinculada a su arquitectura. El término 'uncensored gemma' suele referirse al comportamiento del modelo, pero el ID del modelo es simplemente 'uncensored'.

¿Cómo pago por la API?

Solo aceptamos pagos con criptomonedas, específicamente USDT (TRC20) o USDC (Base). Puedes recargar con cualquier cantidad entera entre $10 y $500. No hay opciones de tarjeta de crédito ni PayPal. Hay un crédito de prueba de $0,50 disponible sin necesidad de tarjeta.

¿Cuál es el límite de la ventana de contexto?

La ventana de contexto es de 100.000 tokens, lo que incluye tanto el prompt como la completación. La salida máxima por petición es de 32.000 tokens, o 2.048 si no especificas un valor de max_tokens.

¿La API admite llamadas a funciones?

Sí, la API admite llamadas a funciones mediante los parámetros 'tools' y 'tool_choice'. También admite modo JSON para salida estructurada. El streaming está disponible vía SSE, con el uso de tokens reportado en el último fragmento.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave y cambia la URL base. Ese es todo el proceso de configuración.

Obtener clave de API