DE ▾

Uncensored Gemma: Ein Integrationshandbuch für Entwickler

Aktualisiert

Uncensored Gemma bezeichnet ein Open-Weight-LLM, das für die Generierung mit hoher Treue und geringer Ablehnung optimiert ist und über eine Standard-Chat-Completions-Schnittstelle zugänglich ist. Dieses Handbuch erklärt, wie du diese textbasierte API in deinen Workflow integrierst, sie als sofort einsetzbare Alternative zu OpenAI-kompatiblen Clients betrachtest und die spezifischen Token-Limits sowie die Preisstrukturen verstehst.

Warum Uncensored Gemma wählen?

Wenn Entwickler eine Erfahrung im Stil eines unzensierten Gemma suchen, wollen sie oft ein Modell, das die in kommerziellen Angeboten üblichen Sicherheitsfilter vermeidet. Diese API bietet ein einzelnes, leistungsstarkes Modell, das darauf abgestimmt ist, ohne Inhaltsablehnungen für legale Erwachsenennutzung, Sicherheitsforschung oder kontroverse Themen zu antworten. Im Gegensatz zu Plattformen, die mehrere Anbieter aggregieren, konzentriert sich dieser Dienst auf ein spezifisches Open-Weight-Modell, um konsistentes Verhalten und vorhersehbare Latenz zu gewährleisten.

Das Modell lehnt Standard-Prompts für Kreativität oder Analyse nicht ab, was es für die Generierung verschiedener Stilrichtungen geeignet macht. Es ist jedoch wichtig zu beachten, dass es ein unabhängiges Open-Weight-Modell ist, nicht Googles Gemma und auch nicht mit xAIs Grok verwandt. Es läuft auf dedizierten Servern und gibt Text ein und aus, was eine saubere, vorhersehbare Umgebung für Entwickler bietet, die rohe Modellausgaben ohne den Overhead des Multi-Modell-Routings benötigen.

API-Kompatibilitätsübersicht

Die API ist vollständig OpenAI-kompatibel, was bedeutet, dass du die offiziellen OpenAI-SDKs oder jeden anderen Client verwenden kannst, der das OpenAI-Protokoll spricht. Du musst nur die base_url aktualisieren und deinen API-Schlüssel angeben. Die Endpunktstruktur spiegelt die Standard-Chat-Completions-Schnittstelle wider, was die Migration von anderen Anbietern trivial macht.

  • Endpunkte: Nur POST /v1/chat/completions und GET /v1/models sind verfügbar.
  • Keine zusätzlichen Funktionen: Es gibt keine Embedding-, Bildgenerierungs-, Audioverarbeitungs- oder Fine-Tuning-Endpunkte.
  • Base URL: https://api.grokuncensored.cc/v1
  • Model-ID: Verwende uncensored als Modellkennung.

Diese Einfachheit reduziert die Integrationskomplexität. Du musst nicht verschiedene Antwort-Schemata für verschiedene Funktionen verarbeiten. Das Antwortformat ist konsistent und gibt Textinhalte sowie Token-Nutzungsstatistiken zurück.

Einrichtung deiner Umgebung

Die Integration beginnt mit dem Erhalt eines API-Schlüssels. Registriere dich über die Seite API-Schlüssel erhalten entweder über Google-Authentifizierung oder E-Mail und Passwort. Der Schlüssel wird sofort angezeigt, und keine Telefonnummer ist erforderlich. Dieser Prozess ist auf Geschwindigkeit ausgelegt, sodass du innerhalb von Minuten mit Tests beginnen kannst.

Sobald du deinen Schlüssel hast, konfiguriere deine Umgebungsvariablen. Zum Beispiel in Python:

Stelle sicher, dass deine Base URL auf https://api.grokuncensored.cc/v1 zeigt. Du kannst auch das Testguthaben nutzen, das $0,50 für 7 Tage bereitstellt, ohne dass eine Kreditkarte erforderlich ist. So kannst du die Konnektivität und die Antwortqualität überprüfen, bevor du dein Guthaben per Krypto auflädst.

Deine erste Anfrage senden

Nach der Konfiguration deiner Umgebung kannst du eine Anfrage senden. Die API akzeptiert Standard-Nachrichten-Arrays. Hier ist ein grundlegendes Beispiel mit cURL:

curl https://api.grokuncensored.cc/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Die Antwort enthält den generierten Text und die Token-Nutzung. Wenn du max_tokens auf einen Wert setzt, respektiert die API dieses Limit. Wenn du max_tokens nicht setzt, beträgt die maximale Standardausgabe 2.048 Token. Für längere Ausgaben kannst du diesen Wert bis zu 32.000 Token erhöhen, vorausgesetzt, der gesamte Kontext (Prompt + Completion) bleibt innerhalb des 100.000-Token-Fensters.

Verarbeitung von Antworten und Token

Antworten werden im Standard-JSON-Format zurückgegeben. Die Token-Nutzung ist im letzten Chunk einer Streaming-Antwort enthalten, sodass du die Kosten in Echtzeit verfolgen kannst. Die Preise sind transparent: $0,25 pro 1M Input-Token und $1,00 pro 1M Output-Token. Fehler und Ablehnungen sind kostenlos, sodass du experimentieren kannst, ohne dir Sorgen um verbrauchte Guthaben machen zu müssen.

Stelle beim Streaming sicher, dass dein Client Server-Sent Events (SSE) korrekt verarbeitet. Die API gibt Text-Chunks zurück, und der letzte Chunk enthält das Feld usage. Dies ermöglicht eine präzise Abrechnung. Beachte, dass Guthaben Prepaid ist und Fehler nicht von deinem Kontostand abziehen. Dieses Modell ist kein Embedding-Dienst, daher kannst du es nicht direkt für Vektorsuchen verwenden; du musst Embeddings bei Bedarf separat verarbeiten.

Erweiterte Parameter

Die API unterstützt mehrere Parameter zur Steuerung der Generierungsqualität. Du kannst temperature für Kreativität, top_p für Nucleus-Sampling und seed für Reproduzierbarkeit anpassen. Weitere unterstützte Parameter sind stop, presence_penalty und frequency_penalty.

Function Calling wird über die Felder tools und tool_choice unterstützt. Dies ermöglicht es dem Modell, strukturierte Ausgaben zu generieren, die von deiner Anwendung analysiert werden können. Zusätzlich ist der JSON-Modus über response_format: {"type": "json_object"} verfügbar, was sicherstellt, dass die Ausgabe gültiges JSON ist. Dies ist nützlich für den Aufbau von Agents oder strukturierten Datenpipelines. Das Modell ist ein Open-Weight-Modell, das für hochwertige Textgenerierung abgestimmt ist und sich für das Befolgen komplexer Anweisungen eignet.

Fehlerbehandlung

Fehler werden in Standard-HTTP-Statuscodes zurückgegeben. Häufige Fehler sind Ratenlimits (429) oder ungültige API-Schlüssel (401). Die Ratenlimits liegen bei 300 Anfragen pro Minute und 8 parallelen Anfragen pro Schlüssel. Wenn du diese Limits erreichst, implementiere eine exponentielle Backoff-Strategie in deinem Client.

Der Anfragekörper ist auf 8 MB begrenzt. Wird dieses Limit überschritten, wird die Anfrage abgelehnt. Stelle sicher, dass deine Prompts innerhalb dieser Grenzen liegen. Da die API nur Text unterstützt, treten keine Fehler im Zusammenhang mit der Medienverarbeitung auf. Bei Abrechnungsfehlern, wie z. B. unzureichendem Guthaben, gibt die API einen 402-Status zurück. Das Guthaben verfällt nie, sodass du es jederzeit aufladen kannst. Fehler wie doppelte Belastungen können über die Support-Seite geklärt werden, da das Guthaben nicht automatisch erstattet wird.

Vergleich mit grok uncensored

Obwohl es oft mit anderen unzensierten Modellen wie Grok Uncensored diskutiert wird, ist diese API ein unabhängiger Dienst. Sie bedient nicht Googles Gemma, noch ist sie die offizielle Grok-API von xAI. Der Begriff uncensored gemma in Suchergebnissen bezieht sich oft auf das Verhalten des Open-Weight-Modells, das diese API eng imitiert. Die Model-ID ist jedoch einfach uncensored und nicht an Googles Architektur gebunden.

Im Gegensatz zur offiziellen Grok-API, die möglicherweise andere Preise und Limits hat, bietet diese API einen Pauschalpreis von $0,25/$1,00 pro Million Token. Sie unterstützt ausschließlich Krypto-Zahlungen, wobei für das Testguthaben keine Kreditkarte erforderlich ist. Dies macht sie zu einer flexiblen Alternative für Entwickler, die Krypto bevorzugen oder Anbieterbindung vermeiden möchten. Das Modell ist kein Wiederverkäufer von Grok; es handelt sich um ein eigenständiges Open-Weight-Modell.

Fazit

Diese API bietet eine robuste, für Entwickler gemachte Schnittstelle für ein unzensiertes Open-Weight-Modell. Durch die Einhaltung des OpenAI-kompatiblen Protokolls lässt sie sich nahtlos in bestehende Workflows integrieren. Die Preise sind transparent, und die Limits sind für die meisten Anwendungsfälle großzügig. Egal, ob du einen Chatbot, einen Agenten oder ein Tool zur Inhaltsgenerierung entwickelst, diese API bietet eine zuverlässige, unzensierte Alternative. Denke daran, dass es sich um eine Text-only-API handelt, und plane deine Architektur entsprechend. Weitere Details zu Preisen und Schlüsseln findest du auf den entsprechenden Seiten der Website.

Fragen und Antworten

Ist diese API identisch mit Googles Gemma?

Nein, diese API bedient ein unabhängiges Open-Weight-Modell. Es ist nicht Googles Gemma und auch nicht an Googles Architektur gebunden. Der Begriff „uncensored gemma“ bezieht sich oft auf das Verhalten des Modells, die Model-ID ist jedoch einfach „uncensored“.

Wie bezahle ich für die API?

Zahlungen werden ausschließlich per Krypto akzeptiert, speziell USDT (TRC20) oder USDC (Base). Du kannst mit jedem Gesamtbetrag zwischen $10 und $500 aufladen. Es gibt keine Optionen für Kreditkarte oder PayPal. Ein Testguthaben von $0,50 ist ohne Kartenangabe verfügbar.

Wie groß ist das Kontextfenster?

Das Kontextfenster umfasst 100.000 Token, was sowohl den Prompt als auch die Completion einschließt. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token, bzw. 2.048, wenn du keinen max_tokens-Wert angibst.

Unterstützt die API Function Calling?

Ja, die API unterstützt Function Calling über die Parameter 'tools' und 'tool_choice'. Zudem ist der JSON-Modus für strukturierte Ausgaben verfügbar. Streaming ist über SSE möglich, wobei die Token-Nutzung im letzten Chunk gemeldet wird.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Base URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhalten