无审查 Gemma:开发者集成指南
更新于
无审查 Gemma 指的是针对高保真、低拒绝生成进行优化的开放权重大型语言模型,可通过标准聊天补全接口访问。本指南解释如何将此纯文本 API 集成到您的工作流程中,将其作为 OpenAI 兼容客户端的即插即用替代品,同时了解相关的 token 限制和定价结构。
为什么选择无审查 Gemma?
当开发者寻求 无审查的 Gemma 风格体验时,他们通常希望找到一个避免商业产品中常见安全过滤器的模型。该 API 提供单一的高容量模型,针对合法成人用途、安全研究或争议性话题进行优化,确保在回答时不进行内容拒绝。与聚合多个供应商的平台不同,该服务专注于一个特定的开放权重模型,确保行为一致且延迟可预测。
该模型不会拒绝标准的创意或分析提示词,使其适合生成多样化的内容风格。但需要注意的是,它是一个独立的开放权重模型,不是 Google 的 Gemma,也与 xAI 的 Grok 无关。它在专用服务器上运行,提供文本输入和文本输出,为需要原始模型输出且无需多模型路由开销的开发者提供清晰、可预测的环境。
API 兼容性概述
该API完全兼容OpenAI,这意味着你可以使用官方的OpenAI SDK或任何支持OpenAI协议的其他客户端。你只需更新base_url并提供API密钥即可。接口结构与标准的聊天补全接口一致,从其他供应商迁移变得轻而易举。
- 接口: 仅提供
POST /v1/chat/completions和GET /v1/models。 - 无额外功能: 没有嵌入、图像生成、音频处理或微调接口。
- 基础URL:
https://api.grokuncensored.cc/v1 - 模型ID: 使用
uncensored作为模型标识符。
这种简洁性降低了集成复杂度。你无需为不同功能处理不同的响应格式。响应格式保持一致,返回文本内容和 token 使用统计。
设置您的环境
集成始于获取API密钥。通过获取API密钥页面注册,使用Google身份验证或电子邮件和密码。密钥将立即显示,且无需电话号码。此流程专为速度设计,让你能够在几分钟内开始测试。
获得密钥后,配置您的环境变量。例如,在 Python 中:
确保你的基础URL指向https://api.grokuncensored.cc/v1。你还可以利用试用额度,该额度提供有效期为7天的0.50美元,无需信用卡。这允许你在决定进行加密货币充值之前验证连接性和响应质量。
发起首次请求
配置好环境后,你可以发送请求。API 接受标准的消息数组。以下是一个使用 cURL 的基本示例:
curl https://api.grokuncensored.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'响应将包含生成的文本和 token 使用情况。如果你将 max_tokens 设置为某个值,API 将遵守该限制。如果未设置 max_tokens,默认最大输出为 2,048 token。对于更长的输出,你可以将其增加至 32,000 token,前提是总上下文(提示词 + 补全)保持在 100,000 token 窗口内。
处理响应和 Token
响应以标准 JSON 格式返回。token 使用情况包含在流式响应的最后一个块中,允许你实时跟踪成本。定价透明:每 1M 输入 token $0.25 和 每 1M 输出 token $1.00。错误和拒绝免费,因此你可以放心实验,无需担心浪费额度。
使用流式输出时,请确保客户端正确处理 Server-Sent Events (SSE)。API 返回文本块,最后一个块包含 usage 字段。这允许精确的计费对账。请注意,额度是预付的,错误不会从你的余额中扣除。该模型不是嵌入服务,因此不能直接用于向量搜索;如果需要,你必须单独处理嵌入。
高级参数
API 支持多个参数来控制生成质量。你可以调整 temperature 以增加创意,top_p 用于核采样,以及 seed 用于可复现性。其他支持的参数包括 stop、presence_penalty 和 frequency_penalty。
通过tools和tool_choice字段支持函数调用。这允许模型生成结构化输出,供你的应用程序解析。此外,通过response_format: {"type": "json_object"}提供JSON模式,确保输出是有效的JSON。这对于构建代理或结构化数据管道非常有用。该模型是一个开放权重模型,针对高质量文本生成进行了调整,使其适合复杂的指令遵循。
错误处理
错误以标准 HTTP 状态码返回。常见错误包括速率限制 (429) 或无效的 API 密钥 (401)。速率限制设置为每分钟 300 次请求和每个密钥 8 个并发请求。如果达到这些限制,请在客户端实现指数退避。
请求体限制为 8 MB。如果超出此限制,请求将被拒绝。确保你的提示词在此范围内。由于 API 仅支持文本,因此不会发生与媒体处理相关的错误。对于计费错误(如额度不足),API 将返回 402 状态码。额度永不过期,你可以随时充值。如出现重复扣款等错误,可通过支持页面解决,因为额度不会自动退还。
与 Grok 无审查的比较
虽然经常与其他无审查模型如grok uncensored一起讨论,但该API是一个独立服务。它不提供Google的Gemma,也不是xAI的官方Grok API。搜索结果中的无审查的gemma一词通常指开放权重模型的行为,该API紧密模拟了这种行为。然而,模型ID仅为uncensored,且不与Google的架构绑定。
与可能具有不同定价和限制的官方 Grok API 不同,此 API 提供每百万 token 0.25/1.00 美元的固定费率。它还仅支持加密货币支付,无需信用卡即可进行试用。这使得它成为偏好加密货币或希望避免订阅锁定的开发者的灵活替代方案。该模型不是 Grok 的转售商;它是一个独特的开放权重模型。
结论
此 API 为无审查开放权重模型提供了强大的、以开发者为中心的接口。通过坚持使用 OpenAI 兼容协议,它可以无缝集成到现有工作流程中。定价透明,限制对于大多数用例来说都很慷慨。无论您是在构建聊天机器人、代理还是内容生成工具,此 API 都提供可靠的无审查替代方案。请记住这是一个纯文本 API,因此请相应地规划您的架构。有关定价和密钥的更多详细信息,请访问网站上的相应页面。