Uncensored Gemma: Hướng dẫn tích hợp cho nhà phát triển
Cập nhật
Uncensored Gemma đề cập đến một mô hình ngôn ngữ lớn trọng số mở được tối ưu hóa để tạo văn bản trung thực và ít từ chối, có thể truy cập qua giao diện chat-completions tiêu chuẩn. Hướng dẫn này giải thích cách tích hợp API chỉ văn bản này vào quy trình làm việc của bạn, coi nó như một giải pháp thay thế trực tiếp cho các máy khách tương thích OpenAI trong khi hiểu rõ các giới hạn token và cấu trúc giá cả liên quan.
Tại sao chọn Uncensored Gemma?
Khi các nhà phát triển tìm kiếm trải nghiệm kiểu gemma không kiểm duyệt, họ thường tìm một mô hình tránh các bộ lọc bảo mật phổ biến trong các sản phẩm thương mại. API này cung cấp một mô hình dung lượng cao duy nhất được tinh chỉnh để trả lời mà không từ chối nội dung cho mục đích người trưởng thành hợp pháp, nghiên cứu bảo mật hoặc các chủ đề gây tranh cãi. Không giống như các nền tảng tổng hợp nhiều nhà cung cấp, dịch vụ này tập trung vào một mô hình trọng số mở cụ thể, đảm bảo hành vi nhất quán và độ trễ dự đoán được.
Mô hình không từ chối các prompt sáng tạo hoặc phân tích tiêu chuẩn, khiến nó phù hợp để tạo ra các phong cách nội dung đa dạng. Tuy nhiên, điều quan trọng cần lưu ý là đây là một mô hình trọng số mở độc lập, không phải là Google Gemma, cũng không liên quan đến Grok của xAI. Nó chạy trên các máy chủ chuyên dụng và xử lý văn bản vào và văn bản ra, cung cấp một môi trường sạch, dự đoán được cho các nhà phát triển cần đầu ra mô hình thô mà không có chi phí của việc định tuyến đa mô hình.
Tổng quan về khả năng tương thích API
API hoàn toàn tương thích với OpenAI, nghĩa là bạn có thể sử dụng các SDK chính thức của OpenAI hoặc bất kỳ máy khách nào khác hỗ trợ giao thức OpenAI. Bạn chỉ cần cập nhật base_url và cung cấp khóa API của bạn. Cấu trúc endpoint sao chép giao diện hoàn thành trò chuyện tiêu chuẩn, giúp di chuyển từ các nhà cung cấp khác trở nên dễ dàng.
- Endpoints: Chỉ có
POST /v1/chat/completionsvàGET /v1/models. - Không có tính năng bổ sung: Không có endpoint nhúng, tạo hình ảnh, xử lý âm thanh hoặc tinh chỉnh.
- Base URL:
https://api.grokuncensored.cc/v1 - ID mô hình: Sử dụng
uncensoredlàm định danh mô hình.
Sự đơn giản này làm giảm độ phức tạp khi tích hợp. Bạn không cần xử lý các lược đồ phản hồi khác nhau cho các tính năng khác nhau. Định dạng phản hồi nhất quán, trả về nội dung văn bản và thống kê sử dụng token.
Thiết lập môi trường
Tích hợp bắt đầu bằng cách lấy khóa API. Đăng ký qua trang Lấy khóa API bằng xác thực Google hoặc email và mật khẩu. Khóa được hiển thị ngay lập tức và không cần số điện thoại. Quy trình này được thiết kế để nhanh chóng, cho phép bạn bắt đầu kiểm tra trong vài phút.
Sau khi có khóa, hãy định cấu hình các biến môi trường của bạn. Ví dụ, trong Python:
Đảm bảo base URL của bạn trỏ đến https://api.grokuncensored.cc/v1. Bạn cũng có thể tận dụng tín dụng dùng thử, cung cấp $0,50 có giá trị trong 7 ngày, không cần thẻ tín dụng. Điều này cho phép bạn xác minh kết nối và chất lượng phản hồi trước khi cam kết nạp tiền bằng tiền điện tử.
Gửi yêu cầu đầu tiên
Với môi trường đã được định cấu hình, bạn có thể gửi yêu cầu. API chấp nhận các mảng thông báo tiêu chuẩn. Dưới đây là một ví dụ cơ bản sử dụng cURL:
curl https://api.grokuncensored.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Phản hồi sẽ chứa văn bản được tạo và việc sử dụng token. Nếu bạn đặt max_tokens thành một giá trị, API sẽ tôn trọng giới hạn đó. Nếu bạn không đặt max_tokens, lượng đầu ra tối đa mặc định là 2.048 token. Đối với các đầu ra dài hơn, bạn có thể tăng giá trị này lên đến 32.000 token, miễn là tổng ngữ cảnh (prompt + phần hoàn thành) nằm trong cửa sổ 100.000 token.
Xử lý phản hồi và token
Phản hồi được trả về ở định dạng JSON tiêu chuẩn. Việc sử dụng token được bao gồm trong chunk cuối cùng của phản hồi streaming, cho phép bạn theo dõi chi phí theo thời gian thực. Giá cả minh bạch: $0,25 cho mỗi 1 triệu token đầu vào và $1,00 cho mỗi 1 triệu token đầu ra. Lỗi và từ chối đều miễn phí, vì vậy bạn có thể thử nghiệm mà không phải lo lắng về việc tiêu tốn tín dụng.
Khi sử dụng streaming, hãy đảm bảo máy khách của bạn xử lý các Sự kiện gửi qua máy chủ (SSE) đúng cách. API trả về các chunk văn bản, và chunk cuối cùng chứa trường usage. Điều này cho phép đối soát hóa toán chính xác. Lưu ý rằng tín dụng được trả trước và lỗi không trừ từ số dư của bạn. Mô hình này không phải là dịch vụ nhúng, vì vậy bạn không thể sử dụng nó trực tiếp cho các tìm kiếm vector; bạn phải xử lý việc nhúng riêng nếu cần.
Các tham số nâng cao
API hỗ trợ một số tham số để kiểm soát chất lượng tạo. Bạn có thể điều chỉnh temperature để sáng tạo, top_p để lấy mẫu hạt nhân và seed để tái lập. Các tham số được hỗ trợ khác bao gồm stop, presence_penalty và frequency_penalty.
Gọi hàm được hỗ trợ thông qua các trường tools và tool_choice. Điều này cho phép mô hình tạo ra các đầu ra có cấu trúc có thể được phân tích cú pháp bởi ứng dụng của bạn. Ngoài ra, chế độ JSON có sẵn thông qua response_format: {"type": "json_object"}, đảm bảo đầu ra là JSON hợp lệ. Điều này hữu ích cho việc xây dựng các tác nhân hoặc đường ống dữ liệu có cấu trúc. Mô hình là một mô hình trọng số mở, được tinh chỉnh để tạo văn bản chất lượng cao, khiến nó phù hợp cho việc tuân theo hướng dẫn phức tạp.
Xử lý lỗi
Lỗi được trả về trong các mã trạng thái HTTP tiêu chuẩn. Các lỗi phổ biến bao gồm giới hạn tốc độ (429) hoặc khóa API không hợp lệ (401). Giới hạn tốc độ được đặt là 300 yêu cầu mỗi phút và 8 yêu cầu đồng thời mỗi khóa. Nếu bạn vượt quá các giới hạn này, hãy triển khai cơ chế backoff theo cấp số nhân trong máy khách của bạn.
Thân yêu cầu được giới hạn ở 8 MB. Nếu bạn vượt quá giới hạn này, yêu cầu sẽ bị từ chối. Đảm bảo các prompt của bạn nằm trong các giới hạn này. Vì API chỉ hỗ trợ văn bản, các lỗi liên quan đến xử lý phương tiện sẽ không xảy ra. Đối với các lỗi thanh toán, chẳng hạn như không đủ tín dụng, API sẽ trả về mã trạng thái 402. Tín dụng không bao giờ hết hạn, vì vậy bạn có thể nạp tiền khi thuận tiện. Các lỗi như tính phí kép có thể được giải quyết qua trang Hỗ trợ, vì tín dụng không được hoàn lại tự động.
So sánh với Grok Uncensored
Mặc dù thường được thảo luận cùng với các mô hình không kiểm duyệt khác như grok uncensored, API này là một dịch vụ độc lập. Nó không phục vụ Google Gemma, cũng không phải là API Grok chính thức từ xAI. Thuật ngữ uncensored gemma trong kết quả tìm kiếm thường đề cập đến hành vi của mô hình trọng số mở, mà API này mô phỏng rất sát. Tuy nhiên, ID mô hình chỉ đơn giản là uncensored và không liên kết với kiến trúc của Google.
Không giống như API Grok chính thức, có thể có giá và giới hạn khác nhau, API này cung cấp mức giá cố định là $0,25/$1,00 cho mỗi triệu token. API cũng hỗ trợ thanh toán bằng tiền mã hóa, không cần thẻ tín dụng để dùng thử. Điều này tạo nên một giải pháp linh hoạt cho các nhà phát triển ưu tiên tiền mã hóa hoặc muốn tránh bị khóa vào gói đăng ký. Mô hình không phải là nhà bán lại của Grok; đây là một mô hình trọng số mở độc lập.
Kết luận
API này cung cấp giao diện mạnh mẽ, ưu tiên nhà phát triển cho một mô hình trọng số mở không kiểm duyệt. Bằng cách tuân thủ giao thức tương thích OpenAI, API tích hợp liền mạch vào các quy trình làm việc hiện có. Giá cả minh bạch và các giới hạn khá rộng rãi cho hầu hết các trường hợp sử dụng. Dù bạn đang xây dựng một chatbot, một tác nhân hay một công cụ tạo nội dung, API này đều cung cấp một giải pháp thay thế đáng tin cậy và không kiểm duyệt. Hãy nhớ rằng đây là API chỉ xử lý văn bản, vì vậy hãy lên kế hoạch kiến trúc của bạn cho phù hợp. Để biết thêm chi tiết về giá cả và khóa API, hãy truy cập các trang tương ứng trên trang web.