Cập nhật và Trạng thái
Trạng thái inferenced hiện tại và lịch sử thay đổi của cổng.
Trạng thái hiện tại
- MiniMax M2.7Mạng Gonka: Đang hoạt động
- Kimi K2.6Mạng Gonka: Đang hoạt động
- DeepSeek V4 FlashMạng Gonka: Đang hoạt động
Tập hợp các mô hình hoạt động được xác định bởi bỏ phiếu mạng lưới Gonka và có thể thay đổi: một số mô hình đôi khi không khả dụng và sẽ quay lại sau. Danh sách hiện tại nằm ở trên.
Trạng thái chi tiết và thời gian hoạt động →Lịch sử cập nhật
Độ dài tối đa cho một phản hồi của DeepSeek V4 Flash đã được tăng lên gấp 4 lần: từ 8,192 lên 32,768 token (tham số max_tokens). Các tệp lớn và phản hồi dài từ các công cụ agent giờ đây có thể nằm gọn trong một lần gọi. Ngoài ra: nếu phản hồi chạm ngưỡng giới hạn ở giữa quá trình gọi công cụ, cổng gateway sẽ trả về finish_reason="length" chính xác thay vì một cuộc gọi bị cắt — các agent client (Cursor và những phần mềm khác) sẽ tiếp tục hoạt động chính xác thay vì bị treo do lỗi phân tích cú pháp.
Mạng lưới Gonka đã có thêm mô hình hoạt động thứ ba — DeepSeek V4 Flash 0731: ngữ cảnh 380.000 token (dài nhất trong mạng lưới, đã được xác minh bằng yêu cầu thực tế 381K), hỗ trợ reasoning và tool calling. Mã định danh là deepseek-ai/DeepSeek-V4-Flash-0731, giá cả tương đương các mô hình khác. Mô hình đang trong giai đoạn thử nghiệm sớm nhưng đã có sẵn đầy đủ: hãy chọn nó trong chat của bảng điều khiển hoặc chỉ định trong trường model của yêu cầu API của bạn.
Kể từ ngày 3 tháng 8, chi phí inferenced là: đầu vào — 22 nGNK, đầu ra — 66 nGNK mỗi token (gấp đôi mức 11/33 trước đây). Phí cổng thanh toán không thay đổi, vẫn là 10%. Chế độ demo vẫn miễn phí. Giá hiện tại của tất cả các mô hình có trên trang Pricing và GET /api/pricing.
Nếu mạng Gonka nhận yêu cầu nhưng không phản hồi (timeout 300s), gateway hiện sẽ trả về lỗi 504 ngay lập tức thay vì thử lại liên tục một cách âm thầm. Lưu ý quan trọng về tính phí: yêu cầu đã được mạng chấp nhận không thể hủy — node vẫn sẽ xử lý yêu cầu đó, do đó khi xảy ra timeout, phí ước tính xử lý prompt sẽ bị trừ (completion không bị tính phí). Khuyến nghị: đối với tạo nội dung dài, hãy sử dụng stream:true — stream ổn định hơn trước các lỗi timeout và hiển thị tiến trình ngay lập tức.
Phí nạp tiền qua USDT nay giảm dần theo số tiền: cơ bản 5%, từ $25 — 4.5%, từ $50 — 4%, từ $100 — 3.5%, từ $250 — 3%, từ $500 — 2.75%, từ $1000 — 2.5%. Hộp thoại nạp tiền có tính năng bậc thang tương tác: thanh trượt số tiền, phần thưởng GNK cho mỗi cấp và số tiền tiết kiệm của bạn. Ưu đãi được tự động áp dụng khi tiền vào tài khoản.
Bạn có thể đặt giới hạn chi tiêu tổng (lũy kế) cho các khóa con — một hạn mức riêng biệt không được đặt lại, không giống như giới hạn hàng ngày hoặc hàng tháng. Khi hạn mức đã hết, các yêu cầu sử dụng khóa sẽ bị từ chối. Giới hạn được đặt trong bảng điều khiển (với độ chính xác đến nanogonka) hoặc thông qua API sử dụng trường limit_total_ngonka trong POST/PATCH /api/management/keys/{id}/children; mức tiêu thụ tích lũy được đặt lại bằng nút "Reset usage" (hoặc POST /api/management/keys/{id}/children/{childId}/reset-usage).
Chi phí suy luận đã được đồng bộ hóa với giá thực tế của mạng lưới Gonka trên mỗi token. Mức giá vẫn nằm trong nhóm thấp nhất thị trường — chỉ tốn một phần nhỏ của xu cho mỗi triệu token, rẻ hơn hàng trăm lần so với OpenAI và Anthropic khi cùng sử dụng các model open-source. Token đầu ra được định giá cao hơn token đầu vào (×3), tương tự như hầu hết các nhà cung cấp.
Chúng tôi đã xác nhận giới hạn ngữ cảnh thực tế của các model đang hoạt động — lên đến 200,000 token (trước đó con số công bố là 131,072 một cách thận trọng). Giờ đây, bạn có thể gửi các tài liệu và lịch sử đối thoại dài hơn; thông số hiện tại của từng model có trong phần "Network Status".
Chi phí của mỗi yêu cầu được hiển thị bằng USD — trong phản hồi API (trường usage.total_cost_usd) và trong phần «Sử dụng». Thuận tiện để lập kế hoạch chi tiêu.
Thiết lập quyền truy cập API trong công cụ của bạn một cách tự động: chạy npx @joingonka/setup. Hỗ trợ Claude Code, OpenClaw, Cline, Continue, opencode, Aider và các công cụ khác.
Mô hình tìm kiếm trên internet trong khi phản hồi và thêm các liên kết nguồn. Cách bật: truyền trong phần thân yêu cầu plugins: [{ "id": "web", "max_results": 5 }] — hoạt động trong API tương thích với OpenAI và Anthropic.
Độ dài phản hồi tối đa là 8192 token; quản lý bằng tham số max_tokens (mặc định là 1024 cho phản hồi streaming và 1500 cho phản hồi bình thường).
Trên trang «Chat», chọn mô hình từ danh sách (được tải từ /v1/models) — lựa chọn sẽ được lưu và áp dụng cho các cuộc hội thoại mới.
Cần tốc độ? Thêm tiêu đề x-joingonka-meta: 1 vào yêu cầu — phản hồi streaming sẽ trả về ttft_ms (thời gian đến token đầu tiên) và tokens_per_sec.
Tạo khóa quản lý (POST /api/management/keys) và tạo các khóa con kèm giới hạn (hạn mức ngày và tháng, rate limit, thời hạn) thông qua POST /api/management/keys/{id}/children.
Kết nối các plugin với tham số plugins: response-healing sửa JSON bị cắt bớt, privacy-sanitization che giấu dữ liệu riêng tư, file-parser trích xuất văn bản từ PDF và tài liệu.
OpenAI: base_url https://gate.joingonka.ai/v1, tiêu đề Authorization: Bearer your-key. Anthropic (Claude Code): base_url https://gate.joingonka.ai, tiêu đề x-api-key, endpoint /v1/messages.
GNK: nhận địa chỉ và memo rồi gửi token on-chain. USDT: nhập số tiền từ 1 đến 10.000 USD và thanh toán qua OxaPay — tự động chuyển đổi sang GNK.