Dành cho AI agent: hướng dẫn từng bước để thiết lập — /docs/agents.md, chỉ mục tài liệu — /llms.txt.

Models

Các model của mạng Gonka, có thể truy cập qua gateway: ID cho trường model, cửa sổ ngữ cảnh, giới hạn phản hồi, giá và trạng thái.

Models và giá#

Danh sách model thay đổi theo các cuộc bỏ phiếu của mạng Gonka, nên bảng được tổng hợp từ dữ liệu trực tiếp của gateway. Giá tính bằng USD trên 1M token theo tỷ giá GNK hiện tại; việc trừ tiền diễn ra bằng GNK, xem thêm trong mục Bảng giá và tài khoản.

Mô hìnhNgữ cảnhPhản hồiĐầu vào, $/1MĐầu ra, $/1MTrạng thái
MiniMax MiniMaxAI/MiniMax-M2.7200K8K$0.0083$0.025Giảm sút
DeepSeek deepseek-ai/DeepSeek-V4-Flash-0731380K33K$0.0083$0.025Giảm sút
Z.ai zai-org/GLM-5.3-Flash390K8K$0.0083$0.025Hoạt động

Hãy dán ID vào trường model; chữ hoa chữ thường không quan trọng. Trạng thái được tính theo tỷ lệ yêu cầu xử lý thành công, giống như trên trang Trạng thái mạng.

Cách chọn model#

  • Chưa biết bắt đầu từ đâu — hãy chọn MiniMaxAI/MiniMax-M2.7: các ví dụ trong tài liệu và lệnh cài đặt đều được tính toán cho model này.
  • Ngữ cảnh dài nhất — zai-org/GLM-5.3-Flash: 390K token. Phù hợp cho các codebase lớn và tài liệu dài.
  • Phản hồi dài nhất — deepseek-ai/DeepSeek-V4-Flash-0731: tối đa 33K token mỗi lần. Để tạo ra các tệp lớn trong một lần.

Nếu mạng ngừng phục vụ một model, model đó sẽ biến mất khỏi GET /v1/models, và các yêu cầu tới nó sẽ nhận phản hồi 503 với loại lỗi model_unavailable. Trong nội dung lỗi sẽ có model mà bạn có thể chuyển sang.

Độ dài phản hồi#

Độ dài phản hồi được đặt bằng max_tokens — hoặc max_completion_tokens, gateway hiểu cả hai trường. Mỗi model đều có mức trần: nếu max_tokens lớn hơn, gateway sẽ âm thầm cắt xuống mức đó. Nếu max_tokens không được đặt, khi stream: true sẽ dùng mức trần, còn không streaming sẽ dùng giá trị mặc định nhỏ hơn.

Các model có suy luận sẽ dùng một phần max_tokens để suy nghĩ trước khi trả lời — hãy để dư ra.

modelMức trầnMặc định, stream: trueMặc định, không streaming
MiniMaxAI/MiniMax-M2.7819281921500
deepseek-ai/DeepSeek-V4-Flash-073132768327681500
zai-org/GLM-5.3-Flash819281923000

Các con số tương tự ở dạng máy đọc được — trong phản hồi GET /v1/capabilities, trường limits.models.

Model mặc định#

Yêu cầu không có trường model sẽ được gateway gửi tới model mặc định — hiện tại là MiniMaxAI/MiniMax-M2.7.

Claude Code và Anthropic SDK gửi trong /v1/messages tên các model Anthropic (claude-*) — gateway thay thế chúng bằng cùng model mặc định đó.

Để làm việc với model khác, hãy chỉ định ID của nó từ bảng trên; trong trình cài đặt đây là cờ --model.

Danh sách và trạng thái qua API#

Danh sách model thay đổi theo các cuộc bỏ phiếu của mạng Gonka — đừng hardcode danh sách vào code, hãy lấy từ API. Các yêu cầu này không cần key.

Yêu cầuTrả về gì
GET /v1/modelsCác model hiện có sẵn: ID, ngữ cảnh, giới hạn phản hồi và giá token tính bằng USD. Model mà mạng hiện không phục vụ sẽ không có trong danh sách.
GET /v1/models/{model}Một model ở cùng định dạng. Dấu gạch chéo trong ID hãy truyền nguyên hoặc dưới dạng %2F. Model không tồn tại hoặc bị ẩn — 404 với mã model_not_found, còn yêu cầu tới model bị ẩn sẽ nhận 503 model_unavailable.
GET /v1/capabilitiesKhả năng của gateway: các giao thức, tham số yêu cầu và trường limits — giới hạn yêu cầu của key, timeout và mức trần max_tokens theo model.
GET /v1/network-statusTrạng thái của từng model và các sự cố — cùng dữ liệu như trên trang Trạng thái mạng.
GET /healthBản thân gateway có phản hồi không: {"status":"ok"}. Yêu cầu này không kiểm tra tình trạng của các model.