Dành cho AI agent: hướng dẫn từng bước để thiết lập — /docs/agents.md, chỉ mục tài liệu — /llms.txt.
Models
Các model của mạng Gonka, có thể truy cập qua gateway: ID cho trường model, cửa sổ ngữ cảnh, giới hạn phản hồi, giá và trạng thái.
Models và giá#
Danh sách model thay đổi theo các cuộc bỏ phiếu của mạng Gonka, nên bảng được tổng hợp từ dữ liệu trực tiếp của gateway. Giá tính bằng USD trên 1M token theo tỷ giá GNK hiện tại; việc trừ tiền diễn ra bằng GNK, xem thêm trong mục Bảng giá và tài khoản.
| Mô hình | Ngữ cảnh | Phản hồi | Đầu vào, $/1M | Đầu ra, $/1M | Trạng thái |
|---|---|---|---|---|---|
MiniMax MiniMaxAI/MiniMax-M2.7 | 200K | 8K | $0.0083 | $0.025 | Giảm sút |
DeepSeek deepseek-ai/DeepSeek-V4-Flash-0731 | 380K | 33K | $0.0083 | $0.025 | Giảm sút |
Z.ai zai-org/GLM-5.3-Flash | 390K | 8K | $0.0083 | $0.025 | Hoạt động |
Hãy dán ID vào trường model; chữ hoa chữ thường không quan trọng. Trạng thái được tính theo tỷ lệ yêu cầu xử lý thành công, giống như trên trang Trạng thái mạng.
Cách chọn model#
- Chưa biết bắt đầu từ đâu — hãy chọn
MiniMaxAI/MiniMax-M2.7: các ví dụ trong tài liệu và lệnh cài đặt đều được tính toán cho model này. - Ngữ cảnh dài nhất —
zai-org/GLM-5.3-Flash: 390K token. Phù hợp cho các codebase lớn và tài liệu dài. - Phản hồi dài nhất —
deepseek-ai/DeepSeek-V4-Flash-0731: tối đa 33K token mỗi lần. Để tạo ra các tệp lớn trong một lần.
Nếu mạng ngừng phục vụ một model, model đó sẽ biến mất khỏi GET /v1/models, và các yêu cầu tới nó sẽ nhận phản hồi 503 với loại lỗi model_unavailable. Trong nội dung lỗi sẽ có model mà bạn có thể chuyển sang.
Độ dài phản hồi#
Độ dài phản hồi được đặt bằng max_tokens — hoặc max_completion_tokens, gateway hiểu cả hai trường. Mỗi model đều có mức trần: nếu max_tokens lớn hơn, gateway sẽ âm thầm cắt xuống mức đó. Nếu max_tokens không được đặt, khi stream: true sẽ dùng mức trần, còn không streaming sẽ dùng giá trị mặc định nhỏ hơn.
Các model có suy luận sẽ dùng một phần max_tokens để suy nghĩ trước khi trả lời — hãy để dư ra.
model | Mức trần | Mặc định, stream: true | Mặc định, không streaming |
|---|---|---|---|
MiniMaxAI/MiniMax-M2.7 | 8192 | 8192 | 1500 |
deepseek-ai/DeepSeek-V4-Flash-0731 | 32768 | 32768 | 1500 |
zai-org/GLM-5.3-Flash | 8192 | 8192 | 3000 |
Các con số tương tự ở dạng máy đọc được — trong phản hồi GET /v1/capabilities, trường limits.models.
Model mặc định#
Yêu cầu không có trường model sẽ được gateway gửi tới model mặc định — hiện tại là MiniMaxAI/MiniMax-M2.7.
Claude Code và Anthropic SDK gửi trong /v1/messages tên các model Anthropic (claude-*) — gateway thay thế chúng bằng cùng model mặc định đó.
Để làm việc với model khác, hãy chỉ định ID của nó từ bảng trên; trong trình cài đặt đây là cờ --model.
Danh sách và trạng thái qua API#
Danh sách model thay đổi theo các cuộc bỏ phiếu của mạng Gonka — đừng hardcode danh sách vào code, hãy lấy từ API. Các yêu cầu này không cần key.
| Yêu cầu | Trả về gì |
|---|---|
GET /v1/models | Các model hiện có sẵn: ID, ngữ cảnh, giới hạn phản hồi và giá token tính bằng USD. Model mà mạng hiện không phục vụ sẽ không có trong danh sách. |
GET /v1/models/{model} | Một model ở cùng định dạng. Dấu gạch chéo trong ID hãy truyền nguyên hoặc dưới dạng %2F. Model không tồn tại hoặc bị ẩn — 404 với mã model_not_found, còn yêu cầu tới model bị ẩn sẽ nhận 503 model_unavailable. |
GET /v1/capabilities | Khả năng của gateway: các giao thức, tham số yêu cầu và trường limits — giới hạn yêu cầu của key, timeout và mức trần max_tokens theo model. |
GET /v1/network-status | Trạng thái của từng model và các sự cố — cùng dữ liệu như trên trang Trạng thái mạng. |
GET /health | Bản thân gateway có phản hồi không: {"status":"ok"}. Yêu cầu này không kiểm tra tình trạng của các model. |