Para agentes de IA: guia passo a passo de configuração — /docs/agents.md, índice da documentação — /llms.txt.
Modelos
Modelos da rede Gonka disponíveis pelo gateway: identificador para o campo model, janela de contexto, limite de resposta, preço e status.
Modelos e preços#
A composição dos modelos muda conforme as votações da rede Gonka, então a tabela é montada com dados ao vivo do gateway. Os preços são em dólares por 1M de tokens pela cotação atual do GNK; o débito é feito em GNK, com mais detalhes na seção Preços e conta.
| Modelo | Contexto | Resposta | Entrada, $/1M | Saída, $/1M | Status |
|---|---|---|---|---|---|
MiniMax MiniMaxAI/MiniMax-M2.7 | 200K | 8K | $0.0083 | $0.025 | Degradado |
DeepSeek deepseek-ai/DeepSeek-V4-Flash-0731 | 380K | 33K | $0.0083 | $0.025 | Degradado |
Z.ai zai-org/GLM-5.3-Flash | 390K | 8K | $0.0083 | $0.025 | Operacional |
Coloque o identificador no campo model; maiúsculas e minúsculas não importam. O status é calculado pela proporção de requisições processadas com sucesso, como na página Status da rede.
Como escolher um modelo#
- Não sabe por onde começar? Escolha
MiniMaxAI/MiniMax-M2.7: os exemplos da documentação e os comandos do instalador foram feitos para ele. - O contexto mais longo é
zai-org/GLM-5.3-Flash: 390K tokens. Para bases de código grandes e documentos extensos. - A resposta mais longa é
deepseek-ai/DeepSeek-V4-Flash-0731: até 33K tokens de uma vez. Para gerar arquivos grandes por completo.
Se a rede deixar de atender um modelo, ele sai de GET /v1/models, e as requisições para ele recebem 503 com o tipo de erro model_unavailable. O texto do erro indicará um modelo para o qual você pode migrar.
Comprimento da resposta#
O comprimento da resposta é definido por max_tokens — ou max_completion_tokens; o gateway entende os dois campos. Cada modelo tem um teto: um max_tokens maior é silenciosamente cortado até ele. Se max_tokens não for definido, com stream: true aplica-se o teto e, sem streaming, um valor padrão menor.
Modelos com raciocínio gastam parte de max_tokens pensando antes de responder — deixe uma folga.
model | Teto | Padrão, stream: true | Padrão, sem streaming |
|---|---|---|---|
MiniMaxAI/MiniMax-M2.7 | 8192 | 8192 | 1500 |
deepseek-ai/DeepSeek-V4-Flash-0731 | 32768 | 32768 | 1500 |
zai-org/GLM-5.3-Flash | 8192 | 8192 | 3000 |
Os mesmos números em formato de máquina estão na resposta GET /v1/capabilities, campo limits.models.
Modelo padrão#
Uma requisição sem o campo model é enviada pelo gateway ao modelo padrão — atualmente, MiniMaxAI/MiniMax-M2.7.
O Claude Code e o SDK da Anthropic enviam em /v1/messages nomes de modelos da Anthropic (claude-*) — o gateway os substitui pelo mesmo modelo padrão.
Para trabalhar com outro modelo, informe o identificador dele da tabela acima; no instalador, é a flag --model.
Composição e status via API#
A composição dos modelos muda conforme as votações da rede Gonka — não fixe a lista no código, pegue-a da API. Essas requisições não precisam de chave.
| Requisição | O que retorna |
|---|---|
GET /v1/models | Modelos disponíveis agora: identificador, contexto, limite de resposta e preço do token em dólares. Um modelo que a rede não está atendendo no momento não aparece na lista. |
GET /v1/models/{model} | Um modelo no mesmo formato. Passe a barra do identificador como está ou como %2F. Modelo desconhecido ou oculto — 404 com o código model_not_found, e uma requisição a um modelo oculto recebe 503 model_unavailable. |
GET /v1/capabilities | Capacidades do gateway: protocolos, parâmetros de requisição e o campo limits — limite de requisições da chave, timeouts e tetos de max_tokens por modelo. |
GET /v1/network-status | O status de cada modelo e os incidentes — os mesmos dados da página Status da rede. |
GET /health | Se o próprio gateway responde: {"status":"ok"}. Essa requisição não verifica o estado dos modelos. |