Para agentes de IA: guia passo a passo de configuração — /docs/agents.md, índice da documentação — /llms.txt.

Modelos

Modelos da rede Gonka disponíveis pelo gateway: identificador para o campo model, janela de contexto, limite de resposta, preço e status.

Modelos e preços#

A composição dos modelos muda conforme as votações da rede Gonka, então a tabela é montada com dados ao vivo do gateway. Os preços são em dólares por 1M de tokens pela cotação atual do GNK; o débito é feito em GNK, com mais detalhes na seção Preços e conta.

ModeloContextoRespostaEntrada, $/1MSaída, $/1MStatus
MiniMax MiniMaxAI/MiniMax-M2.7200K8K$0.0083$0.025Degradado
DeepSeek deepseek-ai/DeepSeek-V4-Flash-0731380K33K$0.0083$0.025Degradado
Z.ai zai-org/GLM-5.3-Flash390K8K$0.0083$0.025Operacional

Coloque o identificador no campo model; maiúsculas e minúsculas não importam. O status é calculado pela proporção de requisições processadas com sucesso, como na página Status da rede.

Como escolher um modelo#

  • Não sabe por onde começar? Escolha MiniMaxAI/MiniMax-M2.7: os exemplos da documentação e os comandos do instalador foram feitos para ele.
  • O contexto mais longo é zai-org/GLM-5.3-Flash: 390K tokens. Para bases de código grandes e documentos extensos.
  • A resposta mais longa é deepseek-ai/DeepSeek-V4-Flash-0731: até 33K tokens de uma vez. Para gerar arquivos grandes por completo.

Se a rede deixar de atender um modelo, ele sai de GET /v1/models, e as requisições para ele recebem 503 com o tipo de erro model_unavailable. O texto do erro indicará um modelo para o qual você pode migrar.

Comprimento da resposta#

O comprimento da resposta é definido por max_tokens — ou max_completion_tokens; o gateway entende os dois campos. Cada modelo tem um teto: um max_tokens maior é silenciosamente cortado até ele. Se max_tokens não for definido, com stream: true aplica-se o teto e, sem streaming, um valor padrão menor.

Modelos com raciocínio gastam parte de max_tokens pensando antes de responder — deixe uma folga.

modelTetoPadrão, stream: truePadrão, sem streaming
MiniMaxAI/MiniMax-M2.7819281921500
deepseek-ai/DeepSeek-V4-Flash-073132768327681500
zai-org/GLM-5.3-Flash819281923000

Os mesmos números em formato de máquina estão na resposta GET /v1/capabilities, campo limits.models.

Modelo padrão#

Uma requisição sem o campo model é enviada pelo gateway ao modelo padrão — atualmente, MiniMaxAI/MiniMax-M2.7.

O Claude Code e o SDK da Anthropic enviam em /v1/messages nomes de modelos da Anthropic (claude-*) — o gateway os substitui pelo mesmo modelo padrão.

Para trabalhar com outro modelo, informe o identificador dele da tabela acima; no instalador, é a flag --model.

Composição e status via API#

A composição dos modelos muda conforme as votações da rede Gonka — não fixe a lista no código, pegue-a da API. Essas requisições não precisam de chave.

RequisiçãoO que retorna
GET /v1/modelsModelos disponíveis agora: identificador, contexto, limite de resposta e preço do token em dólares. Um modelo que a rede não está atendendo no momento não aparece na lista.
GET /v1/models/{model}Um modelo no mesmo formato. Passe a barra do identificador como está ou como %2F. Modelo desconhecido ou oculto — 404 com o código model_not_found, e uma requisição a um modelo oculto recebe 503 model_unavailable.
GET /v1/capabilitiesCapacidades do gateway: protocolos, parâmetros de requisição e o campo limits — limite de requisições da chave, timeouts e tetos de max_tokens por modelo.
GET /v1/network-statusO status de cada modelo e os incidentes — os mesmos dados da página Status da rede.
GET /healthSe o próprio gateway responde: {"status":"ok"}. Essa requisição não verifica o estado dos modelos.