Atualizações e status
Estado atual do inferenced e histórico de alterações do gateway.
Status atual
- MiniMax M2.7Rede Gonka: Desempenho Degradado
- DeepSeek V4 FlashRede Gonka: Desempenho Degradado
- GLM 5.3 FlashRede Gonka: Operacional
O conjunto de modelos ativos é definido pela votação da rede Gonka e pode mudar: alguns modelos ficam indisponíveis temporariamente e retornam depois. A lista atual está acima.
Status detalhado e uptime →Histórico de atualizações
Você pode recarregar seu saldo com o token WGNK — que é GNK na rede Ethereum. Na sua conta: Recarregar → GNK → Ethereum · WGNK; indique o endereço de onde enviará os tokens — a transferência será creditada automaticamente, geralmente em 15–20 minutos.
O npx @joingonka/setup agora configura 25 ferramentas. Novas: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush e Zoo Code. O modelo é selecionado via flag --model (minimax, deepseek ou glm), com o DeepSeek V4 Flash como padrão. Ao final, o instalador envia uma solicitação de verificação e mostra imediatamente se a chave está funcionando.
A partir de 16 de setembro, cada nova conta recebe 100.000.000 nGNK (0,1 GNK) em vez de 50.000.000 — pelo preço atual da rede, isso equivale a cerca de 3 milhões de tokens para testes sem necessidade de depósito. O bônus é creditado automaticamente após o registro, nenhuma entrada é necessária; o valor atual está sempre visível em GET /api/pricing (campo welcome_bonus_ngonka) e na página de registro.
Os brokers da rede Gonka encerram qualquer stream após aproximadamente 5 minutos de geração (para GLM 5.3 Flash, isso equivale a cerca de 8.000 tokens). Anteriormente, tal corte parecia uma conclusão normal: o stream terminava em [DONE] sem um finish_reason, e o cliente confundia o fragmento com uma resposta completa. Agora, o gateway envia um chunk com finish_reason="length" tanto no stream quanto na resposta normal, e stop_reason="max_tokens" no formato Anthropic. O que fazer com respostas longas: use stream:true e, ao obter finish_reason="length", continue a geração com a próxima solicitação passando a parte já recebida no contexto. Detalhes estão na seção "Limites" da documentação.
O GLM 5.3 Flash da Z.ai chegou à rede Gonka: 320B de parâmetros (MoE, 18B ativos), FP8, licença MIT, contexto de 390.000 tokens. O modelo raciocina antes de responder: o raciocínio chega no campo reasoning_content e consome o orçamento da resposta, portanto defina max_tokens para pelo menos 600 ou use stream:true; para tarefas curtas — reasoning_effort: "low". Tool calling e modo JSON funcionam. Identificador — zai-org/GLM-5.3-Flash, o preço é o mesmo que o de outros modelos da rede. O Kimi K2.6 não é mais mantido pela rede — altere as integrações para MiniMax M2.7, DeepSeek V4 Flash ou GLM 5.3 Flash.
A página "Uso" mostra o consumo de cada modelo: solicitações, tokens de entrada/saída, custo em nGNK e dólares, preço médio por 1M de tokens e velocidade de resposta. "Hoje" é exibido por hora e um predefinido de "90 dias" foi adicionado. Para integrações: GET /api/usage/by-model.
O gateway agora aceita solicitações para /v1/completions — o endpoint "text" da OpenAI: ele recebe uma string de prompt como entrada e retorna choices[].text como saída. Isso é usado por plugins de editor para autocompletar e edição de código inline (Continue.dev e similares). A Base URL permanece a mesma: https://gate.joingonka.ai/v1. Streaming e parâmetros padrão (max_tokens, temperature, stop) são suportados, com os mesmos custos e limites do /v1/chat/completions. Os campos logprobs e best_of não são suportados.
A partir de 22 de agosto, o custo de inferência é: entrada — 33 nGNK, saída — 99 nGNK por token (anteriormente 22/66). A taxa do gateway permanece inalterada em 10%. O modo demo continua gratuito. Por que aumentou: uma solicitação na rede Gonka é processada com redundância — isso é parte do protocolo e do código devshards, necessário para a fluidez do serviço. Um container pode enviar uma solicitação para um host, depois para outro se o primeiro falhar, ou para vários ao mesmo tempo, se necessário. Cada tentativa é paga: o preço da rede é de 10 nGNK por token, multiplicado pela redundância da solicitação (em média ×1—2.5). Anteriormente, esse custo não chegava até nós devido ao não funcionamento da API de finalização de preços, e pagávamos como se fosse para um único host; agora é calculado com base no custo real e estamos repassando para a tarifa. A inferência permanece centenas de vezes mais barata que as APIs de fornecedores. Os preços atuais de todos os modelos estão na página Pricing e via GET /api/pricing.
O gateway aceita solicitações no formato Responses — um novo protocolo da OpenAI adotado pelos SDKs recentes e utilizado pelo Codex CLI. O endereço permanece o mesmo: base URL https://gate.joingonka.ai/v1, o cliente chamará automaticamente /v1/responses. Streaming, function tools e saída estruturada (text.format) são suportados; os custos e limites são os mesmos que para /v1/chat/completions. Não armazenamos diálogos, portanto, store é ignorado e previous_response_id retornará um erro — por favor, passe todo o histórico no campo input. As ferramentas de servidor integradas da OpenAI (web_search, file_search, code_interpreter) não são suportadas; nossa pesquisa web ainda está disponível através do plugin web em /v1/chat/completions.
Anteriormente, falhas na rede Gonka no modo stream:true retornavam um código 200, e o erro era visível apenas dentro do chunk SSE: clientes de agente confundiam essas respostas como bem-sucedidas e vazias, não realizando novas tentativas. Agora, se a resposta da rede ainda não tiver iniciado, o erro é retornado com um código HTTP padrão — 429 para sobrecarga do modelo (com o cabeçalho Retry-After), 504 para timeout e 503 se não houver nós livres. Se a falha ocorrer no meio de um stream, o status não pode ser alterado: ele ainda contém um chunk com um campo error, mas o [DONE] final não é mais enviado para que o fluxo não pareça ter sido concluído com sucesso.
O npx @joingonka/setup agora configura 15 ferramentas de agente: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant e GitHub Copilot BYOK. Para sete delas, a configuração é escrita e mesclada de forma limpa com a sua (comentários e configurações existentes são preservados); para as restantes, que só podem ser configuradas via interface, valores prontos para colar são impressos. Você pode selecionar uma ferramenta específica imediatamente: npx @joingonka/setup --tool zed. Cada execução termina com uma solicitação ao gateway, confirmando que a chave, o endereço e o modelo foram aceitos.
O comprimento máximo de uma resposta única para o DeepSeek V4 Flash foi aumentado em 4 vezes: de 8.192 para 32.768 tokens (parâmetro max_tokens). Arquivos grandes e respostas longas de ferramentas de agente agora cabem em uma única chamada. Adicionalmente: se a resposta atingir o limite no meio de uma chamada de ferramenta, o gateway retorna um finish_reason="length" honesto em vez de uma chamada truncada — clientes de agente (Cursor e outros) continuam funcionando corretamente em vez de travar por erro de análise.
Um terceiro modelo ativo surgiu na rede Gonka — DeepSeek V4 Flash 0731: contexto de 380.000 tokens (o maior da rede, verificado por uma requisição real de 381K), reasoning e tool calling. O identificador é deepseek-ai/DeepSeek-V4-Flash-0731, o preço é o mesmo dos outros modelos. O modelo está em testes iniciais, mas totalmente disponível: selecione-o no chat do dashboard ou especifique no campo model da sua requisição de API.
A partir de 3 de agosto, o custo de inferência é: entrada — 22 nGNK, saída — 66 nGNK por token (o dobro dos 11/33 anteriores). A taxa do gateway permanece inalterada em 10%. O modo demo continua gratuito. Os preços atuais de todos os modelos estão na página Pricing e no GET /api/pricing.
Se a rede Gonka recebe uma solicitação mas não responde (timeout de 300s), o gateway agora retorna imediatamente um erro 504 em vez de uma série de tentativas silenciosas. Nota importante sobre cobrança: uma solicitação aceita pela rede não pode ser cancelada — o nó processa de qualquer maneira, portanto, em caso de timeout, a estimativa de processamento do prompt é debitada (a completion não é tarifada). Recomendação: para gerações longas, use stream:true — o streaming é mais resistente a timeouts e mostra o progresso imediatamente.
A taxa de depósito via USDT agora diminui conforme o valor aumenta: base de 5%, a partir de $25 — 4.5%, a partir de $50 — 4%, a partir de $100 — 3.5%, a partir de $250 — 3%, a partir de $500 — 2.75%, a partir de $1000 — 2.5%. O diálogo de depósito apresenta uma escada interativa: controle deslizante de valor, bônus GNK de cada nível e sua economia. O desconto é aplicado automaticamente após o crédito.
Você pode definir um limite total (cumulativo) de gastos para chaves secundárias — uma cota dedicada que não é redefinida, ao contrário dos limites diários ou mensais. Quando a cota é esgotada, as solicitações usando a chave são rejeitadas. O limite é definido no painel (com precisão de nanogonka) ou via API usando o campo limit_total_ngonka em POST/PATCH /api/management/keys/{id}/children; o consumo acumulado é zerado com o botão "Reset usage" (ou POST /api/management/keys/{id}/children/{childId}/reset-usage).
Os custos de inferenced estão sincronizados com o preço real de rede da Gonka por token. Os preços permanecem entre os mais baixos do mercado — frações de um centavo por milhão de tokens, centenas de vezes mais baratos que OpenAI e Anthropic para os mesmos modelos open-source. Tokens de saída são tarifados de forma mais cara que os de entrada (×3), como na maioria dos provedores.
Confirmamos o limite real de contexto dos modelos ativos — até 200.000 tokens (anteriormente, eram publicados números conservadores de 131.072). Você pode enviar documentos e históricos de diálogo mais longos; as especificações atuais de cada modelo podem ser encontradas na seção "Network Status".
O custo de cada requisição é exibido em USD — na resposta da API (campo usage.total_cost_usd) e na seção "Uso". Útil para planejar despesas.
Configure o acesso à API na sua ferramenta automaticamente: execute npx @joingonka/setup. Suporte para Claude Code, OpenClaw, Cline, Continue, opencode, Aider e outros.
O modelo pesquisa na internet durante a resposta e adiciona links para as fontes. Como ativar: passe no corpo da solicitação plugins: [{ "id": "web", "max_results": 5 }] — funciona em APIs compatíveis com OpenAI e Anthropic.
A duração máxima da resposta é de até 8192 tokens; gerencie o parâmetro max_tokens (padrão 1024 para streaming e 1500 para resposta normal).
Na página "Chat", selecione um modelo da lista (carregada via /v1/models) — a seleção é salva e aplicada aos novos diálogos.
Precisa de velocidade? Adicione à sua solicitação o cabeçalho x-joingonka-meta: 1 — na resposta por streaming você receberá ttft_ms (tempo até o primeiro token) e tokens_per_sec.
Crie uma chave de gerenciamento (POST /api/management/keys) e gere chaves filhas com limites (cota diária e mensal, rate limit, expiração) via POST /api/management/keys/{id}/children.
Conecte plugins via parâmetro plugins: response-healing conserta JSON truncado, privacy-sanitization mascara dados privados, file-parser extrai texto de PDFs e documentos.
OpenAI: base_url https://gate.joingonka.ai/v1, cabeçalho Authorization: Bearer sua-chave. Anthropic (Claude Code): base_url https://gate.joingonka.ai, cabeçalho x-api-key, endpoint /v1/messages.
GNK: obtenha o endereço e o memo, e envie tokens on-chain. USDT: especifique um valor de 1 a 10 000 dólares e pague via OxaPay — a conversão para GNK é automática.