Atualizações e status

Estado atual do inferenced e histórico de alterações do gateway.

Status atual

Rede Gonka: Desempenho Degradado
Modelos da rede
  • MiniMax M2.7Rede Gonka: Desempenho Degradado
  • DeepSeek V4 FlashRede Gonka: Desempenho Degradado
  • GLM 5.3 FlashRede Gonka: Operacional

O conjunto de modelos ativos é definido pela votação da rede Gonka e pode mudar: alguns modelos ficam indisponíveis temporariamente e retornam depois. A lista atual está acima.

Status detalhado e uptime →

Histórico de atualizações

setembro de 2026
Novo
Depósito em WGNK via Ethereum23 de set.

Você pode recarregar seu saldo com o token WGNK — que é GNK na rede Ethereum. Na sua conta: Recarregar → GNK → Ethereum · WGNK; indique o endereço de onde enviará os tokens — a transferência será creditada automaticamente, geralmente em 15–20 minutos.

Novo
Instalador: 25 ferramentas21 de set.

O npx @joingonka/setup agora configura 25 ferramentas. Novas: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush e Zoo Code. O modelo é selecionado via flag --model (minimax, deepseek ou glm), com o DeepSeek V4 Flash como padrão. Ao final, o instalador envia uma solicitação de verificação e mostra imediatamente se a chave está funcionando.

Melhoria
Bônus de boas-vindas dobrado: 100.000.000 nGNK para novas contas16 de set.

A partir de 16 de setembro, cada nova conta recebe 100.000.000 nGNK (0,1 GNK) em vez de 50.000.000 — pelo preço atual da rede, isso equivale a cerca de 3 milhões de tokens para testes sem necessidade de depósito. O bônus é creditado automaticamente após o registro, nenhuma entrada é necessária; o valor atual está sempre visível em GET /api/pricing (campo welcome_bonus_ngonka) e na página de registro.

Melhoria
Truncamento de geração longa — finish_reason=length honesto16 de set.

Os brokers da rede Gonka encerram qualquer stream após aproximadamente 5 minutos de geração (para GLM 5.3 Flash, isso equivale a cerca de 8.000 tokens). Anteriormente, tal corte parecia uma conclusão normal: o stream terminava em [DONE] sem um finish_reason, e o cliente confundia o fragmento com uma resposta completa. Agora, o gateway envia um chunk com finish_reason="length" tanto no stream quanto na resposta normal, e stop_reason="max_tokens" no formato Anthropic. O que fazer com respostas longas: use stream:true e, ao obter finish_reason="length", continue a geração com a próxima solicitação passando a parte já recebida no contexto. Detalhes estão na seção "Limites" da documentação.

Novo
Novo modelo: GLM 5.3 Flash — raciocínio da Z.ai16 de set.

O GLM 5.3 Flash da Z.ai chegou à rede Gonka: 320B de parâmetros (MoE, 18B ativos), FP8, licença MIT, contexto de 390.000 tokens. O modelo raciocina antes de responder: o raciocínio chega no campo reasoning_content e consome o orçamento da resposta, portanto defina max_tokens para pelo menos 600 ou use stream:true; para tarefas curtas — reasoning_effort: "low". Tool calling e modo JSON funcionam. Identificador — zai-org/GLM-5.3-Flash, o preço é o mesmo que o de outros modelos da rede. O Kimi K2.6 não é mais mantido pela rede — altere as integrações para MiniMax M2.7, DeepSeek V4 Flash ou GLM 5.3 Flash.

Novo
Estatísticas de uso por modelo15 de set.

A página "Uso" mostra o consumo de cada modelo: solicitações, tokens de entrada/saída, custo em nGNK e dólares, preço médio por 1M de tokens e velocidade de resposta. "Hoje" é exibido por hora e um predefinido de "90 dias" foi adicionado. Para integrações: GET /api/usage/by-model.

agosto de 2026
Novo
Suporte para legacy OpenAI Completions24 de ago.

O gateway agora aceita solicitações para /v1/completions — o endpoint "text" da OpenAI: ele recebe uma string de prompt como entrada e retorna choices[].text como saída. Isso é usado por plugins de editor para autocompletar e edição de código inline (Continue.dev e similares). A Base URL permanece a mesma: https://gate.joingonka.ai/v1. Streaming e parâmetros padrão (max_tokens, temperature, stop) são suportados, com os mesmos custos e limites do /v1/chat/completions. Os campos logprobs e best_of não são suportados.

Melhoria
Atualização de precificação de inferência22 de ago.

A partir de 22 de agosto, o custo de inferência é: entrada — 33 nGNK, saída — 99 nGNK por token (anteriormente 22/66). A taxa do gateway permanece inalterada em 10%. O modo demo continua gratuito. Por que aumentou: uma solicitação na rede Gonka é processada com redundância — isso é parte do protocolo e do código devshards, necessário para a fluidez do serviço. Um container pode enviar uma solicitação para um host, depois para outro se o primeiro falhar, ou para vários ao mesmo tempo, se necessário. Cada tentativa é paga: o preço da rede é de 10 nGNK por token, multiplicado pela redundância da solicitação (em média ×1—2.5). Anteriormente, esse custo não chegava até nós devido ao não funcionamento da API de finalização de preços, e pagávamos como se fosse para um único host; agora é calculado com base no custo real e estamos repassando para a tarifa. A inferência permanece centenas de vezes mais barata que as APIs de fornecedores. Os preços atuais de todos os modelos estão na página Pricing e via GET /api/pricing.

Novo
Suporte para a Responses API da OpenAI22 de ago.

O gateway aceita solicitações no formato Responses — um novo protocolo da OpenAI adotado pelos SDKs recentes e utilizado pelo Codex CLI. O endereço permanece o mesmo: base URL https://gate.joingonka.ai/v1, o cliente chamará automaticamente /v1/responses. Streaming, function tools e saída estruturada (text.format) são suportados; os custos e limites são os mesmos que para /v1/chat/completions. Não armazenamos diálogos, portanto, store é ignorado e previous_response_id retornará um erro — por favor, passe todo o histórico no campo input. As ferramentas de servidor integradas da OpenAI (web_search, file_search, code_interpreter) não são suportadas; nossa pesquisa web ainda está disponível através do plugin web em /v1/chat/completions.

Correção
Erros de stream — via códigos de status HTTP20 de ago.

Anteriormente, falhas na rede Gonka no modo stream:true retornavam um código 200, e o erro era visível apenas dentro do chunk SSE: clientes de agente confundiam essas respostas como bem-sucedidas e vazias, não realizando novas tentativas. Agora, se a resposta da rede ainda não tiver iniciado, o erro é retornado com um código HTTP padrão — 429 para sobrecarga do modelo (com o cabeçalho Retry-After), 504 para timeout e 503 se não houver nós livres. Se a falha ocorrer no meio de um stream, o status não pode ser alterado: ele ainda contém um chunk com um campo error, mas o [DONE] final não é mais enviado para que o fluxo não pareça ter sido concluído com sucesso.

Novo
Instalador: 15 ferramentas com um único comando20 de ago.

O npx @joingonka/setup agora configura 15 ferramentas de agente: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant e GitHub Copilot BYOK. Para sete delas, a configuração é escrita e mesclada de forma limpa com a sua (comentários e configurações existentes são preservados); para as restantes, que só podem ser configuradas via interface, valores prontos para colar são impressos. Você pode selecionar uma ferramenta específica imediatamente: npx @joingonka/setup --tool zed. Cada execução termina com uma solicitação ao gateway, confirmando que a chave, o endereço e o modelo foram aceitos.

Melhoria
Limite de resposta do DeepSeek — 32.768 tokens17 de ago.

O comprimento máximo de uma resposta única para o DeepSeek V4 Flash foi aumentado em 4 vezes: de 8.192 para 32.768 tokens (parâmetro max_tokens). Arquivos grandes e respostas longas de ferramentas de agente agora cabem em uma única chamada. Adicionalmente: se a resposta atingir o limite no meio de uma chamada de ferramenta, o gateway retorna um finish_reason="length" honesto em vez de uma chamada truncada — clientes de agente (Cursor e outros) continuam funcionando corretamente em vez de travar por erro de análise.

Novo
Novo modelo: DeepSeek V4 Flash com contexto de 380K13 de ago.

Um terceiro modelo ativo surgiu na rede Gonka — DeepSeek V4 Flash 0731: contexto de 380.000 tokens (o maior da rede, verificado por uma requisição real de 381K), reasoning e tool calling. O identificador é deepseek-ai/DeepSeek-V4-Flash-0731, o preço é o mesmo dos outros modelos. O modelo está em testes iniciais, mas totalmente disponível: selecione-o no chat do dashboard ou especifique no campo model da sua requisição de API.

Melhoria
Atualização de preços de inferência3 de ago.

A partir de 3 de agosto, o custo de inferência é: entrada — 22 nGNK, saída — 66 nGNK por token (o dobro dos 11/33 anteriores). A taxa do gateway permanece inalterada em 10%. O modo demo continua gratuito. Os preços atuais de todos os modelos estão na página Pricing e no GET /api/pricing.

julho de 2026
Melhoria
Timeouts justos: 504 rápido em vez de um travamento de 5 minutos23 de jul.

Se a rede Gonka recebe uma solicitação mas não responde (timeout de 300s), o gateway agora retorna imediatamente um erro 504 em vez de uma série de tentativas silenciosas. Nota importante sobre cobrança: uma solicitação aceita pela rede não pode ser cancelada — o nó processa de qualquer maneira, portanto, em caso de timeout, a estimativa de processamento do prompt é debitada (a completion não é tarifada). Recomendação: para gerações longas, use stream:true — o streaming é mais resistente a timeouts e mostra o progresso imediatamente.

Novo
Escada de taxas para depósitos em USDT — até −50%9 de jul.

A taxa de depósito via USDT agora diminui conforme o valor aumenta: base de 5%, a partir de $25 — 4.5%, a partir de $50 — 4%, a partir de $100 — 3.5%, a partir de $250 — 3%, a partir de $500 — 2.75%, a partir de $1000 — 2.5%. O diálogo de depósito apresenta uma escada interativa: controle deslizante de valor, bônus GNK de cada nível e sua economia. O desconto é aplicado automaticamente após o crédito.

junho de 2026
Novo
Limite total de gastos para a chave28 de jun.

Você pode definir um limite total (cumulativo) de gastos para chaves secundárias — uma cota dedicada que não é redefinida, ao contrário dos limites diários ou mensais. Quando a cota é esgotada, as solicitações usando a chave são rejeitadas. O limite é definido no painel (com precisão de nanogonka) ou via API usando o campo limit_total_ngonka em POST/PATCH /api/management/keys/{id}/children; o consumo acumulado é zerado com o botão "Reset usage" (ou POST /api/management/keys/{id}/children/{childId}/reset-usage).

Melhoria
Preço — pelo custo real da rede27 de jun.

Os custos de inferenced estão sincronizados com o preço real de rede da Gonka por token. Os preços permanecem entre os mais baixos do mercado — frações de um centavo por milhão de tokens, centenas de vezes mais baratos que OpenAI e Anthropic para os mesmos modelos open-source. Tokens de saída são tarifados de forma mais cara que os de entrada (×3), como na maioria dos provedores.

Melhoria
Contexto de até 200.000 tokens27 de jun.

Confirmamos o limite real de contexto dos modelos ativos — até 200.000 tokens (anteriormente, eram publicados números conservadores de 131.072). Você pode enviar documentos e históricos de diálogo mais longos; as especificações atuais de cada modelo podem ser encontradas na seção "Network Status".

Melhoria
Custo das requisições em USD23 de jun.

O custo de cada requisição é exibido em USD — na resposta da API (campo usage.total_cost_usd) e na seção "Uso". Útil para planejar despesas.

Novo
Conexão com um comando23 de jun.

Configure o acesso à API na sua ferramenta automaticamente: execute npx @joingonka/setup. Suporte para Claude Code, OpenClaw, Cline, Continue, opencode, Aider e outros.

Novo
Busca na web em tempo real17 de jun.

O modelo pesquisa na internet durante a resposta e adiciona links para as fontes. Como ativar: passe no corpo da solicitação plugins: [{ "id": "web", "max_results": 5 }] — funciona em APIs compatíveis com OpenAI e Anthropic.

maio de 2026
Melhoria
Respostas longas de até 8192 tokens25 de mai.

A duração máxima da resposta é de até 8192 tokens; gerencie o parâmetro max_tokens (padrão 1024 para streaming e 1500 para resposta normal).

Novo
Seleção de modelo no chat5 de mai.

Na página "Chat", selecione um modelo da lista (carregada via /v1/models) — a seleção é salva e aplicada aos novos diálogos.

Melhoria
Métricas de velocidade de resposta5 de mai.

Precisa de velocidade? Adicione à sua solicitação o cabeçalho x-joingonka-meta: 1 — na resposta por streaming você receberá ttft_ms (tempo até o primeiro token) e tokens_per_sec.

março de 2026
Novo
Chaves de gerenciamento para revenda24 de mar.

Crie uma chave de gerenciamento (POST /api/management/keys) e gere chaves filhas com limites (cota diária e mensal, rate limit, expiração) via POST /api/management/keys/{id}/children.

Novo
Plugins de processamento de solicitações24 de mar.

Conecte plugins via parâmetro plugins: response-healing conserta JSON truncado, privacy-sanitization mascara dados privados, file-parser extrai texto de PDFs e documentos.

Novo
API compatível com OpenAI e Anthropic19 de mar.

OpenAI: base_url https://gate.joingonka.ai/v1, cabeçalho Authorization: Bearer sua-chave. Anthropic (Claude Code): base_url https://gate.joingonka.ai, cabeçalho x-api-key, endpoint /v1/messages.

Novo
Depósitos em GNK e USDT18 de mar.

GNK: obtenha o endereço e o memo, e envie tokens on-chain. USDT: especifique um valor de 1 a 10 000 dólares e pague via OxaPay — a conversão para GNK é automática.