Mises à jour et état
État actuel de l'inférence et historique des modifications de la passerelle.
État actuel
- MiniMax M2.7Réseau Gonka : Performances dégradées
- DeepSeek V4 FlashRéseau Gonka : Performances dégradées
- GLM 5.3 FlashRéseau Gonka : Opérationnel
L'ensemble des modèles actifs est déterminé par le vote du réseau Gonka et peut varier : certains modèles sont parfois indisponibles avant de revenir. La liste actuelle est ci-dessus.
État détaillé et disponibilité →Historique des mises à jour
Vous pouvez recharger votre solde avec le jeton WGNK — il s'agit du GNK sur le réseau Ethereum. Dans votre compte : Recharger → GNK → Ethereum · WGNK ; indiquez l'adresse depuis laquelle vous enverrez les jetons — le transfert sera crédité automatiquement, généralement sous 15 à 20 minutes.
npx @joingonka/setup configure désormais 25 outils. Nouveautés : Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush et Zoo Code. Le modèle est sélectionné via le flag --model (minimax, deepseek ou glm), par défaut sur DeepSeek V4 Flash. À la fin, l'installateur envoie une requête de vérification et affiche immédiatement si la clé fonctionne.
À partir du 16 septembre, chaque nouveau compte reçoit 100 000 000 nGNK (0,1 GNK) au lieu de 50 000 000 — au prix actuel du réseau, cela représente environ 3 millions de tokens pour effectuer des tests sans dépôt. Le bonus est crédité automatiquement lors de l'inscription, aucune saisie n'est requise ; le montant actuel est toujours visible dans GET /api/pricing (champ welcome_bonus_ngonka) et sur la page d'inscription.
Les brokers du réseau Gonka terminent tout flux après environ 5 minutes de génération (pour GLM 5.3 Flash, cela représente environ 8 000 jetons). Auparavant, une telle coupure apparaissait comme une fin normale : le flux se terminait par [DONE] sans finish_reason, et le client prenait le fragment pour une réponse complète. Désormais, la passerelle envoie un chunk avec finish_reason="length" dans le flux et dans la réponse normale, et stop_reason="max_tokens" au format Anthropic. Que faire avec les réponses longues : utilisez stream:true et, lors de l'obtention de finish_reason="length", poursuivez la génération avec la requête suivante en passant la partie déjà reçue dans le contexte. Les détails se trouvent dans la section "Limites" de la documentation.
Le modèle GLM 5.3 Flash de Z.ai est arrivé sur le réseau Gonka : 320B paramètres (MoE, 18B actifs), FP8, licence MIT, contexte de 390 000 tokens. Le modèle raisonne avant de répondre : le raisonnement apparaît dans le champ reasoning_content et consomme le budget de la réponse, veillez donc à définir max_tokens à au moins 600 ou utilisez stream:true ; pour les tâches courtes — reasoning_effort: "low". Le Tool calling et le mode JSON fonctionnent. L'identifiant est zai-org/GLM-5.3-Flash, et le prix est identique à celui des autres modèles du réseau. Kimi K2.6 n'est plus pris en charge par le réseau — veuillez migrer vos intégrations vers MiniMax M2.7, DeepSeek V4 Flash ou GLM 5.3 Flash.
La page « Utilisation » affiche la consommation pour chaque modèle : requêtes, jetons d'entrée/sortie, coût en nGNK et en dollars, prix moyen pour 1M de jetons et vitesse de réponse. « Aujourd'hui » est affiché par heure et un préréglage « 90 jours » a été ajouté. Pour les intégrations : GET /api/usage/by-model.
La passerelle accepte désormais les requêtes vers /v1/completions — l'endpoint "text" d'OpenAI : il prend une chaîne de caractères prompt en entrée et renvoie choices[].text en sortie. Ceci est utilisé par les plugins d'éditeur pour l'autocomplétion et l'édition de code en ligne (Continue.dev et similaires). L'URL de base reste la même : https://gate.joingonka.ai/v1. Le streaming et les paramètres standard (max_tokens, temperature, stop) sont pris en charge, avec les mêmes coûts et limites que /v1/chat/completions. Les champs logprobs et best_of ne sont pas supportés.
À partir du 22 août, le coût d'inférence est le suivant : entrée — 33 nGNK, sortie — 99 nGNK par token (auparavant 22/66). La commission de la passerelle reste inchangée à 10 %. Le mode démo reste gratuit. Pourquoi cette hausse : une requête sur le réseau Gonka est traitée avec une redondance — cela fait partie du protocole et du code devshards, nécessaire pour la fluidité du service. Un conteneur peut envoyer une requête à un hôte, puis à un autre si le premier échoue, ou à plusieurs simultanément si nécessaire. Chaque tentative est payée : le prix du réseau est de 10 nGNK par token, multiplié par la redondance de la requête (en moyenne ×1—2.5). Auparavant, ce coût ne nous parvenait pas car l'API de finalisation des prix ne fonctionnait pas, et nous payions comme pour un seul hôte ; maintenant, il est calculé selon les données réelles et nous l'intégrons dans la tarification. L'inférence reste des centaines de fois moins chère que les API des fournisseurs. Les prix actuels de tous les modèles sont disponibles sur la page Pricing et via GET /api/pricing.
La passerelle accepte désormais les requêtes au format Responses, un nouveau protocole OpenAI adopté par les SDK récents et utilisé par Codex CLI. L'adresse reste inchangée : base URL https://gate.joingonka.ai/v1, le client appellera automatiquement /v1/responses. Le streaming, les function tools et la sortie structurée (text.format) sont pris en charge ; les coûts et les limites sont identiques à ceux de /v1/chat/completions. Nous ne stockons pas les dialogues, donc store est ignoré et previous_response_id renverra une erreur — veuillez transmettre l'historique complet dans le champ input. Les outils serveur intégrés d'OpenAI (web_search, file_search, code_interpreter) ne sont pas pris en charge ; notre recherche web reste disponible via le plugin web sur /v1/chat/completions.
Auparavant, les échecs du réseau Gonka en mode stream:true renvoyaient un code 200, et l'erreur n'était visible qu'à l'intérieur du chunk SSE : les clients agents prenaient ces réponses pour des succès vides et n'effectuaient pas de nouvelle tentative. Désormais, si la réponse réseau n'a pas encore commencé, l'erreur est renvoyée avec un code HTTP standard — 429 en cas de surcharge du modèle (avec l'en-tête Retry-After), 504 en cas de timeout, et 503 s'il ne reste plus de nœuds libres. Si l'échec survient au milieu du flux, le statut ne peut pas être modifié : il contient toujours un chunk avec un champ error, mais le [DONE] final n'est plus envoyé afin que le flux ne paraisse pas avoir été terminé avec succès.
npx @joingonka/setup configure désormais 15 outils d'agent : Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant et GitHub Copilot BYOK. Pour sept d'entre eux, la configuration est écrite et fusionnée proprement avec la vôtre (les commentaires et les paramètres existants sont conservés) ; pour les autres, qui ne se configurent que via l'interface, des valeurs prêtes à être collées sont affichées. Vous pouvez sélectionner un outil spécifique immédiatement : npx @joingonka/setup --tool zed. Chaque exécution se termine par une requête en direct à la passerelle, confirmant que la clé, l'adresse et le modèle ont été acceptés.
La longueur maximale d'une réponse unique pour DeepSeek V4 Flash a été multipliée par 4 : passant de 8 192 à 32 768 tokens (paramètre max_tokens). Les fichiers volumineux et les longues réponses des outils d'agent tiennent désormais dans un seul appel. De plus : si la réponse atteint la limite au milieu d'un appel d'outil, la passerelle renvoie un finish_reason="length" correct au lieu d'un appel tronqué — les clients d'agent (Cursor et autres) continuent de fonctionner correctement au lieu de se bloquer sur une erreur d'analyse.
Un troisième modèle actif est apparu sur le réseau Gonka : DeepSeek V4 Flash 0731 : contexte de 380 000 tokens (le plus long du réseau, vérifié par une requête réelle de 381K), reasoning et tool calling. L'identifiant est deepseek-ai/DeepSeek-V4-Flash-0731, et la tarification est identique aux autres modèles. Le modèle est en phase de test précoce mais est entièrement disponible : sélectionnez-le dans le chat du tableau de bord ou spécifiez-le dans le champ model de votre requête API.
À partir du 3 août, le coût d'inférence est : entrée — 22 nGNK, sortie — 66 nGNK par token (le double des 11/33 précédents). Les frais de passerelle restent inchangés à 10%. Le mode démo reste gratuit. Les prix actuels de tous les modèles sont disponibles sur la page Pricing et via GET /api/pricing.
Si le réseau Gonka reçoit une requête mais ne répond pas (timeout de 300s), le gateway renvoie désormais immédiatement une erreur 504 au lieu d'une série de tentatives silencieuses. Remarque importante sur la facturation : une requête acceptée par le réseau ne peut être annulée — le nœud la traite de toute façon, donc en cas de timeout, l'estimation de traitement du prompt est débitée (la completion n'est pas facturée). Recommandation : pour les générations longues, utilisez stream:true — le streaming est plus résistant aux timeouts et affiche la progression immédiatement.
Les frais de dépôt via USDT diminuent désormais avec le montant : base de 5%, dès $25 — 4.5%, dès $50 — 4%, dès $100 — 3.5%, dès $250 — 3%, dès $500 — 2.75%, dès $1000 — 2.5%. La fenêtre de dépôt propose une échelle interactive : curseur de montant, bonus GNK par palier et vos économies. La réduction est appliquée automatiquement lors du crédit.
Vous pouvez définir une limite de dépense totale (cumulée) pour les clés secondaires — un quota dédié qui ne se réinitialise pas, contrairement aux limites quotidiennes ou mensuelles. Une fois le quota épuisé, les requêtes utilisant cette clé sont rejetées. La limite est définie dans le tableau de bord (avec une précision au nanogonka) ou via l'API en utilisant le champ limit_total_ngonka dans POST/PATCH /api/management/keys/{id}/children ; la consommation accumulée est réinitialisée via le bouton "Reset usage" (ou POST /api/management/keys/{id}/children/{childId}/reset-usage).
Les coûts d'inférence sont désormais synchronisés avec le prix réel du réseau Gonka par jeton. Les prix restent parmi les plus bas du marché — une fraction de centime par million de jetons, des centaines de fois moins cher qu'OpenAI et Anthropic pour les mêmes modèles open-source. Les jetons de sortie sont facturés plus cher que les jetons d'entrée (×3), comme chez la plupart des fournisseurs.
Nous avons confirmé la limite de contexte réelle des modèles actifs — jusqu'à 200 000 jetons (auparavant, des chiffres conservateurs de 131 072 étaient publiés). Vous pouvez désormais envoyer des documents et des historiques de dialogue plus longs ; les caractéristiques actuelles de chaque modèle sont disponibles dans la section « Network Status ».
Le coût de chaque requête est visible en dollars — dans la réponse API (champ usage.total_cost_usd) et dans la section « Usage ». Pratique pour planifier les dépenses.
Configurez l'accès à l'API dans votre outil automatiquement : exécutez npx @joingonka/setup. Support pour Claude Code, OpenClaw, Cline, Continue, opencode, Aider et autres.
Le modèle effectue des recherches sur Internet lors de la réponse et ajoute des liens vers les sources. Comment activer : passez dans le corps de la requête plugins: [{ "id": "web", "max_results": 5 }] — fonctionne avec l'API compatible OpenAI et Anthropic.
Longueur maximale de réponse jusqu'à 8192 tokens ; gérez le paramètre max_tokens (par défaut 1024 pour une réponse en streaming et 1500 pour une normale).
Sur la page « Chat », sélectionnez un modèle dans la liste (chargée depuis /v1/models) — la sélection est enregistrée et appliquée aux nouvelles conversations.
Besoin de vitesse ? Ajoutez à la requête l'en-tête x-joingonka-meta: 1 — dans la réponse en streaming, vous recevrez ttft_ms (temps jusqu'au premier token) et tokens_per_sec.
Créez une clé de gestion (POST /api/management/keys) et générez des clés enfants avec des limites (quota journalier et mensuel, rate limit, durée) via POST /api/management/keys/{id}/children.
Connectez des plugins via le paramètre plugins : response-healing répare le JSON tronqué, privacy-sanitization masque les données privées, file-parser extrait le texte des PDF et documents.
OpenAI : base_url https://gate.joingonka.ai/v1, en-tête Authorization: Bearer votre-clé. Anthropic (Claude Code) : base_url https://gate.joingonka.ai, en-tête x-api-key, endpoint /v1/messages.
GNK : obtenez une adresse et un memo, puis envoyez les tokens on-chain. USDT : indiquez un montant entre 1 et 10 000 dollars et payez via OxaPay — la conversion en GNK est automatique.