Mises à jour et état
État actuel de l'inférence et historique des modifications de la passerelle.
État actuel
- MiniMax M2.7Réseau Gonka : Opérationnel
- Kimi K2.6Réseau Gonka : Opérationnel
- DeepSeek V4 FlashRéseau Gonka : Opérationnel
L'ensemble des modèles actifs est déterminé par le vote du réseau Gonka et peut varier : certains modèles sont parfois indisponibles avant de revenir. La liste actuelle est ci-dessus.
État détaillé et disponibilité →Historique des mises à jour
La longueur maximale d'une réponse unique pour DeepSeek V4 Flash a été multipliée par 4 : passant de 8 192 à 32 768 tokens (paramètre max_tokens). Les fichiers volumineux et les longues réponses des outils d'agent tiennent désormais dans un seul appel. De plus : si la réponse atteint la limite au milieu d'un appel d'outil, la passerelle renvoie un finish_reason="length" correct au lieu d'un appel tronqué — les clients d'agent (Cursor et autres) continuent de fonctionner correctement au lieu de se bloquer sur une erreur d'analyse.
Un troisième modèle actif est apparu sur le réseau Gonka : DeepSeek V4 Flash 0731 : contexte de 380 000 tokens (le plus long du réseau, vérifié par une requête réelle de 381K), reasoning et tool calling. L'identifiant est deepseek-ai/DeepSeek-V4-Flash-0731, et la tarification est identique aux autres modèles. Le modèle est en phase de test précoce mais est entièrement disponible : sélectionnez-le dans le chat du tableau de bord ou spécifiez-le dans le champ model de votre requête API.
À partir du 3 août, le coût d'inférence est : entrée — 22 nGNK, sortie — 66 nGNK par token (le double des 11/33 précédents). Les frais de passerelle restent inchangés à 10%. Le mode démo reste gratuit. Les prix actuels de tous les modèles sont disponibles sur la page Pricing et via GET /api/pricing.
Si le réseau Gonka reçoit une requête mais ne répond pas (timeout de 300s), le gateway renvoie désormais immédiatement une erreur 504 au lieu d'une série de tentatives silencieuses. Remarque importante sur la facturation : une requête acceptée par le réseau ne peut être annulée — le nœud la traite de toute façon, donc en cas de timeout, l'estimation de traitement du prompt est débitée (la completion n'est pas facturée). Recommandation : pour les générations longues, utilisez stream:true — le streaming est plus résistant aux timeouts et affiche la progression immédiatement.
Les frais de dépôt via USDT diminuent désormais avec le montant : base de 5%, dès $25 — 4.5%, dès $50 — 4%, dès $100 — 3.5%, dès $250 — 3%, dès $500 — 2.75%, dès $1000 — 2.5%. La fenêtre de dépôt propose une échelle interactive : curseur de montant, bonus GNK par palier et vos économies. La réduction est appliquée automatiquement lors du crédit.
Vous pouvez définir une limite de dépense totale (cumulée) pour les clés secondaires — un quota dédié qui ne se réinitialise pas, contrairement aux limites quotidiennes ou mensuelles. Une fois le quota épuisé, les requêtes utilisant cette clé sont rejetées. La limite est définie dans le tableau de bord (avec une précision au nanogonka) ou via l'API en utilisant le champ limit_total_ngonka dans POST/PATCH /api/management/keys/{id}/children ; la consommation accumulée est réinitialisée via le bouton "Reset usage" (ou POST /api/management/keys/{id}/children/{childId}/reset-usage).
Les coûts d'inférence sont désormais synchronisés avec le prix réel du réseau Gonka par jeton. Les prix restent parmi les plus bas du marché — une fraction de centime par million de jetons, des centaines de fois moins cher qu'OpenAI et Anthropic pour les mêmes modèles open-source. Les jetons de sortie sont facturés plus cher que les jetons d'entrée (×3), comme chez la plupart des fournisseurs.
Nous avons confirmé la limite de contexte réelle des modèles actifs — jusqu'à 200 000 jetons (auparavant, des chiffres conservateurs de 131 072 étaient publiés). Vous pouvez désormais envoyer des documents et des historiques de dialogue plus longs ; les caractéristiques actuelles de chaque modèle sont disponibles dans la section « Network Status ».
Le coût de chaque requête est visible en dollars — dans la réponse API (champ usage.total_cost_usd) et dans la section « Usage ». Pratique pour planifier les dépenses.
Configurez l'accès à l'API dans votre outil automatiquement : exécutez npx @joingonka/setup. Support pour Claude Code, OpenClaw, Cline, Continue, opencode, Aider et autres.
Le modèle effectue des recherches sur Internet lors de la réponse et ajoute des liens vers les sources. Comment activer : passez dans le corps de la requête plugins: [{ "id": "web", "max_results": 5 }] — fonctionne avec l'API compatible OpenAI et Anthropic.
Longueur maximale de réponse jusqu'à 8192 tokens ; gérez le paramètre max_tokens (par défaut 1024 pour une réponse en streaming et 1500 pour une normale).
Sur la page « Chat », sélectionnez un modèle dans la liste (chargée depuis /v1/models) — la sélection est enregistrée et appliquée aux nouvelles conversations.
Besoin de vitesse ? Ajoutez à la requête l'en-tête x-joingonka-meta: 1 — dans la réponse en streaming, vous recevrez ttft_ms (temps jusqu'au premier token) et tokens_per_sec.
Créez une clé de gestion (POST /api/management/keys) et générez des clés enfants avec des limites (quota journalier et mensuel, rate limit, durée) via POST /api/management/keys/{id}/children.
Connectez des plugins via le paramètre plugins : response-healing répare le JSON tronqué, privacy-sanitization masque les données privées, file-parser extrait le texte des PDF et documents.
OpenAI : base_url https://gate.joingonka.ai/v1, en-tête Authorization: Bearer votre-clé. Anthropic (Claude Code) : base_url https://gate.joingonka.ai, en-tête x-api-key, endpoint /v1/messages.
GNK : obtenez une adresse et un memo, puis envoyez les tokens on-chain. USDT : indiquez un montant entre 1 et 10 000 dollars et payez via OxaPay — la conversion en GNK est automatique.