Aggiornamenti e stato
Stato attuale dell'inferenced e cronologia delle modifiche del gateway.
Stato attuale
- MiniMax M2.7Rete Gonka: Operativa
- Kimi K2.6Rete Gonka: Operativa
- DeepSeek V4 FlashRete Gonka: Operativa
Il set di modelli attivi è determinato dalla votazione della rete Gonka e può variare: alcuni modelli potrebbero non essere disponibili temporaneamente per tornare attivi in seguito. L'elenco aggiornato è disponibile sopra.
Stato dettagliato e uptime →Cronologia degli aggiornamenti
La lunghezza massima di una singola risposta per DeepSeek V4 Flash è stata aumentata di 4 volte: da 8.192 a 32.768 token (parametro max_tokens). File di grandi dimensioni e risposte lunghe dagli strumenti agent ora rientrano in un'unica chiamata. Inoltre: se la risposta raggiunge il limite a metà di una chiamata allo strumento, il gateway restituisce un finish_reason="length" corretto anziché una chiamata troncata — i client agent (Cursor e altri) continuano a funzionare correttamente invece di bloccarsi a causa di un errore di parsing.
È arrivato un terzo modello attivo sulla rete Gonka: DeepSeek V4 Flash 0731: contesto di 380.000 token (il più lungo della rete, verificato con una richiesta reale da 381K), reasoning e tool calling. L'identificativo è deepseek-ai/DeepSeek-V4-Flash-0731, il prezzo è lo stesso degli altri modelli. Il modello è in fase di test iniziale ma è completamente disponibile: selezionalo nella chat della dashboard o specificalo nel campo model della tua richiesta API.
Dal 3 agosto, il costo dell'inferenza è: input — 22 nGNK, output — 66 nGNK per token (il doppio dei 11/33 precedenti). La commissione del gateway rimane invariata al 10%. La modalità demo rimane gratuita. I prezzi correnti di tutti i modelli sono disponibili nella pagina Pricing e tramite GET /api/pricing.
Se la rete Gonka riceve una richiesta ma non risponde (timeout di 300s), il gateway ora restituisce immediatamente un errore 504 invece di una serie di tentativi silenziosi. Nota importante sulla fatturazione: una richiesta accettata dalla rete non può essere annullata — il nodo la elabora comunque, quindi in caso di timeout viene detratta la stima di elaborazione del prompt (la completion non viene fatturata). Raccomandazione: per generazioni lunghe, usa stream:true — lo streaming è più resistente ai timeout e mostra il progresso immediatamente.
La commissione per i depositi tramite USDT ora diminuisce all'aumentare dell'importo: base 5%, da $25 — 4.5%, da $50 — 4%, da $100 — 3.5%, da $250 — 3%, da $500 — 2.75%, da $1000 — 2.5%. La finestra di deposito presenta una scala interattiva: cursore dell'importo, bonus GNK per ogni livello e i tuoi risparmi. Lo sconto viene applicato automaticamente al momento dell'accredito.
È possibile impostare un limite di spesa totale (cumulativo) per le chiavi secondarie: una quota dedicata che non si azzera, a differenza dei limiti giornalieri o mensili. Esaurita la quota, le richieste che utilizzano la chiave vengono rifiutate. Il limite si imposta nella dashboard (con precisione di nanogonka) o tramite API utilizzando il campo limit_total_ngonka in POST/PATCH /api/management/keys/{id}/children; il consumo accumulato si resetta con il pulsante "Reset usage" (o POST /api/management/keys/{id}/children/{childId}/reset-usage).
Il costo di inferenced è sincronizzato con il prezzo reale di rete Gonka per token. I prezzi rimangono tra i più bassi sul mercato – frazioni di centesimo per milione di token, centinaia di volte più economici di OpenAI e Anthropic a parità di modelli open-source. I token di output vengono tariffati più dei token di input (×3), come avviene presso la maggior parte dei provider.
Abbiamo confermato il limite di contesto reale dei modelli attivi – fino a 200 000 token (in precedenza erano stati pubblicati 131 072). È possibile inviare documenti e cronologie di chat più lunghi; le specifiche aggiornate di ogni modello si trovano nella sezione «Stato della rete».
Il costo di ogni richiesta è visibile in dollari nella risposta API (campo usage.total_cost_usd) e nella sezione "Utilizzo". Utile per pianificare le proprie spese.
Configura automaticamente l'accesso all'API nel tuo strumento eseguendo npx @joingonka/setup. Supporto per Claude Code, OpenClaw, Cline, Continue, opencode, Aider e altri.
Il modello effettua ricerche su internet durante la risposta e aggiunge i link alle fonti. Come abilitarlo: inserisci nel corpo della richiesta plugins: [{ "id": "web", "max_results": 5 }] — funziona con API compatibili OpenAI e Anthropic.
La lunghezza massima della risposta è fino a 8192 token; gestisci il parametro max_tokens (predefinito a 1024 per la risposta in streaming e 1500 per quella standard).
Dalla pagina "Chat", scegli un modello dall'elenco (caricato da /v1/models) — la scelta viene salvata e applicata ai nuovi dialoghi.
Ti serve velocità? Aggiungi alla richiesta l'header x-joingonka-meta: 1 — nella risposta in streaming riceverai ttft_ms (tempo fino al primo token) e tokens_per_sec.
Crea una chiave di gestione (POST /api/management/keys) e genera chiavi figlio con limiti (quota giornaliera/mensile, rate limit, scadenza) tramite POST /api/management/keys/{id}/children.
Collega i plugin tramite il parametro plugins: response-healing ripara JSON troncati, privacy-sanitization maschera dati privati, file-parser estrae testo da PDF e documenti.
OpenAI: base_url https://gate.joingonka.ai/v1, header Authorization: Bearer tua-chiave. Anthropic (Claude Code): base_url https://gate.joingonka.ai, header x-api-key, endpoint /v1/messages.
GNK: ottieni indirizzo e memo e invia i token on-chain. USDT: specifica l'importo da 1 a 10.000 dollari e paga tramite OxaPay — la conversione in GNK è automatica.