Aggiornamenti e stato
Stato attuale dell'inferenced e cronologia delle modifiche del gateway.
Stato attuale
- MiniMax M2.7Rete Gonka: Prestazioni ridotte
- DeepSeek V4 FlashRete Gonka: Prestazioni ridotte
- GLM 5.3 FlashRete Gonka: Operativa
Il set di modelli attivi è determinato dalla votazione della rete Gonka e può variare: alcuni modelli potrebbero non essere disponibili temporaneamente per tornare attivi in seguito. L'elenco aggiornato è disponibile sopra.
Stato dettagliato e uptime →Cronologia degli aggiornamenti
Puoi ricaricare il tuo saldo con il token WGNK, che è GNK sulla rete Ethereum. Nel tuo account: Ricarica → GNK → Ethereum · WGNK; indica l'indirizzo da cui invierai i token — il trasferimento verrà accreditato automaticamente, solitamente in 15–20 minuti.
npx @joingonka/setup ora configura 25 strumenti. Novità: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush e Zoo Code. Il modello viene selezionato tramite il flag --model (minimax, deepseek o glm), con DeepSeek V4 Flash come predefinito. Alla fine, l'installatore invia una richiesta di verifica e mostra immediatamente se la chiave è funzionante.
Dal 16 settembre, ogni nuovo account riceve 100.000.000 nGNK (0,1 GNK) invece di 50.000.000 — al prezzo di rete attuale, questo equivale a circa 3 milioni di token per effettuare test senza deposito. Il bonus viene accreditato automaticamente al momento della registrazione, non è necessario inserire nulla; l'importo attuale è sempre visibile in GET /api/pricing (campo welcome_bonus_ngonka) e sulla pagina di registrazione.
I nodi della rete Gonka chiudono ogni stream dopo circa 5 minuti di generazione (per GLM 5.3 Flash sono circa 8.000 token). In precedenza, questo troncamento appariva come una normale conclusione: il flusso terminava con [DONE] senza finish_reason, e il client scambiava il frammento per una risposta completa. Ora il gateway invia un chunk con finish_reason="length", sia nello stream che nella risposta normale, mentre nel formato Anthropic è stop_reason="max_tokens". Cosa fare con le risposte lunghe: utilizzare stream:true e, in caso di finish_reason="length", continuare la generazione con una richiesta successiva, passando la parte già ricevuta nel contesto. Dettagli nella sezione “Limiti” della documentazione.
Nella rete Gonka è disponibile GLM 5.3 Flash di Z.ai: 320B parametri (MoE, 18B attivi), FP8, licenza MIT, contesto di 390 000 token. Il modello ragiona prima di rispondere: il ragionamento arriva nel campo reasoning_content e consuma il budget della risposta, quindi impostare max_tokens ad almeno 600 o utilizzare stream:true; per compiti brevi — reasoning_effort: "low". Il tool calling e la modalità JSON funzionano. L'identificativo è zai-org/GLM-5.3-Flash, il prezzo è lo stesso degli altri modelli della rete. Kimi K2.6 non è più supportato dalla rete — aggiornare le integrazioni a MiniMax M2.7, DeepSeek V4 Flash o GLM 5.3 Flash.
La pagina "Utilizzo" mostra il consumo per ogni modello: richieste, token di input/output, costo in nGNK e dollari, prezzo medio per 1M di token e velocità di risposta. "Oggi" viene mostrato per ora ed è stato aggiunto un preset "90 giorni". Per le integrazioni: GET /api/usage/by-model.
Il gateway ora accetta richieste a /v1/completions — l'endpoint "text" di OpenAI: accetta una stringa prompt in input e restituisce choices[].text in output. Questo viene utilizzato dai plugin dell'editor per il completamento automatico e la modifica del codice inline (Continue.dev e simili). La Base URL rimane la stessa: https://gate.joingonka.ai/v1. Lo streaming e i parametri standard (max_tokens, temperature, stop) sono supportati, con gli stessi costi e limiti di /v1/chat/completions. I campi logprobs e best_of non sono supportati.
Dal 22 agosto il costo dell'inferenza è: ingresso — 33 nGNK, uscita — 99 nGNK per token (precedentemente 22/66). La commissione del gateway non cambia: 10%. La modalità demo rimane gratuita. Perché è aumentato: una richiesta nella rete Gonka viene elaborata con redundancy — questo fa parte del protocollo e del codice devshards, necessario per la fluidità del servizio. Un container può inviare una richiesta a un host, poi a un altro se il primo non riesce, e se necessario, a diversi contemporaneamente. Ogni tentativo viene pagato: il prezzo di rete è 10 nGNK per token, moltiplicato per la redundancy della richiesta (in media ×1—2.5). In precedenza questo costo non ci arrivava a causa del malfunzionamento dell'API di finalizzazione del prezzo e pagavamo come per un singolo host; ora viene conteggiato effettivamente e lo trasferiamo sulla tariffa. L'inferenza rimane centinaia di volte più economica delle API dei vendor. I prezzi aggiornati di tutti i modelli sono disponibili nella pagina Pricing e tramite GET /api/pricing.
Il gateway accetta richieste nel formato Responses, un nuovo protocollo OpenAI adottato dagli SDK più recenti e utilizzato da Codex CLI. L'indirizzo rimane lo stesso: base URL https://gate.joingonka.ai/v1, il client contatterà automaticamente /v1/responses. Lo streaming, i function tools e l'output strutturato (text.format) sono supportati; i costi e i limiti sono identici a /v1/chat/completions. Non memorizziamo le conversazioni, quindi store viene ignorato e previous_response_id restituirà un errore: si prega di trasmettere l'intera cronologia nel campo input. Gli strumenti server integrati di OpenAI (web_search, file_search, code_interpreter) non sono supportati; la nostra ricerca web rimane disponibile tramite il plugin web su /v1/chat/completions.
In precedenza, gli errori di rete di Gonka in modalità stream:true venivano restituiti con un codice 200 e l'errore era visibile solo all'interno dello SSE-chunk: i client agent interpretavano questa risposta come un successo vuoto e non tentavano il ripristino. Ora, finché la risposta della rete non è iniziata, l'errore viene restituito con un codice HTTP standard: 429 in caso di sovraccarico del modello (con header Retry-After), 504 in caso di timeout, 503 se non ci sono node liberi. Se l'errore si verifica nel mezzo dello stream, lo stato non può essere modificato: rimane un chunk con un campo error, ma non viene più inviato il [DONE] finale, affinché lo stream non appaia come completato correttamente.
npx @joingonka/setup ora configura 15 tool agent: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant e GitHub Copilot BYOK. Per sette di questi la configurazione viene scritta e unita accuratamente alla tua (commenti e impostazioni esistenti vengono conservati), per gli altri, quelli configurabili solo tramite interfaccia, vengono stampati i valori pronti per l'inserimento. Lo strumento desiderato può essere selezionato immediatamente: npx @joingonka/setup --tool zed. Ogni esecuzione termina con una richiesta live al gateway che conferma l'accettazione di chiave, indirizzo e modello.
La lunghezza massima di una singola risposta per DeepSeek V4 Flash è stata aumentata di 4 volte: da 8.192 a 32.768 token (parametro max_tokens). File di grandi dimensioni e risposte lunghe dagli strumenti agent ora rientrano in un'unica chiamata. Inoltre: se la risposta raggiunge il limite a metà di una chiamata allo strumento, il gateway restituisce un finish_reason="length" corretto anziché una chiamata troncata — i client agent (Cursor e altri) continuano a funzionare correttamente invece di bloccarsi a causa di un errore di parsing.
È arrivato un terzo modello attivo sulla rete Gonka: DeepSeek V4 Flash 0731: contesto di 380.000 token (il più lungo della rete, verificato con una richiesta reale da 381K), reasoning e tool calling. L'identificativo è deepseek-ai/DeepSeek-V4-Flash-0731, il prezzo è lo stesso degli altri modelli. Il modello è in fase di test iniziale ma è completamente disponibile: selezionalo nella chat della dashboard o specificalo nel campo model della tua richiesta API.
Dal 3 agosto, il costo dell'inferenza è: input — 22 nGNK, output — 66 nGNK per token (il doppio dei 11/33 precedenti). La commissione del gateway rimane invariata al 10%. La modalità demo rimane gratuita. I prezzi correnti di tutti i modelli sono disponibili nella pagina Pricing e tramite GET /api/pricing.
Se la rete Gonka riceve una richiesta ma non risponde (timeout di 300s), il gateway ora restituisce immediatamente un errore 504 invece di una serie di tentativi silenziosi. Nota importante sulla fatturazione: una richiesta accettata dalla rete non può essere annullata — il nodo la elabora comunque, quindi in caso di timeout viene detratta la stima di elaborazione del prompt (la completion non viene fatturata). Raccomandazione: per generazioni lunghe, usa stream:true — lo streaming è più resistente ai timeout e mostra il progresso immediatamente.
La commissione per i depositi tramite USDT ora diminuisce all'aumentare dell'importo: base 5%, da $25 — 4.5%, da $50 — 4%, da $100 — 3.5%, da $250 — 3%, da $500 — 2.75%, da $1000 — 2.5%. La finestra di deposito presenta una scala interattiva: cursore dell'importo, bonus GNK per ogni livello e i tuoi risparmi. Lo sconto viene applicato automaticamente al momento dell'accredito.
È possibile impostare un limite di spesa totale (cumulativo) per le chiavi secondarie: una quota dedicata che non si azzera, a differenza dei limiti giornalieri o mensili. Esaurita la quota, le richieste che utilizzano la chiave vengono rifiutate. Il limite si imposta nella dashboard (con precisione di nanogonka) o tramite API utilizzando il campo limit_total_ngonka in POST/PATCH /api/management/keys/{id}/children; il consumo accumulato si resetta con il pulsante "Reset usage" (o POST /api/management/keys/{id}/children/{childId}/reset-usage).
Il costo di inferenced è sincronizzato con il prezzo reale di rete Gonka per token. I prezzi rimangono tra i più bassi sul mercato – frazioni di centesimo per milione di token, centinaia di volte più economici di OpenAI e Anthropic a parità di modelli open-source. I token di output vengono tariffati più dei token di input (×3), come avviene presso la maggior parte dei provider.
Abbiamo confermato il limite di contesto reale dei modelli attivi – fino a 200 000 token (in precedenza erano stati pubblicati 131 072). È possibile inviare documenti e cronologie di chat più lunghi; le specifiche aggiornate di ogni modello si trovano nella sezione «Stato della rete».
Il costo di ogni richiesta è visibile in dollari nella risposta API (campo usage.total_cost_usd) e nella sezione "Utilizzo". Utile per pianificare le proprie spese.
Configura automaticamente l'accesso all'API nel tuo strumento eseguendo npx @joingonka/setup. Supporto per Claude Code, OpenClaw, Cline, Continue, opencode, Aider e altri.
Il modello effettua ricerche su internet durante la risposta e aggiunge i link alle fonti. Come abilitarlo: inserisci nel corpo della richiesta plugins: [{ "id": "web", "max_results": 5 }] — funziona con API compatibili OpenAI e Anthropic.
La lunghezza massima della risposta è fino a 8192 token; gestisci il parametro max_tokens (predefinito a 1024 per la risposta in streaming e 1500 per quella standard).
Dalla pagina "Chat", scegli un modello dall'elenco (caricato da /v1/models) — la scelta viene salvata e applicata ai nuovi dialoghi.
Ti serve velocità? Aggiungi alla richiesta l'header x-joingonka-meta: 1 — nella risposta in streaming riceverai ttft_ms (tempo fino al primo token) e tokens_per_sec.
Crea una chiave di gestione (POST /api/management/keys) e genera chiavi figlio con limiti (quota giornaliera/mensile, rate limit, scadenza) tramite POST /api/management/keys/{id}/children.
Collega i plugin tramite il parametro plugins: response-healing ripara JSON troncati, privacy-sanitization maschera dati privati, file-parser estrae testo da PDF e documenti.
OpenAI: base_url https://gate.joingonka.ai/v1, header Authorization: Bearer tua-chiave. Anthropic (Claude Code): base_url https://gate.joingonka.ai, header x-api-key, endpoint /v1/messages.
GNK: ottieni indirizzo e memo e invia i token on-chain. USDT: specifica l'importo da 1 a 10.000 dollari e paga tramite OxaPay — la conversione in GNK è automatica.