अपडेट्स और स्टेटस
इन्फरेन्स की वर्तमान स्थिति और गेटवे का चेंजलॉग।
वर्तमान स्थिति
- MiniMax M2.7गोंका नेटवर्क: प्रदर्शन खराब
- DeepSeek V4 Flashगोंका नेटवर्क: प्रदर्शन खराब
- GLM 5.3 Flashगोंका नेटवर्क: चालू
सक्रिय मॉडलों का चयन Gonka नेटवर्क द्वारा वोटिंग के माध्यम से किया जाता है और यह बदल सकता है: कुछ मॉडल कभी-कभी उपलब्ध नहीं होते और बाद में वापस आ जाते हैं। अद्यतन सूची ऊपर दी गई है।
विस्तृत स्टेटस और अपटाइम →अपडेट्स का इतिहास
आप WGNK टोकन के साथ अपना बैलेंस रिचार्ज कर सकते हैं — यह Ethereum नेटवर्क पर GNK है। अपने अकाउंट में: टॉप अप → GNK → Ethereum · WGNK; वह पता निर्दिष्ट करें जहाँ से आप टोकन भेजेंगे — ट्रांसफर अपने आप क्रेडिट हो जाएगा, आमतौर पर 15–20 मिनट में।
npx @joingonka/setup अब 25 टूल्स कॉन्फ़िगर करता है। नए: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush और Zoo Code। मॉडल का चयन --model फ्लैग (minimax, deepseek या glm) के माध्यम से किया जाता है, डिफ़ॉल्ट DeepSeek V4 Flash है। अंत में, इंस्टॉलर एक सत्यापन अनुरोध भेजता है और तुरंत दिखाता है कि क्या कुंजी काम कर रही है।
16 सितंबर से, प्रत्येक नया खाता 50,000,000 के बजाय 100,000,000 nGNK (0.1 GNK) प्राप्त करता है — वर्तमान नेटवर्क कीमत के अनुसार, यह बिना जमा किए परीक्षण के लिए लगभग 3 मिलियन टोकन के बराबर है। बोनस पंजीकरण पर स्वचालित रूप से क्रेडिट हो जाता है, कुछ भी इनपुट करने की आवश्यकता नहीं है; वर्तमान राशि हमेशा GET /api/pricing (फ़ील्ड welcome_bonus_ngonka) और पंजीकरण पृष्ठ पर दिखाई देती है।
Gonka नेटवर्क के नोड्स लगभग 5 मिनट के जनरेशन के बाद किसी भी स्ट्रीम को बंद कर देते हैं (GLM 5.3 Flash के लिए यह लगभग 8,000 token हैं)। पहले ऐसा कट-ऑफ सामान्य समाप्ति जैसा दिखता था: स्ट्रीम बिना किसी finish_reason के [DONE] के साथ समाप्त हो जाती थी, और क्लाइंट अधूरे जवाब को पूरा जवाब मान लेता था। अब गेटवे finish_reason="length" वाला एक chunk भेजता है — स्ट्रीम और सामान्य प्रतिक्रिया दोनों में, और Anthropic फॉर्मेट में यह stop_reason="max_tokens" है। लंबे जवाबों के साथ क्या करें: stream:true का उपयोग करें और finish_reason="length" मिलने पर, पहले से प्राप्त हिस्से को कॉन्टेक्स्ट में पास करते हुए अगले रिक्वेस्ट के साथ जनरेशन जारी रखें। विवरण डॉक्यूमेंटेशन के “Limits” अनुभाग में हैं।
Gonka नेटवर्क पर Z.ai द्वारा GLM 5.3 Flash उपलब्ध है: 320B पैरामीटर्स (MoE, 18B एक्टिव), FP8, MIT लाइसेंस, 390,000 टोकन का संदर्भ। मॉडल उत्तर देने से पहले तर्क करता है: तर्क reasoning_content फ़ील्ड में आता है और उत्तर के बजट का उपयोग करता है, इसलिए max_tokens को कम से कम 600 सेट करें या stream:true का उपयोग करें; छोटे कार्यों के लिए — reasoning_effort: "low"। Tool calling और JSON-मोड काम करते हैं। आइडेंटिफ़ायर — zai-org/GLM-5.3-Flash, कीमत नेटवर्क के अन्य मॉडलों के समान है। Kimi K2.6 अब नेटवर्क द्वारा समर्थित नहीं है — अपने इंटीग्रेशन को MiniMax M2.7, DeepSeek V4 Flash या GLM 5.3 Flash पर स्विच करें।
"उपयोग" पृष्ठ प्रत्येक मॉडल के लिए खपत दिखाता है: अनुरोध, इनपुट/आउटपुट token, nGNK और डॉलर में लागत, प्रति 1M token औसत मूल्य और प्रतिक्रिया गति। "आज" घंटे के अनुसार दिखाया गया है, और "90 दिन" प्रीसेट जोड़ा गया है। एकीकरण के लिए: GET /api/usage/by-model।
गेटवे अब /v1/completions के अनुरोधों को स्वीकार करता है — OpenAI का "text" एंडपॉइंट: यह इनपुट के रूप में एक prompt स्ट्रिंग लेता है और आउटपुट के रूप में choices[].text लौटाता है। इसका उपयोग एडिटर प्लगइन्स द्वारा ऑटो-कंप्लीट और इनलाइन कोड एडिटिंग (Continue.dev और समान) के लिए किया जाता है। Base URL वही है: https://gate.joingonka.ai/v1। स्ट्रीमिंग और मानक पैरामीटर (max_tokens, temperature, stop) समर्थित हैं, और लागत और सीमाएं /v1/chat/completions के समान ही हैं। logprobs और best_of फ़ील्ड समर्थित नहीं हैं।
22 अगस्त से इन्फेरेंस (inference) की लागत: इनपुट — 33 nGNK, आउटपुट — 99 nGNK प्रति टोकन (पहले 22/66 थी)। गेटवे कमीशन में कोई बदलाव नहीं है — 10%। डेमो मोड मुफ्त रहेगा। वृद्धि का कारण: Gonka नेटवर्क में एक अनुरोध (request) redundancy के साथ प्रोसेस किया जाता है — यह प्रोटोकॉल और devshards कोड का हिस्सा है, जो सर्विस की सुचारू उपलब्धता के लिए आवश्यक है। एक कंटेनर अनुरोध को एक होस्ट पर भेज सकता है, फिर दूसरे पर यदि पहला सफल नहीं होता, और जरूरत पड़ने पर एक साथ कई होस्ट पर भेज सकता है। प्रत्येक प्रयास का भुगतान किया जाता है: नेटवर्क की कीमत 10 nGNK प्रति टोकन है, जिसे अनुरोध की redundancy से गुणा किया जाता है (औसतन ×1—2.5)। पहले, यह लागत हम तक नहीं पहुँचती थी क्योंकि प्राइस फाइनलाइजेशन API काम नहीं कर रहा था और हम केवल एक होस्ट के लिए भुगतान कर रहे थे; अब यह वास्तविक उपयोग के आधार पर गिना जाता है और हम इसे टैरिफ में जोड़ रहे हैं। इन्फेरेंस अभी भी वेंडर API की तुलना में सैकड़ों गुना सस्ता है। सभी मॉडलों की वर्तमान कीमतें Pricing पेज और GET /api/pricing पर उपलब्ध हैं।
गेटवे Responses प्रारूप में अनुरोधों को स्वीकार करता है — जो कि OpenAI का एक नया प्रोटोकॉल है जिसे हालिया SDKs ने अपनाया है और जिसके माध्यम से Codex CLI काम करता है। पता वही है: base URL https://gate.joingonka.ai/v1, क्लाइंट स्वयं /v1/responses से जुड़ जाएगा। स्ट्रीमिंग, function tools और स्ट्रक्चर्ड आउटपुट (text.format) काम करते हैं, लागत और सीमाएं /v1/chat/completions के समान ही हैं। हम संवादों को संग्रहीत नहीं करते हैं, इसलिए store को अनदेखा कर दिया जाता है और previous_response_id एक त्रुटि लौटाएगा — कृपया पूरे इतिहास को input फ़ील्ड में पास करें। अंतर्निहित OpenAI सर्वर टूल्स (web_search, file_search, code_interpreter) समर्थित नहीं हैं; हमारी वेब खोज अभी भी /v1/chat/completions पर web प्लगइन के माध्यम से उपलब्ध है।
पहले stream:true मोड में Gonka नेटवर्क त्रुटियां 200 कोड के साथ आती थीं और त्रुटि केवल SSE-chunk के भीतर दिखाई देती थी: एजेंट क्लाइंट इसे एक खाली सफल प्रतिक्रिया मान लेते थे और फिर से प्रयास (retry) नहीं करते थे। अब, नेटवर्क से प्रतिक्रिया शुरू होने से पहले, त्रुटि सामान्य HTTP कोड के साथ भेजी जाती है – मॉडल ओवरलोड होने पर 429 (Retry-After हेडर के साथ), टाइमआउट होने पर 504, और यदि कोई नोड उपलब्ध न हो तो 503। यदि त्रुटि स्ट्रीम के बीच में होती है, तो स्थिति बदली नहीं जा सकती: वहां error फ़ील्ड वाला एक chunk रहता है, लेकिन अंतिम [DONE] अब नहीं भेजा जाता है, ताकि ऐसी स्ट्रीम सामान्य रूप से पूर्ण न दिखाई दे।
npx @joingonka/setup अब 15 एजेंट टूल्स को कॉन्फ़िगर करता है: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant और GitHub Copilot BYOK। इनमें से सात के लिए कॉन्फ़िगरेशन लिखा जाता है और उसे आपके कॉन्फ़िगरेशन के साथ सफाई से मर्ज किया जाता है (टिप्पणियाँ और मौजूदा सेटिंग्स सुरक्षित रहती हैं), बाकी जो केवल इंटरफ़ेस के माध्यम से कॉन्फ़िगर किए जा सकते हैं, उनके लिए कॉपी-पेस्ट के लिए रेडी-वैल्यू दी जाती है। आप वांछित टूल को तुरंत चुन सकते हैं: npx @joingonka/setup --tool zed। प्रत्येक रन एक लाइव गेटवे क्वेरी के साथ समाप्त होता है, जो पुष्टि करता है कि कुंजी, पता और मॉडल स्वीकार कर लिए गए हैं।
DeepSeek V4 Flash के लिए एक सिंगल रिस्पॉन्स की अधिकतम लंबाई 4 गुना बढ़ा दी गई है: 8,192 से 32,768 टोकन (max_tokens पैरामीटर) तक। बड़ी फाइलें और एजेंट टूल के लंबे रिस्पॉन्स अब एक ही कॉल में समा जाते हैं। इसके अतिरिक्त: यदि रिस्पॉन्स टूल कॉल के बीच में ही लिमिट तक पहुँच जाता है, तो गेटवे टूटी हुई कॉल के बजाय एक सही finish_reason="length" लौटाता है — एजेंट क्लाइंट्स (Cursor और अन्य) पार्सिंग त्रुटि पर लटकने के बजाय सही ढंग से काम करना जारी रखते हैं।
Gonka नेटवर्क में तीसरा सक्रिय मॉडल आ गया है — DeepSeek V4 Flash 0731: 380,000 टोकन संदर्भ (नेटवर्क में सबसे लंबा, 381K के वास्तविक अनुरोध द्वारा सत्यापित), reasoning और tool calling। इसका आइडेंटिफायर deepseek-ai/DeepSeek-V4-Flash-0731 है, और कीमत अन्य मॉडलों के समान है। मॉडल शुरुआती परीक्षण में है, लेकिन पूरी तरह से उपलब्ध है: डैशबोर्ड चैट में इसे चुनें या अपने API अनुरोध के model फ़ील्ड में इसे निर्दिष्ट करें।
3 अगस्त से, इन्फरेन्स की लागत: इनपुट — 22 nGNK, आउटपुट — 66 nGNK प्रति टोकन (पिछले 11/33 से दोगुना) है। गेटवे शुल्क 10% पर अपरिवर्तित है। डेमो मोड मुफ़्त है। सभी मॉडलों की वर्तमान कीमतें Pricing पेज और GET /api/pricing पर उपलब्ध हैं।
यदि Gonka नेटवर्क को कोई अनुरोध मिलता है लेकिन वह प्रतिक्रिया नहीं देता है (300s टाइमआउट), तो गेटवे अब मौन पुन: प्रयास की श्रृंखला के बजाय तुरंत 504 त्रुटि लौटाता है। बिलिंग पर महत्वपूर्ण नोट: नेटवर्क द्वारा स्वीकार किए गए अनुरोध को रद्द नहीं किया जा सकता है — नोड इसे हर हाल में संसाधित करता है, इसलिए टाइमआउट के मामले में प्रॉम्प्ट प्रोसेसिंग का अनुमान काट लिया जाता है (completion के लिए शुल्क नहीं लिया जाता है)। अनुशंसा: लंबे जनरेशन के लिए, stream:true का उपयोग करें — स्ट्रीम टाइमआउट के प्रति अधिक प्रतिरोधी है और तुरंत प्रगति दिखाती है।
USDT के माध्यम से डिपॉजिट शुल्क अब राशि बढ़ने पर कम हो जाता है: आधार 5%, $25 से — 4.5%, $50 से — 4%, $100 से — 3.5%, $250 से — 3%, $500 से — 2.75%, $1000 से — 2.5%। डिपॉजिट डायलॉग में एक इंटरैक्टिव लैडर है: राशि स्लाइडर, प्रत्येक स्तर पर GNK बोनस और आपकी बचत। डिपॉजिट क्रेडिट होने पर छूट स्वतः लागू हो जाती है।
आप चाइल्ड कुंजियों के लिए कुल (संचयी) व्यय सीमा निर्धारित कर सकते हैं — एक समर्पित कोटा जो दैनिक या मासिक सीमाओं के विपरीत रीसेट नहीं होता है। कोटा समाप्त होने पर, कुंजी का उपयोग करने वाले अनुरोधों को अस्वीकार कर दिया जाता है। सीमा डैशबोर्ड में (nanogonka की सटीकता के साथ) या API के माध्यम से POST/PATCH /api/management/keys/{id}/children में limit_total_ngonka फ़ील्ड का उपयोग करके सेट की जाती है; संचयी उपयोग को "Reset usage" बटन (या POST /api/management/keys/{id}/children/{childId}/reset-usage) से रीसेट किया जाता है।
inferenced पर आने वाली लागत को प्रति टोकन वास्तविक Gonka नेटवर्क मूल्य के साथ सिंक किया गया है। कीमतें बाजार में सबसे कम बनी हुई हैं – प्रति मिलियन टोकन पर कुछ सेंट, जो समान open-source मॉडल के लिए OpenAI और Anthropic की तुलना में सैकड़ों गुना सस्ता है। अधिकांश प्रदाताओं की तरह, आउटपुट टोकन (output tokens) इनपुट टोकन (input tokens) की तुलना में अधिक महंगे (×3) हैं।
हमने सक्रिय मॉडल की वास्तविक कॉन्टेक्स्ट सीमा की पुष्टि की है – 200 000 टोकन तक (पहले कम करके 131 072 बताया गया था)। अब आप लंबे दस्तावेज़ और चैट इतिहास भेज सकते हैं; प्रत्येक मॉडल की वर्तमान विशेषताएं «नेटवर्क स्थिति» अनुभाग में उपलब्ध हैं।
प्रत्येक अनुरोध की लागत USD में दिखाई देती है — API रिस्पॉन्स (usage.total_cost_usd फ़ील्ड) और "उपयोग" अनुभाग में। खर्चों की योजना बनाना सुविधाजनक है।
अपने टूल में API एक्सेस को तुरंत सेटअप करें: npx @joingonka/setup चलाएँ। Claude Code, OpenClaw, Cline, Continue, opencode, Aider और अन्य के लिए सपोर्ट।
मॉडल रिस्पॉन्स के दौरान इंटरनेट पर सर्च करता है और सोर्स के लिंक जोड़ता है। कैसे सक्षम करें: रिक्वेस्ट बॉडी में plugins: [{ "id": "web", "max_results": 5 }] पास करें — यह OpenAI और Anthropic-संगत API में काम करता है।
अधिकतम रिस्पॉन्स लंबाई 8192 टोकन तक है; max_tokens पैरामीटर को नियंत्रित करें (डिफॉल्ट रूप से स्ट्रीमिंग के लिए 1024 और सामान्य के लिए 1500)।
चैट पेज पर सूची से एक मॉडल चुनें (जो /v1/models से लोड होता है) — चयन सहेजा जाता है और नई बातचीत पर लागू होता है।
क्या गति चाहिए? अनुरोध में x-joingonka-meta: 1 हेडर जोड़ें — स्ट्रीमिंग रिस्पॉन्स में आपको ttft_ms (पहले टोकन तक का समय) और tokens_per_sec मिलेंगे।
एक मैनेजमेंट की (POST /api/management/keys) बनाएँ और POST /api/management/keys/{id}/children के माध्यम से सीमा के साथ (दैनिक और मासिक कोटा, रेट लिमिट, अवधि) चाइल्ड कीज़ जनरेट करें।
किसी प्लगइन को plugins पैरामीटर के साथ कनेक्ट करें: response-healing कटे हुए JSON को ठीक करता है, privacy-sanitization निजी डेटा को मास्क करता है, file-parser PDF और दस्तावेजों से टेक्स्ट निकालता है।
OpenAI: base_url https://gate.joingonka.ai/v1, हेडर Authorization: Bearer आपकी-की। Anthropic (Claude Code): base_url https://gate.joingonka.ai, हेडर x-api-key, endpoint /v1/messages.
GNK: एड्रेस और memo प्राप्त करें और ऑन-चेन टोकन भेजें। USDT: 1 से 10,000 डॉलर तक की राशि निर्दिष्ट करें और OxaPay के माध्यम से भुगतान करें — GNK में रूपांतरण स्वचालित है।