Updates und Status
Aktueller Status der Inferenz und Änderungshistorie des Gateways.
Aktueller Status
- MiniMax M2.7Gonka Network: Leistung verschlechtert
- DeepSeek V4 FlashGonka Network: Leistung verschlechtert
- GLM 5.3 FlashGonka Network: Betriebsbereit
Das Set der aktiven Modelle wird durch Gonka-Netzwerkabstimmungen bestimmt und kann sich ändern: Einige Modelle sind zeitweise nicht verfügbar und kehren später zurück. Die aktuelle Liste finden Sie oben.
Detaillierter Status und Uptime →Update-Historie
Sie können Ihr Guthaben mit dem WGNK-Token aufladen – das ist GNK im Ethereum-Netzwerk. In Ihrem Konto: Einzahlen → GNK → Ethereum · WGNK; geben Sie die Adresse an, von der Sie die Tokens senden werden – die Überweisung wird automatisch gutgeschrieben, in der Regel in 15–20 Minuten.
npx @joingonka/setup konfiguriert jetzt 25 Tools. Neu hinzugefügt: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush und Zoo Code. Das Modell wird über den Flag --model (minimax, deepseek oder glm) ausgewählt, wobei DeepSeek V4 Flash der Standard ist. Am Ende sendet der Installer eine Verifizierungsanfrage und zeigt sofort an, ob der Schlüssel funktioniert.
Ab dem 16. September erhält jedes neue Konto 100.000.000 nGNK (0,1 GNK) statt 50.000.000 — zum aktuellen Netzwerkpreis entspricht dies etwa 3 Millionen Token für Tests ohne Einzahlung. Der Bonus wird bei der Registrierung automatisch gutgeschrieben, es ist keine Eingabe erforderlich; der aktuelle Betrag ist jederzeit unter GET /api/pricing (Feld welcome_bonus_ngonka) und auf der Registrierungsseite sichtbar.
Die Knoten des Gonka-Netzwerks beenden jeden Stream nach etwa 5 Minuten Generierung (für GLM 5.3 Flash entspricht dies etwa 8.000 Token). Bisher sah dieser Abbruch wie ein normaler Abschluss aus: Der Stream endete mit [DONE] ohne finish_reason, und der Client hielt das Fragment für eine vollständige Antwort. Jetzt sendet das Gateway einen Chunk mit finish_reason="length" – sowohl im Stream als auch in der normalen Antwort, und im Anthropic-Format ist dies stop_reason="max_tokens". Was Sie bei langen Antworten tun sollten: Verwenden Sie stream:true und setzen Sie bei finish_reason="length" die Generierung mit einer neuen Anfrage fort, wobei Sie den bereits erhaltenen Teil im Kontext übergeben. Details finden Sie im Abschnitt „Limits“ in der Dokumentation.
Im Gonka-Netzwerk ist jetzt GLM 5.3 Flash von Z.ai verfügbar: 320B Parameter (MoE, 18B aktiv), FP8, MIT-Lizenz, 390 000 Token Kontext. Das Modell denkt vor der Antwort nach: Das Nachdenken erscheint im Feld reasoning_content und verbraucht das Antwortbudget, daher setzen Sie max_tokens auf mindestens 600 oder verwenden Sie stream:true; für kurze Aufgaben — reasoning_effort: "low". Tool calling und JSON-Modus funktionieren. Die ID lautet zai-org/GLM-5.3-Flash, der Preis ist der gleiche wie bei den anderen Modellen des Netzwerks. Kimi K2.6 wird vom Netzwerk nicht mehr unterstützt — stellen Sie Ihre Integrationen auf MiniMax M2.7, DeepSeek V4 Flash oder GLM 5.3 Flash um.
Die Seite "Nutzung" zeigt den Verbrauch für jedes Modell: Anfragen, Eingabe-/Ausgabetoken, Kosten in nGNK und Dollar, Durchschnittspreis pro 1M Token und Reaktionsgeschwindigkeit. "Heute" wird stündlich angezeigt und eine "90 Tage"-Voreinstellung wurde hinzugefügt. Für Integrationen: GET /api/usage/by-model.
Das Gateway akzeptiert jetzt Anfragen an /v1/completions — den "Text"-Endpunkt von OpenAI: Er nimmt einen Prompt-String als Eingabe entgegen und gibt choices[].text als Ausgabe zurück. Dies wird von Editor-Plugins für Autocomplete und Inline-Codebearbeitung (Continue.dev und ähnliche) genutzt. Die Base URL bleibt unverändert: https://gate.joingonka.ai/v1. Streaming und Standardparameter (max_tokens, temperature, stop) werden unterstützt, mit den gleichen Kosten und Limits wie bei /v1/chat/completions. Die Felder logprobs und best_of werden nicht unterstützt.
Ab dem 22. August betragen die Kosten für Inference: Input — 33 nGNK, Output — 99 nGNK pro Token (bisher 22/66). Die Gateway-Gebühr bleibt unverändert bei 10%. Der Demo-Modus bleibt kostenlos. Warum der Anstieg: Ein Request im Gonka-Netzwerk wird mit Redundancy verarbeitet — dies ist ein Teil des Protokolls und des devshards-Codes, um einen reibungslosen Betrieb zu gewährleisten. Ein Container kann einen Request an einen Host senden, dann an einen anderen, falls der erste nicht reagiert, oder bei Bedarf sofort an mehrere. Jeder Versuch wird bezahlt: Netzwerkpreis 10 nGNK pro Token, multipliziert mit der Redundancy des Requests (durchschnittlich ×1—2.5). Früher erreichte uns diese Kostenstelle aufgrund eines nicht funktionierenden Preis-Finalisierungs-API nicht und wir zahlten nur für einen Host; jetzt wird sie tatsächlich berechnet und wir übertragen sie auf den Tarif. Inference bleibt um ein Hundertfaches günstiger als Vendor-APIs. Aktuelle Preise aller Modelle finden Sie auf der Pricing-Seite und via GET /api/pricing.
Das Gateway akzeptiert Anfragen im Responses-Format — einem neuen OpenAI-Protokoll, auf das aktuelle SDKs umgestellt haben und über das Codex CLI funktioniert. Die Adresse bleibt gleich: base URL https://gate.joingonka.ai/v1, der Client greift automatisch auf /v1/responses zu. Streaming, function tools und strukturierte Ausgabe (text.format) funktionieren, Kosten und Limits sind identisch mit /v1/chat/completions. Wir speichern keine Dialoge, daher wird store ignoriert und previous_response_id gibt einen Fehler zurück — bitte übermitteln Sie die gesamte Historie im Feld input. Integrierte OpenAI-Server-Tools (web_search, file_search, code_interpreter) werden nicht unterstützt; unsere Websuche ist weiterhin über das web-Plugin unter /v1/chat/completions verfügbar.
Früher wurden Netzwerkfehler von Gonka im stream:true-Modus mit einem 200-Code zurückgegeben, während der Fehler selbst nur innerhalb des SSE-Chunks sichtbar war: Agent-Clients hielten eine solche Antwort für eine leere Erfolgsmeldung und führten keinen Retry durch. Jetzt wird der Fehler vor Beginn der Antwort als Standard-HTTP-Code ausgegeben – 429 bei Modellüberlastung (mit Retry-After-Header), 504 bei Timeout, 503 wenn keine freien Nodes verfügbar sind. Wenn der Fehler mitten im Stream auftritt, kann der Status nicht geändert werden: Dort befindet sich weiterhin ein Chunk mit einem error-Feld, aber das abschließende [DONE] wird nicht mehr gesendet, damit ein solcher Stream nicht als erfolgreich abgeschlossen erscheint.
npx @joingonka/setup konfiguriert jetzt 15 Agent-Tools: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant und GitHub Copilot BYOK. Für sieben davon wird die Konfiguration geschrieben und sauber mit Ihrer zusammengeführt (Kommentare und bestehende Einstellungen bleiben erhalten), für die anderen – die nur über die Benutzeroberfläche konfiguriert werden können – werden fertige Werte zum Einfügen ausgegeben. Das gewünschte Tool kann sofort ausgewählt werden: npx @joingonka/setup --tool zed. Jeder Durchlauf endet mit einer Live-Abfrage am Gateway, die bestätigt, dass Schlüssel, Adresse und Modell akzeptiert wurden.
Die maximale Länge einer einzelnen Antwort für DeepSeek V4 Flash wurde um das Vierfache erhöht: von 8.192 auf 32.768 Tokens (max_tokens-Parameter). Große Dateien und lange Antworten von Agent-Tools passen nun in einen einzigen Aufruf. Zusätzlich: Wenn die Antwort mitten im Tool-Aufruf das Limit erreicht, gibt das Gateway ein korrektes finish_reason="length" zurück, anstatt einen abgeschnittenen Aufruf — Agent-Clients (Cursor und andere) arbeiten korrekt weiter, anstatt wegen eines Parsing-Fehlers hängenzubleiben.
Ein drittes aktives Modell ist im Gonka-Netzwerk verfügbar — DeepSeek V4 Flash 0731: 380.000 Token Kontext (der längste im Netzwerk, durch eine reale 381K-Anfrage verifiziert), reasoning und tool calling. Die Kennung lautet deepseek-ai/DeepSeek-V4-Flash-0731, die Preise sind identisch mit denen der anderen Modelle. Das Modell befindet sich in der frühen Testphase, ist aber vollständig verfügbar: Wählen Sie es im Dashboard-Chat aus oder geben Sie es im Feld model Ihrer API-Anfrage an.
Ab dem 3. August betragen die Inferenzkosten: Eingang — 22 nGNK, Ausgang — 66 nGNK pro Token (das Doppelte der bisherigen 11/33). Die Gateway-Gebühr bleibt unverändert bei 10%. Der Demo-Modus bleibt kostenlos. Die aktuellen Preise für alle Modelle finden Sie auf der Pricing-Seite und unter GET /api/pricing.
Wenn das Gonka-Netzwerk eine Anfrage erhält, aber nicht antwortet (300s Timeout), gibt das Gateway jetzt sofort einen 504-Fehler zurück, anstatt eine Reihe stummer Wiederholungsversuche durchzuführen. Wichtiger Hinweis zur Abrechnung: Eine vom Netzwerk akzeptierte Anfrage kann nicht storniert werden — der Node verarbeitet sie in jedem Fall, daher wird bei einem Timeout die geschätzte Prompt-Verarbeitung abgezogen (die completion wird nicht berechnet). Empfehlung: Verwenden Sie für lange Generierungen stream:true — Streaming ist resistenter gegen Timeouts und zeigt den Fortschritt sofort an.
Die Gebühr für Einzahlungen via USDT sinkt nun mit zunehmendem Betrag: Basis 5%, ab $25 — 4.5%, ab $50 — 4%, ab $100 — 3.5%, ab $250 — 3%, ab $500 — 2.75%, ab $1000 — 2.5%. Der Einzahlungsdialog enthält eine interaktive Staffelung: Betrag-Schieberegler, GNK-Bonus für jede Stufe und Ihre Ersparnisse. Der Rabatt wird bei der Gutschrift automatisch angewendet.
Sie können ein gesamtes (kumulatives) Ausgabenlimit für untergeordnete Schlüssel festlegen – ein dediziertes Kontingent, das im Gegensatz zu täglichen oder monatlichen Limits nicht zurückgesetzt wird. Sobald das Kontingent aufgebraucht ist, werden Anfragen mit diesem Schlüssel abgelehnt. Das Limit wird im Dashboard (mit nanogonka-Präzision) oder über die API im Feld limit_total_ngonka unter POST/PATCH /api/management/keys/{id}/children eingestellt; der kumulierte Verbrauch wird über die Schaltfläche "Reset usage" (oder POST /api/management/keys/{id}/children/{childId}/reset-usage) zurückgesetzt.
Die Kosten für inferenced sind mit dem tatsächlichen Gonka-Netzwerkpreis pro Token synchronisiert. Die Preise bleiben einige der niedrigsten auf dem Markt – Bruchteile eines Cents pro Million Token, Hunderte Male günstiger als OpenAI und Anthropic bei denselben open-source Modellen. Ausgabesegmente (Output-Token) werden teurer berechnet als Eingabesegmente (Input-Token) (×3), wie bei den meisten Anbietern.
Wir haben das tatsächliche Kontextlimit der aktiven Modelle bestätigt – bis zu 200 000 Token (zuvor wurden niedrigere 131 072 angegeben). Sie können jetzt längere Dokumente und Chat-Verläufe senden; die aktuellen Spezifikationen jedes Modells finden Sie im Bereich «Netzwerkstatus».
Die Kosten jeder Anfrage werden in USD angezeigt – in der API-Antwort (Feld usage.total_cost_usd) und im Bereich „Nutzung“. Praktisch für die Budgetplanung.
Konfigurieren Sie den API-Zugang in Ihrem Tool automatisch: führen Sie npx @joingonka/setup aus. Unterstützt Claude Code, OpenClaw, Cline, Continue, opencode, Aider und weitere.
Das Modell durchsucht das Internet während der Antwortgenerierung und fügt Quellenlinks hinzu. Aktivierung: Übergeben Sie im Anfrage-Body plugins: [{ "id": "web", "max_results": 5 }] – funktioniert in der OpenAI- und Anthropic-kompatiblen API.
Die maximale Antwortlänge beträgt bis zu 8192 Token; steuern Sie dies über den Parameter max_tokens (Standardwert: 1024 für Streaming-Antworten und 1500 für reguläre Antworten).
Wählen Sie auf der „Chat“-Seite ein Modell aus der Liste (wird von /v1/models geladen) – die Auswahl wird gespeichert und auf neue Dialoge angewendet.
Brauchen Sie Geschwindigkeit? Fügen Sie den Header x-joingonka-meta: 1 zur Anfrage hinzu – in der Streaming-Antwort werden ttft_ms (Zeit bis zum ersten Token) und tokens_per_sec übermittelt.
Erstellen Sie einen Management-Schlüssel (POST /api/management/keys) und generieren Sie untergeordnete Schlüssel mit Limits (tägliche/monatliche Quote, Rate Limit, Laufzeit) über POST /api/management/keys/{id}/children.
Binden Sie Plugins mit dem Parameter plugins ein: response-healing repariert abgeschnittenes JSON, privacy-sanitization maskiert private Daten, file-parser extrahiert Text aus PDF und Dokumenten.
OpenAI: base_url https://gate.joingonka.ai/v1, Header Authorization: Bearer Ihr-Schlüssel. Anthropic (Claude Code): base_url https://gate.joingonka.ai, Header x-api-key, endpoint /v1/messages.
GNK: Adresse und Memo abrufen und Token on-chain senden. USDT: Betrag zwischen 1 und 10.000 USD angeben und über OxaPay bezahlen – die Konvertierung in GNK erfolgt automatisch.