Aktualizacje i status
Aktualny stan inferencji oraz historia zmian bramki (gateway).
Aktualny status
- MiniMax M2.7Sieć Gonka: Zmniejszona wydajność
- DeepSeek V4 FlashSieć Gonka: Zmniejszona wydajność
- GLM 5.3 FlashSieć Gonka: Działa
Zestaw aktywnych modeli jest określany w drodze głosowania sieci Gonka i może ulec zmianie: niektóre modele są czasowo niedostępne, a następnie wracają. Aktualna lista znajduje się powyżej.
Szczegółowy status i uptime →Historia aktualizacji
Możesz doładować swoje saldo tokenem WGNK — jest to GNK w sieci Ethereum. W swoim koncie: Doładuj → GNK → Ethereum · WGNK; podaj adres, z którego wyślesz tokeny — przelew zostanie zaksięgowany automatycznie, zazwyczaj w ciągu 15–20 minut.
npx @joingonka/setup konfiguruje teraz 25 narzędzi. Nowości: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush i Zoo Code. Model wybiera się za pomocą flagi --model (minimax, deepseek lub glm), domyślnie DeepSeek V4 Flash. Na końcu instalator wysyła żądanie weryfikacji i od razu pokazuje, czy klucz działa.
Od 16 września każde nowe konto otrzymuje 100 000 000 nGNK (0,1 GNK) zamiast 50 000 000 — przy obecnej cenie sieci jest to około 3 miliony tokenów na testy bez konieczności wpłaty. Bonus jest przyznawany automatycznie podczas rejestracji, nie trzeba nic wpisywać; aktualną kwotę zawsze można sprawdzić w GET /api/pricing (pole welcome_bonus_ngonka) oraz na stronie rejestracji.
Węzły sieci Gonka kończą każdy strumień po około 5 minutach generowania (dla GLM 5.3 Flash to około 8 000 tokenów). Wcześniej takie przerwanie wyglądało jak normalne zakończenie: strumień kończył się [DONE] bez finish_reason, a klient brał ucięty fragment za pełną odpowiedź. Teraz brama wysyła chunk z finish_reason="length" — zarówno w strumieniu, jak i w zwykłej odpowiedzi, a w formacie Anthropic jest to stop_reason="max_tokens". Co robić przy długich odpowiedziach: używaj stream:true, a przy finish_reason="length" kontynuuj generowanie w następnym zapytaniu, przekazując już otrzymaną część w kontekście. Szczegóły znajdują się w sekcji „Limity” w dokumentacji.
W sieci Gonka pojawił się GLM 5.3 Flash od Z.ai: 320B parametrów (MoE, 18B aktywnych), FP8, licencja MIT, kontekst 390 000 tokenów. Model myśli przed odpowiedzią: myślenie przychodzi w polu reasoning_content i zużywa budżet odpowiedzi, dlatego ustaw max_tokens na co najmniej 600 lub użyj stream:true; dla krótkich zadań — reasoning_effort: "low". Tool calling i tryb JSON działają. Identyfikator — zai-org/GLM-5.3-Flash, cena jest taka sama jak w przypadku innych modeli w sieci. Kimi K2.6 nie jest już obsługiwany przez sieć — przełącz swoje integracje na MiniMax M2.7, DeepSeek V4 Flash lub GLM 5.3 Flash.
Strona "Użycie" pokazuje zużycie dla każdego modelu: zapytania, tokeny wejściowe/wyjściowe, koszt w nGNK i dolarach, średnią cenę za 1M tokenów oraz prędkość odpowiedzi. "Dzisiaj" wyświetlane jest godzinowo, dodano również ustawienie "90 dni". Dla integracji: GET /api/usage/by-model.
Brama akceptuje teraz zapytania do /v1/completions — endpointu "text" OpenAI: przyjmuje ciąg prompt jako wejście i zwraca choices[].text jako wyjście. Jest to wykorzystywane przez wtyczki edytorów do autouzupełniania i edycji kodu inline (Continue.dev i podobne). Adres Base URL pozostaje bez zmian: https://gate.joingonka.ai/v1. Obsługiwany jest streaming i standardowe parametry (max_tokens, temperature, stop), przy tych samych kosztach i limitach co w /v1/chat/completions. Pola logprobs i best_of nie są obsługiwane.
Od 22 sierpnia koszt inferencji wynosi: wejście — 33 nGNK, wyjście — 99 nGNK za token (poprzednio 22/66). Prowizja bramki pozostaje bez zmian — 10%. Tryb demo pozostaje darmowy. Dlaczego wzrosło: zapytanie w sieci Gonka jest przetwarzane z redundancy — jest to część protokołu i kodu devshards, niezbędna dla płynności obsługi. Kontener może wysłać zapytanie do jednego hosta, następnie do kolejnego, jeśli pierwszy nie dał rady, a w razie potrzeby — od razu do kilku. Opłacana jest każda próba: cena sieciowa wynosi 10 nGNK za token, pomnożona przez redundancy zapytania (średnio ×1—2.5). Wcześniej ten koszt do nas nie docierał z powodu niedziałającego API finalizacji ceny i płaciliśmy jak za jeden host; teraz jest on liczony faktycznie i przenosimy go na cennik. Inferencja pozostaje setki razy tańsza niż API dostawców zewnętrznych. Aktualne ceny wszystkich modeli znajdują się na stronie Pricing oraz pod adresem GET /api/pricing.
Brama obsługuje zapytania w formacie Responses — nowym protokole OpenAI, na który przeszły najnowsze SDK i przez który działa Codex CLI. Adres pozostaje bez zmian: base URL https://gate.joingonka.ai/v1, klient sam skieruje się do /v1/responses. Streaming, function tools oraz ustrukturyzowane wyjście (text.format) działają, a koszty i limity są takie same jak w /v1/chat/completions. Nie przechowujemy dialogów, więc store jest ignorowany, a previous_response_id zwróci błąd — prosimy przesyłać całą historię w polu input. Wbudowane narzędzia serwerowe OpenAI (web_search, file_search, code_interpreter) nie są wspierane; nasze wyszukiwanie internetowe jest nadal dostępne przez wtyczkę web pod adresem /v1/chat/completions.
Wcześniej błędy sieciowe Gonka w trybie stream:true zwracały kod 200, a sam błąd był widoczny tylko wewnątrz SSE-chunk: klienci agentów traktowali taką odpowiedź jako pusty sukces i nie podejmowali ponownej próby. Teraz, zanim odpowiedź z sieci się rozpocznie, błąd jest zwracany standardowym kodem HTTP – 429 przy przeciążeniu modelu (z nagłówkiem Retry-After), 504 przy timeout, 503 jeśli nie ma wolnych node. Jeśli błąd wystąpi w trakcie strumienia, statusu nie można zmienić: nadal znajduje się tam chunk z polem error, ale końcowy [DONE] nie jest już wysyłany, aby taki strumień nie wyglądał na poprawnie zakończony.
npx @joingonka/setup konfiguruje teraz 15 narzędzi agentowych: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant oraz GitHub Copilot BYOK. Dla siedmiu z nich konfiguracja jest zapisywana i płynnie scalana z Twoją (komentarze i ustawienia użytkownika są zachowane), a dla pozostałych, konfigurowalnych wyłącznie przez interfejs, drukowane są gotowe wartości do wklejenia. Wybrane narzędzie można wskazać od razu: npx @joingonka/setup --tool zed. Każde uruchomienie kończy się aktywnym zapytaniem do gatewaya, które potwierdza, że klucz, adres i model zostały zaakceptowane.
Maksymalna długość pojedynczej odpowiedzi dla DeepSeek V4 Flash została zwiększona 4-krotnie: z 8 192 do 32 768 tokenów (parametr max_tokens). Duże pliki i długie odpowiedzi z narzędzi agentowych mieszczą się teraz w jednym wywołaniu. Dodatkowo: jeśli odpowiedź osiągnie limit w trakcie wywołania narzędzia, brama zwraca poprawne finish_reason="length" zamiast uciętego wywołania — klienci agentowi (Cursor i inni) kontynuują pracę poprawnie, zamiast zawieszać się na błędzie parsowania.
W sieci Gonka pojawił się trzeci aktywny model — DeepSeek V4 Flash 0731: 380 000 tokenów kontekstu (najdłuższy w sieci, zweryfikowany rzeczywistym zapytaniem 381K), obsługa reasoning i tool calling. Identyfikator to deepseek-ai/DeepSeek-V4-Flash-0731, cena jest taka sama jak w przypadku innych modeli. Model jest na wczesnym etapie testów, ale jest w pełni dostępny: wybierz go na czacie w dashboardzie lub określ w polu model w swoim zapytaniu API.
Od 3 sierpnia koszt inferencji wynosi: wejście — 22 nGNK, wyjście — 66 nGNK za token (dwukrotność poprzednich 11/33). Opłata za bramkę pozostaje bez zmian na poziomie 10%. Tryb demo pozostaje darmowy. Aktualne ceny wszystkich modeli znajdują się na stronie Pricing oraz pod GET /api/pricing.
Jeśli sieć Gonka otrzyma żądanie, ale nie odpowie (limit 300s), bramka zwraca teraz natychmiast błąd 504 zamiast serii cichych ponownych prób. Ważna uwaga dotycząca rozliczeń: żądanie zaakceptowane przez sieć nie może zostać anulowane — node przetwarza je w każdym przypadku, więc w razie przekroczenia czasu naliczana jest szacunkowa opłata za przetworzenie promptu (completion nie jest naliczane). Zalecenie: dla długich generacji używaj stream:true — strumieniowanie jest bardziej odporne na limity czasu i pokazuje postęp natychmiast.
Prowizja za wpłaty przez USDT maleje teraz wraz ze wzrostem kwoty: podstawa 5%, od $25 — 4.5%, od $50 — 4%, od $100 — 3.5%, od $250 — 3%, od $500 — 2.75%, od $1000 — 2.5%. W oknie wpłaty dostępna jest interaktywna drabinka: suwak kwoty, bonus GNK za każdy poziom oraz Twoje oszczędności. Zniżka jest naliczana automatycznie w momencie zaksięgowania.
Możesz ustawić całkowity (skumulowany) limit wydatków dla podkluczy — dedykowany przydział, który nie resetuje się, w przeciwieństwie do limitów dziennych lub miesięcznych. Po wyczerpaniu przydziału żądania używające klucza są odrzucane. Limit ustawia się w panelu nawigacyjnym (z dokładnością do nanogonka) lub przez API za pomocą pola limit_total_ngonka w POST/PATCH /api/management/keys/{id}/children; skumulowane zużycie zeruje się przyciskiem „Reset usage” (lub POST /api/management/keys/{id}/children/{childId}/reset-usage).
Koszt inferenced został zsynchronizowany z rzeczywistą ceną sieci Gonka za token. Ceny pozostają jednymi z najniższych na rynku – ułamki centa za milion tokenów, setki razy taniej niż w OpenAI i Anthropic przy tych samych modelach open-source. Tokeny wyjściowe (output tokens) są droższe od wejściowych (input tokens) (×3), podobnie jak u większości dostawców.
Potwierdziliśmy faktyczny limit kontekstu aktywnych modeli – do 200 000 tokenów (wcześniej podawano zaniżone 131 072). Można wysyłać dłuższe dokumenty i historie czatów; aktualne specyfikacje każdego modelu znajdują się w sekcji «Status sieci».
Koszt każdego zapytania jest widoczny w USD — w odpowiedzi API (pole usage.total_cost_usd) oraz w sekcji „Użycie”. Pozwala to na wygodne planowanie wydatków.
Skonfiguruj dostęp do API w swoim narzędziu automatycznie: wykonaj npx @joingonka/setup. Wsparcie dla Claude Code, OpenClaw, Cline, Continue, opencode, Aider i innych.
Model przeszukuje internet podczas generowania odpowiedzi i dodaje linki do źródeł. Jak włączyć: przekaż w ciele zapytania plugins: [{ "id": "web", "max_results": 5 }] — działa w API kompatybilnym z OpenAI i Anthropic.
Maksymalna długość odpowiedzi wynosi 8192 tokeny; zarządzaj parametrem max_tokens (domyślnie 1024 dla odpowiedzi strumieniowych i 1500 dla zwykłych).
Na stronie „Czat” wybierz model z listy (ładowanej z /v1/models) — wybór jest zapisywany i stosowany do nowych konwersacji.
Potrzebujesz szybkości? Dodaj do zapytania nagłówek x-joingonka-meta: 1 — w odpowiedzi strumieniowej otrzymasz ttft_ms (czas do pierwszego tokena) oraz tokens_per_sec.
Utwórz klucz zarządzający (POST /api/management/keys) i generuj klucze podrzędne z limitami (dzienny i miesięczny limit, rate limit, termin ważności) poprzez POST /api/management/keys/{id}/children.
Podłączaj wtyczki za pomocą parametru plugins: response-healing naprawia ucięty JSON, privacy-sanitization maskuje dane prywatne, file-parser wyodrębnia tekst z plików PDF i dokumentów.
OpenAI: base_url https://gate.joingonka.ai/v1, nagłówek Authorization: Bearer twój-klucz. Anthropic (Claude Code): base_url https://gate.joingonka.ai, nagłówek x-api-key, endpoint /v1/messages.
GNK: pobierz adres oraz memo i wyślij tokeny on-chain. USDT: określ kwotę od 1 do 10 000 dolarów i zapłać przez OxaPay — konwersja na GNK jest automatyczna.