업데이트 및 상태
현재 추론 상태 및 게이트웨이 변경 이력입니다.
현재 상태
- MiniMax M2.7Gonka 네트워크: 성능 저하
- DeepSeek V4 FlashGonka 네트워크: 성능 저하
- GLM 5.3 FlashGonka 네트워크: 운영 중
활성 모델 세트는 Gonka 네트워크 투표에 의해 결정되며 변경될 수 있습니다. 일부 모델은 일시적으로 사용이 제한될 수 있으나 나중에 복구됩니다. 최신 목록은 위를 참조하세요.
상세 상태 및 가동 시간 →업데이트 기록
WGNK 토큰으로 잔액을 충전할 수 있습니다. 이는 Ethereum 네트워크상의 GNK입니다. 계정 내에서: 입금 → GNK → Ethereum · WGNK; 토큰을 보낼 주소를 지정하세요. 전송은 일반적으로 15~20분 내에 자동으로 반영됩니다.
npx @joingonka/setup이 이제 25개의 도구를 설정합니다. 추가 사항: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush, Zoo Code. 모델은 --model 플래그(minimax, deepseek 또는 glm)로 선택하며 기본값은 DeepSeek V4 Flash입니다. 마지막에 설치 프로그램이 확인 요청을 보내고 키가 작동하는지 즉시 표시합니다.
9월 16일부터 모든 신규 계정은 기존 50,000,000 nGNK 대신 100,000,000 nGNK (0.1 GNK)를 받게 됩니다. 이는 현재 네트워크 가격 기준으로 입금 없이 테스트할 수 있는 약 300만 토큰에 해당합니다. 보너스는 가입 시 자동으로 지급되며 별도의 입력 절차는 없습니다. 현재 보너스 금액은 GET /api/pricing(welcome_bonus_ngonka 필드) 및 회원가입 페이지에서 항상 확인할 수 있습니다.
Gonka 네트워크 브로커는 약 5분의 생성 후 스트림을 종료합니다(GLM 5.3 Flash의 경우 약 8,000 토큰). 이전에는 이러한 잘림이 일반적인 종료처럼 보였습니다. 스트림이 finish_reason 없이 [DONE]으로 종료되어 클라이언트가 잘린 응답을 완전한 응답으로 착각했습니다. 이제 게이트웨이는 스트림과 일반 응답 모두에 finish_reason="length"를 포함한 청크를 전송하며, Anthropic 형식에서는 stop_reason="max_tokens"를 전송합니다. 긴 응답을 처리하는 방법: stream:true를 사용하고 finish_reason="length"가 발생하면 이전에 받은 부분을 컨텍스트에 전달하여 다음 요청으로 생성을 계속하십시오. 자세한 내용은 문서의 "제한" 섹션을 참조하십시오.
Gonka 네트워크에 Z.ai의 GLM 5.3 Flash가 추가되었습니다: 320B 파라미터(MoE, 활성 18B), FP8, MIT 라이선스, 390,000 토큰 컨텍스트. 모델은 답변 전에 추론합니다. 추론 내용은 reasoning_content 필드로 전달되며 응답 예산을 소모하므로 max_tokens를 600 이상으로 설정하거나 stream:true를 사용하세요. 짧은 작업은 reasoning_effort: "low"를 권장합니다. Tool calling 및 JSON 모드를 지원합니다. 식별자는 zai-org/GLM-5.3-Flash이며 가격은 네트워크의 다른 모델과 동일합니다. Kimi K2.6은 더 이상 지원되지 않으므로 MiniMax M2.7, DeepSeek V4 Flash 또는 GLM 5.3 Flash로 전환하십시오.
「사용량」 페이지에는 각 모델의 요청 수, 입력/출력 토큰, nGNK 및 달러 단위 비용, 1M 토큰당 평균 가격, 응답 속도가 표시됩니다. 「오늘」은 시간별로 표시되며 「90일」 프리셋이 추가되었습니다. 통합용: GET /api/usage/by-model.
게이트웨이가 /v1/completions (OpenAI의 "텍스트" 엔드포인트)에 대한 요청을 허용합니다. 프롬프트 문자열을 입력으로 받아 choices[].text를 출력으로 반환합니다. 이는 자동 완성 및 인라인 코드 편집(Continue.dev 등)을 위한 에디터 플러그인에서 사용됩니다. Base URL은 동일합니다: https://gate.joingonka.ai/v1. 스트리밍 및 표준 매개변수(max_tokens, temperature, stop)가 지원되며, 비용과 제한 사항은 /v1/chat/completions와 동일합니다. logprobs 및 best_of 필드는 지원되지 않습니다.
8월 22일부터 추론 비용이 다음과 같이 변경됩니다: 입력 33 nGNK, 출력 99 nGNK/token (기존 22/66). 게이트웨이 수수료는 10%로 동일합니다. 데모 모드는 무료로 유지됩니다. 가격 인상 이유: Gonka 네트워크의 요청은 중복성(redundancy)을 가지고 처리되는데, 이는 원활한 서비스 운영을 위해 필요한 프로토콜 및 devshards 코드의 일부입니다. 컨테이너는 하나의 호스트에 요청을 보내고, 첫 번째 호스트가 실패하면 다른 호스트로, 필요 시 여러 호스트로 동시에 요청을 보낼 수 있습니다. 모든 시도마다 비용이 발생합니다. 네트워크 가격은 10 nGNK/token에 요청의 중복도(평균 ×1—2.5)를 곱한 값입니다. 이전에는 가격 정산 API가 작동하지 않아 이 비용이 청구되지 않았고 단일 호스트 비용만 지불했으나, 이제는 실제 비용을 기준으로 계산되어 요금에 반영하게 되었습니다. 추론 서비스는 여전히 벤더 API보다 수백 배 저렴합니다. 모든 모델의 현재 가격은 Pricing 페이지 및 GET /api/pricing에서 확인하실 수 있습니다.
게이트웨이는 Responses 형식의 요청을 수용합니다. 이는 최신 SDK와 Codex CLI에서 채택된 OpenAI의 새로운 프로토콜입니다. 주소는 동일합니다: base URL https://gate.joingonka.ai/v1, 클라이언트가 자동으로 /v1/responses를 호출합니다. 스트리밍, function tools 및 구조화된 출력(text.format)을 지원하며 비용과 제한은 /v1/chat/completions와 동일합니다. 대화 기록을 저장하지 않으므로 store는 무시되며 previous_response_id는 오류를 반환합니다. 전체 기록은 input 필드에 전달해 주십시오. OpenAI 내장 서버 도구(web_search, file_search, code_interpreter)는 지원되지 않습니다. 당사의 웹 검색 기능은 /v1/chat/completions의 web 플러그인을 통해 계속 사용할 수 있습니다.
이전에는 stream:true 모드에서 Gonka 네트워크 오류 발생 시 200 코드가 반환되었고, 오류는 SSE 청크 내부에서만 확인 가능했습니다. 이로 인해 에이전트 클라이언트는 이러한 응답을 빈 성공 응답으로 오인하여 재시도를 하지 않았습니다. 이제는 네트워크 응답이 시작되기 전에 오류가 발생하면 표준 HTTP 코드로 반환됩니다 (모델 과부하 시 429 (Retry-After 헤더 포함), 시간 초과 시 504, 사용 가능한 노드가 없을 시 503). 스트림 중간에 오류가 발생하면 상태를 변경할 수 없습니다. 여전히 error 필드가 포함된 청크는 존재하지만, 마지막 [DONE]이 전송되지 않아 스트림이 정상적으로 완료된 것처럼 보이지 않게 처리됩니다.
npx @joingonka/setup은 이제 Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant, GitHub Copilot BYOK 등 15개의 에이전트 도구를 구성합니다. 그중 7개는 설정 파일이 작성되어 기존 설정과 깔끔하게 병합되며(주석 및 기존 설정 유지), 인터페이스를 통해서만 설정 가능한 나머지 도구는 즉시 붙여넣을 수 있는 값으로 출력됩니다. 도구를 즉시 선택할 수도 있습니다: npx @joingonka/setup --tool zed. 각 실행이 끝날 때마다 게이트웨이에 실시간 요청을 보내 키, 주소, 모델이 성공적으로 승인되었는지 확인합니다.
DeepSeek V4 Flash의 단일 응답 최대 길이가 4배 증가했습니다: 8,192에서 32,768 토큰(max_tokens 매개변수). 이제 대용량 파일과 에이전트 도구의 긴 응답을 한 번의 호출로 처리할 수 있습니다. 추가적으로, 도구 호출 도중 제한에 도달할 경우, 게이트웨이는 잘린 호출 대신 정확한 finish_reason="length"를 반환하므로 에이전트 클라이언트(Cursor 등)가 구문 분석 오류로 멈추지 않고 올바르게 작업을 계속할 수 있습니다.
Gonka 네트워크에 세 번째 활성 모델인 DeepSeek V4 Flash 0731이 추가되었습니다. 380,000 토큰 컨텍스트(네트워크 내 최장 길이, 381K 실제 요청으로 검증됨), reasoning 및 tool calling을 지원합니다. 식별자는 deepseek-ai/DeepSeek-V4-Flash-0731이며, 가격은 기존 모델과 동일합니다. 초기 테스트 단계이지만 완전하게 이용 가능합니다. 대시보드 채팅에서 선택하거나 API 요청의 model 필드에 지정하여 사용하세요.
8월 3일부터 추론 비용이 입력 22 nGNK, 출력 66 nGNK(토큰당)로 변경됩니다(기존 11/33의 두 배). 게이트웨이 수수료는 10%로 동일합니다. 데모 모드는 무료로 유지됩니다. 모든 모델의 최신 가격은 Pricing 페이지와 GET /api/pricing에서 확인할 수 있습니다.
Gonka 네트워크가 요청을 수신했으나 응답하지 않는 경우(300초 타임아웃), 게이트웨이는 이제 조용한 재시도 대신 즉시 504 오류를 반환합니다. 과금 관련 중요 사항: 네트워크가 수락한 요청은 취소할 수 없으며 노드가 처리하므로, 타임아웃 발생 시 프롬프트 처리 예상 비용이 차감됩니다(completion은 과금되지 않음). 권장 사항: 긴 생성을 위해서는 stream:true를 사용하세요. 스트리밍은 타임아웃에 더 안정적이며 진행 상황을 즉시 확인할 수 있습니다.
USDT 입금 수수료가 금액에 따라 낮아집니다: 기본 5%, $25 이상 — 4.5%, $50 이상 — 4%, $100 이상 — 3.5%, $250 이상 — 3%, $500 이상 — 2.75%, $1000 이상 — 2.5%. 입금 대화 상자에 인터랙티브 래더가 추가되어 금액 조절 슬라이더, 각 단계별 GNK 보너스 및 절약 금액을 확인할 수 있습니다. 할인은 입금 시 자동으로 적용됩니다.
자식 키에 대해 전체(누적) 소비 한도를 설정할 수 있으며, 이는 일일 또는 월간 한도와 달리 재설정되지 않는 전용 쿼터입니다. 쿼터가 소진되면 해당 키를 사용하는 요청은 거부됩니다. 한도는 대시보드에서 (nanogonka 단위의 정밀도로) 설정하거나 API의 POST/PATCH /api/management/keys/{id}/children 내 limit_total_ngonka 필드를 사용하여 설정할 수 있습니다. 누적 사용량은 "Reset usage" 버튼(또는 POST /api/management/keys/{id}/children/{childId}/reset-usage)을 통해 초기화할 수 있습니다.
추론 비용이 실제 Gonka 네트워크 토큰 가격과 동기화되었습니다. 가격은 시장 최저 수준을 유지하고 있으며, 동일한 open-source 모델 사용 시 OpenAI나 Anthropic보다 수백 배 저렴한 100만 토큰당 소액의 비용으로 이용 가능합니다. 대부분의 제공업체와 마찬가지로 출력 토큰은 입력 토큰보다 비싸게(×3) 책정됩니다.
활성 모델의 실제 컨텍스트 제한이 최대 200,000 토큰임을 확인했습니다(기존에는 보수적인 수치인 131,072가 게시되었습니다). 이제 더 긴 문서와 대화 기록을 보낼 수 있습니다. 각 모델의 현재 사양은 '네트워크 상태(Network Status)' 섹션에서 확인할 수 있습니다.
각 요청 비용은 API 응답(usage.total_cost_usd 필드) 및 '사용량' 섹션에서 달러 단위로 확인할 수 있어 비용 관리에 용이합니다.
도구에서 자동으로 API 접근을 설정하세요: npx @joingonka/setup을 실행하십시오. Claude Code, OpenClaw, Cline, Continue, opencode, Aider 등을 지원합니다.
모델이 응답 중 인터넷을 검색하고 소스 링크를 추가합니다. 활성화 방법: 요청 본문에 plugins: [{ "id": "web", "max_results": 5 }]를 전달하세요. OpenAI 및 Anthropic 호환 API에서 작동합니다.
최대 응답 길이는 8192 토큰까지 지원하며, max_tokens 매개변수로 제어 가능합니다(기본값: 스트리밍 응답 시 1024, 일반 응답 시 1500).
'채팅' 페이지에서 목록 중 모델을 선택하십시오(/v1/models에서 로드). 선택 사항은 저장되며 새 대화에 적용됩니다.
속도가 필요하신가요? 요청에 x-joingonka-meta: 1 헤더를 추가하면 스트리밍 응답 시 ttft_ms(첫 토큰까지 시간)와 tokens_per_sec가 포함됩니다.
관리 키를 생성(POST /api/management/keys)하고 POST /api/management/keys/{id}/children을 통해 제한이 있는(일일/월간 쿼터, 속도 제한, 만료일) 하위 키를 발급할 수 있습니다.
plugins 매개변수로 플러그인을 연결하세요: response-healing은 잘린 JSON을 복구하고, privacy-sanitization은 개인정보를 마스킹하며, file-parser는 PDF 및 문서에서 텍스트를 추출합니다.
OpenAI: base_url https://gate.joingonka.ai/v1, 헤더 Authorization: Bearer {당신의 키} . Anthropic (Claude Code): base_url https://gate.joingonka.ai, 헤더 x-api-key, 엔드포인트 /v1/messages.
GNK: 주소와 memo를 확인하여 온체인 토큰을 전송하세요. USDT: 1~10,000달러 범위의 금액을 지정하고 OxaPay를 통해 결제하면 자동으로 GNK로 환전됩니다.