更新与状态
当前推理状态和网关变更日志。
当前状态
- MiniMax M2.7Gonka 网络:性能下降
- DeepSeek V4 FlashGonka 网络:性能下降
- GLM 5.3 FlashGonka 网络:运行正常
活动模型集由 Gonka 网络投票决定,可能会发生变化:某些模型有时不可用,稍后会恢复。当前列表见上文。
详细状态与运行时间 →更新日志
您可以使用 WGNK 代币为余额充值 — 这是 Ethereum 网络上的 GNK。在账户中:充值 → GNK → Ethereum · WGNK;指定您发送代币的地址 — 转账将自动入账,通常需要 15–20 分钟。
npx @joingonka/setup 现在可配置 25 个工具。新增:Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush 和 Zoo Code。模型通过 --model 标志(minimax, deepseek 或 glm)进行选择,默认为 DeepSeek V4 Flash。最后,安装程序会发送验证请求并立即显示密钥是否有效。
从9月16日起,每个新账户将获得 100,000,000 nGNK (0.1 GNK),而非之前的 50,000,000 — 按当前网络价格计算,这大约相当于 300 万个代币,无需充值即可用于测试。奖励在注册时自动发放,无需任何操作;当前数额可在 GET /api/pricing(字段 welcome_bonus_ngonka)及注册页面查看。
Gonka 网络代理会在生成约 5 分钟后终止任何流(对于 GLM 5.3 Flash,大约是 8,000 token)。以前,这种截断看起来像正常结束:流以 [DONE] 结束且没有 finish_reason,客户端会将截断的部分误认为完整响应。现在,网关会在流和常规响应中附加一个带有 finish_reason="length" 的分块,而在 Anthropic 格式中为 stop_reason="max_tokens"。如何处理长响应:使用 stream:true,当出现 finish_reason="length" 时,通过在上下文中传递已接收的部分,使用下一个请求继续生成。详情请参阅文档中的“限制”部分。
Gonka 网络现已上线 Z.ai 的 GLM 5.3 Flash:320B 参数(MoE,18B 激活),FP8,MIT 许可证,390,000 上下文窗口。模型在回答前会进行推理:推理内容出现在 reasoning_content 字段中并消耗响应预算,因此请将 max_tokens 设置为至少 600 或使用 stream:true;短任务请使用 reasoning_effort: "low"。支持 Tool calling 和 JSON 模式。标识符为 zai-org/GLM-5.3-Flash,价格与其他网络模型相同。Kimi K2.6 已不再由网络维护,请将集成切换至 MiniMax M2.7、DeepSeek V4 Flash 或 GLM 5.3 Flash。
“使用情况”页面显示每个模型的消耗情况:请求数、输入/输出 token、nGNK 和美元计价的成本、每 1M token 的平均价格以及响应速度。“今天”按小时显示,并添加了“90 天”预设。集成方式:GET /api/usage/by-model。
网关现已支持对 /v1/completions 的请求 — 这是 OpenAI 的“文本”端点:输入为一个 prompt 字符串,输出为 choices[].text。编辑器插件(如 Continue.dev 等)通过此接口进行自动补全和内联代码编辑。Base URL 保持不变:https://gate.joingonka.ai/v1。支持流式传输和标准参数(max_tokens, temperature, stop),计费和限制与 /v1/chat/completions 相同。暂不支持 logprobs 和 best_of 字段。
自8月22日起,推理成本调整为:输入 33 nGNK,输出 99 nGNK/token(之前为 22/66)。网关手续费保持 10% 不变。演示模式依然免费。关于涨价原因:Gonka 网络中的请求处理带有冗余(redundancy),这是协议和 devshards 代码的一部分,旨在保证服务的流畅性。容器可能会向一个主机发送请求,若失败则发送给另一个,必要时还会同时向多个发送。每次尝试均需付费:网络价格为 10 nGNK/token,乘以请求的冗余度(平均 ×1—2.5)。此前由于价格结算 API 未生效,该成本未计入,我们仅按单台主机付费;现在已按实际成本核算,因此我们将其纳入定价。推理费用仍比供应商 API 便宜数百倍。所有型号的最新价格请查看 Pricing 页面及 GET /api/pricing。
网关现已支持 Responses 格式请求 — 这是 OpenAI 推出的新协议,已在最新 SDK 和 Codex CLI 中应用。基础地址不变:base URL https://gate.joingonka.ai/v1,客户端会自动调用 /v1/responses。支持流式传输、function tools 以及结构化输出 (text.format),费用和限制与 /v1/chat/completions 相同。我们不存储对话记录,因此 store 参数会被忽略,previous_response_id 将返回错误 — 请在 input 字段中传入完整历史记录。OpenAI 内置服务器工具 (web_search, file_search, code_interpreter) 不受支持;我们的网络搜索功能仍可通过 /v1/chat/completions 的 web 插件使用。
以前,Gonka 网络在 stream:true 模式下的故障会返回 200 代码,错误信息仅在 SSE chunk 内部可见:代理客户端会将此类响应误认为是空的成功响应而不会重试。现在,如果在网络响应尚未开始时发生错误,系统会返回标准的 HTTP 错误代码 — 模型过载时返回 429(附带 Retry-After 标头),超时返回 504,如果没有可用节点则返回 503。如果故障发生在流传输过程中,则无法更改状态:虽然仍然包含带有 error 字段的 chunk,但不再发送结束的 [DONE],以防止该流看起来像是成功完成的。
npx @joingonka/setup 现在可以配置 15 个代理工具:Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant 和 GitHub Copilot BYOK。对于其中七个工具,配置文件会被写入并与您的配置完美合并(保留注释和原有设置);对于其余仅能通过界面配置的工具,系统会打印出可直接复制的值。您可以直接指定工具:npx @joingonka/setup --tool zed。每次运行结束时,系统会向网关发送实时请求,以确认密钥、地址和模型均已成功接受。
DeepSeek V4 Flash 的单次响应最大长度增加了 4 倍:从 8,192 增加到 32,768 tokens (max_tokens 参数)。现在,大文件和 Agent 工具的长回复可以放入单次调用中。此外:如果回复在工具调用过程中达到限制,网关将返回正确的 finish_reason="length",而不是截断的调用 —— Agent 客户端(Cursor 等)可以正确地继续工作,而不会因解析错误而挂起。
Gonka 网络中出现了第三个活跃模型 —— DeepSeek V4 Flash 0731:支持 380,000 token 上下文(网络中最长,已通过 381K 真实请求验证)、推理 (reasoning) 和工具调用 (tool calling)。标识符为 deepseek-ai/DeepSeek-V4-Flash-0731,定价与其他模型相同。该模型处于早期测试阶段,但已完全可用:在仪表板聊天中选择它,或在 API 请求的 model 字段中指定即可。
自8月3日起,推理成本调整为:输入 22 nGNK,输出 66 nGNK 每个 token(是之前 11/33 的两倍)。网关费用保持不变,仍为 10%。演示模式保持免费。所有模型的最新价格请查看 Pricing 页面及 GET /api/pricing。
如果 Gonka 网络收到请求但未响应(300秒超时),网关现在会立即返回 504 错误,而不是进行一系列无声的重试。关于扣费的重要说明:网络已接受的请求无法取消 — 节点无论如何都会进行处理,因此即使超时,也会扣除提示词(prompt)处理费用(completion 不计费)。建议:对于长文本生成,请使用 stream:true — 流式传输对超时更具鲁棒性,并能即时显示进度。
USDT 充值手续费现随充值金额增加而降低:基础费率 5%,$25 起 — 4.5%,$50 起 — 4%,$100 起 — 3.5%,$250 起 — 3%,$500 起 — 2.75%,$1000 起 — 2.5%。充值对话框新增交互式阶梯显示:金额滑动条、每级 GNK 奖励以及您的节省金额。折扣将在入账时自动应用。
可以为子密钥设置总额(累积)消费限额,这是一个不会重置的专用配额,不同于每日或每月限额。配额用尽后,使用该密钥的请求将被拒绝。该限额可在仪表盘设置(精确到 nanogonka),或通过 API 使用 POST/PATCH /api/management/keys/{id}/children 中的 limit_total_ngonka 字段设置;通过“重置用量”按钮(或 POST /api/management/keys/{id}/children/{childId}/reset-usage)可清除累计消耗。
推理成本现已与 Gonka 网络的实际代币价格同步。价格保持市场最低水平——每百万代币仅需几分之几美分,在运行相同 open-source 模型的情况下,比 OpenAI 和 Anthropic 便宜数百倍。与大多数提供商一样,输出代币的定价高于输入代币 (×3)。
我们已确认活动模型的实际上下文限制——高达 200,000 token(之前公布的是保守的 131,072)。现在您可以发送更长的文档和对话历史记录;每种模型的当前参数可在“网络状态”部分查看。
每次请求的费用均以美元显示 — 在 API 响应(usage.total_cost_usd 字段)和“使用情况”页面中可见。方便规划预算。
自动配置工具中的 API 访问:执行 npx @joingonka/setup。支持 Claude Code, OpenClaw, Cline, Continue, opencode, Aider 等。
模型在响应时搜索互联网并添加引用链接。启用方法:在请求体中传入 plugins: [{ "id": "web", "max_results": 5 }] — 适用于 OpenAI 和 Anthropic 兼容的 API。
最大回复长度支持最高 8192 token;可通过 max_tokens 参数控制(流式响应默认 1024,普通响应默认 1500)。
在“聊天”页面,从列表中选择模型(从 /v1/models 加载)— 选择会被保存并应用于新的对话。
需要速度数据?向请求添加头部 x-joingonka-meta: 1 — 流式响应中将包含 ttft_ms(首 token 耗时)和 tokens_per_sec(每秒 token 数)。
创建管理密钥 (POST /api/management/keys),并通过 POST /api/management/keys/{id}/children 生成带有自定义限额(日/月额度、速率限制、有效期)的子密钥。
使用 plugins 参数连接插件:response-healing 修复损坏的 JSON,privacy-sanitization 屏蔽隐私数据,file-parser 从 PDF 和各类文档中提取文本。
OpenAI: base_url https://gate.joingonka.ai/v1, 头部 Authorization: Bearer 您的密钥。Anthropic (Claude Code): base_url https://gate.joingonka.ai, 头部 x-api-key, endpoint /v1/messages。
GNK: 获取地址和 memo 并进行链上转账。USDT: 指定 1 到 10,000 美元的金额并通过 OxaPay 支付 — 自动转换为 GNK。