Actualizaciones y estado
Estado actual de inferenced e historial de cambios de la pasarela.
Estado actual
- MiniMax M2.7Red Gonka: Rendimiento degradado
- DeepSeek V4 FlashRed Gonka: Rendimiento degradado
- GLM 5.3 FlashRed Gonka: Operativa
El conjunto de modelos activos se define mediante la votación de la red Gonka y puede cambiar: algunos modelos pueden no estar disponibles temporalmente y volver más tarde. La lista actual se encuentra arriba.
Estado detallado y uptime →Historial de actualizaciones
Puede recargar su saldo con el token WGNK, que es GNK en la red Ethereum. En su cuenta: Recargar → GNK → Ethereum · WGNK; indique la dirección desde la que enviará los tokens; la transferencia se acreditará automáticamente, normalmente en 15–20 minutos.
npx @joingonka/setup ahora configura 25 herramientas. Nuevas: Codex CLI, Kimi Code, omp, MiniMax Code, Goose, MiMo Code, Qwen Code, Factory Droid, Crush y Zoo Code. El modelo se selecciona mediante el flag --model (minimax, deepseek o glm), siendo DeepSeek V4 Flash el valor predeterminado. Al final, el instalador envía una solicitud de verificación y muestra inmediatamente si la clave funciona.
Desde el 16 de septiembre, cada nueva cuenta recibe 100,000,000 nGNK (0.1 GNK) en lugar de 50,000,000; al precio actual de la red, esto equivale a unos 3 millones de tokens para realizar pruebas sin necesidad de depósito. El bono se acredita automáticamente al registrarse, no se requiere ninguna acción; el monto actual siempre es visible en GET /api/pricing (campo welcome_bonus_ngonka) y en la página de registro.
Los brokers de la red Gonka terminan cualquier stream después de aproximadamente 5 minutos de generación (para GLM 5.3 Flash, esto es aproximadamente 8,000 tokens). Anteriormente, dicho corte parecía una finalización normal: el stream terminaba con [DONE] sin finish_reason, y el cliente confundía el fragmento con una respuesta completa. Ahora, la pasarela envía un chunk con finish_reason="length" tanto en el stream como en la respuesta normal, y stop_reason="max_tokens" en el formato Anthropic. Qué hacer con las respuestas largas: utilice stream:true y, al obtener finish_reason="length", continúe la generación con la siguiente solicitud pasando la parte ya recibida en el contexto. Los detalles se encuentran en la sección "Límites" de la documentación.
GLM 5.3 Flash de Z.ai ha llegado a la red Gonka: 320B de parámetros (MoE, 18B activos), FP8, licencia MIT, ventana de contexto de 390,000 tokens. El modelo razona antes de responder: el razonamiento llega en el campo reasoning_content y consume el presupuesto de respuesta, por lo que debe configurar max_tokens en al menos 600 o usar stream:true; para tareas cortas — reasoning_effort: "low". Tool calling y modo JSON funcionan correctamente. Identificador — zai-org/GLM-5.3-Flash, el precio es el mismo que el de otros modelos de la red. Kimi K2.6 ya no es soportado por la red — cambie las integraciones a MiniMax M2.7, DeepSeek V4 Flash o GLM 5.3 Flash.
La página «Uso» muestra el consumo de cada modelo: solicitudes, tokens de entrada/salida, costo en nGNK y dólares, precio promedio por 1M de tokens y velocidad de respuesta. «Hoy» se muestra por horas y se agregó el ajuste preestablecido «90 días». Para integraciones: GET /api/usage/by-model.
El gateway ahora acepta solicitudes a /v1/completions — el endpoint "text" de OpenAI: toma una cadena prompt como entrada y devuelve choices[].text como salida. Es utilizado por plugins de edición para autocompletado y edición de código inline (Continue.dev y similares). La Base URL permanece igual: https://gate.joingonka.ai/v1. Se admite streaming y parámetros estándar (max_tokens, temperature, stop), con los mismos costos y límites que /v1/chat/completions. Los campos logprobs y best_of no están soportados.
A partir del 22 de agosto, el coste de inferencia es: entrada — 33 nGNK, salida — 99 nGNK por token (antes 22/66). La comisión de la pasarela se mantiene en el 10%. El modo demo sigue siendo gratuito. Por qué aumentó: una solicitud en la red Gonka se procesa con redundancia — esto es parte del protocolo y del código devshards, necesario para la fluidez del servicio. Un contenedor puede enviar una solicitud a un host, luego a otro si el primero no responde, o a varios si es necesario. Se paga cada intento: el precio de la red es de 10 nGNK por token, multiplicado por la redundancia de la solicitud (en promedio ×1—2.5). Anteriormente, este coste no nos llegaba debido a que la API de finalización de precios no funcionaba, y pagábamos como por un solo host; ahora se calcula según lo real y lo trasladamos a la tarifa. La inferencia sigue siendo cientos de veces más barata que las API de los proveedores. Los precios actuales de todos los modelos están en la página Pricing y en GET /api/pricing.
La pasarela acepta solicitudes en formato Responses, un nuevo protocolo de OpenAI adoptado por los SDK más recientes y utilizado por Codex CLI. La dirección sigue siendo la misma: base URL https://gate.joingonka.ai/v1, el cliente llamará automáticamente a /v1/responses. Son compatibles el streaming, function tools y la salida estructurada (text.format); los costos y límites son los mismos que para /v1/chat/completions. No almacenamos diálogos, por lo que store se ignora y previous_response_id devolverá un error; por favor, pase todo el historial en el campo input. Las herramientas de servidor integradas de OpenAI (web_search, file_search, code_interpreter) no son compatibles; nuestra búsqueda web sigue disponible a través del plugin web en /v1/chat/completions.
Anteriormente, los fallos de la red Gonka en modo stream:true devolvían un código 200 y el error solo era visible dentro del chunk de SSE: los clientes agentes interpretaban estas respuestas como exitosas pero vacías y no realizaban reintentos. Ahora, si la respuesta de la red aún no ha comenzado, el error se entrega con un código HTTP estándar: 429 por sobrecarga del modelo (con el encabezado Retry-After), 504 por tiempo de espera y 503 si no quedan nodos libres. Si el fallo ocurre a mitad del flujo, el estatus no se puede cambiar: todavía contiene un chunk con un campo error, pero ya no se envía el [DONE] final, de modo que el flujo no parezca haberse completado normalmente.
npx @joingonka/setup ahora configura 15 herramientas de agente: Claude Code, OpenClaw, Cursor, Cline, opencode, Aider, Kilo Code, Roo Code, Continue, Hermes, Pi, Zed, ZCode, JetBrains AI Assistant y GitHub Copilot BYOK. Para siete de ellas, la configuración se escribe y se fusiona limpiamente con la suya (se conservan los comentarios y los ajustes existentes); para el resto, que solo se configuran mediante interfaz, se imprimen valores listos para copiar. Puede seleccionar una herramienta específica inmediatamente: npx @joingonka/setup --tool zed. Cada ejecución concluye con una solicitud en vivo a la pasarela, confirmando que la clave, la dirección y el modelo han sido aceptados.
La longitud máxima de una respuesta única para DeepSeek V4 Flash se ha incrementado 4 veces: de 8,192 a 32,768 tokens (parámetro max_tokens). Los archivos grandes y las respuestas largas de herramientas de agentes ahora caben en una sola llamada. Además: si la respuesta alcanza el límite en medio de una llamada de herramienta, la puerta de enlace devuelve un finish_reason="length" adecuado en lugar de una llamada truncada; los clientes de agentes (Cursor y otros) continúan funcionando correctamente en lugar de colgarse por un error de análisis.
Ha aparecido un tercer modelo activo en la red Gonka: DeepSeek V4 Flash 0731: contexto de 380,000 tokens (el más largo de la red, verificado mediante una solicitud real de 381K), reasoning y tool calling. El identificador es deepseek-ai/DeepSeek-V4-Flash-0731, el precio es el mismo que el de los otros modelos. El modelo está en fase de prueba temprana pero totalmente disponible: selecciónelo en el chat del panel o especifíquelo en el campo model de su solicitud de API.
A partir del 3 de agosto, el costo de inferencia es: entrada — 22 nGNK, salida — 66 nGNK por token (el doble de los 11/33 anteriores). La comisión de la pasarela se mantiene sin cambios en 10%. El modo demo sigue siendo gratuito. Los precios actuales de todos los modelos están en la página Pricing y en GET /api/pricing.
Si la red Gonka recibe una solicitud pero no responde (timeout de 300s), ahora el gateway devuelve inmediatamente un error 504 en lugar de una serie de reintentos silenciosos. Nota importante sobre el cobro: una solicitud aceptada por la red no se puede cancelar; el nodo la procesa de todos modos, por lo que en caso de timeout se descuenta la estimación de procesamiento del prompt (la finalización no se factura). Recomendación: para generaciones largas, utilice stream:true; el streaming es más resistente a los timeouts y muestra el progreso de inmediato.
La comisión por depósitos en USDT ahora disminuye según el monto: base del 5%, desde $25 — 4.5%, desde $50 — 4%, desde $100 — 3.5%, desde $250 — 3%, desde $500 — 2.75%, desde $1000 — 2.5%. El cuadro de diálogo de depósito incluye una escala interactiva: deslizador de monto, bono GNK de cada nivel y sus ahorros. El descuento se aplica automáticamente al recibir el depósito.
Se puede establecer un límite de gasto total (acumulativo) para las claves secundarias: una cuota dedicada que no se reinicia, a diferencia de los límites diarios o mensuales. Cuando se agota la cuota, las solicitudes que utilizan la clave son rechazadas. El límite se establece en el panel de control (con precisión de nanogonka) o mediante la API utilizando el campo limit_total_ngonka en POST/PATCH /api/management/keys/{id}/children; el consumo acumulado se restablece con el botón "Reset usage" (o POST /api/management/keys/{id}/children/{childId}/reset-usage).
Los costos de inferenced están sincronizados con el precio de red real de Gonka por token. Los precios siguen siendo de los más bajos del mercado — fracciones de un centavo por millón de tokens, cientos de veces más baratos que OpenAI y Anthropic con los mismos modelos open-source. Los tokens de salida tienen un precio más alto que los de entrada (×3), como en la mayoría de los proveedores.
Hemos confirmado el límite real de contexto de los modelos activos: hasta 200,000 tokens (antes se publicaban 131,072 como cifra conservadora). Ahora puede enviar documentos e historiales de diálogo más largos; las características actuales de cada modelo se encuentran en la sección "Network Status".
El costo de cada solicitud se muestra en USD — en la respuesta de la API (campo usage.total_cost_usd) y en la sección "Uso". Es útil para planificar gastos.
Configure el acceso a la API en su herramienta automáticamente: ejecute npx @joingonka/setup. Compatible con Claude Code, OpenClaw, Cline, Continue, opencode, Aider y otros.
El modelo busca en internet durante la respuesta y añade enlaces a las fuentes. Cómo activarlo: pase en el cuerpo de la solicitud plugins: [{ "id": "web", "max_results": 5 }] — funciona en APIs compatibles con OpenAI y Anthropic.
La longitud máxima de respuesta es de hasta 8192 tokens; gestione el parámetro max_tokens (por defecto 1024 para respuestas en streaming y 1500 para las normales).
En la página "Chat", seleccione un modelo de la lista (cargado desde /v1/models) — la selección se guarda y se aplica a los nuevos diálogos.
¿Necesita velocidad? Añada a su solicitud la cabecera x-joingonka-meta: 1 — en la respuesta en streaming recibirá ttft_ms (tiempo hasta el primer token) y tokens_per_sec.
Cree una clave de gestión (POST /api/management/keys) y genere claves secundarias con límites (cuota diaria y mensual, rate limit, expiración) mediante POST /api/management/keys/{id}/children.
Conecte plugins mediante el parámetro plugins: response-healing repara JSON truncado, privacy-sanitization oculta datos privados, file-parser extrae texto de PDFs y documentos.
OpenAI: base_url https://gate.joingonka.ai/v1, cabecera Authorization: Bearer su-clave. Anthropic (Claude Code): base_url https://gate.joingonka.ai, cabecera x-api-key, endpoint /v1/messages.
GNK: obtenga la dirección y el memo, y envíe los tokens on-chain. USDT: especifique un monto de 1 a 10 000 dólares y pague a través de OxaPay — la conversión a GNK es automática.