Para agentes de IA: guía paso a paso de configuración — /docs/agents.md, índice de documentación — /llms.txt.
Modelos
Modelos de la red Gonka disponibles a través de la pasarela: identificador para el campo model, ventana de contexto, límite de respuesta, precio y estado.
Modelos y precios#
La composición de modelos cambia con las votaciones de la red Gonka, por eso la tabla se arma con datos en vivo de la pasarela. Los precios están en dólares por 1M de tokens según el tipo de cambio actual de GNK; el débito se hace en GNK, más detalles en la sección Precios y cuenta.
| Modelo | Contexto | Respuesta | Entrada, $/1M | Salida, $/1M | Estado |
|---|---|---|---|---|---|
MiniMax MiniMaxAI/MiniMax-M2.7 | 200K | 8K | $0.0083 | $0.025 | Degradado |
DeepSeek deepseek-ai/DeepSeek-V4-Flash-0731 | 380K | 33K | $0.0083 | $0.025 | Degradado |
Z.ai zai-org/GLM-5.3-Flash | 390K | 8K | $0.0083 | $0.025 | Operativo |
Pega el identificador en el campo model; no distingue mayúsculas de minúsculas. El estado se calcula por la proporción de solicitudes procesadas con éxito, como en la página Estado de la red.
Cómo elegir un modelo#
- Si no sabes por dónde empezar, elige
MiniMaxAI/MiniMax-M2.7: los ejemplos de la documentación y los comandos del instalador están pensados para él. - El contexto más largo es
zai-org/GLM-5.3-Flash: 390K tokens. Para bases de código grandes y documentos extensos. - La respuesta más larga es
deepseek-ai/DeepSeek-V4-Flash-0731: hasta 33K tokens de una vez. Para generar archivos grandes completos.
Si la red deja de servir un modelo, este desaparece de GET /v1/models y las solicitudes que lo pidan reciben un 503 con el tipo de error model_unavailable. El texto del error incluirá un modelo al que puedes cambiarte.
Longitud de la respuesta#
La longitud de la respuesta la define max_tokens o max_completion_tokens; la pasarela entiende ambos campos. Cada modelo tiene un techo: si max_tokens es mayor, la pasarela lo recorta silenciosamente hasta ese techo. Si no se especifica max_tokens, con stream: true se aplica el techo, y sin streaming, un valor por defecto menor.
Los modelos con razonamiento gastan parte de max_tokens en pensar antes de responder; deja margen.
model | Techo | Por defecto, stream: true | Por defecto, sin streaming |
|---|---|---|---|
MiniMaxAI/MiniMax-M2.7 | 8192 | 8192 | 1500 |
deepseek-ai/DeepSeek-V4-Flash-0731 | 32768 | 32768 | 1500 |
zai-org/GLM-5.3-Flash | 8192 | 8192 | 3000 |
Los mismos números en formato máquina están en la respuesta GET /v1/capabilities, campo limits.models.
Modelo por defecto#
Una solicitud sin el campo model la pasarela la envía al modelo por defecto, que ahora es MiniMaxAI/MiniMax-M2.7.
Claude Code y el SDK de Anthropic envían en /v1/messages nombres de modelos de Anthropic (claude-*); la pasarela los sustituye por el mismo modelo por defecto.
Para trabajar con otro modelo, indica su identificador de la tabla de arriba; en el instalador es el flag --model.
Composición y estado vía API#
La composición de modelos cambia con las votaciones de la red Gonka; no fijes la lista en el código, tómala de la API. Estas solicitudes no necesitan clave.
| Solicitud | Qué devuelve |
|---|---|
GET /v1/models | Modelos disponibles ahora: identificador, contexto, límite de respuesta y precio del token en dólares. Un modelo que la red no está sirviendo actualmente no aparece en la lista. |
GET /v1/models/{model} | Un modelo en el mismo formato. Pasa la barra del identificador tal cual o como %2F. Modelo desconocido u oculto: 404 con el código model_not_found, y una solicitud a un modelo oculto recibe 503 model_unavailable. |
GET /v1/capabilities | Capacidades de la pasarela: protocolos, parámetros de solicitud y el campo limits: límite de solicitudes de la clave, timeouts y techos de max_tokens por modelo. |
GET /v1/network-status | El estado de cada modelo y los incidentes: los mismos datos que en la página Estado de la red. |
GET /health | Si la propia pasarela responde: {"status":"ok"}. Esta solicitud no comprueba el estado de los modelos. |