← SCRAM AI Lab

Herramientas IA

Kimi K3, GLM-5.3 y DeepSeek V4-Flash: la frontera abierta de agosto 2026

Kimi K3, GLM-5.3 y DeepSeek V4-Flash redefinen la IA open-weight en agosto 2026: comparativa de costos, licencias MIT, hardware y adopción técnica en LATAM.

August 19, 2026

71 lecturas

Kimi K3, GLM-5.3 y DeepSeek V4-Flash: la frontera abierta de agosto 2026

Tres semanas que reordenaron el ranking

Entre el 27 de julio y el 14 de agosto de 2026, la frontera open-weight cambió de líder dos veces. El estado al 19 de agosto: Kimi K3 es el mejor todo-terreno abierto, GLM-5.2/5.3 el más fuerte bajo licencia MIT plana, y DeepSeek V4-Flash el piso de costo para API hosteada.

Kimi K3 — el nuevo líder todo-terreno

  • Lanzado el 27 de julio por Moonshot con pesos en Hugging Face.
  • 2.8T de parámetros totales, 104B activos (MoE) y 1M de tokens de contexto.
  • 88.3 en Terminal-Bench 2.1 — el mejor puntaje open-weight registrado a agosto 2026.
  • Licencia: "Kimi K3 License", texto tipo MIT con un gate comercial: si tu revenue model-as-a-service supera los $20M anuales, necesitas licencia aparte. Para self-hosting interno y productos normales, en la práctica es libre.

GLM-5.3 — Z.ai escala el post-training

Z.ai publicó GLM-5.3 el 14 de agosto: la misma base que GLM-5.2 con post-training escalado. La familia GLM mantiene sus dos cartas fuertes: 1M de contexto sin pérdida (desde 5.2) y agentes de coding de larga duración. GLM-5.2 sigue siendo el modelo más fuerte bajo licencia MIT plana (62.1% SWE-bench Pro) — sin gates comerciales de ningún tipo, lo que importa si tu asesoría legal es alérgica a licencias custom.

DeepSeek V4-Flash — el piso de costo

  • La variante V4-Flash-0731 (MIT) queda a 2.3 puntos de Claude Opus 4.8 en Terminal-Bench 2.1, por delante de GLM-5.2.
  • API oficial: $0.14 por millón de tokens de entrada (sin caché) y $0.28 de salida, con 1M de contexto según la lista de precios oficial publicada por DeepSeek. Ningún modelo cerrado se acerca a ese costo por punto de benchmark.

Y el tier compacto: Qwen3.6-27B

Para quien necesita correr en una sola GPU, Qwen3.6-27B alcanza 77.2% en benchmarks de coding con un modelo denso de 27B — el mejor ratio capacidad/VRAM del momento para inferencia local seria.

Comparativa técnica de la frontera abierta

Modelo Arquitectura Contexto Licencia Rendimiento clave Infraestructura recomendada
Kimi K3 MoE (2.8T total / 104B activos) 1M tokens Kimi License (gate $20M USD) 88.3 Terminal-Bench 2.1 Cluster 8x H100/H200 (cuantizado FP8)
GLM-5.3 MoE optimizado 1M tokens MIT permisiva 62.1% SWE-bench Pro Cluster 4x a 8x H100 (vLLM / TensorRT-LLM)
DeepSeek V4-Flash MoE disperso ultra-rápido 1M tokens MIT permisiva A 2.3 pts de Opus 4.8 en Terminal-Bench API Cloud o 4x L40S para variantes destiladas
Qwen3.6-27B Densa (27B) 128k tokens Apache 2.0 77.2% Coding Benchmarks 1x RTX 4090 / A100 80GB (FP8 / AWQ)

¿Cuál de estos modelos abiertos conviene implementar en producción en 2026?

La elección depende directamente de dos factores: la postura de tu departamento legal respecto a la propiedad intelectual y el volumen mensual de tokens que procesas. Si requieres despliegue interno sin fricción corporativa, GLM-5.3 es la ruta obligada; si operas a escala masiva vía API comercial, DeepSeek V4-Flash ofrece la economía unitaria más rentable del mercado.

Desafíos de infraestructura y qué puede salir mal

Alojar modelos de la escala de Kimi K3 o GLM-5.3 dentro de servidores propios presenta retos técnicos que van más allá de rentar GPUs en la nube:

  • Fragmentación del KV Cache en contextos largos: Aunque ambos modelos soportan 1 millón de tokens en el papel, sostener esa ventana para múltiples usuarios concurrentes agota la memoria VRAM de inmediato. Sin técnicas agresivas de PagedAttention y compresión de contexto, el costo de hardware se dispara de forma insostenible.
  • Degradación cualitativa por cuantización excesiva: Correr un modelo de 2.8T parámetros en 4 bits (INT4) introduce caídas medibles en razonamiento simbólico y generación de sintaxis estricta, particularmente en tareas de automatización de código donde la precisión sintáctica no tolera desvíos.
  • Latencia en el primer token (TTFT): En escenarios con prompts extensos (más de 100k tokens de documentación o bases de código completas), el tiempo hasta recibir la primera respuesta puede superar los 15 segundos si no se cuenta con hardware interconectado por InfiniBand o NVLink de última generación.

Implicaciones estratégicas para empresas en América Latina

Para los equipos de ingeniería y directores de tecnología en México, Colombia, Brasil y el resto de la región, esta camada de modelos abiertos cambia la ecuación financiera por tres motivos concretos:

En primer lugar, la mitigación del riesgo cambiario. La facturación en dólares de proveedores propietarios como OpenAI o Anthropic representa una exposición constante a la volatilidad de las divisas locales. Implementar instancias de DeepSeek V4-Flash mediante proveedores locales de cómputo o correr Qwen3.6-27B en centros de datos regionales permite fijar presupuestos operativos predecibles en moneda nacional.

En segundo lugar, el cumplimiento de soberanía de datos. Con regulaciones como la Ley Federal de Protección de Datos Personales en Posesión de los Particulares (LFPDPPP) en México o la LGPD en Brasil, los sectores financiero, fintech y de salud enfrentan barreras estrictas para enviar información sensible a APIs centralizadas en Estados Unidos. La disponibilidad de modelos de nivel frontera bajo licencia MIT pura, como GLM-5.3, permite mantener los datos estrictamente dentro del perímetro de la red corporativa sin sacrificar capacidad analítica.

Por último, la adaptabilidad al español regional. Las evaluaciones de Z.ai y Moonshot muestran una mejora sustancial en la captura de giros idiomáticos técnicos y formalismos legales en español neutro y dialectos latinoamericanos, reduciendo la necesidad de tareas costosas de fine-tuning superficial que antes eran obligatorias para lograr una interacción profesional creíble.

Cuál elegir según tu carga

  • Agente todo-terreno con contexto masivo → Kimi K3 (si el gate de $20M no te aplica).
  • Coding de larga duración + licencia MIT limpia → GLM-5.2/5.3.
  • Volumen extremo por API al menor costo → DeepSeek V4-Flash.
  • Inferencia local en hardware modesto → Qwen3.6-27B.

Conclusión

La conversación de 2025 era "¿los abiertos alcanzarán a los cerrados?". La de agosto 2026 es otra: a qué costo por token quieres capacidad casi-frontera, y con qué licencia. Para presupuesto y soberanía de datos, el cómputo propio no solo compite — en varias cargas ya gana.

open-weight
kimi-k3
glm-5-3
deepseek
qwen
self-hosting
benchmarks
← Volver a SCRAM AI Lab