← SCRAM AI Lab
Kimi K3, GLM-5.3 y DeepSeek V4-Flash redefinen la IA open-weight en agosto 2026: comparativa de costos, licencias MIT, hardware y adopción técnica en LATAM.
August 19, 2026
71 lecturas

Entre el 27 de julio y el 14 de agosto de 2026, la frontera open-weight cambió de líder dos veces. El estado al 19 de agosto: Kimi K3 es el mejor todo-terreno abierto, GLM-5.2/5.3 el más fuerte bajo licencia MIT plana, y DeepSeek V4-Flash el piso de costo para API hosteada.
Z.ai publicó GLM-5.3 el 14 de agosto: la misma base que GLM-5.2 con post-training escalado. La familia GLM mantiene sus dos cartas fuertes: 1M de contexto sin pérdida (desde 5.2) y agentes de coding de larga duración. GLM-5.2 sigue siendo el modelo más fuerte bajo licencia MIT plana (62.1% SWE-bench Pro) — sin gates comerciales de ningún tipo, lo que importa si tu asesoría legal es alérgica a licencias custom.
Para quien necesita correr en una sola GPU, Qwen3.6-27B alcanza 77.2% en benchmarks de coding con un modelo denso de 27B — el mejor ratio capacidad/VRAM del momento para inferencia local seria.
| Modelo | Arquitectura | Contexto | Licencia | Rendimiento clave | Infraestructura recomendada |
|---|---|---|---|---|---|
| Kimi K3 | MoE (2.8T total / 104B activos) | 1M tokens | Kimi License (gate $20M USD) | 88.3 Terminal-Bench 2.1 | Cluster 8x H100/H200 (cuantizado FP8) |
| GLM-5.3 | MoE optimizado | 1M tokens | MIT permisiva | 62.1% SWE-bench Pro | Cluster 4x a 8x H100 (vLLM / TensorRT-LLM) |
| DeepSeek V4-Flash | MoE disperso ultra-rápido | 1M tokens | MIT permisiva | A 2.3 pts de Opus 4.8 en Terminal-Bench | API Cloud o 4x L40S para variantes destiladas |
| Qwen3.6-27B | Densa (27B) | 128k tokens | Apache 2.0 | 77.2% Coding Benchmarks | 1x RTX 4090 / A100 80GB (FP8 / AWQ) |
La elección depende directamente de dos factores: la postura de tu departamento legal respecto a la propiedad intelectual y el volumen mensual de tokens que procesas. Si requieres despliegue interno sin fricción corporativa, GLM-5.3 es la ruta obligada; si operas a escala masiva vía API comercial, DeepSeek V4-Flash ofrece la economía unitaria más rentable del mercado.
Alojar modelos de la escala de Kimi K3 o GLM-5.3 dentro de servidores propios presenta retos técnicos que van más allá de rentar GPUs en la nube:
Para los equipos de ingeniería y directores de tecnología en México, Colombia, Brasil y el resto de la región, esta camada de modelos abiertos cambia la ecuación financiera por tres motivos concretos:
En primer lugar, la mitigación del riesgo cambiario. La facturación en dólares de proveedores propietarios como OpenAI o Anthropic representa una exposición constante a la volatilidad de las divisas locales. Implementar instancias de DeepSeek V4-Flash mediante proveedores locales de cómputo o correr Qwen3.6-27B en centros de datos regionales permite fijar presupuestos operativos predecibles en moneda nacional.
En segundo lugar, el cumplimiento de soberanía de datos. Con regulaciones como la Ley Federal de Protección de Datos Personales en Posesión de los Particulares (LFPDPPP) en México o la LGPD en Brasil, los sectores financiero, fintech y de salud enfrentan barreras estrictas para enviar información sensible a APIs centralizadas en Estados Unidos. La disponibilidad de modelos de nivel frontera bajo licencia MIT pura, como GLM-5.3, permite mantener los datos estrictamente dentro del perímetro de la red corporativa sin sacrificar capacidad analítica.
Por último, la adaptabilidad al español regional. Las evaluaciones de Z.ai y Moonshot muestran una mejora sustancial en la captura de giros idiomáticos técnicos y formalismos legales en español neutro y dialectos latinoamericanos, reduciendo la necesidad de tareas costosas de fine-tuning superficial que antes eran obligatorias para lograr una interacción profesional creíble.
La conversación de 2025 era "¿los abiertos alcanzarán a los cerrados?". La de agosto 2026 es otra: a qué costo por token quieres capacidad casi-frontera, y con qué licencia. Para presupuesto y soberanía de datos, el cómputo propio no solo compite — en varias cargas ya gana.
Artículos relacionados
GLM-5.2: la apuesta de Z.ai por 1M de contexto para agentes de coding
GLM-5.2 introduce un millón de tokens de contexto para coding agéntico. Analizamos su arquitectura, comparativa de costos y aplicabilidad en empresas de LATAM.
Sakana Fugu: orquestar modelos frontera como un solo modelo
Sakana AI presenta Fugu, un sistema que orquesta modelos frontera vía API única, optimizando costos, latencia y neutralidad de infraestructura en producción.
RPA REPSE/IMSS con Playwright + undetected-chromedriver
Guía técnica para implementar RPA en portales del SAT, IMSS y REPSE usando undetected-chromedriver y Playwright con arquitectura para entornos de producción.