🤖 IA Weekly Digest #10 — Semana 36, 2026
Compilado el 4 de septiembre de 2026
Lo ligero compite directamente con lo pesado. Esta semana, tres frentes distintos demuestran que la optimización de software y los modelos sparse están recortando la dependencia de hardware caro: un Nemotron cuantizado que cabe en 16 GB con 262K de contexto, un portátil con eGPU igualando a un dual-3090, y un router que decide cuándo tu modelo local debe rendir la partida ante la nube. El mensaje ya no es «compra más GPU», sino «basta con mejores algoritmos».
🔝 Lo más importante de la semana
1. Nemotron-3.5-Lightning a 11.77 GB: un modelo serio de 16 GB con 262K de contexto
Qué ha pasado: NVIDIA publica una cuantización real de Nemotron-3.5-Lightning a 11.77 GB (~3.07 bpw), destapando que los «low-bit» anteriores eran en secreto ~4.70 bpw. Con llama.cpp parcheado, el modelo soporta 262K tokens de contexto en solo 16 GB de VRAM. Ojo: no funciona en LM Studio ni Ollama — requiere la compilación custom de llama.cpp.
Por qué importa: Democratiza el acceso a modelos avanzados con hardware mainstream. Análisis documental y agentes con memoria larga ya no exigen 40+ GB de VRAM: la calidad «gama alta» baja a tarjetas de gama media.
Para quién importa: Quien tenga una 4060 Ti 16GB, 4070 Ti Super o similar y quiera un modelo potente sin montar multi-GPU.
2. HybridInfer: el router que detecta cuando tu modelo local se atasca y salta a la nube
Qué ha pasado: Un desarrollador publica (Apache-2.0) un router que monitoriza la ejecución de prompts en modelos locales y, ante stalls silenciosos (contexto desbordado, errores CUDA mudos, GPU OOM), redirige automáticamente la petición al cloud. No es failover simple: detecta patrones de stalling, estima tiempos de respuesta y decide cuándo compensa cambiar.
Por qué importa: Resuelve uno de los mayores dolores de correr modelos locales: quedarte colgado sin output y sin saber si la culpa es del modelo, la GPU o la red. Es un patrón arquitectural replicable en cualquier stack de inferencia local.
Para quién importa: Cualquiera con inferencia local — y muy especialmente productos SaaS basados en LLMs donde la fiabilidad es crítica.
3. Qwen3.8-Flash-Next (104 GB MoE) en Strix Halo + eGPU: 84 tok/s a 0.4x del coste de un dual-3090
Qué ha pasado: Con la cuantización UD-Q4_K_XL de unsloth (103.69 GB), un portátil ASUS Strix Halo con eGPU RTX 3090 Ti pasa de 22 a 84 tokens/segundo ejecutando Qwen3.8-Flash-Next — un MoE con 512 expertos por capa, 36 capas de DeltaNet y tabla n-gram de 26.8 GiB — quedando a un problema de HumanEval+ de distancia de una caja dual-3090 con vLLM.
Por qué importa: Un portátil gamer + eGPU ya rivaliza con configuraciones de servidor dedicadas. La activación sparse del MoE hace el resto. Cambia la conversación sobre dónde ejecutar LLMs grandes.
Para quién importa: Devs e investigadores sin espacio, presupuesto o electricidad para un server dedicado.
🧭 Radar rápido
- AVX2 acelera prompts en batch grande con llama.cpp — PR #27402 mejora el throughput en servidores multi-usuario con CPUs AVX2. 🔗 GitHub
- MTP rompe el tool calling en Qwen 3.6 9B — La Multi-Token Prediction acelera la generación pero degrada el JSON estructurado de las herramientas; desactiva MTP si dependes del tool calling. 🔗 Reddit
- -DGGML_CUDA_NCCL=ON puede empeorar el rendimiento — El flag «multi-GPU mejor» introdujo overhead de sincronización en ciertos setups: testea siempre con tu configuración concreta. 🔗 Reddit
🎯 Mi lectura de la semana
Llevo semanas siguiendo la misma señal y esta se consolida: cada vez basta con mejores algoritmos, no con más GPUs. Nemotron en 11 GB, un portátil compitiendo con dos 3090, y un router que orquesta local y nube con criterio. La optimización de software, los modelos sparse y la arquitectura inteligente están recortando la factura de hardware semana a semana.
Para quien monta agentes —como yo con mis flujos de escritura y publicación— el aprendizaje práctico es doble: vigila los fallos silenciosos del modelo local (un router tipo HybridInfer tiene mucho sentido), y no des MTP por sentado si dependes del tool calling.
¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.
