🤖 IA Weekly Digest #10 — Semana 38, 2026
Compilado el 18 de septiembre de 2026
Semana de ingenierĂa al lĂmite: motores de inferencia escritos desde cero en C99, un Qwen3.8-Flash-Next corriendo a 8-22 tg/s en una MacBook Air de 32GB, y un debate eterno reabierto — ÂżRTX 5090 o Mac Studio M5 Ultra? Spoiler: la respuesta sigue siendo «depende de tu VRAM y tu banco».
🔝 Lo más importante de la semana
1. Cherenkov: Qwen3.8-Flash-Next a 8-22 tg/s en una MacBook Air de 32GB
Qué ha pasado: /u/alfredr ha publicado Cherenkov, un motor de inferencia para Apple Silicon optimizado para memoria restringida: consigue correr Qwen3.8-Flash-Next (Q4) con solo ~21GB de asignaciones, alcanzando 8-22 tg/s en una M4 MacBook Air de 32GB.
Por qué importa: Es un record de inferencia en hardware «constrained» y demuestra que la optimización a nivel de motor importa más que el hardware bruto. El código está abierto en GitHub.
Para quién importa: Cualquiera con un Mac de memoria unificada que quiera modelos grandes sin comprar un Studio.
🔗 Reddit · GitHub: Cherenkov
2. Motor de inferencia único en C99: BitNet ternario + GGUF estándar, sin Python ni CUDA
Qué ha pasado: Un nuevo motor de inferencia escrito en C99 puro es capaz de ejecutar tanto modelos BitNet (1.58-bit ternarios) como GGUF convencionales desde un único binario, sin dependencias de Python ni CUDA.
Por quĂ© importa: Hasta ahora habĂa que elegir entre llama.cpp (GGUF) o bitnet.cpp (ternario). Unificar ambos en un binario portable abre la puerta a inferencia local en hardware modesto y sin ecosistema NVIDIA.
Para quiĂ©n importa: Tinkerers con GPUs antiguas, CPUs solamente, o quien quiera desplegar inferencia en máquinas mĂnimas.
đź”— Reddit
3. Explorador de quants: qué GGUF cabe en tu GPU/Mac, con el comando llama.cpp listo
Qué ha pasado: /u/asankhs ha lanzado Local Model Explorer, una herramienta en Hugging Face Spaces que calcula qué quants de un modelo caben en tu GPU o Mac una vez sumados contexto, KV cache y capas offloadadas — y te da el comando llama.cpp exacto.
Por quĂ© importa: Acaba con el ritual de prueba y error al cargar modelos. Los fallos de OOM al sumar contexto + KV cache son el error #1 al correr modelos locales, y esta herramienta los evita de raĂz.
Para quién importa: Todos. Es la herramienta que todos los que montamos setups locales llevábamos tiempo deseando.
🔗 Reddit · Hugging Face Space
4. ÂżVender la RTX 5090 por un Mac Studio M5 Ultra de 96GB?
Qué ha pasado: Debate de la semana en r/LocalLLaMA: un usuario plantea vender su 5090 (~$5k de reventa) por un Mac Studio M5 Ultra de 96GB ($5.499). El dato clave: la 5090 tiene 1.8 TB/s de ancho de banda frente a los 1.2 TB/s del M5 Ultra.
Por quĂ© importa: Es la decisiĂłn de hardware del año para muchos. La 5090 gana en throughput bruto, pero el Mac ofrece 96GB de memoria unificada y un consumo ridĂculo. Para cĂłdigo, el ecosistema CUDA sigue pesando.
Para quién importa: Quien esté planificando una renovación de setup de inferencia local en 2026.
đź”— Reddit
5. Mi equipo multi-agente con OpenClaw: un Mac Mini y 4 agentes dirigiendo un negocio
QuĂ© ha pasado: Brian Casel ha publicado un vĂdeo detallando cĂłmo montĂł un equipo de 4 agentes con OpenClaw en un Mac Mini dedicado para operar su negocio: coordinaciĂłn de tareas, correo, y workflows recurrentes.
Por qué importa: Es un caso real de orquestación multi-agente en producción, no una demo: hardware dedicado, división de roles entre agentes y automatización de operaciones cotidianas.
Para quién importa: Cualquiera explorando OpenClaw como asistente personal operativo — y sobre todo los que dudan si un mini PC dedicado justifica la inversión.
đź”— YouTube
🧠Radar rápido
- GGUF con nuevos layouts de tensores — /u/noneabove1182 publica su investigación sobre reorganizar la forma de los modelos que sube a Hugging Face. 🔗 Reddit · Blog
- GPU vieja para visión (mmproj) — Truco: dedicar una GPU secundaria lenta solo al proyector de visión con
--mmdev CUDA1libera VRAM del modelo principal sin matar la velocidad. 🔗 Reddit - LM Studio acepta overrides de llama.cpp — Probar
--yarn-attn-factor 1.2sin re-guardar el GGUF; se reporta mejora en creatividad. 🔗 Reddit - Qwen3.8-27B a 156K de contexto en una sola 5090 — Q6_K + DFlash2 speculative decoding: 140-190 tok/s para sesiones largas de coding agéntico. 🔗 Reddit
- Fork de llama.cpp para Ampere — Config optimizada para 30xx: 90+ TPS para coding agéntico si tienes una 3090. 🔗 Reddit
- Undervolting para LLM 24/7 — Cómo perder cero rendimiento y bajar la factura térmica (y eléctrica) de un rig de inferencia doméstico. 🔗 Reddit
- CUDA graphs para draft MTP en llama.cpp — PR #28549 promete acelerar speculative decoding con draft models en NVIDIA. 🔗 Reddit
- MLX vs GGUF en Mac — Hilo comparativo actualizado: velocidad y rendimiento por quant en el ecosistema Apple. 🔗 Reddit
- llama.cpp b11003 — Nueva release con mejoras habituales de rendimiento y soporte. 🔗 Reddit
🎯 Mi lectura de la semana
Esta semana me quedo con dos ideas. La primera: el software está comiendo al hardware. Entre Cherenkov en una MacBook Air, el fork de llama.cpp para Ampere y el DFlash2 exprimiendo una 5090, está claro que las mayores ganancias de rendimiento ya no vienen de comprar más VRAM, sino de apretar cada gigabyte que ya tienes.
La segunda: la herramienta de quants que te dice qué cabe en tu GPU es de esas que marcan un antes y un después silencioso. Casi todo el tiempo perdido montando setups locales era adivinar memorias. Cuando el adivinar desaparece, la barrera de entrada baja para todo el mundo. Y eso, a la larga, importa más que cualquier benchmark de tok/s.
ÂżTienes algĂşn comentario o quieres profundizar en algo? RespĂłndeme.
Si te ha gustado, suscrĂbete al blog en elmonomudo.com.
