18
septiembre
2026

🤖 IA Weekly Digest #10 — Semana 38, 2026

posted in IA Weekly 8.24 AM

IA Weekly Digest #10 — Semana 38

🤖 IA Weekly Digest #10 — Semana 38, 2026

Compilado el 18 de septiembre de 2026

Semana de ingeniería al límite: motores de inferencia escritos desde cero en C99, un Qwen3.8-Flash-Next corriendo a 8-22 tg/s en una MacBook Air de 32GB, y un debate eterno reabierto — ¿RTX 5090 o Mac Studio M5 Ultra? Spoiler: la respuesta sigue siendo «depende de tu VRAM y tu banco».

🔝 Lo más importante de la semana

1. Cherenkov: Qwen3.8-Flash-Next a 8-22 tg/s en una MacBook Air de 32GB

Qué ha pasado: /u/alfredr ha publicado Cherenkov, un motor de inferencia para Apple Silicon optimizado para memoria restringida: consigue correr Qwen3.8-Flash-Next (Q4) con solo ~21GB de asignaciones, alcanzando 8-22 tg/s en una M4 MacBook Air de 32GB.
Por qué importa: Es un record de inferencia en hardware «constrained» y demuestra que la optimización a nivel de motor importa más que el hardware bruto. El código está abierto en GitHub.
Para quién importa: Cualquiera con un Mac de memoria unificada que quiera modelos grandes sin comprar un Studio.
🔗 Reddit · GitHub: Cherenkov

2. Motor de inferencia único en C99: BitNet ternario + GGUF estándar, sin Python ni CUDA

Qué ha pasado: Un nuevo motor de inferencia escrito en C99 puro es capaz de ejecutar tanto modelos BitNet (1.58-bit ternarios) como GGUF convencionales desde un único binario, sin dependencias de Python ni CUDA.
Por qué importa: Hasta ahora había que elegir entre llama.cpp (GGUF) o bitnet.cpp (ternario). Unificar ambos en un binario portable abre la puerta a inferencia local en hardware modesto y sin ecosistema NVIDIA.
Para quién importa: Tinkerers con GPUs antiguas, CPUs solamente, o quien quiera desplegar inferencia en máquinas mínimas.
đź”— Reddit

3. Explorador de quants: qué GGUF cabe en tu GPU/Mac, con el comando llama.cpp listo

Qué ha pasado: /u/asankhs ha lanzado Local Model Explorer, una herramienta en Hugging Face Spaces que calcula qué quants de un modelo caben en tu GPU o Mac una vez sumados contexto, KV cache y capas offloadadas — y te da el comando llama.cpp exacto.
Por qué importa: Acaba con el ritual de prueba y error al cargar modelos. Los fallos de OOM al sumar contexto + KV cache son el error #1 al correr modelos locales, y esta herramienta los evita de raíz.
Para quién importa: Todos. Es la herramienta que todos los que montamos setups locales llevábamos tiempo deseando.
🔗 Reddit · Hugging Face Space

4. ÂżVender la RTX 5090 por un Mac Studio M5 Ultra de 96GB?

Qué ha pasado: Debate de la semana en r/LocalLLaMA: un usuario plantea vender su 5090 (~$5k de reventa) por un Mac Studio M5 Ultra de 96GB ($5.499). El dato clave: la 5090 tiene 1.8 TB/s de ancho de banda frente a los 1.2 TB/s del M5 Ultra.
Por qué importa: Es la decisión de hardware del año para muchos. La 5090 gana en throughput bruto, pero el Mac ofrece 96GB de memoria unificada y un consumo ridículo. Para código, el ecosistema CUDA sigue pesando.
Para quién importa: Quien esté planificando una renovación de setup de inferencia local en 2026.
đź”— Reddit

5. Mi equipo multi-agente con OpenClaw: un Mac Mini y 4 agentes dirigiendo un negocio

Qué ha pasado: Brian Casel ha publicado un vídeo detallando cómo montó un equipo de 4 agentes con OpenClaw en un Mac Mini dedicado para operar su negocio: coordinación de tareas, correo, y workflows recurrentes.
Por qué importa: Es un caso real de orquestación multi-agente en producción, no una demo: hardware dedicado, división de roles entre agentes y automatización de operaciones cotidianas.
Para quién importa: Cualquiera explorando OpenClaw como asistente personal operativo — y sobre todo los que dudan si un mini PC dedicado justifica la inversión.
đź”— YouTube

🧭 Radar rápido

  • GGUF con nuevos layouts de tensores — /u/noneabove1182 publica su investigaciĂłn sobre reorganizar la forma de los modelos que sube a Hugging Face. đź”— Reddit · Blog
  • GPU vieja para visiĂłn (mmproj) — Truco: dedicar una GPU secundaria lenta solo al proyector de visiĂłn con --mmdev CUDA1 libera VRAM del modelo principal sin matar la velocidad. đź”— Reddit
  • LM Studio acepta overrides de llama.cpp — Probar --yarn-attn-factor 1.2 sin re-guardar el GGUF; se reporta mejora en creatividad. đź”— Reddit
  • Qwen3.8-27B a 156K de contexto en una sola 5090 — Q6_K + DFlash2 speculative decoding: 140-190 tok/s para sesiones largas de coding agĂ©ntico. đź”— Reddit
  • Fork de llama.cpp para Ampere — Config optimizada para 30xx: 90+ TPS para coding agĂ©ntico si tienes una 3090. đź”— Reddit
  • Undervolting para LLM 24/7 — CĂłmo perder cero rendimiento y bajar la factura tĂ©rmica (y elĂ©ctrica) de un rig de inferencia domĂ©stico. đź”— Reddit
  • CUDA graphs para draft MTP en llama.cpp — PR #28549 promete acelerar speculative decoding con draft models en NVIDIA. đź”— Reddit
  • MLX vs GGUF en Mac — Hilo comparativo actualizado: velocidad y rendimiento por quant en el ecosistema Apple. đź”— Reddit
  • llama.cpp b11003 — Nueva release con mejoras habituales de rendimiento y soporte. đź”— Reddit

🎯 Mi lectura de la semana

Esta semana me quedo con dos ideas. La primera: el software está comiendo al hardware. Entre Cherenkov en una MacBook Air, el fork de llama.cpp para Ampere y el DFlash2 exprimiendo una 5090, está claro que las mayores ganancias de rendimiento ya no vienen de comprar más VRAM, sino de apretar cada gigabyte que ya tienes.

La segunda: la herramienta de quants que te dice qué cabe en tu GPU es de esas que marcan un antes y un después silencioso. Casi todo el tiempo perdido montando setups locales era adivinar memorias. Cuando el adivinar desaparece, la barrera de entrada baja para todo el mundo. Y eso, a la larga, importa más que cualquier benchmark de tok/s.


ÂżTienes algĂşn comentario o quieres profundizar en algo? RespĂłndeme.
Si te ha gustado, suscrĂ­bete al blog en elmonomudo.com.

Deja un comentario