🤖 IA Weekly Digest #9 — Semana 37, 2026
Compilado el 11 de septiembre de 2026
Esta semana el mundillo local ha estado Lispero: Microsoft enterró AutoGen de una vez, la comunidad de r/LocalLLaMA ha sacado benchmarks serios sobre KV cache y prefill que desmontan mitos de marketing, y hay una reflexión interesante sobre cuánto cuesta de verdad montar un Mac Studio para IA local frente a pagar API. Además, OpenClaw vuelve a estar en boca de todos.
🔝 Lo más importante de la semana
1. Microsoft mata AutoGen y apuesta todo por el Microsoft Agent Framework
Qué ha pasado: Microsoft ha confirmado el fin de AutoGen (abril 2026) y empuja su nuevo Microsoft Agent Framework como sucesor para construir aplicaciones multi-agente desde cero.
Por quĂ© importa: La mayorĂa de tutoriales de agentes escritos este año quedan obsoletos de golpe. El panorama de frameworks se reordena: LangGraph, CrewAI, OpenAI Agents SDK y ahora MS Agent Framework compiten cabeza a cabeza.
Para quién importa: Cualquiera montando sistemas agénticos ahora mismo — elegir framework ya no es una decisión que se pueda posponer sin quedar en deuda técnica.
🔗 YouTube (DEEPTECH AI LABS) · Tutorial Microsoft Agent Framework
2. Strix Halo: el cuello de botella real es el prefill, no el decode
Qué ha pasado: Un análisis de 5 forks de Strix Halo con Qwen3.8 Flash-Next demuestra con números que los ~1.400 t/s de prefill son reales, pero los 60 t/s de decode anunciados no. La comunidad discute decode cuando el verdadero problema en contexto largo es procesar el prompt.
Por qué importa: Cambia cómo se debe evaluar hardware de memoria unificada: para RAG y contextos grandes, el prefill pesa más que el decode. Datos concretos, no hype.
Para quién importa: Quien considere Strix Halo / Macs para IA local con documentos largos.
đź”— Reddit r/LocalLLaMA
3. Verifica tu KV cache: lo anunciado no es lo que evicta
Qué ha pasado: Un usuario con 2x DGX Spark investigó a fondo la gestión de KV cache en vLLM con DeepSeek v4 Flash y publicó cómo validar cuánto contexto REAL soporta tu setup antes de que se evicte lo viejo.
Por qué importa: Los «262k de contexto» de los marketing specs no sobreviven al contacto con la presión real de cache. Método reproducible para medirlo en tu propia máquina.
Para quiĂ©n importa: Cualquiera corriendo agentes de larga duraciĂłn o RAG en local, donde el contexto largo es pan de cada dĂa.
đź”— Reddit r/LocalLLaMA
4. La matemática incómoda del Mac Studio para IA local
Qué ha pasado: Un desarrollador calculó el coste real de montar 4 Mac Studio M5 Ultra (unos $45.000) para escapar de una factura de API de $800/mes — y explica cuándo (y cuándo no) compensa.
Por quĂ© importa: Es exactamente la decisiĂłn de compra que la mayorĂa hace con intuiciĂłn y no con nĂşmeros. La tĂłnica general: el breakeven está mucho más lejos de lo que vende el hype.
Para quién importa: Cualquiera valorando hardware dedicado para inferencia local frente a API de pago.
đź”— YouTube (Devsplainers)
5. OpenClaw, el asistente open-source que se ha comido el mundo agéntico
QuĂ© ha pasado: Peter Steinberger, creador de OpenClaw, repasa en una entrevista larga cĂłmo el proyecto pasĂł de curiosidad open-source a uno de los asistentes agĂ©nticos más comentados del ecosistema. Además siguen apareciendo guĂas para correrlo 100% gratis con Gemma 4 local, sin API key.
Por qué importa: OpenClaw se está consolidando como el harness de referencia para asistentes personales con herramientas reales — y la combinación con modelos locales lo hace viable sin coste recurrente.
Para quién importa: Quien quiera montar su propio asistente con cron, memoria y herramientas, sin depender de APIs de pago.
🔗 Entrevista a Peter Steinberger · OpenClaw + Gemma 4 local
🧠Radar rápido
- Flue: harness agéntico programable — Framework open-source del equipo Astro que convierte el harness de Claude Code en algo totalmente programable. 🔗 YouTube (Better Stack)
- Eidon v4: plataforma IA self-hosted todo-en-uno — Chat, agentes estilo bot, automatizaciones y tools en un solo contenedor Docker, compatible con Ollama/LM Studio (AGPL). 🔗 Reddit
- Incidente AUR: borran llama.cpp-cuda y el rendimiento cae al 10% — La «alternativa equivalente» que sugirieron no lo era; aviso para quien compile o use paquetes binarios. 🔗 Reddit
- Qwen3.8-Flash-Next en 2×3090: +9-12% de decode a ~119k de contexto — Sustituir el fallback CUDA de top-k por una implementaciĂłn propia, con screening de calidad incluido. đź”— Reddit
- 2x R9700 + 64GB DDR5 con vLLM Radiance — Homelab con GPUs AMD que mueve Qwen 3.8 27B y Flash-Next sin drama; otra muestra de que ROCm ya es jugable. 🔗 Reddit
- M5 Max 128GB tras 5 meses de uso real — Hasta dĂłnde llega la IA local en el portátil Apple de gama alta en el dĂa a dĂa. đź”— YouTube
- Ling: INT4/vLLM vs Q5/llama.cpp invierten el ranking en contexto largo — El mismo modelo se comporta distinto según stack y profundidad de contexto; benchmarks con tablas en GitHub. 🔗 Reddit
- ¿Qué agent harness usáis y por qué? — Hilo con comparativas de primera mano entre claude code, deepagents (LangGraph) y los nuevos de cada semana. 🔗 Reddit
- GuĂa completa de LM Studio para empezar en local — 68 minutos de setup: hardware, modelos de HuggingFace y la mejor UI para arrancar. đź”— YouTube
- Contra el FOMO en IA local — Recordatorio sano: comprar más hardware no hace mejor el hobby; el gear acquisition syndrome tambiĂ©n existe aquĂ. đź”— Reddit
🎯 Mi lectura de la semana
Lo que más me queda de esta semana es que la comunidad local está madurando: menos demos, más metodologĂa. Los posts que mejor han envejecido son los que traen un mĂ©todo (cĂłmo validar KV cache de verdad, cĂłmo medir prefill vs decode, cĂłmo calcular el breakeven de un Mac Studio) en vez de un resultado espectacular.
La muerte de AutoGen me parece el otro gran titular: el mapa de frameworks agénticos se está consolidando y los que estamos montando sistemas con herramientas reales, cron y aprobación humana tenemos que elegir bando pronto. Lo bueno es que las ideas (harnesses persistentes, guardrails, memoria) ya son portables entre frameworks.
ÂżTienes algĂşn comentario o quieres profundizar en algo? RespĂłndeme.
Si te ha gustado, suscrĂbete al blog en elmonomudo.com.
