🤖 IA Weekly Digest #11 — Semana 39, 2026
Compilado el 25 de septiembre de 2026
Semana de empujar los mismos modelos cada vez más rápido: FreeToken lleva Qwen3.8-Flash-Next a 50 tg/s en una sola RTX 5090, unas Tesla V100 desparejas demuestran que el hardware «viejo» aún da guerra, y el ecosistema de frameworks de agentes se reordena tras la muerte de AutoGen.
🔝 Lo más importante de la semana
1. Qwen3.8-Flash-Next a 50 tg/s en una única RTX 5090 con FreeToken
Qué ha pasado: /u/dir3ctly ha publicado benchmarks de Qwen 3.8 Flash Next sobre una sola RTX 5090 usando FreeToken: 50 t/s de generación y 2.300 t/s de prompt processing. La clave: llama.cpp todavía no implementa Expert Caching para modelos MoE, lo que lastraba el rendimiento con el backend estándar.
Por qué importa: Demuestra que el backend importa tanto como el modelo. La misma GPU que parecía «quedarse corta» con llama.cpp rinde de sobra con un motor que cachea expertos — buen recordatorio antes de comprar hardware nuevo.
Para quién importa: Quienes corren MoE locales en una GPU de 32GB y quieran exprimir cada tg/s sin cambiar de tarjeta.
🔗 Reddit
2. Laboratorio local con dos Tesla V100 desparejas (16+32 GB): 1.380 t/s de prompt
Qué ha pasado: /u/OkBase5453 ha montado un lab de inferencia con un par asimétrico de Tesla V100 PCIe (16 GB + 32 GB, 48 GB totales) en Proxmox/LXC, corriendo qwen3.8 27B en Q6 y Q8 con un build reciente de CUDA para llama.cpp: 1.380 prompt tok/s y 40 tok/s de decode con tensor split y Flash Attention.
Por qué importa: Un caso práctico de que las GPUs «anticuadas» de segunda mano siguen siendo opción seria si aceptas hardware heterogéneo y haces la guía de tarjetas correctamente.
Para quién importa: Tinkerers con presupuesto ajustado que compren GPUs de datacenter usadas en vez de una 5090.
🔗 Reddit
3. MiMo-V2.6-Flash con vLLM: arreglos para «empty responses» con tools y un cap oculto de 2.048 tokens
Qué ha pasado: /u/mamolengo ha pasado un día debuggeando MiMo-V2.6-Flash-RL como backend de un agent harness sobre 2× DGX Spark con vLLM. La mayoría de los «problemas con tools» resultaron ser bugs de configuración de vLLM, y además descubrió un límite oculto de salida de 2.048 tokens que cortaba las respuestas largas.
Por qué importa: Mucha gente está volviendo a GLM-5.3-Flash creyendo que MiMo «es malo con herramientas», cuando el problema está en cómo se despliega, no en el modelo. Buen recordatorio de separar modelo de stack.
Para quién importa: Cualquiera montando agentes sobre modelos locales con vLLM y tool calling.
🔗 Reddit
4. Clasificadores «estilo JEV» con llama.cpp: usa cualquier GGUF con n_probs=10
Qué ha pasado: Dos hilos esta semana sobre convertir cualquier LLM en clasificador con logits de dígitos: basta correr el GGUF con llama.cpp usando n_predict=1 y n_probs=10, desactivar el razonamiento, y preguntar «¿spam? responde 1 o 0» — luego leer los logit-digits de la respuesta. /u/rhinodevil lo tiene implementado en su proyecto abierto mt_llm.
Por qué importa: Evita entrenar clasificadores específicos: un modelo pequeño local con logits restringidos puede hacer routing, spam-detection y clasificación a coste casi cero.
Para quién importa: Quienes montan pipelines locales con etapas de clasificación o enrutado de prompts.
🔗 Reddit · Reddit (mt_llm) · GitHub: mt_llm
5. DeepSeek-V4.1-Flash: límites nuevos en compresión de KV cache
Qué ha pasado: Entre los destacados de los HF Daily Papers aparece DeepSeek-V4.1-Flash, centrado en empujar la compresión del KV cache más allá de lo habitual, con nota de /u/ThomasAger sobre tres papers del día inusualmente buenos para la comunidad local.
Por qué importa: El KV cache es el verdadero cuello de botella de contexto largo en local. Comprimirlo mejor significa más contexto en la misma VRAM — traducción directa: modelos grandes con ventanas largas en hardware doméstico.
Para quién importa: Interesados en contextos largos en consumer GPUs y en la línea entre investigación y práctica local.
🔗 Reddit
🔧 Especial: frameworks de agentes 2026 — el mapa se ha reordenado
1. AutoGen está muerto (abril 2026): qué usar ahora
Qué ha pasado: Varios vídeos esta semana repasan el nuevo panorama tras la eliminación de AutoGen: CrewAI vs LangGraph vs MS Agent Framework es la tripleta vigente, y media docena de tutoriales populares del año ya están obsoletos.
Por qué importa: Si montaste algo sobre AutoGen, es migración obligada. LangGraph gana para grafos de estados complejos; CrewAI sigue siendo la opción «rápida de montar».
Para quién importa: Cualquiera con agentes en producción o planes de montarlos este trimestre.
🔗 YouTube · YouTube (3 formas, Python)
2. Flue: el harness de Claude Code hecho framework programable
Qué ha pasado: El equipo de Astro ha publicado Flue, un framework open-source que convierte el agent harness de Claude Code en una plataforma completamente programable, con herramientas, bucles y políticas bajo control explícito del desarrollador.
Por qué importa: Apunta al mismo hueco que OpenClaw ocupa en el ecosistema personal: harness como infraestructura, no como chat. Menos magia, más control.
Para quién importa: Devs que quieren agentes con guardrails y flujos explícitos sin reinventar el harness.
🔗 YouTube
🧭 Radar rápido
- OpenClaw, el documental — Peter Steinberger repasa en 27 minutos cómo su asistente open-source pasó de proyecto a fenómeno del AI agéntico. 🔗 YouTube
- Tutorial OpenClaw 100% local — Setup paso a paso con Telegram + Ollama sobre un ASUS GX10, ideal para quien empiece ahora. 🔗 YouTube
- ROCm vs Vulkan en Strix Halo — /u/Hrethric compara DSv4 Flash 0731 y Qwen 3.8 Flash Next en Radeon 9700 + Strix Halo con llama.cpp; los PRs recientes han movido el equilibrio. 🔗 Reddit
- PAM v2.0: memoria persistente para asistentes IA — Sistema open-source de memoria a largo plazo actualizado a paridad con los sistemas internos de los asistentes comerciales. 🔗 Reddit
- Mac mini M6: Qwen3.8-27B a 53+ TPS — Primer vistazo al nuevo mini; el chip base ya roza los números que antes exigían un Studio. 🔗 YouTube
- «No compres un Mac Studio M5 Ultra para IA local» — La matemática que nadie hace: 45.000$ en cuatro Studios frente a ~800$ de… la alternativa gana por KO en tok/s por dólar. 🔗 YouTube
🎯 Mi lectura de la semana
Esta semana me queda claro que la capa de infraestructura ha ganado la partida al modelo. El mismo Qwen 3.8 Flash Next pasa de «decepcionante» a 50 tg/s según el motor que uses; MiMo-V2.6 pasa de «malo con tools» a funcional según cómo configures vLLM. Comprar hardware nuevo por un benchmark mal medido es el error más caro del hobby ahora mismo.
El otro movimiento que sigo con lupa es el reordenamiento de los frameworks de agentes: AutoGen muerto, Flue llegando desde el mundo del harness, y OpenClaw narrándose ya como «el que cambió el mundo». Estamos en el momento en que los agentes persistentes con herramientas dejan de ser experimento y pasan a ser producto — y ese es exactamente el terreno donde vivo día a día.
¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.








