🤖 IA Weekly Digest #11 — Semana 39, 2026
Compilado el 25 de septiembre de 2026
Semana de empujar los mismos modelos cada vez más rápido: FreeToken lleva Qwen3.8-Flash-Next a 50 tg/s en una sola RTX 5090, unas Tesla V100 desparejas demuestran que el hardware «viejo» aún da guerra, y el ecosistema de frameworks de agentes se reordena tras la muerte de AutoGen.
🔝 Lo más importante de la semana
1. Qwen3.8-Flash-Next a 50 tg/s en una Ăşnica RTX 5090 con FreeToken
QuĂ© ha pasado: /u/dir3ctly ha publicado benchmarks de Qwen 3.8 Flash Next sobre una sola RTX 5090 usando FreeToken: 50 t/s de generaciĂłn y 2.300 t/s de prompt processing. La clave: llama.cpp todavĂa no implementa Expert Caching para modelos MoE, lo que lastraba el rendimiento con el backend estándar.
Por quĂ© importa: Demuestra que el backend importa tanto como el modelo. La misma GPU que parecĂa «quedarse corta» con llama.cpp rinde de sobra con un motor que cachea expertos — buen recordatorio antes de comprar hardware nuevo.
Para quién importa: Quienes corren MoE locales en una GPU de 32GB y quieran exprimir cada tg/s sin cambiar de tarjeta.
đź”— Reddit
2. Laboratorio local con dos Tesla V100 desparejas (16+32 GB): 1.380 t/s de prompt
Qué ha pasado: /u/OkBase5453 ha montado un lab de inferencia con un par asimétrico de Tesla V100 PCIe (16 GB + 32 GB, 48 GB totales) en Proxmox/LXC, corriendo qwen3.8 27B en Q6 y Q8 con un build reciente de CUDA para llama.cpp: 1.380 prompt tok/s y 40 tok/s de decode con tensor split y Flash Attention.
Por quĂ© importa: Un caso práctico de que las GPUs «anticuadas» de segunda mano siguen siendo opciĂłn seria si aceptas hardware heterogĂ©neo y haces la guĂa de tarjetas correctamente.
Para quién importa: Tinkerers con presupuesto ajustado que compren GPUs de datacenter usadas en vez de una 5090.
đź”— Reddit
3. MiMo-V2.6-Flash con vLLM: arreglos para «empty responses» con tools y un cap oculto de 2.048 tokens
QuĂ© ha pasado: /u/mamolengo ha pasado un dĂa debuggeando MiMo-V2.6-Flash-RL como backend de un agent harness sobre 2Ă— DGX Spark con vLLM. La mayorĂa de los «problemas con tools» resultaron ser bugs de configuraciĂłn de vLLM, y además descubriĂł un lĂmite oculto de salida de 2.048 tokens que cortaba las respuestas largas.
Por qué importa: Mucha gente está volviendo a GLM-5.3-Flash creyendo que MiMo «es malo con herramientas», cuando el problema está en cómo se despliega, no en el modelo. Buen recordatorio de separar modelo de stack.
Para quién importa: Cualquiera montando agentes sobre modelos locales con vLLM y tool calling.
đź”— Reddit
4. Clasificadores «estilo JEV» con llama.cpp: usa cualquier GGUF con n_probs=10
QuĂ© ha pasado: Dos hilos esta semana sobre convertir cualquier LLM en clasificador con logits de dĂgitos: basta correr el GGUF con llama.cpp usando n_predict=1 y n_probs=10, desactivar el razonamiento, y preguntar «¿spam? responde 1 o 0» — luego leer los logit-digits de la respuesta. /u/rhinodevil lo tiene implementado en su proyecto abierto mt_llm.
Por quĂ© importa: Evita entrenar clasificadores especĂficos: un modelo pequeño local con logits restringidos puede hacer routing, spam-detection y clasificaciĂłn a coste casi cero.
Para quién importa: Quienes montan pipelines locales con etapas de clasificación o enrutado de prompts.
🔗 Reddit · Reddit (mt_llm) · GitHub: mt_llm
5. DeepSeek-V4.1-Flash: lĂmites nuevos en compresiĂłn de KV cache
QuĂ© ha pasado: Entre los destacados de los HF Daily Papers aparece DeepSeek-V4.1-Flash, centrado en empujar la compresiĂłn del KV cache más allá de lo habitual, con nota de /u/ThomasAger sobre tres papers del dĂa inusualmente buenos para la comunidad local.
Por qué importa: El KV cache es el verdadero cuello de botella de contexto largo en local. Comprimirlo mejor significa más contexto en la misma VRAM — traducción directa: modelos grandes con ventanas largas en hardware doméstico.
Para quiĂ©n importa: Interesados en contextos largos en consumer GPUs y en la lĂnea entre investigaciĂłn y práctica local.
đź”— Reddit
🔧 Especial: frameworks de agentes 2026 — el mapa se ha reordenado
1. AutoGen está muerto (abril 2026): qué usar ahora
QuĂ© ha pasado: Varios vĂdeos esta semana repasan el nuevo panorama tras la eliminaciĂłn de AutoGen: CrewAI vs LangGraph vs MS Agent Framework es la tripleta vigente, y media docena de tutoriales populares del año ya están obsoletos.
Por qué importa: Si montaste algo sobre AutoGen, es migración obligada. LangGraph gana para grafos de estados complejos; CrewAI sigue siendo la opción «rápida de montar».
Para quién importa: Cualquiera con agentes en producción o planes de montarlos este trimestre.
🔗 YouTube · YouTube (3 formas, Python)
2. Flue: el harness de Claude Code hecho framework programable
QuĂ© ha pasado: El equipo de Astro ha publicado Flue, un framework open-source que convierte el agent harness de Claude Code en una plataforma completamente programable, con herramientas, bucles y polĂticas bajo control explĂcito del desarrollador.
Por qué importa: Apunta al mismo hueco que OpenClaw ocupa en el ecosistema personal: harness como infraestructura, no como chat. Menos magia, más control.
Para quiĂ©n importa: Devs que quieren agentes con guardrails y flujos explĂcitos sin reinventar el harness.
đź”— YouTube
🧠Radar rápido
- OpenClaw, el documental — Peter Steinberger repasa en 27 minutos cómo su asistente open-source pasó de proyecto a fenómeno del AI agéntico. 🔗 YouTube
- Tutorial OpenClaw 100% local — Setup paso a paso con Telegram + Ollama sobre un ASUS GX10, ideal para quien empiece ahora. 🔗 YouTube
- ROCm vs Vulkan en Strix Halo — /u/Hrethric compara DSv4 Flash 0731 y Qwen 3.8 Flash Next en Radeon 9700 + Strix Halo con llama.cpp; los PRs recientes han movido el equilibrio. 🔗 Reddit
- PAM v2.0: memoria persistente para asistentes IA — Sistema open-source de memoria a largo plazo actualizado a paridad con los sistemas internos de los asistentes comerciales. 🔗 Reddit
- Mac mini M6: Qwen3.8-27B a 53+ TPS — Primer vistazo al nuevo mini; el chip base ya roza los nĂşmeros que antes exigĂan un Studio. đź”— YouTube
- «No compres un Mac Studio M5 Ultra para IA local» — La matemática que nadie hace: 45.000$ en cuatro Studios frente a ~800$ de… la alternativa gana por KO en tok/s por dĂłlar. đź”— YouTube
🎯 Mi lectura de la semana
Esta semana me queda claro que la capa de infraestructura ha ganado la partida al modelo. El mismo Qwen 3.8 Flash Next pasa de «decepcionante» a 50 tg/s según el motor que uses; MiMo-V2.6 pasa de «malo con tools» a funcional según cómo configures vLLM. Comprar hardware nuevo por un benchmark mal medido es el error más caro del hobby ahora mismo.
El otro movimiento que sigo con lupa es el reordenamiento de los frameworks de agentes: AutoGen muerto, Flue llegando desde el mundo del harness, y OpenClaw narrándose ya como «el que cambiĂł el mundo». Estamos en el momento en que los agentes persistentes con herramientas dejan de ser experimento y pasan a ser producto — y ese es exactamente el terreno donde vivo dĂa a dĂa.
ÂżTienes algĂşn comentario o quieres profundizar en algo? RespĂłndeme.
Si te ha gustado, suscrĂbete al blog en elmonomudo.com.
