18
septiembre
2026
IA Weekly Digest #10 — Semana 38: motores C99, Cherenkov en MacBook Air y el debate 5090 vs Mac Studio


🤖 IA Weekly Digest #10 — Semana 38, 2026

Compilado el 18 de septiembre de 2026

Semana de ingeniería al límite: motores de inferencia escritos desde cero en C99, un Qwen3.8-Flash-Next corriendo a 8-22 tg/s en una MacBook Air de 32GB, y un debate eterno reabierto — ¿RTX 5090 o Mac Studio M5 Ultra? Spoiler: la respuesta sigue siendo «depende de tu VRAM y tu banco».

🔝 Lo más importante de la semana

1. Cherenkov: Qwen3.8-Flash-Next a 8-22 tg/s en una MacBook Air de 32GB

Qué ha pasado: /u/alfredr ha publicado Cherenkov, un motor de inferencia para Apple Silicon optimizado para memoria restringida: consigue correr Qwen3.8-Flash-Next (Q4) con solo ~21GB de asignaciones, alcanzando 8-22 tg/s en una M4 MacBook Air de 32GB.
Por qué importa: Es un record de inferencia en hardware «constrained» y demuestra que la optimización a nivel de motor importa más que el hardware bruto. El código está abierto en GitHub.
Para quién importa: Cualquiera con un Mac de memoria unificada que quiera modelos grandes sin comprar un Studio.
🔗 Reddit · GitHub: Cherenkov

2. Motor de inferencia único en C99: BitNet ternario + GGUF estándar, sin Python ni CUDA

Qué ha pasado: Un nuevo motor de inferencia escrito en C99 puro es capaz de ejecutar tanto modelos BitNet (1.58-bit ternarios) como GGUF convencionales desde un único binario, sin dependencias de Python ni CUDA.
Por qué importa: Hasta ahora había que elegir entre llama.cpp (GGUF) o bitnet.cpp (ternario). Unificar ambos en un binario portable abre la puerta a inferencia local en hardware modesto y sin ecosistema NVIDIA.
Para quién importa: Tinkerers con GPUs antiguas, CPUs solamente, o quien quiera desplegar inferencia en máquinas mínimas.
🔗 Reddit

3. Explorador de quants: qué GGUF cabe en tu GPU/Mac, con el comando llama.cpp listo

Qué ha pasado: /u/asankhs ha lanzado Local Model Explorer, una herramienta en Hugging Face Spaces que calcula qué quants de un modelo caben en tu GPU o Mac una vez sumados contexto, KV cache y capas offloadadas — y te da el comando llama.cpp exacto.
Por qué importa: Acaba con el ritual de prueba y error al cargar modelos. Los fallos de OOM al sumar contexto + KV cache son el error #1 al correr modelos locales, y esta herramienta los evita de raíz.
Para quién importa: Todos. Es la herramienta que todos los que montamos setups locales llevábamos tiempo deseando.
🔗 Reddit · Hugging Face Space

4. ¿Vender la RTX 5090 por un Mac Studio M5 Ultra de 96GB?

Qué ha pasado: Debate de la semana en r/LocalLLaMA: un usuario plantea vender su 5090 (~$5k de reventa) por un Mac Studio M5 Ultra de 96GB ($5.499). El dato clave: la 5090 tiene 1.8 TB/s de ancho de banda frente a los 1.2 TB/s del M5 Ultra.
Por qué importa: Es la decisión de hardware del año para muchos. La 5090 gana en throughput bruto, pero el Mac ofrece 96GB de memoria unificada y un consumo ridículo. Para código, el ecosistema CUDA sigue pesando.
Para quién importa: Quien esté planificando una renovación de setup de inferencia local en 2026.
🔗 Reddit

5. Mi equipo multi-agente con OpenClaw: un Mac Mini y 4 agentes dirigiendo un negocio

Qué ha pasado: Brian Casel ha publicado un vídeo detallando cómo montó un equipo de 4 agentes con OpenClaw en un Mac Mini dedicado para operar su negocio: coordinación de tareas, correo, y workflows recurrentes.
Por qué importa: Es un caso real de orquestación multi-agente en producción, no una demo: hardware dedicado, división de roles entre agentes y automatización de operaciones cotidianas.
Para quién importa: Cualquiera explorando OpenClaw como asistente personal operativo — y sobre todo los que dudan si un mini PC dedicado justifica la inversión.
🔗 YouTube

🧭 Radar rápido

  • GGUF con nuevos layouts de tensores — /u/noneabove1182 publica su investigación sobre reorganizar la forma de los modelos que sube a Hugging Face. 🔗 Reddit · Blog
  • GPU vieja para visión (mmproj) — Truco: dedicar una GPU secundaria lenta solo al proyector de visión con --mmdev CUDA1 libera VRAM del modelo principal sin matar la velocidad. 🔗 Reddit
  • LM Studio acepta overrides de llama.cpp — Probar --yarn-attn-factor 1.2 sin re-guardar el GGUF; se reporta mejora en creatividad. 🔗 Reddit
  • Qwen3.8-27B a 156K de contexto en una sola 5090 — Q6_K + DFlash2 speculative decoding: 140-190 tok/s para sesiones largas de coding agéntico. 🔗 Reddit
  • Fork de llama.cpp para Ampere — Config optimizada para 30xx: 90+ TPS para coding agéntico si tienes una 3090. 🔗 Reddit
  • Undervolting para LLM 24/7 — Cómo perder cero rendimiento y bajar la factura térmica (y eléctrica) de un rig de inferencia doméstico. 🔗 Reddit
  • CUDA graphs para draft MTP en llama.cpp — PR #28549 promete acelerar speculative decoding con draft models en NVIDIA. 🔗 Reddit
  • MLX vs GGUF en Mac — Hilo comparativo actualizado: velocidad y rendimiento por quant en el ecosistema Apple. 🔗 Reddit
  • llama.cpp b11003 — Nueva release con mejoras habituales de rendimiento y soporte. 🔗 Reddit

🎯 Mi lectura de la semana

Esta semana me quedo con dos ideas. La primera: el software está comiendo al hardware. Entre Cherenkov en una MacBook Air, el fork de llama.cpp para Ampere y el DFlash2 exprimiendo una 5090, está claro que las mayores ganancias de rendimiento ya no vienen de comprar más VRAM, sino de apretar cada gigabyte que ya tienes.

La segunda: la herramienta de quants que te dice qué cabe en tu GPU es de esas que marcan un antes y un después silencioso. Casi todo el tiempo perdido montando setups locales era adivinar memorias. Cuando el adivinar desaparece, la barrera de entrada baja para todo el mundo. Y eso, a la larga, importa más que cualquier benchmark de tok/s.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.


11
septiembre
2026
IA Weekly Digest #9 — Semana 37: AutoGen retirado, benchmarks de KV cache y prefill, hardware local y OpenClaw

🤖 IA Weekly Digest #9 — Semana 37, 2026

Compilado el 11 de septiembre de 2026

Esta semana el mundillo local ha estado Lispero: Microsoft enterró AutoGen de una vez, la comunidad de r/LocalLLaMA ha sacado benchmarks serios sobre KV cache y prefill que desmontan mitos de marketing, y hay una reflexión interesante sobre cuánto cuesta de verdad montar un Mac Studio para IA local frente a pagar API. Además, OpenClaw vuelve a estar en boca de todos.

🔝 Lo más importante de la semana

1. Microsoft mata AutoGen y apuesta todo por el Microsoft Agent Framework

Qué ha pasado: Microsoft ha confirmado el fin de AutoGen (abril 2026) y empuja su nuevo Microsoft Agent Framework como sucesor para construir aplicaciones multi-agente desde cero.
Por qué importa: La mayoría de tutoriales de agentes escritos este año quedan obsoletos de golpe. El panorama de frameworks se reordena: LangGraph, CrewAI, OpenAI Agents SDK y ahora MS Agent Framework compiten cabeza a cabeza.
Para quién importa: Cualquiera montando sistemas agénticos ahora mismo — elegir framework ya no es una decisión que se pueda posponer sin quedar en deuda técnica.
🔗 YouTube (DEEPTECH AI LABS) · Tutorial Microsoft Agent Framework

2. Strix Halo: el cuello de botella real es el prefill, no el decode

Qué ha pasado: Un análisis de 5 forks de Strix Halo con Qwen3.8 Flash-Next demuestra con números que los ~1.400 t/s de prefill son reales, pero los 60 t/s de decode anunciados no. La comunidad discute decode cuando el verdadero problema en contexto largo es procesar el prompt.
Por qué importa: Cambia cómo se debe evaluar hardware de memoria unificada: para RAG y contextos grandes, el prefill pesa más que el decode. Datos concretos, no hype.
Para quién importa: Quien considere Strix Halo / Macs para IA local con documentos largos.
🔗 Reddit r/LocalLLaMA

3. Verifica tu KV cache: lo anunciado no es lo que evicta

Qué ha pasado: Un usuario con 2x DGX Spark investigó a fondo la gestión de KV cache en vLLM con DeepSeek v4 Flash y publicó cómo validar cuánto contexto REAL soporta tu setup antes de que se evicte lo viejo.
Por qué importa: Los «262k de contexto» de los marketing specs no sobreviven al contacto con la presión real de cache. Método reproducible para medirlo en tu propia máquina.
Para quién importa: Cualquiera corriendo agentes de larga duración o RAG en local, donde el contexto largo es pan de cada día.
🔗 Reddit r/LocalLLaMA

4. La matemática incómoda del Mac Studio para IA local

Qué ha pasado: Un desarrollador calculó el coste real de montar 4 Mac Studio M5 Ultra (unos $45.000) para escapar de una factura de API de $800/mes — y explica cuándo (y cuándo no) compensa.
Por qué importa: Es exactamente la decisión de compra que la mayoría hace con intuición y no con números. La tónica general: el breakeven está mucho más lejos de lo que vende el hype.
Para quién importa: Cualquiera valorando hardware dedicado para inferencia local frente a API de pago.
🔗 YouTube (Devsplainers)

5. OpenClaw, el asistente open-source que se ha comido el mundo agéntico

Qué ha pasado: Peter Steinberger, creador de OpenClaw, repasa en una entrevista larga cómo el proyecto pasó de curiosidad open-source a uno de los asistentes agénticos más comentados del ecosistema. Además siguen apareciendo guías para correrlo 100% gratis con Gemma 4 local, sin API key.
Por qué importa: OpenClaw se está consolidando como el harness de referencia para asistentes personales con herramientas reales — y la combinación con modelos locales lo hace viable sin coste recurrente.
Para quién importa: Quien quiera montar su propio asistente con cron, memoria y herramientas, sin depender de APIs de pago.
🔗 Entrevista a Peter Steinberger · OpenClaw + Gemma 4 local

🧭 Radar rápido

  • Flue: harness agéntico programable — Framework open-source del equipo Astro que convierte el harness de Claude Code en algo totalmente programable. 🔗 YouTube (Better Stack)
  • Eidon v4: plataforma IA self-hosted todo-en-uno — Chat, agentes estilo bot, automatizaciones y tools en un solo contenedor Docker, compatible con Ollama/LM Studio (AGPL). 🔗 Reddit
  • Incidente AUR: borran llama.cpp-cuda y el rendimiento cae al 10% — La «alternativa equivalente» que sugirieron no lo era; aviso para quien compile o use paquetes binarios. 🔗 Reddit
  • Qwen3.8-Flash-Next en 2×3090: +9-12% de decode a ~119k de contexto — Sustituir el fallback CUDA de top-k por una implementación propia, con screening de calidad incluido. 🔗 Reddit
  • 2x R9700 + 64GB DDR5 con vLLM Radiance — Homelab con GPUs AMD que mueve Qwen 3.8 27B y Flash-Next sin drama; otra muestra de que ROCm ya es jugable. 🔗 Reddit
  • M5 Max 128GB tras 5 meses de uso real — Hasta dónde llega la IA local en el portátil Apple de gama alta en el día a día. 🔗 YouTube
  • Ling: INT4/vLLM vs Q5/llama.cpp invierten el ranking en contexto largo — El mismo modelo se comporta distinto según stack y profundidad de contexto; benchmarks con tablas en GitHub. 🔗 Reddit
  • ¿Qué agent harness usáis y por qué? — Hilo con comparativas de primera mano entre claude code, deepagents (LangGraph) y los nuevos de cada semana. 🔗 Reddit
  • Guía completa de LM Studio para empezar en local — 68 minutos de setup: hardware, modelos de HuggingFace y la mejor UI para arrancar. 🔗 YouTube
  • Contra el FOMO en IA local — Recordatorio sano: comprar más hardware no hace mejor el hobby; el gear acquisition syndrome también existe aquí. 🔗 Reddit

🎯 Mi lectura de la semana

Lo que más me queda de esta semana es que la comunidad local está madurando: menos demos, más metodología. Los posts que mejor han envejecido son los que traen un método (cómo validar KV cache de verdad, cómo medir prefill vs decode, cómo calcular el breakeven de un Mac Studio) en vez de un resultado espectacular.

La muerte de AutoGen me parece el otro gran titular: el mapa de frameworks agénticos se está consolidando y los que estamos montando sistemas con herramientas reales, cron y aprobación humana tenemos que elegir bando pronto. Lo bueno es que las ideas (harnesses persistentes, guardrails, memoria) ya son portables entre frameworks.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.


04
septiembre
2026

🤖 IA Weekly Digest #10 — Semana 36, 2026

Compilado el 4 de septiembre de 2026

Lo ligero compite directamente con lo pesado. Esta semana, tres frentes distintos demuestran que la optimización de software y los modelos sparse están recortando la dependencia de hardware caro: un Nemotron cuantizado que cabe en 16 GB con 262K de contexto, un portátil con eGPU igualando a un dual-3090, y un router que decide cuándo tu modelo local debe rendir la partida ante la nube. El mensaje ya no es «compra más GPU», sino «basta con mejores algoritmos».

🔝 Lo más importante de la semana

1. Nemotron-3.5-Lightning a 11.77 GB: un modelo serio de 16 GB con 262K de contexto

Qué ha pasado: NVIDIA publica una cuantización real de Nemotron-3.5-Lightning a 11.77 GB (~3.07 bpw), destapando que los «low-bit» anteriores eran en secreto ~4.70 bpw. Con llama.cpp parcheado, el modelo soporta 262K tokens de contexto en solo 16 GB de VRAM. Ojo: no funciona en LM Studio ni Ollama — requiere la compilación custom de llama.cpp.

Por qué importa: Democratiza el acceso a modelos avanzados con hardware mainstream. Análisis documental y agentes con memoria larga ya no exigen 40+ GB de VRAM: la calidad «gama alta» baja a tarjetas de gama media.

Para quién importa: Quien tenga una 4060 Ti 16GB, 4070 Ti Super o similar y quiera un modelo potente sin montar multi-GPU.

🔗 Reddit r/LocalLLaMA

2. HybridInfer: el router que detecta cuando tu modelo local se atasca y salta a la nube

Qué ha pasado: Un desarrollador publica (Apache-2.0) un router que monitoriza la ejecución de prompts en modelos locales y, ante stalls silenciosos (contexto desbordado, errores CUDA mudos, GPU OOM), redirige automáticamente la petición al cloud. No es failover simple: detecta patrones de stalling, estima tiempos de respuesta y decide cuándo compensa cambiar.

Por qué importa: Resuelve uno de los mayores dolores de correr modelos locales: quedarte colgado sin output y sin saber si la culpa es del modelo, la GPU o la red. Es un patrón arquitectural replicable en cualquier stack de inferencia local.

Para quién importa: Cualquiera con inferencia local — y muy especialmente productos SaaS basados en LLMs donde la fiabilidad es crítica.

🔗 Reddit r/LocalLLaMA

3. Qwen3.8-Flash-Next (104 GB MoE) en Strix Halo + eGPU: 84 tok/s a 0.4x del coste de un dual-3090

Qué ha pasado: Con la cuantización UD-Q4_K_XL de unsloth (103.69 GB), un portátil ASUS Strix Halo con eGPU RTX 3090 Ti pasa de 22 a 84 tokens/segundo ejecutando Qwen3.8-Flash-Next — un MoE con 512 expertos por capa, 36 capas de DeltaNet y tabla n-gram de 26.8 GiB — quedando a un problema de HumanEval+ de distancia de una caja dual-3090 con vLLM.

Por qué importa: Un portátil gamer + eGPU ya rivaliza con configuraciones de servidor dedicadas. La activación sparse del MoE hace el resto. Cambia la conversación sobre dónde ejecutar LLMs grandes.

Para quién importa: Devs e investigadores sin espacio, presupuesto o electricidad para un server dedicado.

🔗 Reddit r/LocalLLaMA


🧭 Radar rápido

  • AVX2 acelera prompts en batch grande con llama.cpp — PR #27402 mejora el throughput en servidores multi-usuario con CPUs AVX2. 🔗 GitHub
  • MTP rompe el tool calling en Qwen 3.6 9B — La Multi-Token Prediction acelera la generación pero degrada el JSON estructurado de las herramientas; desactiva MTP si dependes del tool calling. 🔗 Reddit
  • -DGGML_CUDA_NCCL=ON puede empeorar el rendimiento — El flag «multi-GPU mejor» introdujo overhead de sincronización en ciertos setups: testea siempre con tu configuración concreta. 🔗 Reddit

🎯 Mi lectura de la semana

Llevo semanas siguiendo la misma señal y esta se consolida: cada vez basta con mejores algoritmos, no con más GPUs. Nemotron en 11 GB, un portátil compitiendo con dos 3090, y un router que orquesta local y nube con criterio. La optimización de software, los modelos sparse y la arquitectura inteligente están recortando la factura de hardware semana a semana.

Para quien monta agentes —como yo con mis flujos de escritura y publicación— el aprendizaje práctico es doble: vigila los fallos silenciosos del modelo local (un router tipo HybridInfer tiene mucho sentido), y no des MTP por sentado si dependes del tool calling.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


28
agosto
2026
Ilustración IA local: cerebro de circuitos sobre un PC de sobremesa

🤖 IA Weekly Digest #9 — Semana 35, 2026

Compilado el 28 de agosto de 2026

Esta semana la inferencia local dejó de ser privilegio de GPUs caros: DFlash acerca el speculative decoding a las CPUs, Quantization-Aware Healing consigue que un modelo 4-bit supere a su original en FP16, y Flue convierte el harness de Claude Code en un framework agéntico programable. Democratizar primero la ejecución, luego el control.

🔝 Lo más importante de la semana

1. Flue: un framework agéntico programable que funciona — del hype a lo real

Qué ha pasado: El equipo de Astro, conocidos por Vite y Nuxt, lanzó Flue, un framework open-source que transforma el harness de agentes de Claude Code en algo plenamente programable. En vez de ser solo un wrapper sobre herramientas predefinidas, Flue permite escribir lógica de agente como código estructurado — flujos condicionales, state management, composición de herramientas custom. Es la diferencia entre «el modelo decide qué herramienta usar» y «tú defines cómo se encadenan las decisiones».
Lo que realmente importa: La comunidad lleva meses pidiendo frameworks que no sean cajas negras. Flue rompe esa caja. No es otro LangChain — es una capa encima del agent harness que te da control explícito sobre el flujo de ejecución. Para quien haya probado AutoGen, CrewAI o LangGraph y se haya frustrado con la complejidad opaca, esto llega como un soplo de aire fresco.
Por qué importa: Si los frameworks agénticos actuales son cajas negras difíciles de depurar, Flue los hace transparentes y programables. Es un cambio de paradigma: dejar de tratar al agent como magia y empezar a tratarlo como software que puedes inspeccionar, testear y escalar.
🔗 YouTube

2. Speculative Decoding en CPUs con DFlash: casi 4x más rápido sin cambiar modelo

Qué ha pasado: Ehssan Khan publica en Towards Data Science resultados sólidos de DFlash aplicado a speculative decoding en CPUs. Con Qwen3.5-9B sobre Intel Xeon 6, obtuvo un throughput de 3.92x sobre generación autoregresiva pura, a concurrencia 1. La clave: usa el compute infrautilizado de la CPU para generar tokens speculativos que luego valida el modelo pequeño, sin alterar el resultado final ni requerir GPU.
Lo que realmente importa: Hasta ahora el speculative decoding era terreno exclusivo de GPUs con VRAM generosa. DFlash democratiza la técnica: si tienes un servidor con CPUs modernas pero sin GPU dedicada, puedes obtener speedups reales sin comprar hardware nuevo. Los tests con vLLM confirman que no es un truco de laboratorio — escala de forma predecible.
Por qué importa: Reduce la barrera de entrada para inferencia rápida. Cualquier empresa o particular con servidores x86 puede obtener rendimiento cercano al de GPU sin inversión adicional. Además, abre la puerta a despliegues serverless más baratos y eficientes.
🔗 Artículo completo

3. Quantization-Aware Healing: un modelo 4-bit comprimido que supera a su original en precisión completa

Qué ha pasado: Multiverse Computing presenta en Hugging Face Blog una técnica llamada Quantization-Aware Healing aplicada a modelos 4-bit. El hallazgo sorprendente: un modelo comprimido y reparado mediante este proceso no solo mantiene su accuracy, sino que la supera frente al original en precisión completa. El «healing» ajusta pesos durante la cuantización para compensar pérdidas de información, y el resultado es un modelo más compacto y más preciso que el baseline.
Lo que realmente importa: La cuantización suele implicar trade-offs — menos memoria, sí, pero también menos capacidad. Esto invierte la ecuación. Si un modelo 4-bit bien reparado puede superar al FP16 original, el coste de desplegar modelos locales se reduce radicalmente: menos VRAM, menos inference time, mejor resultado.
Por qué importa: Democratiza acceso a modelos grandes con hardware modesto. Un mismo modelo que antes necesitaba 80 GB de VRAM podría ahora correr en 20 GB con resultados iguales o mejores. Cambia la ecuación de viabilidad para despliegues edge, IoT y entornos constrained.
🔗 Blog Hugging Face

✅ Secundarios Útiles

Two RTX 3090 sin NVLink: 3.200 tokens/min con Qwen3.8-27B a contexto completo de 262K

Un usuario configura dos RTX 3090 en tensor parallel sin NVLink, ejecutando Qwen3.8-27B (W4A16-AutoRound) con vLLM 0.27.1. La combinación de MTP speculative decoding + GPU prefix cache + KV cache en fp8 le permite alcanzar ~3.200 tok/min manteniendo el contexto completo de 262K tokens. Demuestra que con la stack correcta, incluso hardware sin NVLink puede ofrecer rendimiento competitivo para agentes locales.
🔗 Hilo en r/LocalLLaMA

¿Cómo ejecutar Qwen3.6-35B-A3B con Continue en VSCodium? Solución definitiva

Un usuario con Intel Ultra 7 265K, 128 GB DDR5 y RTX 5090 (32 GB GDDR7) quiere reproducir la experiencia de Claude Desktop de forma local. Prueba con llama.cpp + extensión Continue en VSCodium. Aunque parte de una configuración sólida (hardware potente), enfrenta problemas de integración. El hilo genera soluciones prácticas de otros usuarios sobre flags de llama.cpp y config de Continue.
🔗 Hilo en r/LocalLLaMA

Ollama como cuello de botella: harness vs chat normal

Un usuario reporta que su Qwen3.6 35B A3B alcanza ~27 t/s en chat normal pero cae a 15 t/s cuando usa harnesses como OpenCode o Maki, con contexto menor. Investiga si es problema de la herramienta o de Ollama como intermediario. La conclusión comunitaria: Ollama añade overhead innecesario; llamar directamente a llama.cpp o vLLM elimina el bottleneck.
🔗 Hilo en r/LocalLLaMA

💬 Ángulo editorial

«La inferencia local deja de ser privilegio de GPUs caros.» De DFlash (CPU-speculative a 4x) a Quantization-Aware Healing (4-bit > FP16), esta semana muestra una tendencia clara: el hardware caro ya no es requisito indispensable para buen rendimiento. Combinado con Flue (agentes programables transparentes), hay un movimiento de abajo hacia arriba: democratizar primero la ejecución, luego el control. Quien tenga servidores x86 modestos o GPUs consumer pueden competir con stacks optimizados, no solo con specs brutas.

¿Tienes algún comentario o quieres que ajuste algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


21
agosto
2026
🤖 IA Weekly Digest #4 — Semana 34, 2026

🤖 IA Weekly Digest #4 — Semana 34, 2026

Compilado el 21 de agosto de 2026

Esta semana fue el 13 de agosto — la noche en que DeepSeek dejó de ser solo un proveedor de modelos y se convirtió en infraestructura agéntica. Con Harness, Google con Gemini 3.7 Flash, y Zhipu con GLM-5.3, la guerra ya no es por quién tiene el modelo más inteligente, sino por quién controla la capa entre el modelo y la máquina.

🔝 Lo más importante de la semana

1. DeepSeek Harness: «Everything is a Plugin» — 95K estrellas en 2 días

Qué ha pasado: El 13 de agosto, DeepSeek publicó un proyecto open-source llamado DeepSeek Harness (CLI: dsh) bajo licencia MIT. No fue un modelo nuevo — fue un agent harness, el runtime que decide cómo un modelo llama a herramientas, edita archivos y corre comandos. 10K estrellas en 30 minutos, 50K en 12 horas, 95K en 2 días. Récord absoluto en GitHub.
Por qué importa: La arquitectura es «everything is a plugin» — el adaptador de modelo, herramientas, sesiones, sandbox, scheduler, incluso la UI son intercambiables. Detrás está Cordis, un meta-framework con un paper de 88 páginas de Peking University + DeepSeek. Y lo más revelador: V4-Pro sacó 87.9 en Terminal-Bench con el harness propio, pero solo 54.68 con el harness de referencia. El harness importa tanto como el modelo.
Para quién importa: Cualquiera que ya use OpenClaw, Cursor o Claude Code. La pregunta no es «¿lo cambio?» sino «¿qué partes de esta arquitectura plugin-first puedo reutilizar?»
🔗 GitHub · Deep dive · Guía completa

2. Google lanza Gemini 3.7 Flash: coding y agents a mitad de precio

Qué ha pasado: El mismo 13 de agosto, Google anunció Gemini 3.7 Flash — solo 3 semanas después de 3.6 Flash. Context window de 1M tokens. Optimizado para debugging, código de producción y workflows agénticos multi-paso. Precio introductorio: $0.75/M input y $3.75/M output, la mitad de 3.6 Flash, hasta el 31 de diciembre.
Por qué importa: La cadencia de 3 semanas es sin precedentes. Google está ejecutando una estrategia de saturación — modelos buenos y baratos tan rápido que la competencia no dé tiempo a reaccionar. Para quien busque un modelo de trabajo diario eficiente por dollar, 3.7 Flash es ahora la referencia.
Para quién importa: Cualquiera que busque un modelo coding/agent barato y capaz para uso diario. Especialmente relevante para quien quiera automatizar flujos sin pagar precios de frontier.
🔗 Google Blog · DeepMind · Ars Technica

3. GLM-5.3 de Zhipu: el modelo open-weights de coding más fuerte — con trampa

Qué ha pasado: Zhipu AI lanzó GLM-5.3, 743B parámetros (misma base que GLM-5.2) con +50% en programación vía post-training. En CyberGym lidera discovery de vulnerabilidades y rinde el doble que GLM-5.2 en exploit chains. Zhipu dice que se acerca a Claude Fable 5.
Por qué importa: La dirección es clara: post-training scaling sin cambiar la base. Pero la trampa es que los weights no se liberaron — Zhipu promete «dos semanas» tras revisión de seguridad. Mientras tanto, solo API. Prometer open-weights y no soltarlos es un patrón que la comunidad ya empieza a cansar de ver.
Para quién importa: Si los weights se liberan, será un modelo coding serious para ecosistema local. Mientras tanto, la promesa es interesante pero la entrega es pendiente.
🔗 China Daily · Tech in Asia


🧭 Radar rápido

  • Nvidia entrena Nemotron 4 — Modelo open de 1 trillón de parámetros, posible release para finales de otoño. Junto con Nemotron 3.5 Lightning y NeMo Switchyard (router open-source). 🔗 Reuters
  • Anthropic negocia compra de Decart AI por ~$6B — Señal clara de preparación para IPO. Decart desarrolla infraestructura AI y modelos para robotics. 🔗 Reuters
  • DeepSeek V4-Pro-0813 GA + subida de precios — Release oficial, 1M tokens context. El 16 de agosto, output subió de 6 a 27 CNY/M tokens. El harness open-source compensa parcialmente si corres local. 🔗 DeepSeek
  • Kimi-K3 llega a llama.cpp — PR #26185 en curso para soporte del modelo de MoonshotAI en GGUF. La comunidad ya está testeando quants. 🔗 Reddit
  • Llama.cpp ROCm 7.2→7.14 — Soporte traido para Radeon 780m iGPU. Mejoras reales pero aún limitaciones. 🔗 Reddit

🎯 Mi lectura de la semana

El 13 de agosto fue el día en que la guerra de modelos se convirtió en guerra de infraestructura. DeepSeek abrió todo su stack agéntico. Google saturó el mercado con un Flash más barato. Zhipu prometió el mejor modelo de coding open-weights (pero no lo soltó). Nvidia prepara un trillón de parámetros open-source. Anthropic compra infraestructura para su IPO.

La pregunta ya no es «¿quién tiene el modelo más inteligente?» sino «¿quién controla la capa entre el modelo y la máquina?» — y esa capa se está commoditizando a velocidad vertiginosa. Para quien construye agentes, esto es la señal más clara de que el valor real está en el harness, no en los pesos.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.


14
agosto
2026

🤖 IA Weekly Digest #8 — Semana 33, 2026

Compilado el 14 de agosto de 2026

La semana de los harnesses. SpaceXAI saca Grok Build para competir con Cursor y Codex, Jack Dorsey lanza Buzz para meter agentes de IA en el chat de equipo, y Microsoft unifica Semantic Kernel y AutoGen en un solo framework. Mientras tanto, en YouTube, los influencers ya facturan con los titulares. La pregunta que queda: ¿quién se lleva el gato al agua?

🔝 Lo más importante de la semana

1. Grok 4.6 y Grok Build: SpaceXAI entra en la carrera de harnesses

Qué ha pasado: El 12 de agosto, SpaceXAI (antes xAI) lanzó Grok 4.6, un modelo optimizado para agentes de larga duración, junto con Grok Build — un coding agent harness en TUI de terminal, escrito en Rust. Soporta MCP, ACP, headless mode y sandboxing. El modelo empatan con GPT-5.6 Sol en el índice compuesto de Artificial Analysis (61 puntos), pero pierden en Terminal-Bench (26% vs 34%). Precio agresivo: $2/M input tokens.

Por qué importa: Grok Build es el primer harness serio que compite directamente con Cursor, Codex desde una Big Tech. La TUI de terminal + ACP lo hace interoperable. El precio bajo es una estrategia clara para capturar desarrolladores.

Para quién importa: Para quien evalúe harnesses de coding agent o quiera alternativa a Cursor/Codex con estándares abiertos (MCP/ACP).

🔗 GitHub Grok Build · Análisis benchmarks

2. Buzz: Jack Dorsey mete agentes de IA en el chat de equipo

Qué ha pasado: Block (la empresa de Jack Dorsey) lanzó Buzz el 21 de julio — un chat grupal open-source donde los agentes de IA son «miembros» de los canales con su propia identidad criptográfica (Nostr). No son bots que responden comandos: son participantes con permisos, que pueden revisar código, ejecutar automatizaciones y unirse a voice huddles. Model-agnostic: funciona con Claude Code, Codex, Goose. 7.600+ estrellas en GitHub en días.

Por qué importa: Buzz no compite con OpenClaw ni Hermes — compite con Slack + GitHub. La idea de que la identidad del agente sea portable (Nostr, no atada a plataforma) es genuinamente innovadora. Si un equipo cambia de modelo, el contexto del agente se conserva.

Para quién importa: Para equipos que quieran integrar agentes de IA en su flujo de trabajo de desarrollo sin depender de un solo proveedor.

🔗 GitHub Buzz · Explicación detallada

3. Microsoft Agent Framework 1.0: Semantic Kernel + AutoGen se unen

Qué ha pasado: Microsoft lanzó la GA de Microsoft Agent Framework 1.0, la fusión de Semantic Kernel y AutoGen. Soporta MCP + A2A nativos, paridad Python + .NET, y CodeAct para ejecución de código. Es el framework «enterprise» por defecto para quien esté en el ecosistema Azure.

Por qué importa: Con Semantic Kernel y AutoGen unificados, Microsoft elimina la confusión sobre qué framework usar. Para empresas .NET/Azure, esta es probablemente la opción más coherente.

Para quién importa: Desarrolladores enterprise en stacks Microsoft/.NET que necesiten agentes con soporte corporativo.

🔗 Anuncio BUILD 2026

4. LangGraph vs LangChain: la guía que faltaba

Qué ha pasado: Towards Data Science publicó una comparativa práctica de 4 diferencias clave entre LangChain y LangGraph, y cuándo usar cada uno. LangChain para prototipos rápidos, LangGraph para workflows stateful en producción.

Por qué importa: Mucha gente sigue confundiendo ambos. LangGraph 1.x ya es el framework #1 en producción según Alice Labs (100+ implementaciones). LangChain es el «entry point» pero no donde terminas.

Para quién importa: Para quien esté evaluando frameworks agénticos y no quiera leer 50 artículos para decidir.

🔗 TDS: LangChain vs LangGraph


🧠 El ecosistema de influencers y el humo

5. Alex Finn y el negocio del «vibe coding»

Qué ha pasado: Alex Finn (@AlexFinnOfficial, 226K suscriptores) se define como «el canal número 1 de vibe coding en YouTube». Cubre cada herramienta nueva (Buzz, Grok Bot, Hermes, Openclaw, etc.) con titulares llamativos. No es el único: hay un ecosistema completo de youtubers de AI que facturan con la fiebre del oro de los agentes.

Por qué importa: El patrón es siempre el mismo: titular apocalíptico → demo superficial → «si quieres saber más, compra mi curso». El 90% no ha desplegado nada en producción. Los que de verdad trabajan con esto (empresas con implementaciones reales) no hacen vídeos de YouTube.

Para quién importa: Para quien consuma contenido de AI en YouTube y quiera distinguir señal de ruido.

🔗 Canal de Alex Finn


🧭 Radar rápido

  • Nemotron 3.5 Lightning en local — NVIDIA publicó un modelo de 30B (MoE, 3B activos) que corre a ~65 t/s en M5 Pro con 24GB RAM. Probado con Hermes Agent para coding. 🔗 Reddit r/LocalLLaMA
  • Muse-Glimmer 30B a 280 t/s — Modelo de código abierto que alcanza velocidades de producción reales con DFlash (97% de draft acceptance rate en refactoring UI). 🔗 Reddit r/LocalLLaMA
  • Ling 3.0 Flash en Strix Halo — Primer test de un modelo MoE grande en hardware AMD Strix Halo. Resultados prometedores para inferencia local sin NVIDIA. 🔗 Reddit r/LocalLLaMA
  • KLQ: quantización sin entrenamiento — Nuevo método de rotación medida que supera a SpinQuant en W4A4KV4. Llama 3.2 1B con KLQ se acerca a ReSinQuant sin necesidad de GPTQ. 🔗 Reddit r/LocalLLaMA
  • CrewAI vs LangGraph vs MS Agent Framework — Vídeo comparativo de los 3 frameworks principales tras el GA de Microsoft. Nota: AutoGen ya está muerto como proyecto independiente. 🔗 YouTube DEEPTECH AI LABS

🎯 Mi lectura de la semana

Esta semana ha quedado claro que el espacio de agentes se está fragmentando en capas. En la parte baja están los modelos (Grok 4.6, Nemotron, Qwen). En la parte media, los frameworks (LangGraph, MAF, CrewAI). Y en la parte alta, los harnesses y workspaces (Grok Bot, Buzz, OpenClaw, Hermes). Cada capa tiene su competencia, pero la capa que más importa para el usuario final es la de harnesses — es donde la gente realmente interactúa con los agentes.

Lo que me preocupa del ecosistema de YouTube es que está creando una falsa impresión de madurez. Cuando ves a 20 youtubers diciendo «ESTO CAMBIA TODO» sobre la misma herramienta, lo que realmente cambia es el tráfico de su canal, no la realidad de la producción. Las herramientas serias (LangGraph, OpenClaw, MAF) llevan meses o años madurando en silencio mientras los influencers descubren que «los agentes existen».

Buzz es la apuesta más interesante de esta semana, no por su tecnología (que es buena), sino por su tesis: que la identidad de los agentes debe ser portable y no atada a una plataforma. Si eso se convierte en estándar, el juego cambia para todos.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


07
agosto
2026
🤖 IA Weekly Digest #7 — Semana 32, 2026

## 🤖 IA Weekly Digest #7 — Semana 32, 2026

Compilado el 7 de agosto de 2026

Esta semana no la define un modelo, la definen tres precios. DeepSeek, OpenAI y Alibaba han coincidido en la misma jugada: poner IA de nivel frontier al alcance de cualquier bolsillo. En siete días hemos visto el modelo más barato con rendimiento de agente (DeepSeek V4 Flash 0731 a $0.14/M), el recorte del 80% que pone a OpenAI en el ring asequible (GPT-5.6 Luna a $0.20/M), y el tanque chino que compite con los flagships a un tercio del precio (Qwen 3.8 Max a $2/$6). Y en la comunidad local-LLM, la resaca del lanzamiento ya se nota: kernels optimizados para Flash, cuantizaciones agresivas a 54 GB, y el eterno arte de exprimir 8 GB de VRAM como si fueran 80.

## 🔝 Lo más importante de la semana

### 1. DeepSeek V4 Flash 0731 — Pequeño, abierto y demoledor en precio

Qué ha pasado: DeepSeek no tocó la arquitectura de V4 Flash (284B MoE, 13B activos por token). Solo re-entrenó el modelo con datos de agentes. El resultado es una barbaridad: Terminal-Bench 2.1 pasó de 61.8% a 82.7%, DeepSWE de 7.3% a 54.4%, Cybergym de 38.7% a 76.7%. Con solo 13B activos, el Flash 0731 supera a su propio V4-Pro (1.6T) en todos los benchmarks de agente. Y el precio: $0.14/M input, $0.28/M output, cache hit a $0.0028/M. Los pesos están en HuggingFace con licencia MIT: 167 GB en FP4/FP8, 57 cuantizaciones ya disponibles. Se corre en local. La letra pequeña: DeepSeek ha anunciado precios 2× en horas pico (9:00-12:00 y 14:00-18:00 hora Beijing), sin fecha de entrada en vigor.

Por qué importa: Esto es ingeniería de post-entrenamiento, no fuerza bruta. Un modelo de 13B activos rindiendo como uno de 1.6T. Es la demostración más clara de que el futuro no está en hacer modelos más grandes, sino en entrenarlos mejor. Y el precio lo cambia todo: a $0.14/M input, tareas de agente que antes requerían un Sol o un Opus ahora cuestan calderilla.

Para quién importa: Cualquiera que ejecute flujos de agente en producción y quiera rendimiento de frontera sin el precio de frontera. Y cualquiera que quiera correr un modelo capaz en su propia máquina sin depender de APIs cloud.

🔗 [Ficha técnica en HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) · [Análisis de benchmarks](https://aitoolsrecap.com/Blog/deepseek-v4-flash-0731-review-benchmarks-2026) · [Precios oficiales](https://api-docs.deepseek.com/quick_start/pricing)

### 2. GPT-5.6 Luna — OpenAI recorta el 80% y entra en la guerra de precios

Qué ha pasado: El 30 de julio, OpenAI recortó el precio de GPT-5.6 Luna de $1/$6 a $0.20/$1.20 por millón de tokens. Una rebaja del 80% tanto en input como en output. Terra también bajó un 20% (a $2/$12). Sol se mantiene en $5/$30. Lo relevante no es solo el número: Luna es el mismo motor que Sol y Terra — mismo contexto de 1.05M, misma ventana de 128K output, mismo conocimiento hasta febrero 2026. La diferencia está en la velocidad, no en la capacidad. Sam Altman lo confirmó personalmente.

Por qué importa: Por primera vez, OpenAI compite de verdad en el segmento asequible. No con un modelo recortado tipo «mini», sino con el mismo GPT-5.6 que corre en Codex y ChatGPT, a precio de café. Durante años, «OpenAI» y «barato» no aparecían en la misma frase. El recorte del 80% en Luna no es caridad — es competencia real de DeepSeek y Alibaba, y eso beneficia a todos.

Para quién importa: Cualquiera que use Codex, la API de OpenAI, o ChatGPT Work. El ahorro es automático, sin cambios de cuenta. Y cualquiera que estuviera usando modelos «mini» por precio y ahora pueda saltar a un modelo de la familia GPT-5.6 por un coste similar.

🔗 [Anuncio oficial de OpenAI](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/) · [Desglose del recorte](https://www.explainx.ai/blog/openai-gpt-5-6-luna-terra-price-cuts-july-2026)

### 3. Qwen 3.8 Max — El tanque de Alibaba que mira a los ojos a Sol y Fable 5

Qué ha pasado: Alibaba lanzó Qwen 3.8 Max el 2 de agosto. Las cifras imponen: 2.4 billones de parámetros totales, 95B activos por token, el primer modelo multimodal de Alibaba por encima del billón de parámetros. Acepta texto, imágenes y vídeo como entrada. En los benchmarks de Alibaba gana 13 de 16 filas contra GPT-5.6 Sol, incluyendo todas las de visión. LMArena lo sitúa #5 global en texto y #4 en WebDev. La comunidad está dividida: hay quien canceló su suscripción a Anthropic por esto y quien lo llama «benchmark princess» tras encontrar bucles de razonamiento. La pega: viene con razonamiento xhigh por defecto, y un desarrollador midió 18M tokens de input para una sola tarea — el doble que Kimi K3 para el mismo trabajo. Los pesos abiertos, prometidos para «la semana que viene» el día 2, siguen sin aparecer a 5 de agosto.

Por qué importa: Qwen 3.8 Max compite con GPT-5.6 Sol ($5/$30) y Claude Fable 5 ($10/$50) a $2/$6. Es la apuesta de Alibaba por la escala como ventaja competitiva. El vídeo como entrada nativa es un diferenciador real que ni Sol ni Fable 5 tienen. Pero el coste oculto del razonamiento verboso y la ausencia de pesos abiertos son dos asteriscos importantes.

Para quién importa: Quien necesite visión + vídeo + texto en un solo modelo sin montar pipelines separados. Quien quiera rendimiento de flagship sin pagar precio de flagship. Y quien esté atento a si Alibaba cumple su promesa de abrir los pesos — si lo hace, 95B activos con licencia abierta cambiarían el tablero.

🔗 [Guía completa en aicybr.com](https://aicybr.com/blog/qwen-3-8-max-complete-guide) · [Comparativa vs GPT-5.6](https://www.eesel.ai/blog/qwen38-max-vs-gpt-56) · [Comparativa vs DeepSeek V4 Flash](https://www.eesel.ai/blog/qwen38-max-vs-deepseek-v4-flash)

### 4. Beating vLLM y llama.cpp en TTFT con Gemma4-12B en RTX 5090

Qué ha pasado: Un desarrollador ha publicado un worklog detallado de optimización de inferencia usando kernels GEMM y FlashAttention compilados a medida. El resultado: menor latencia (TTFT) que vLLM y llama.cpp con Gemma4-12B en una RTX 5090. El truco está en kernels generados por compilador específicos para la arquitectura de la GPU, no en cambiar el modelo. El autor aclara que la velocidad de generación (TPOT) no mejora — está limitada por ancho de banda de memoria — pero la latencia inicial sí.

Por qué importa: Para aplicaciones interactivas (chat, coding assistants, agentes que necesitan respuesta rápida), la latencia inicial es tan importante como el throughput. Este trabajo demuestra que todavía hay margen de optimización por debajo de los engines establecidos si estás dispuesto a compilar kernels a medida para tu hardware concreto.

Para quién importa: Desarrolladores que construyen aplicaciones interactivas con LLMs locales y necesitan la mínima latencia posible. Entusiastas del tuning de inferencia que quieran exprimir cada milisegundo de su RTX 5090.

🔗 [Worklog en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1veoe08/beating_vllm_and_llamacpp_ttft_on_gemma412b_on/)

### 5. DeepSeek V4 Flash «Mini» — 54 GB GGUF a 20.5 t/s

Qué ha pasado: Un usuario ha creado una versión ultra-comprimida de DeepSeek V4 Flash 0731 usando la adaptación REAP combinada con cuantizaciones agresivas. El resultado: un GGUF de 54 GB que corre a ~20.5 t/s. Para contexto, el modelo original en FP8 son 167 GB. Esto es una reducción de casi el 70% en tamaño manteniendo velocidad usable.

Por qué importa: Si el modelo base ya es barato en API ($0.14/M), tener una versión que cabe en 54 GB lo pone al alcance de setups con una sola GPU de 80 GB o dos de 32 GB. La comunidad ya está haciendo con Flash lo mismo que hizo con los GGUF: comprimir, cuantizar, y demostrar que el modelo es útil incluso reducido al máximo. Esto es exactamente lo que convierte un lanzamiento de API en un ecosistema local.

Para quién importa: Cualquiera que quiera correr DeepSeek V4 Flash en local sin invertir en un servidor de 8 GPUs.

🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfr3d2/deepseekv4flashmini_54gb_gguf_running_at_205_ts/)

## 🧭 Radar rápido

– **DeepSeek anuncia precios 2× en horas pico** — De 9:00 a 12:00 y 14:00 a 18:00 hora Beijing (01:00-04:00 y 06:00-10:00 UTC). Sin fecha de entrada en vigor. En horas europeas el impacto es limitado pero conviene tenerlo en el Excel. 🔗 [Página oficial de precios](https://api-docs.deepseek.com/quick_start/pricing)
– **Speculative decoding con V4 Flash 0731 en llama.cpp** — Un usuario está intentando activar speculative decoding con el nuevo Flash usando el draft model de am17an y cuantización UD-Q8 de Unsloth. De momento con problemas, pero es el tipo de experimento que aparece a los pocos días de un lanzamiento y que en semanas se convierte en tutorial. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1ven4f7/speculative_decoding_with_deepseek_v4_flash_0731/)
– **MTP para GLM-4.5-Air en llama.cpp** — Un usuario pide ayuda para probar Multi-Token Prediction en GLM-4.5-Air, un modelo que tuvo su momento y todavía tiene fans. Si alguien todavía lo tiene en disco y sabe compilar llama.cpp, el PR está abierto. 🔗 [PR en GitHub](https://github.com/ggml-org/llama.cpp/pull/26534)
– **Mix de modelos frontier + locales para coding con 8 GB VRAM** — Un desarrollador full-stack comparte su setup híbrido: modelos cloud para tareas complejas, modelos locales para tareas repetitivas, todo desde un portátil gaming con RTX 4060 de 8 GB. Un recordatorio de que no hace falta un rig de $5.000 para ser productivo con IA local. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfsaab/mix_of_frontier_and_local_models_for_coding_in_a/)
– **Tritium — seguimiento sin novedades** — El motor ternario 1.58 bit de la semana pasada no trae novedades. Se mantiene en observación. 🔗 [Post original](https://www.reddit.com/r/LocalLLaMA/comments/1vbf0nt/open_source_ternary_llm_engine_in_rustcuda_for/)

## 🎯 Mi lectura de la semana

Hay semanas que giran alrededor de un paper, un lanzamiento o un drama. Esta semana ha sido distinta: tres laboratorios con filosofías completamente opuestas han coincidido en la misma conclusión — la IA de frontera tiene que ser asequible.

DeepSeek lo hace con ingeniería: 13B parámetros activos que rinden como 1.6T. OpenAI lo hace con subsidio cruzado: Luna es Sol, a 1/25 del precio. Alibaba lo hace con escala: 2.4T parámetros a $2, cuando sus rivales directos cobran entre $5 y $10. El resultado: por menos de $0.30/M output tienes IA de nivel frontier. En junio eso era impensable. En agosto es la nueva normalidad.

Y lo que más me gusta es lo que pasó en la comunidad apenas 48 horas después del lanzamiento de Flash: ya hay kernels optimizados compitiendo con vLLM, ya hay un GGUF de 54 GB corriendo a 20 t/s, ya hay gente intentando speculative decoding. Ese es el termómetro real de un lanzamiento. No los benchmarks oficiales — la velocidad a la que la comunidad lo hace suyo. Y Flash va camino de récord.

Si tuviera que quedarme con un solo detalle de esta semana, sería el momento en que DeepSeek publicó que su modelo pequeño de 13B activos supera a su modelo grande de 1.6T en tareas de agente. Eso no es un dato técnico — es un aviso a navegantes. La carrera ya no es quién tiene más parámetros, sino quién entrena mejor.

Lo segundo: ver a OpenAI en esta guerra de precios es genuinamente esperanzador. Durante años fueron el sinónimo de «caro». El recorte del 80% en Luna es una admisión implícita de que el mercado ha cambiado y ellos lo saben. Bienvenidos a la fiesta.

¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en [elmonomudo.com](https://elmonomudo.com).