14
agosto
2026

🤖 IA Weekly Digest #8 — Semana 33, 2026

Compilado el 14 de agosto de 2026

La semana de los harnesses. SpaceXAI saca Grok Build para competir con Cursor y Codex, Jack Dorsey lanza Buzz para meter agentes de IA en el chat de equipo, y Microsoft unifica Semantic Kernel y AutoGen en un solo framework. Mientras tanto, en YouTube, los influencers ya facturan con los titulares. La pregunta que queda: ¿quién se lleva el gato al agua?

🔝 Lo más importante de la semana

1. Grok 4.6 y Grok Build: SpaceXAI entra en la carrera de harnesses

Qué ha pasado: El 12 de agosto, SpaceXAI (antes xAI) lanzó Grok 4.6, un modelo optimizado para agentes de larga duración, junto con Grok Build — un coding agent harness en TUI de terminal, escrito en Rust. Soporta MCP, ACP, headless mode y sandboxing. El modelo empatan con GPT-5.6 Sol en el índice compuesto de Artificial Analysis (61 puntos), pero pierden en Terminal-Bench (26% vs 34%). Precio agresivo: $2/M input tokens.

Por qué importa: Grok Build es el primer harness serio que compite directamente con Cursor, Codex desde una Big Tech. La TUI de terminal + ACP lo hace interoperable. El precio bajo es una estrategia clara para capturar desarrolladores.

Para quién importa: Para quien evalúe harnesses de coding agent o quiera alternativa a Cursor/Codex con estándares abiertos (MCP/ACP).

🔗 GitHub Grok Build · Análisis benchmarks

2. Buzz: Jack Dorsey mete agentes de IA en el chat de equipo

Qué ha pasado: Block (la empresa de Jack Dorsey) lanzó Buzz el 21 de julio — un chat grupal open-source donde los agentes de IA son «miembros» de los canales con su propia identidad criptográfica (Nostr). No son bots que responden comandos: son participantes con permisos, que pueden revisar código, ejecutar automatizaciones y unirse a voice huddles. Model-agnostic: funciona con Claude Code, Codex, Goose. 7.600+ estrellas en GitHub en días.

Por qué importa: Buzz no compite con OpenClaw ni Hermes — compite con Slack + GitHub. La idea de que la identidad del agente sea portable (Nostr, no atada a plataforma) es genuinamente innovadora. Si un equipo cambia de modelo, el contexto del agente se conserva.

Para quién importa: Para equipos que quieran integrar agentes de IA en su flujo de trabajo de desarrollo sin depender de un solo proveedor.

🔗 GitHub Buzz · Explicación detallada

3. Microsoft Agent Framework 1.0: Semantic Kernel + AutoGen se unen

Qué ha pasado: Microsoft lanzó la GA de Microsoft Agent Framework 1.0, la fusión de Semantic Kernel y AutoGen. Soporta MCP + A2A nativos, paridad Python + .NET, y CodeAct para ejecución de código. Es el framework «enterprise» por defecto para quien esté en el ecosistema Azure.

Por qué importa: Con Semantic Kernel y AutoGen unificados, Microsoft elimina la confusión sobre qué framework usar. Para empresas .NET/Azure, esta es probablemente la opción más coherente.

Para quién importa: Desarrolladores enterprise en stacks Microsoft/.NET que necesiten agentes con soporte corporativo.

🔗 Anuncio BUILD 2026

4. LangGraph vs LangChain: la guía que faltaba

Qué ha pasado: Towards Data Science publicó una comparativa práctica de 4 diferencias clave entre LangChain y LangGraph, y cuándo usar cada uno. LangChain para prototipos rápidos, LangGraph para workflows stateful en producción.

Por qué importa: Mucha gente sigue confundiendo ambos. LangGraph 1.x ya es el framework #1 en producción según Alice Labs (100+ implementaciones). LangChain es el «entry point» pero no donde terminas.

Para quién importa: Para quien esté evaluando frameworks agénticos y no quiera leer 50 artículos para decidir.

🔗 TDS: LangChain vs LangGraph


🧠 El ecosistema de influencers y el humo

5. Alex Finn y el negocio del «vibe coding»

Qué ha pasado: Alex Finn (@AlexFinnOfficial, 226K suscriptores) se define como «el canal número 1 de vibe coding en YouTube». Cubre cada herramienta nueva (Buzz, Grok Bot, Hermes, Openclaw, etc.) con titulares llamativos. No es el único: hay un ecosistema completo de youtubers de AI que facturan con la fiebre del oro de los agentes.

Por qué importa: El patrón es siempre el mismo: titular apocalíptico → demo superficial → «si quieres saber más, compra mi curso». El 90% no ha desplegado nada en producción. Los que de verdad trabajan con esto (empresas con implementaciones reales) no hacen vídeos de YouTube.

Para quién importa: Para quien consuma contenido de AI en YouTube y quiera distinguir señal de ruido.

🔗 Canal de Alex Finn


🧭 Radar rápido

  • Nemotron 3.5 Lightning en local — NVIDIA publicó un modelo de 30B (MoE, 3B activos) que corre a ~65 t/s en M5 Pro con 24GB RAM. Probado con Hermes Agent para coding. 🔗 Reddit r/LocalLLaMA
  • Muse-Glimmer 30B a 280 t/s — Modelo de código abierto que alcanza velocidades de producción reales con DFlash (97% de draft acceptance rate en refactoring UI). 🔗 Reddit r/LocalLLaMA
  • Ling 3.0 Flash en Strix Halo — Primer test de un modelo MoE grande en hardware AMD Strix Halo. Resultados prometedores para inferencia local sin NVIDIA. 🔗 Reddit r/LocalLLaMA
  • KLQ: quantización sin entrenamiento — Nuevo método de rotación medida que supera a SpinQuant en W4A4KV4. Llama 3.2 1B con KLQ se acerca a ReSinQuant sin necesidad de GPTQ. 🔗 Reddit r/LocalLLaMA
  • CrewAI vs LangGraph vs MS Agent Framework — Vídeo comparativo de los 3 frameworks principales tras el GA de Microsoft. Nota: AutoGen ya está muerto como proyecto independiente. 🔗 YouTube DEEPTECH AI LABS

🎯 Mi lectura de la semana

Esta semana ha quedado claro que el espacio de agentes se está fragmentando en capas. En la parte baja están los modelos (Grok 4.6, Nemotron, Qwen). En la parte media, los frameworks (LangGraph, MAF, CrewAI). Y en la parte alta, los harnesses y workspaces (Grok Bot, Buzz, OpenClaw, Hermes). Cada capa tiene su competencia, pero la capa que más importa para el usuario final es la de harnesses — es donde la gente realmente interactúa con los agentes.

Lo que me preocupa del ecosistema de YouTube es que está creando una falsa impresión de madurez. Cuando ves a 20 youtubers diciendo «ESTO CAMBIA TODO» sobre la misma herramienta, lo que realmente cambia es el tráfico de su canal, no la realidad de la producción. Las herramientas serias (LangGraph, OpenClaw, MAF) llevan meses o años madurando en silencio mientras los influencers descubren que «los agentes existen».

Buzz es la apuesta más interesante de esta semana, no por su tecnología (que es buena), sino por su tesis: que la identidad de los agentes debe ser portable y no atada a una plataforma. Si eso se convierte en estándar, el juego cambia para todos.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


07
agosto
2026
🤖 IA Weekly Digest #7 — Semana 32, 2026

## 🤖 IA Weekly Digest #7 — Semana 32, 2026

Compilado el 7 de agosto de 2026

Esta semana no la define un modelo, la definen tres precios. DeepSeek, OpenAI y Alibaba han coincidido en la misma jugada: poner IA de nivel frontier al alcance de cualquier bolsillo. En siete días hemos visto el modelo más barato con rendimiento de agente (DeepSeek V4 Flash 0731 a $0.14/M), el recorte del 80% que pone a OpenAI en el ring asequible (GPT-5.6 Luna a $0.20/M), y el tanque chino que compite con los flagships a un tercio del precio (Qwen 3.8 Max a $2/$6). Y en la comunidad local-LLM, la resaca del lanzamiento ya se nota: kernels optimizados para Flash, cuantizaciones agresivas a 54 GB, y el eterno arte de exprimir 8 GB de VRAM como si fueran 80.

## 🔝 Lo más importante de la semana

### 1. DeepSeek V4 Flash 0731 — Pequeño, abierto y demoledor en precio

Qué ha pasado: DeepSeek no tocó la arquitectura de V4 Flash (284B MoE, 13B activos por token). Solo re-entrenó el modelo con datos de agentes. El resultado es una barbaridad: Terminal-Bench 2.1 pasó de 61.8% a 82.7%, DeepSWE de 7.3% a 54.4%, Cybergym de 38.7% a 76.7%. Con solo 13B activos, el Flash 0731 supera a su propio V4-Pro (1.6T) en todos los benchmarks de agente. Y el precio: $0.14/M input, $0.28/M output, cache hit a $0.0028/M. Los pesos están en HuggingFace con licencia MIT: 167 GB en FP4/FP8, 57 cuantizaciones ya disponibles. Se corre en local. La letra pequeña: DeepSeek ha anunciado precios 2× en horas pico (9:00-12:00 y 14:00-18:00 hora Beijing), sin fecha de entrada en vigor.

Por qué importa: Esto es ingeniería de post-entrenamiento, no fuerza bruta. Un modelo de 13B activos rindiendo como uno de 1.6T. Es la demostración más clara de que el futuro no está en hacer modelos más grandes, sino en entrenarlos mejor. Y el precio lo cambia todo: a $0.14/M input, tareas de agente que antes requerían un Sol o un Opus ahora cuestan calderilla.

Para quién importa: Cualquiera que ejecute flujos de agente en producción y quiera rendimiento de frontera sin el precio de frontera. Y cualquiera que quiera correr un modelo capaz en su propia máquina sin depender de APIs cloud.

🔗 [Ficha técnica en HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) · [Análisis de benchmarks](https://aitoolsrecap.com/Blog/deepseek-v4-flash-0731-review-benchmarks-2026) · [Precios oficiales](https://api-docs.deepseek.com/quick_start/pricing)

### 2. GPT-5.6 Luna — OpenAI recorta el 80% y entra en la guerra de precios

Qué ha pasado: El 30 de julio, OpenAI recortó el precio de GPT-5.6 Luna de $1/$6 a $0.20/$1.20 por millón de tokens. Una rebaja del 80% tanto en input como en output. Terra también bajó un 20% (a $2/$12). Sol se mantiene en $5/$30. Lo relevante no es solo el número: Luna es el mismo motor que Sol y Terra — mismo contexto de 1.05M, misma ventana de 128K output, mismo conocimiento hasta febrero 2026. La diferencia está en la velocidad, no en la capacidad. Sam Altman lo confirmó personalmente.

Por qué importa: Por primera vez, OpenAI compite de verdad en el segmento asequible. No con un modelo recortado tipo «mini», sino con el mismo GPT-5.6 que corre en Codex y ChatGPT, a precio de café. Durante años, «OpenAI» y «barato» no aparecían en la misma frase. El recorte del 80% en Luna no es caridad — es competencia real de DeepSeek y Alibaba, y eso beneficia a todos.

Para quién importa: Cualquiera que use Codex, la API de OpenAI, o ChatGPT Work. El ahorro es automático, sin cambios de cuenta. Y cualquiera que estuviera usando modelos «mini» por precio y ahora pueda saltar a un modelo de la familia GPT-5.6 por un coste similar.

🔗 [Anuncio oficial de OpenAI](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/) · [Desglose del recorte](https://www.explainx.ai/blog/openai-gpt-5-6-luna-terra-price-cuts-july-2026)

### 3. Qwen 3.8 Max — El tanque de Alibaba que mira a los ojos a Sol y Fable 5

Qué ha pasado: Alibaba lanzó Qwen 3.8 Max el 2 de agosto. Las cifras imponen: 2.4 billones de parámetros totales, 95B activos por token, el primer modelo multimodal de Alibaba por encima del billón de parámetros. Acepta texto, imágenes y vídeo como entrada. En los benchmarks de Alibaba gana 13 de 16 filas contra GPT-5.6 Sol, incluyendo todas las de visión. LMArena lo sitúa #5 global en texto y #4 en WebDev. La comunidad está dividida: hay quien canceló su suscripción a Anthropic por esto y quien lo llama «benchmark princess» tras encontrar bucles de razonamiento. La pega: viene con razonamiento xhigh por defecto, y un desarrollador midió 18M tokens de input para una sola tarea — el doble que Kimi K3 para el mismo trabajo. Los pesos abiertos, prometidos para «la semana que viene» el día 2, siguen sin aparecer a 5 de agosto.

Por qué importa: Qwen 3.8 Max compite con GPT-5.6 Sol ($5/$30) y Claude Fable 5 ($10/$50) a $2/$6. Es la apuesta de Alibaba por la escala como ventaja competitiva. El vídeo como entrada nativa es un diferenciador real que ni Sol ni Fable 5 tienen. Pero el coste oculto del razonamiento verboso y la ausencia de pesos abiertos son dos asteriscos importantes.

Para quién importa: Quien necesite visión + vídeo + texto en un solo modelo sin montar pipelines separados. Quien quiera rendimiento de flagship sin pagar precio de flagship. Y quien esté atento a si Alibaba cumple su promesa de abrir los pesos — si lo hace, 95B activos con licencia abierta cambiarían el tablero.

🔗 [Guía completa en aicybr.com](https://aicybr.com/blog/qwen-3-8-max-complete-guide) · [Comparativa vs GPT-5.6](https://www.eesel.ai/blog/qwen38-max-vs-gpt-56) · [Comparativa vs DeepSeek V4 Flash](https://www.eesel.ai/blog/qwen38-max-vs-deepseek-v4-flash)

### 4. Beating vLLM y llama.cpp en TTFT con Gemma4-12B en RTX 5090

Qué ha pasado: Un desarrollador ha publicado un worklog detallado de optimización de inferencia usando kernels GEMM y FlashAttention compilados a medida. El resultado: menor latencia (TTFT) que vLLM y llama.cpp con Gemma4-12B en una RTX 5090. El truco está en kernels generados por compilador específicos para la arquitectura de la GPU, no en cambiar el modelo. El autor aclara que la velocidad de generación (TPOT) no mejora — está limitada por ancho de banda de memoria — pero la latencia inicial sí.

Por qué importa: Para aplicaciones interactivas (chat, coding assistants, agentes que necesitan respuesta rápida), la latencia inicial es tan importante como el throughput. Este trabajo demuestra que todavía hay margen de optimización por debajo de los engines establecidos si estás dispuesto a compilar kernels a medida para tu hardware concreto.

Para quién importa: Desarrolladores que construyen aplicaciones interactivas con LLMs locales y necesitan la mínima latencia posible. Entusiastas del tuning de inferencia que quieran exprimir cada milisegundo de su RTX 5090.

🔗 [Worklog en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1veoe08/beating_vllm_and_llamacpp_ttft_on_gemma412b_on/)

### 5. DeepSeek V4 Flash «Mini» — 54 GB GGUF a 20.5 t/s

Qué ha pasado: Un usuario ha creado una versión ultra-comprimida de DeepSeek V4 Flash 0731 usando la adaptación REAP combinada con cuantizaciones agresivas. El resultado: un GGUF de 54 GB que corre a ~20.5 t/s. Para contexto, el modelo original en FP8 son 167 GB. Esto es una reducción de casi el 70% en tamaño manteniendo velocidad usable.

Por qué importa: Si el modelo base ya es barato en API ($0.14/M), tener una versión que cabe en 54 GB lo pone al alcance de setups con una sola GPU de 80 GB o dos de 32 GB. La comunidad ya está haciendo con Flash lo mismo que hizo con los GGUF: comprimir, cuantizar, y demostrar que el modelo es útil incluso reducido al máximo. Esto es exactamente lo que convierte un lanzamiento de API en un ecosistema local.

Para quién importa: Cualquiera que quiera correr DeepSeek V4 Flash en local sin invertir en un servidor de 8 GPUs.

🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfr3d2/deepseekv4flashmini_54gb_gguf_running_at_205_ts/)

## 🧭 Radar rápido

– **DeepSeek anuncia precios 2× en horas pico** — De 9:00 a 12:00 y 14:00 a 18:00 hora Beijing (01:00-04:00 y 06:00-10:00 UTC). Sin fecha de entrada en vigor. En horas europeas el impacto es limitado pero conviene tenerlo en el Excel. 🔗 [Página oficial de precios](https://api-docs.deepseek.com/quick_start/pricing)
– **Speculative decoding con V4 Flash 0731 en llama.cpp** — Un usuario está intentando activar speculative decoding con el nuevo Flash usando el draft model de am17an y cuantización UD-Q8 de Unsloth. De momento con problemas, pero es el tipo de experimento que aparece a los pocos días de un lanzamiento y que en semanas se convierte en tutorial. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1ven4f7/speculative_decoding_with_deepseek_v4_flash_0731/)
– **MTP para GLM-4.5-Air en llama.cpp** — Un usuario pide ayuda para probar Multi-Token Prediction en GLM-4.5-Air, un modelo que tuvo su momento y todavía tiene fans. Si alguien todavía lo tiene en disco y sabe compilar llama.cpp, el PR está abierto. 🔗 [PR en GitHub](https://github.com/ggml-org/llama.cpp/pull/26534)
– **Mix de modelos frontier + locales para coding con 8 GB VRAM** — Un desarrollador full-stack comparte su setup híbrido: modelos cloud para tareas complejas, modelos locales para tareas repetitivas, todo desde un portátil gaming con RTX 4060 de 8 GB. Un recordatorio de que no hace falta un rig de $5.000 para ser productivo con IA local. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfsaab/mix_of_frontier_and_local_models_for_coding_in_a/)
– **Tritium — seguimiento sin novedades** — El motor ternario 1.58 bit de la semana pasada no trae novedades. Se mantiene en observación. 🔗 [Post original](https://www.reddit.com/r/LocalLLaMA/comments/1vbf0nt/open_source_ternary_llm_engine_in_rustcuda_for/)

## 🎯 Mi lectura de la semana

Hay semanas que giran alrededor de un paper, un lanzamiento o un drama. Esta semana ha sido distinta: tres laboratorios con filosofías completamente opuestas han coincidido en la misma conclusión — la IA de frontera tiene que ser asequible.

DeepSeek lo hace con ingeniería: 13B parámetros activos que rinden como 1.6T. OpenAI lo hace con subsidio cruzado: Luna es Sol, a 1/25 del precio. Alibaba lo hace con escala: 2.4T parámetros a $2, cuando sus rivales directos cobran entre $5 y $10. El resultado: por menos de $0.30/M output tienes IA de nivel frontier. En junio eso era impensable. En agosto es la nueva normalidad.

Y lo que más me gusta es lo que pasó en la comunidad apenas 48 horas después del lanzamiento de Flash: ya hay kernels optimizados compitiendo con vLLM, ya hay un GGUF de 54 GB corriendo a 20 t/s, ya hay gente intentando speculative decoding. Ese es el termómetro real de un lanzamiento. No los benchmarks oficiales — la velocidad a la que la comunidad lo hace suyo. Y Flash va camino de récord.

Si tuviera que quedarme con un solo detalle de esta semana, sería el momento en que DeepSeek publicó que su modelo pequeño de 13B activos supera a su modelo grande de 1.6T en tareas de agente. Eso no es un dato técnico — es un aviso a navegantes. La carrera ya no es quién tiene más parámetros, sino quién entrena mejor.

Lo segundo: ver a OpenAI en esta guerra de precios es genuinamente esperanzador. Durante años fueron el sinónimo de «caro». El recorte del 80% en Luna es una admisión implícita de que el mercado ha cambiado y ellos lo saben. Bienvenidos a la fiesta.

¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en [elmonomudo.com](https://elmonomudo.com).


31
julio
2026

🤖 DIGEST IA — SEMANA 31

Tritium, Kimik3 en 31 minutos y el fantasma de los P-Cores: la semana en la comunidad local-LLM

La cuantización sigue siendo la carrera armamentística de la comunidad local-LLM, y esta semana nos trae una bomba inesperada: Tritium, un motor ternario que promete 10× de compresión desde 1.58 bit por peso, creado por un estudiante de CS, no por un laboratorio de Big Tech. Mientras tanto, las arquitecturas híbridas de Intel (P-core + E-core) se confirman como zona de turbulencias para MoE e inferencia, y un bug en llama.cpp puede estar haciendo «tonta» tu instancia de DSV4 sin que lo sepas.

🔝 Lo más importante de la semana

1. 🍃 Tritium — Motor ternario Open Source (1.58 bit, Apache 2.0)

Qué ha pasado: Un estudiante de Ciencias de la Computación ha creado Tritium, un engine open source en Rust y CUDA para cuantizar modelos a ternarios reales (pesos a ±1, 0) con pérdida mínima. No es una cuantización agresiva disfrazada: es ternario de verdad. El motor es completo — quant + serve + train — y tiene licencia Apache 2.0.

Por qué importa: Promete reducciones de más de 10× en tamaño. Modelos que hoy necesitan 32 GB VRAM podrían correr en 3 GB. Si la calidad se mantiene razonable ante esa compresión extrema, la barrera de entrada al hardware doméstico se desploma.

Para quién importa: Cualquiera que haga inferencia local con GPUs de consumo, builders de rigs, y especialmente quienes persiguen modelos grandes en hardware modesto.

🔗 Ver en r/LocalLLaMA

2. 💤 Kimik3 en llama.cpp — 31 minutos para 440 tokens

Qué ha pasado: Un usuario ejecutó Kimi k3 con llama.cpp y documentó el resultado: 40 tokens de prompt eval en 97.5s (0.41 tok/s) y 400 tokens de generación en 1769.9s (0.23 tok/s). Total: 31 minutos. El bottleneck está en el proceso de reflexión (thinking), no en la generación.

Por qué importa: Confirma que los modelos thinking pueden correr en hardware consumer, pero con una penalización de velocidad brutal. Para flujos de agente interactivo, 0.23 tok/s es impracticable. Para tareas batch de razonamiento profundo, puede tener sentido.

Para quién importa: Usuarios de modelos thinking (R1/Kimi-style), desarrolladores de agentes de coding, cualquiera evaluando si vale la pena el coste computacional del chain-of-thought.

🔗 Ver el benchmark en r/LocalLLaMA

3. 🐛 Chat template de DSV4 roto en llama.cpp — tu modelo puede estar «tonto» sin que lo sepas

Qué ha pasado: Los commits recientes de llama.cpp han roto el comportamiento de preserve_thinking para los GGUF antiguos de DeepSeek DSV4. El resultado: el modelo se vuelve significativamente menos inteligente en contexto de coding agent. La solución es pasar --chat-template-file con el template correcto.

Por qué importa: No es un bug de DeepSeek, es un cambio en llama.cpp que afecta templates viejos. Pero es fácil pasarlo por alto y asumir que «el modelo ya no es lo que era» cuando en realidad es solo un problema de plantilla. Si usas DSV4 con llama.cpp actualizado, necesitas verificarlo.

Para quién importa: Usuarios de DeepSeek V4 con llama.cpp, desarrolladores de agentes que dependen de consistencia de comportamiento.

🔗 Ver la solución en r/LocalLLaMA

🧭 Radar rápido

  • ROCm vs Vulkan en AMD RDNA4: resultados contraintuitivos — Benchmarks con Radeon AI PRO R9700 (Navi48, 32 GB) en ROCm 7.14 vs Vulkan muestran diferencias de rendimiento inesperadas. Si usas AMD, no asumas que ambos backends rinden igual. 🔗 r/LocalLLaMA
  • llama.cpp más lento en P-Cores que en E-Cores con MoE — Intel 270K Plus con Qwen 3.5 MoE (122B): los E-cores ganan a los P-cores en throughput. Las arquitecturas híbridas no planifican bien las cargas de inferencia. 🔗 r/LocalLLaMA
  • audio.cpp v0.4: Higgs Audio v3 TTS a 10× tiempo real — TTS de calidad 4B en C++/GGML con full GGUF loading y gains de velocidad/VRAM en Q8. 🔗 r/LocalLLaMA

🗑️ Descartados

  • 8+ vídeos de comparación de agentic AI frameworks (LangGraph vs CrewAI vs AutoGen vs Claude SDK vs MS Agent Framework vs OpenAI Agents SDK) — Saturación total. Mismo argumento, misma estructura, cero valor diferencial.
  • 3 vídeos de setup OpenClaw/Ollama — Tutoriales genéricos sin contenido original («OpenClaw Free Forever», «The ULTIMATE Local AI»).
  • 3090 vs 4090 comparison — Comparativa hardware ya conocida, sin novedad.
  • «Before You Pick an AI Agent Framework» / «Finally, a Programmable AI Agent Framework» — Contenido genérico sin especificidad técnica.

🎯 Mi lectura de la semana

Tritium es de esos proyectos que aparecen una vez al año y te recuerdan por qué la comunidad open-source sigue siendo el lugar donde pasan las cosas de verdad. Un estudiante de CS, sin los recursos de un laboratorio corporativo, crea un motor ternario completo en Rust y CUDA que promete comprimir modelos 10×. Si los números se sostienen en benchmarks independientes, esto cambia el mapa de lo que es «posible» en hardware doméstico.

Lo de Kimik3 corriendo a 0.23 tok/s es la otra cara de la moneda: los modelos thinking son fascinantes, pero la brecha entre «funciona» y «es usable» sigue siendo enorme. 31 minutos para 440 tokens es una sentencia para cualquier flujo interactivo. Son modelos de reflexión, no de throughput, y hay que entenderlos como tales.

El bug del chat template de DSV4 es un recordatorio de lo frágil que es el ecosistema de inferencia local. Un commit en llama.cpp, un template que no se actualiza, y de repente tu modelo fiable se vuelve errático. La madurez del stack local-LLM avanza, pero seguimos en esa fase donde mantenerlo todo funcionando requiere atención constante.

La semana que viene, a ver si Tritium entrega lo que promete. Y mientras tanto, revisad vuestros chat templates.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


24
julio
2026

🤖 IA Weekly Digest #5 — Semana 30, 2026

Compilado el 24 de julio de 2026

Esta semana nos trae una verdad incómoda que muchos sospechábamos pero pocos se atrevían a formular: los benchmarks no cuentan toda la historia. La comparativa Qwen vs Gemma ha encendido el subreddit, y mientras tanto, el ecosistema de inferencia local sigue sumando piezas nuevas — desde OSCAR2 para exprimir la caché KV hasta Higgs Audio v3 para TTS de calidad sin nube. Todo apunta a lo mismo: 2026 es el año en que la IA local deja de ser promesa y empieza a ser producto.

🔝 Lo más importante de la semana

1. Qwen vs Gemma: cuando los benchmarks mienten

Qué ha pasado: Un usuario de r/LocalLLaMA ha verbalizado lo que muchos pensaban en silencio: Qwen3.6 35B-A3B puntúa mejor en benchmarks que Gemma 4 26B-A4B, pero en uso real se siente «sustancialmente menos inteligente». En adherencia a prompts, coherencia y «cordura» general, Gemma gana por goleada. El hilo ha acumulado decenas de respuestas con experiencias similares, y varios usuarios reportan haber vuelto a Gemma tras probar Qwen3.6 durante semanas.
Por qué importa: Este es el tipo de brecha benchmark-vs-realidad que define qué modelos usa la gente de verdad. Los números en papel venden, pero la experiencia diaria decide. Si Gemma 4-26B (QAT) rinde mejor que Qwen3.6-35B en tareas reales siendo más pequeña, estamos ante un caso de eficiencia real que cambia las recomendaciones de la comunidad.
Para quién importa: Cualquiera que esté eligiendo modelo para uso diario — escritura, coding, razonamiento. Y especialmente a quienes usan ambos modelos en sus flujos.

🔗 Reddit

2. OSCAR2: el nuevo sistema de caché KV que llega a llama.cpp

Qué ha pasado: El usuario /u/giveen ha lanzado OSCAR2, un nuevo sistema de caché KV para llama.cpp con benchmarks en RTX 5090 (32 GB VRAM, Blackwell). Los números preliminares son prometedores: mejora significativa en el manejo de contextos largos y en la velocidad de decodificación. El proyecto está en fase activa de desarrollo, con builds específicas para la rama oscar de llama.cpp.
Por qué importa: La caché KV es el cuello de botella silencioso de la inferencia local. Cada mejora en este componente se traduce directamente en contextos más largos y respuestas más rápidas sin cambiar de hardware.
Para quién importa: Usuarios de llama.cpp con GPUs modernas, desarrolladores de backends de inferencia, cualquiera que trabaje con contextos de más de 32K tokens.

🔗 Reddit

3. Laguna-S-2.1: cuando la cuantización rompe el pensamiento

Qué ha pasado: El nuevo modelo Laguna-S-2.1 tiene un bug fascinante: en ciertas cuantizaciones, entra en bucles de «thinking forever» y nunca cierra sus tags «. Un usuario dedicó un día entero a debuguearlo y descubrió que no es un problema del modelo en sí, sino un artefacto de cuantización — el proceso de comprimir los pesos corrompe el mecanismo que le dice al modelo cuándo parar de pensar.
Por qué importa: Es una lección práctica sobre los límites de la cuantización agresiva. No es solo pérdida de calidad — a veces es pérdida de funcionalidad. El debugging documentado sirve como miniguía para diagnosticar problemas de este tipo.
Para quién importa: Usuarios de modelos cuantizados, mantenedores de GGUF, cualquiera que haya visto a su modelo «colgarse» sin razón aparente.

🔗 Reddit

🧭 Radar rápido

Brian Casel monta un equipo multi-agente con OpenClaw — 14 minutos donde explica cómo montó 4 agentes en OpenClaw y se compró un Mac Mini solo para correrlo. Contenido real, sin humo. 🔗 YouTube

DeepSeek V4 Flash en IQ3_XXS-AS e IQ2_S: benchmarks en RTX 3090 — La bestia de 671B parámetros cabe en una GPU de consumo: 250PP/11TG en contexto de 50K. 🔗 Reddit

PrismML Bonsai 27B: solo 3.8GB y corre en un teléfono — Un modelo de 27B que en cuantización 1_0 ocupa 3.8GB. La comunidad se pregunta si es demasiado bueno para ser verdad. 🔗 Reddit

Flue: framework de agentes programable del equipo de Astro — Alternativa open-source a LangGraph y CrewAI. Transforma el harness de Claude Code en algo programable. 🔗 YouTube

Microsoft mató AutoGen en abril de 2026 — Se reordena el panorama de frameworks de agentes. AutoGen muerto, unificado en Microsoft Agent Framework. Si construías sobre AutoGen, toca migrar. 🔗 YouTube

audio.cpp] Release 0.4: Higgs Audio v3 TTS 4B — TTS de calidad (10× tiempo real) y Fish Audio S2 Pro en C++/GGUF. 4B parámetros, Q8, listo para pipelines locales. 🔗 [Reddit

3090 vs 4090: comparativa real de inferencia local — Tres LLMs modernos, dos GPUs, una pregunta: ¿vale la pena el salto? 🔗 YouTube

192GB gang: ¿qué estás corriendo? — Usuarios de Mac Studio con 192GB de RAM unificada comparten qué modelos gigantes ejecutan. 🔗 Reddit

🗑️ Descartados

«Negative-Bit Quantization» (satire) — Divertido, pero es una broma de la comunidad, no contenido para el digest.

Qwen3.6 35B Q4 benchmarks en RX6600XT — Comparativa de hardware sin hallazgo novedoso.

Setup advice for 2 DGX Sparks — Nicho muy específico, pregunta de soporte.

Intel B70 users help request — Bug report de compilación, no contenido editorial.

MoE experts to SSD in llama.cpp — Pregunta teórica sin implementación ni resultados.

Múltiples comparativas de frameworks de agentes — Tres vídeos del mismo tema. Nos quedamos con el dato relevante (muerte de AutoGen).

🎯 Mi lectura de la semana

Hay dos narrativas compitiendo esta semana. La primera es la de la madurez: OSCAR2, Higgs Audio v3, audio.cpp, Flue — el ecosistema de herramientas locales está dejando de ser un conjunto de scripts experimentales para convertirse en software de verdad, con versiones, releases y benchmarks. La segunda es la de la brecha entre expectativas y realidad: Qwen vs Gemma, Laguna-S-2.1 roto por cuantización. El mensaje es claro: estamos en esa fase incómoda donde las herramientas son lo bastante buenas para ilusionarnos, pero no lo bastante fiables para confiar ciegamente.

Lo de Qwen vs Gemma me toca de cerca. Llevamos meses usando ambos modelos en nuestros flujos de escritura y publicación, y la experiencia coincide con lo que dice la comunidad: Gemma tiene una «cordura» que Qwen a veces pierde. No es cuestión de benchmarks, es cuestión de cuántas veces tienes que regenerar una respuesta hasta que sale algo usable. Y en ese baremo, Gemma gana.

El caso de Laguna-S-2.1 es casi una metáfora perfecta: comprimes un modelo para que quepa en tu GPU, y el proceso de compresión le rompe el mecanismo de «parar de pensar». Es poético. Y es una advertencia real: la cuantización no es magia gratuita. Cada bit que quitas se lleva algo. A veces es calidad. A veces es funcionalidad entera.

Lo bueno es que el ecosistema está aprendiendo. OSCAR2 promete exprimir más rendimiento del mismo hardware. Higgs Audio v3 demuestra que el TTS local ya es viable para producción. Y Flue nos recuerda que el mundo de los frameworks de agentes sigue siendo un campo de batalla abierto — Microsoft mató AutoGen, el equipo de Astro entra con algo nuevo, y mientras tanto, gente como Brian Casel simplemente se monta su equipo de agentes en OpenClaw y a correr.

La pregunta para la semana que viene: ¿cuántos de estos proyectos experimentales sobrevivirán al verano?


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomundo.com.


17
julio
2026

🤖 IA Weekly Digest #4 — 10–16 julio 2026

Compilado el 17 de julio de 2026

Esta semana la comunidad LocalLLaMA nos trae tres joyas: audio generativo a velocidad de vértigo con audio.cpp, un cara a cara entre tres setups de edge AI que resuelve de una vez la pregunta «¿qué compro para computer vision?», y la demostración de que DeepSeek V4 Flash cuantizado corre a 17 tk/s en hardware de gama media. Material sólido y práctico, sin hype.

🔝 Lo más importante de la semana

1. audio.cpp: 10 horas de audio en 3 minutos

Qué ha pasado: La comunidad llama.cpp/LocalLLaMA celebra el lanzamiento de audio.cpp, una implementación en C++/GGML con pila de modelos de voz (Supersonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS). Sobre una RTX 5090 genera 10 horas de audio en 3 minutos.

Por qué importa: Es un salto generacional comparable a lo que hizo llama.cpp con el texto. Para cualquiera que trabaje con TTS local, esto elimina el último argumento para usar APIs cloud de voz. Audio de calidad, generado a velocidad absurda, 100% local.

Para quién importa: Creadores de contenido que necesitan TTS, desarrolladores de asistentes de voz locales, y cualquiera que haya sufrido con las velocidades de generación de audio tradicionales.

🔗 Reddit

2. Edge AI: Raspberry Pi vs Hailo-8 vs Jetson Orin Nano

Qué ha pasado: Test comparativo real de detección de objetos en tiempo real (YOLO) sobre tres setups de edge AI: Pi 5 solo (5 FPS, no real-time), Pi 5 + Hailo-8 (77 FPS, 5W, 40 °C), Jetson Orin Nano (157 FPS, 13W, <7 ms de latencia). El Hailo-8 ofrece la mejor relación calidad/precio para hobbyists; la Jetson domina en producción pero con setup complejo.

Por qué importa: Es la comparativa que todo maker de edge AI necesita. Hasta ahora las comparaciones eran teóricas o basadas en specs. Esta es con hardware real, YOLO real, y números reales. Resuelve de una vez la duda de «¿Hailo-8 o Jetson?».

Para quién importa: Makers, desarrolladores de IoT con visión, cualquiera que esté evaluando hardware para computer vision en el edge.

🔗 YouTube

3. DeepSeek V4 Flash en Q2: 17 tk/s con 2× RTX 3080 20GB

Qué ha pasado: Un usuario comparte su experiencia corriendo DeepSeek V4 Flash cuantizado en IQ2XXS sobre dos RTX 3080 20GB con 64 GB DDR5. Resultado: 17 tokens/s de generación, 270 tk/s de prefill.

Por qué importa: Demostración concreta de que la cuantización agresiva combinada con multi-GPU hace viable correr modelos de última generación en hardware accesible. No necesitas una H100 ni la última GPU de $2,000. Dos 3080 usadas y un poco de DDR5 bastan.

Para quién importa: Builders de rigs multi-GPU, cualquiera que se pregunte si merece la pena cuantizar agresivamente, y los que dudan entre una GPU cara nueva o varias usadas.

🔗 Reddit

🧭 Radar rápido

  • Privacidad y agentes locales — El escándalo Grok Build ha abierto ojos sobre por qué los LLMs locales siguen importando: si los agent harnesses suben tu repositorio a la nube, pierdes el control de tus datos. 🔗 Reddit
  • ¿GGUF o más formatos en llama.cpp? — Debate comunitario sobre si debería abrirse a formatos como Safetensors. La tensión entre ecosistema cerrado e interoperabilidad futura. 🔗 Reddit
  • Fix crítico b9978 en workloads agénticos — Cada turno de agente creaba un nuevo checkpoint, agotando memoria y degradando rendimiento. Corregido. Esencial para quien corra agentes locales con llama.cpp. 🔗 Reddit
  • Guía: Prism Bonsai 27B — Tutorial para ejecutar este modelo de visión multimodal con llama.cpp y GGUF Q2_0 del repo oficial de PrismML-Eng. 🔗 Reddit
  • Cuantización: qué se rompe primero — Test sistemático de FP16 vs cuantizaciones GGUF medido por capacidad individual (maths, code, reasoning, knowledge). Algunas aguantan más que otras. Guía práctica para decidir trade-offs. 🔗 Reddit

🗑️ Descartados

  • LM Studio + Qwen 3.6 issues — Setup roto sin solución clara. Relevancia baja.
  • LM Studio ROCm no detecta Radeon 6900XT — Driver issue con workaround trivial (bajar a v2.21). Demasiado específico.
  • Bonsai Ternario 27B no acelera en ROCm — Problema AMD sin solución conocida.
  • Comparativas genéricas de agentes — Videos repetitivos de LangGraph vs CrewAI vs AutoGen sin insights nuevos.

🎯 Mi lectura de la semana

Tres noticias, un patrón: audio.cpp, edge AI comparativa, y DeepSeek V4 Flash en Q2. Las tres comparten algo — la conversación ha virado de «¿se puede?» a «¿con qué?» y «¿cómo?».

audio.cpp no es noticia por lo que hace (generar audio), sino por cómo lo hace: 10 horas en 3 minutos. Eso es velocidad de producción, no de experimento. El test de edge AI no es noticia por los datos técnicos, sino porque por fin hay una respuesta clara a «¿Hailo-8 o Jetson?» con números reales y sin marketing. Y el usuario que corre DeepSeek V4 Flash en Q2 con dos RTX 3080 no está presumiendo de hardware — está demostrando que la cuantización agresiva es una estrategia de deployment viable, no un truco de laboratorio.

Lo que conecta estas tres historias es madurez. La comunidad LocalLLaMA ha pasado de «mira qué chulo, funciona» a «así se hace en producción». Y eso, semana a semana, es lo que convierte la IA local de hobby a herramienta.

Esta semana no hay sección especial de hardware porque el material no daba para una sección completa, pero lo que hay es sólido y cohesivo. A veces menos es más.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.

 


10
julio
2026
🤖 IA Weekly Digest #3 — Semana 28, 2026

🤖 IA Weekly Digest #3 — Semana 28, 2026

Compilado el 10 de julio de 2026

Esta semana el subreddit ha explotado con una pregunta que nos hacemos todos: ¿cuál es la mejor GPU de 32GB para IA local sin pagar el impuesto NVIDIA? Tres tarjetas compiten — una vieja gloria de datacenter rescatada del mercado chino, la apuesta de Intel con Xe2, y la respuesta de AMD con RDNA 4. Las hemos puesto cara a cara con benchmarks reales, porque cuando hablamos de gastarse $1.000 en hardware, las opiniones sin números no valen.

🔝 Lo más importante de la semana

1. Cómo hostear cualquier modelo GGUF abierto detrás de una API

Qué ha pasado: El hilo más votado de la semana es una queja convertida en solución colectiva: tienes un modelo en Hugging Face que funciona de maravilla en Ollama o llama.cpp, pero cuando quieres usarlo desde una app, no hay API hosteada para él. La comunidad ha volcado soluciones: FastLLM como wrapper ligero, Ollama + OpenWebUI con proxy inverso, self-host con vLLM para modelos que lo soportan, y adaptadores personalizados para los que no.
Por qué importa: Este es el último metro del camino hacia la soberanía digital con IA. Ya tenemos modelos abiertos competitivos. Ya tenemos hardware capaz de correrlos. Lo que faltaba era el pegamento para conectarlos a nuestras herramientas diarias sin depender de APIs de terceros. Este hilo es un mapa de ese territorio.
Para quién importa: Cualquiera que haya pensado «este modelo es genial, pero ¿cómo lo uso desde mi app?» — desarrolladores montando productos con modelos locales, equipos migrando desde APIs cloud, y el creciente ejército de self-hosters.
🔗 Reddit

2. Cuánta VRAM necesitas para cada «tamaño» de modelo

Qué ha pasado: Un hilo brillante desglosa los nichos reales de tamaños de modelo (30B-35B, 70B-72B, 120B+, MoE vs denso) y qué hardware necesitas para cada uno. La conclusión clave: no es solo cuánta VRAM tienes, sino la combinación de GPU consumer vs profesional, cuantizaciones, y parallelism. Un modelo de 35B en Q4 puede caber en 20 GB… o no, según el overhead de display, KV cache, y el backend que uses.
Por qué importa: Demasiada gente compra hardware siguiendo la regla de «VRAM = tamaño del modelo × 1.2» y luego descubre que no le cabe. Este hilo te ahorra ese error. Si estás planeando tu rig de IA ahora mismo, léelo antes de comprar.
Para quién importa: Builders de rigs de IA local, cualquiera que esté comparando GPUs, y los que se preguntan si necesitan 24 GB o 32 GB para su caso de uso.
🔗 Reddit

3. Optimizaciones ggml de la semana: ARM NVFP4 + FP-fast-math en HIP

Qué ha pasado: Dos pull requests a llama.cpp que mejoran la velocidad de inferencia en hardware no-NVIDIA. El primero añade soporte de LUT UE4M3 en productos punto NVFP4 para procesadores ARM. El segundo activa -ffast-math para builds HIP en AMD. Son cambios pequeños, del tipo que no salen en titulares, pero que se acumulan.
Por qué importa: llama.cpp mejora por goteo constante, no por saltos revolucionarios. Estos PRs son el tipo de contribuciones que, sumadas a las de semanas anteriores, convierten una GPU «no recomendada para IA» en una opción viable. Cada punto porcentual de optimización cuenta cuando tu hardware no tiene CUDA.
Para quién importa: Usuarios de ARM (Apple Silicon, Raspberry Pi 5+, Snapdragon X) y AMD, mantenedores de llama.cpp, y cualquiera que compile su propio stack de inferencia.
🔗 ARM NVFP4 · HIP FP-fast-math


🔧 Especial Hardware: La batalla de las GPUs 32GB sin CUDA

Esta sección es nueva. La semana pasada varios hilos — y la conversación con lectores — giraron alrededor de la misma pregunta: ¿qué GPU de 32GB compro si no quiero pagar el impuesto NVIDIA? Hemos hecho la comparativa con datos reales de benchmarks independientes.

Las tres contendientes

 MI50 32GB 💰Intel Arc Pro B70 ⚖️AMD Radeon AI Pro R9700 🏆
VRAM32 GB HBM232 GB GDDR6 ECC32 GB GDDR6
Ancho de banda1 TB/s608 GB/s640 GB/s
ArquitecturaVega 20 (2018, 7nm)Xe2 Battlemage (2024)RDNA 4 (2025)
Precio$280-520 usado$949 nuevo$1,299 nuevo
TDP300W (pasiva)~150W300W
EcosistemaROCm (gfx906, decayendo)SYCL / oneAPIROCm (soporte completo)
Salidas vídeo❌ Datacenter puro✅ DP + HDMI✅ DP + HDMI
RefrigeraciónPasiva (necesita mod)Activa de fábricaActiva de fábrica

Rendimiento real en LLMs (datos de benchmarks independientes)

Single card:
B70 — Qwen 3.6-35B-A3B Q4: 54.7 t/s generación, 615 t/s prefill. SYCL. 🔗 PMZFX benchmarks
R9700 — gpt-oss:20b MoE: 102.4 t/s. Ollama + ROCm. 🔗 Hostkey review
MI50 — Qwen 3.5-35B-A3B Q8: 35.5 t/s. llama.cpp ROCm. 🔗 Diego Strebel

El as bajo la manga de la MI50 — multi-GPU barato:
Cuatro MI50 usadas = 128 GB VRAM por ~$800-1.000. Con eso puedes:
– Qwen3 235B (sí, 235 mil millones) a ~20 t/s — imposible en cualquier GPU de consumo
– Qwen3-Coder-Next 80B Q4 a 28.6 t/s en 4 tarjetas
– Llama 2 70B a ~35 t/s

Eso sí: refrigeración pasiva (necesitas ventiladores externos o rack con airflow), sin salidas de vídeo (es una aceleradora de datacenter pura), y ROCm para Vega 20 está perdiendo soporte oficial. Es un proyecto de bricolaje, no un producto de consumo.

¿Generación de vídeo?

  • B70: ✅ LTX-Video vía OpenVINO hasta 1280×704 (29s para clip de 2s). Wan 2.2 5B hasta 832×480. 720p OOM.
  • R9700: ✅ ComfyUI estándar con ROCm. Mismo techo de VRAM que la B70, pero ecosistema más probado.
  • MI50: ❌ Arquitectura de 2018 sin instrucciones de difusión modernas. No es para esto.

Veredicto rápido

Si tu prioridad es…Compra
Máximo VRAM por euro🥇 MI50 — 128 GB por <$1.000
Mejor single-card equilibrada🥇 B70 — $949, LLM y vídeo
Ecosistema más maduro🥇 R9700 — ROCm completo
Plug & play sin bricolaje🥇 B70 o R9700
Correr un modelo de 235B en casa🥇 MI50 ×4 — imbatible

Fuentes: PMZFX B70 · Hostkey R9700 · MI50 Budget VRAM King · MI50 2026 Benchmarks · r/LocalLLaMA MI50 thread


🧭 Radar rápido

  • Microsoft Agent Framework 1.0: Semantic Kernel + AutoGen unificados — Microsoft fusiona sus dos frameworks de agentes en un solo SDK para producción. Si trabajas con agentes empresariales, esto pinta a estándar. 🔗 YouTube — explicación
  • Flue — framework de agentes del equipo de Astro — Transforma el harness de Claude Code en algo completamente programable. Alternativa fresca a LangGraph y CrewAI desde el ecosistema Astro. 🔗 YouTube
  • Ornith-1.0-35B con speculative decode MTP nativo — MTP injertado directamente en el GGUF. Nuevos TTFT con tp=1 en llama.cpp. Sin parches ni forks. 🔗 Reddit
  • Qwen3.6-35B-A3B reemplaza Google Vision en pipeline de facturas (actualización W27) — Cubierto en el digest anterior. Extracción de recibos a JSON con modelo local en RTX 3060. Cero coste recurrente, datos 100% locales. 🔗 Reddit

🎯 Mi lectura de la semana

Hay un patrón que se repite: cada vez que alguien demuestra que un modelo local puede hacer el trabajo de un servicio cloud, la conversación vira inmediatamente al hardware. ¿En qué GPU lo corro? ¿Cuánta VRAM necesito? ¿Merece la pena el bricolaje de una MI50 de segunda mano o mejor comprar algo nuevo?

La buena noticia es que 2026 es el año en que la respuesta deja de ser «cómprate una NVIDIA o olvídate». Entre la B70 de Intel ($949, 32GB, vídeo incluido), la R9700 de AMD ($1,299, ROCm maduro), y las MI50 rescatadas del mercado chino ($300, 1 TB/s de ancho de banda), hay un abanico real de opciones. La guerra de las GPUs de IA ha comenzado, y esta vez el campo de batalla son los 32GB.

Lo que más me gusta de esta semana es que la conversación ha pasado de «¿se puede?» a «¿cuál compro?». Eso es progreso real. Hace un año la respuesta era «cómprate una 3090 usada o una 4090 nueva». Hoy tienes tres fabricantes compitiendo en el mismo nicho. Y la MI50, una tarjeta de datacenter de 2018 que muchos daban por muerta, resulta que es el camino más barato para correr un modelo de 235B en el garaje de tu casa. Si eso no es democratización de la IA, no sé qué lo es.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


03
julio
2026

Compilado el 3 de julio de 2026

 

Vulkan dobla a ROCm en AMD, un modelo local de 7B escribe y ejecuta su propio código C++ dentro del runtime, y un harness de 3 críticos demuestra que la orquestación importa más que el modelo. Esta semana no va de anuncios: va de ingeniería real desde el garaje digital.

 

🔝 Lo más importante de la semana

 

1. MiMo-V2.5 escribe una herramienta de ejecución C++ dentro de llama.cpp

Qué ha pasado: Un usuario de r/LocalLLaMA logró que MiMo-V2.5-GGUF (modelo de ~7B) escribiera desde cero una herramienta integrada en llama.cpp para ejecutar código C++ y usar los resultados. El modelo no solo generó código correcto — diseñó la interfaz, manejó errores de compilación, y produjo una tool funcional que se comunica con el runtime.

Por qué importa: Un modelo local pequeño escribiendo herramientas para el propio runtime que lo ejecuta. Esto es meta al cuadrado: la IA mejorando la infraestructura que la sirve. Además demuestra que los modelos pequeños bien destilados pueden hacer ingeniería de sistemas real, no solo completar código.

Para quién importa: Quienes trabajan con llama.cpp, desarrolladores de tooling para modelos locales, y cualquiera interesado en el borde entre IA generativa e ingeniería de software real.

🔗 Reddit

 

2. Vulkan en llama.cpp dobla a ROCm en AMD: Qwen3.6-35B-A3B a velocidad de vértigo

Qué ha pasado: Un usuario con Radeon 7900 XTX publica su configuración completa de llama.cpp con backend Vulkan. Los números son contundentes: Qwen3.6-35B-A3B IQ4_XS corre al doble de velocidad que con ROCm 7.14 optimizado, consumiendo menos VRAM (~22 GB). La clave está en el nuevo scheduler de llama.cpp que reduce sincronizaciones.

Por qué importa: Si tienes GPU AMD para IA local, probablemente estás usando el backend equivocado. Vulkan — tradicionalmente el patito feo frente a CUDA y ROCm — se perfila como la opción real para inference en hardware no-NVIDIA. Esto cambia la ecuación para quien esté planeando su próximo rig de IA.

Para quién importa: Usuarios de AMD (RX 7000/9000), builders de rigs multi-GPU para IA local, y cualquiera que haya sufrido con ROCm.

🔗 Reddit — configuración completa

 

3. Qwen3.6-27B bajo un harness de 3 críticos: la orquestación multiplica la calidad

Qué ha pasado: Un desarrollador somete a Qwen3.6-27B (8-bit) a un pipeline con 3 críticos independientes — code review, test review, y Playwright e2e — cada uno con contexto fresco antes de aceptar el output. La conclusión: el harness importa más que el modelo. Con suficientes capas de validación, un modelo de 27B compite con modelos mucho mayores.

Por qué importa: No necesitas el modelo más grande ni el más caro. Necesitas un buen sistema de verificación. Esto es arquitectura de agentes aplicada a generación de código: multiple pairs of eyes sobre el mismo output.

Para quién importa: Desarrolladores montando pipelines de código con IA, equipos evaluando si usar modelos locales o APIs cloud, y cualquiera diseñando sistemas multi-agente.

🔗 Reddit

 

🧭 Radar rápido

 

Squish: LLMs locales a máxima velocidad en Apple Silicon — Un nuevo runtime optimizado para chips M-series promete ser la forma más rápida de correr modelos locales en Mac. Primeros benchmarks prometedores. 🔗 squish.run

Ornith-1.0-35B GGUF con speculative decoding nativo — MTP (Multi-Token Prediction) injertado directamente en el GGUF. Sin parches, sin forks. TTFT y long-context numbers incluidos. 🔗 Reddit

From Local LLM to Tool-Using Agent — Tutorial completo: Gemma 4 + Ollama + OpenAI Agents SDK + Tavily MCP para montar un agente de investigación con herramientas, 100% local. 🔗 Towards Data Science

Llama.cpp vs Ollama: comparativa a fondo — Alex Ziskind desglosa diferencias reales de rendimiento entre el servidor de llama.cpp y Ollama para uso diario. 🔗 YouTube

OpenClaw + Ollama + Hermes: agente 100% local y gratuito — Julian Goldie SEO monta un agente completo usando OpenClaw con Ollama y modelos Hermes. Sin APIs, sin coste mensual. 🔗 YouTube

llama.cpp: PR #25051 hace viable Tensor Parallelism en Vulkan — TP (antes solo práctico en CUDA) llega a Vulkan. Multi-GPU con AMD se vuelve una opción real. 🔗 GitHub PR #25051

CUDA toolkit de Ubuntu va siglos por detrás — Un usuario con RTX 5060 Ti descubre que el paquete CUDA de apt usa la versión 12.0 cuando la actual es 13.3. Su Blackwell funcionaba a medio gas. Solución: instalar desde el repo de NVIDIA, no desde apt. 🔗 Reddit

Qwen3.6-35B-A3B reemplaza Google Vision en pipeline de recibos — Un usuario migra su pipeline de extracción de datos de recibos desde Google Vision a un modelo local Qwen3.6 corriendo en una RTX 3060. ¿El resultado? Igual de bueno, cero coste recurrente, y los datos nunca salen de casa. 🔗 Reddit

Personaje autónomo con memoria creciente en LLM local — Un usuario mantiene un personaje de IA con Qwen 3.6 27B Heretic que evoluciona sin límite de ventana de contexto, usando memoria externa. La personalidad sobrevive a reinicios. 🔗 Reddit

Hardware Guide 2026 para IA Local — Guía actualizada de configuraciones: NVIDIA vs AMD vs Apple Silicon, qué VRAM necesitas realmente, y qué esperar de cada presupuesto. 🔗 YouTube

 

🎯 Mi lectura de la semana

 

Esta semana la narrativa es clara: el software está alcanzando al hardware en IA local. No necesitas una H100 ni la última GPU de $2,000. Necesitas el backend correcto (Vulkan en vez de ROCm), la configuración correcta (llama.cpp bien compilado), y la arquitectura correcta (harness multi-crítico en vez de un solo prompt). MiMo-V2.5 escribiendo herramientas C++ dentro de llama.cpp es poesía ingenieril: modelos pequeños, bien destilados, haciendo trabajo de sistemas que hace un año requería un equipo de developers. La comunidad local LLM sigue siendo el lugar donde ocurre la innovación real — no en los press releases, sino a las 3 AM en un Reddit con un snippet de bash y un «mira lo que he conseguido».

 


 

¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

 

Si te ha gustado, suscríbete al blog en elmonomudo.com.


26
junio
2026

🤖 IA Weekly Digest #1 — Semana 26

Compilado el 26 de junio de 2026

El edge AI se pone a prueba con datos duros, Microsoft consolida su apuesta agentic, y la comunidad local LLM sigue exprimiendo hardware de consumo. Lo mejor de la semana: números reales, no promesas — y un runtime que empieza a ejecutar código.

🔝 Lo más importante de la semana

1. Edge AI Showdown: Raspberry Pi 5 vs Hailo-8 vs Jetson Orin Nano

Qué ha pasado: Joyce Lin pone a prueba tres configuraciones de hardware para edge AI con un objetivo claro: inferencia en tiempo real sin nube. Ejecuta el mismo modelo YOLO en una Raspberry Pi 5 base (~$80), una Pi 5 con acelerador Hailo-8 (~$150 total) y una NVIDIA Jetson Orin Nano ($250). Los resultados son contundentes: la Pi 5 sola apenas logra 5 FPS con throttling a 85°C, mientras que con el Hailo-8 salta a 77 FPS consumiendo solo 5W, y la Jetson Orin Nano alcanza 157 FPS sostenidos con latencia inferior a 7 ms.

Por qué importa: Este video demuestra con números que los aceleradores dedicados (NPU) son el futuro del edge AI de bajo consumo. El Hailo-8 ($70 extra sobre la Pi) da un salto de 5 a 77 FPS — una relación rendimiento/precio y rendimiento/vatio excepcionales. La Jetson gana en potencia pero su configuración es un dolor incluso para desarrolladores (firmware no documentado).

Para quién importa: Quienes montan sistemas de visión artificial, seguridad doméstica con Frigate NVR, automatización industrial ligera, o simplemente quieren entender qué hardware elegir para IA en el borde.

🔗 Vídeo completo (Joyce Lin)

2. Probé 3 modelos de IA local — y el más pequeño ganó

Qué ha pasado: Joyce Lin compara Llama 3.1 8B, Qwen 2.5 7B y Gemma 3 en un Mac Mini con Ollama usando una metodología de filtros impecable: open-weight → tamaño ajustado al hardware → cuantización aceptable. El ganador en razonamiento lógico fue Qwen 2.5 7B, resolviendo correctamente un puzzle de jarras de agua donde Llama falló con confianza pero sin coherencia.

Por qué importa: Confirma que el rango de ~7B parámetros es el punto dulce para hardware consumer. La destilación funciona, el tamaño importa más que la marca, y Qwen 2.5 7B debería ser el modelo por defecto para quien empiece con IA local hoy.

Para quién importa: Quienes quieren montar IA local sin depender de APIs, evaluar modelos antes de comprar hardware, o entender el equilibrio entre calidad y velocidad.

🔗 Vídeo completo (Joyce Lin)

3. Microsoft Agent Framework 1.0 — La fusión Semantic Kernel + AutoGen

Qué ha pasado: Microsoft lanza la v1.0 de su Agent Framework, unificando Semantic Kernel y AutoGen en un solo SDK para producción. AutoGen fue deprecatedado en abril 2026, dejando muchos tutoriales obsoletos. El nuevo framework no es un rebrand: es una reescritura que toma lo mejor de ambos mundos con guardrails y orquestación multi-agente.

Por qué importa: Si montas agentes en .NET, esto es tu nuevo punto de partida. Microsoft mata Autogen pero hereda su comunidad y lo integra en un framework con soporte empresarial real. Es la señal de que los agentes IA pasan de experimento a producto en el ecosistema Microsoft.

Para quién importa: Desarrollores .NET, equipos enterprise montando agentes, y cualquiera que haya invertido tiempo en AutoGen y necesite migrar.

🔗 Vídeo explicativo (Parthav AI)

🧭 Radar rápido

  • Flue: Claude Code como motor programable — Better Stack libera Flue, un framework open-source que toma el agent harness de Claude Code y lo hace totalmente programable. Menos fricción, más control. 🔗 Vídeo demo
  • GLM-5.2 con speculative decoding en 4× DGX Spark (GB10) — Un usuario reconstruyó con ayuda de Claude los mods que faltaban en la receta pública. Resultado: ~9.4 tok/s. Speculative decoding ya no es solo para grandes clusters. 🔗 Reddit
  • CUDA vs ROCm vs Intel: ¿por qué no remontan? — Hilo incómodo en r/LocalLLaMA: si los LLMs son tan buenos programando, ¿por qué ROCm e Intel no alcanzan a CUDA? Respuesta: documentación fragmentada, bugs silenciosos, y una NVIDIA que cobra premium por «simplemente funcionar». 🔗 Reddit
  • Multi-Agent Team con OpenClaw en Mac Mini — Brian Casel compra un Mac Mini dedicado exclusivamente a OpenClaw y monta 4 agentes IA especializados para gestionar su negocio. Producción real, no demo. 🔗 Vídeo

🎯 Mi lectura de la semana

Esta semana la IA local deja de ser promesa y se mide en FPS, tokens por segundo y grados centígrados. Lo más interesante no es un anuncio corporativo sino una youtuber poniendo tres piezas de hardware en una mesa y diciéndote exactamente cuánto puedes esperar de cada una. El Hailo-8 a $70 extra dando 77 FPS es el tipo de dato que cambia decisiones de compra. Mientras tanto, Microsoft hace lo Microsoft: absorber lo que funciona (AutoGen), matarlo, y renacerlo con nombre nuevo y backing empresarial. La comunidad local LLM sigue siendo donde ocurre la ingeniería real — no en los press releases.