07
agosto
2026
🤖 IA Weekly Digest #7 — Semana 32, 2026

## 🤖 IA Weekly Digest #7 — Semana 32, 2026

Compilado el 7 de agosto de 2026

Esta semana no la define un modelo, la definen tres precios. DeepSeek, OpenAI y Alibaba han coincidido en la misma jugada: poner IA de nivel frontier al alcance de cualquier bolsillo. En siete días hemos visto el modelo más barato con rendimiento de agente (DeepSeek V4 Flash 0731 a $0.14/M), el recorte del 80% que pone a OpenAI en el ring asequible (GPT-5.6 Luna a $0.20/M), y el tanque chino que compite con los flagships a un tercio del precio (Qwen 3.8 Max a $2/$6). Y en la comunidad local-LLM, la resaca del lanzamiento ya se nota: kernels optimizados para Flash, cuantizaciones agresivas a 54 GB, y el eterno arte de exprimir 8 GB de VRAM como si fueran 80.

## 🔝 Lo más importante de la semana

### 1. DeepSeek V4 Flash 0731 — Pequeño, abierto y demoledor en precio

Qué ha pasado: DeepSeek no tocó la arquitectura de V4 Flash (284B MoE, 13B activos por token). Solo re-entrenó el modelo con datos de agentes. El resultado es una barbaridad: Terminal-Bench 2.1 pasó de 61.8% a 82.7%, DeepSWE de 7.3% a 54.4%, Cybergym de 38.7% a 76.7%. Con solo 13B activos, el Flash 0731 supera a su propio V4-Pro (1.6T) en todos los benchmarks de agente. Y el precio: $0.14/M input, $0.28/M output, cache hit a $0.0028/M. Los pesos están en HuggingFace con licencia MIT: 167 GB en FP4/FP8, 57 cuantizaciones ya disponibles. Se corre en local. La letra pequeña: DeepSeek ha anunciado precios 2× en horas pico (9:00-12:00 y 14:00-18:00 hora Beijing), sin fecha de entrada en vigor.

Por qué importa: Esto es ingeniería de post-entrenamiento, no fuerza bruta. Un modelo de 13B activos rindiendo como uno de 1.6T. Es la demostración más clara de que el futuro no está en hacer modelos más grandes, sino en entrenarlos mejor. Y el precio lo cambia todo: a $0.14/M input, tareas de agente que antes requerían un Sol o un Opus ahora cuestan calderilla.

Para quién importa: Cualquiera que ejecute flujos de agente en producción y quiera rendimiento de frontera sin el precio de frontera. Y cualquiera que quiera correr un modelo capaz en su propia máquina sin depender de APIs cloud.

🔗 [Ficha técnica en HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) · [Análisis de benchmarks](https://aitoolsrecap.com/Blog/deepseek-v4-flash-0731-review-benchmarks-2026) · [Precios oficiales](https://api-docs.deepseek.com/quick_start/pricing)

### 2. GPT-5.6 Luna — OpenAI recorta el 80% y entra en la guerra de precios

Qué ha pasado: El 30 de julio, OpenAI recortó el precio de GPT-5.6 Luna de $1/$6 a $0.20/$1.20 por millón de tokens. Una rebaja del 80% tanto en input como en output. Terra también bajó un 20% (a $2/$12). Sol se mantiene en $5/$30. Lo relevante no es solo el número: Luna es el mismo motor que Sol y Terra — mismo contexto de 1.05M, misma ventana de 128K output, mismo conocimiento hasta febrero 2026. La diferencia está en la velocidad, no en la capacidad. Sam Altman lo confirmó personalmente.

Por qué importa: Por primera vez, OpenAI compite de verdad en el segmento asequible. No con un modelo recortado tipo «mini», sino con el mismo GPT-5.6 que corre en Codex y ChatGPT, a precio de café. Durante años, «OpenAI» y «barato» no aparecían en la misma frase. El recorte del 80% en Luna no es caridad — es competencia real de DeepSeek y Alibaba, y eso beneficia a todos.

Para quién importa: Cualquiera que use Codex, la API de OpenAI, o ChatGPT Work. El ahorro es automático, sin cambios de cuenta. Y cualquiera que estuviera usando modelos «mini» por precio y ahora pueda saltar a un modelo de la familia GPT-5.6 por un coste similar.

🔗 [Anuncio oficial de OpenAI](https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/) · [Desglose del recorte](https://www.explainx.ai/blog/openai-gpt-5-6-luna-terra-price-cuts-july-2026)

### 3. Qwen 3.8 Max — El tanque de Alibaba que mira a los ojos a Sol y Fable 5

Qué ha pasado: Alibaba lanzó Qwen 3.8 Max el 2 de agosto. Las cifras imponen: 2.4 billones de parámetros totales, 95B activos por token, el primer modelo multimodal de Alibaba por encima del billón de parámetros. Acepta texto, imágenes y vídeo como entrada. En los benchmarks de Alibaba gana 13 de 16 filas contra GPT-5.6 Sol, incluyendo todas las de visión. LMArena lo sitúa #5 global en texto y #4 en WebDev. La comunidad está dividida: hay quien canceló su suscripción a Anthropic por esto y quien lo llama «benchmark princess» tras encontrar bucles de razonamiento. La pega: viene con razonamiento xhigh por defecto, y un desarrollador midió 18M tokens de input para una sola tarea — el doble que Kimi K3 para el mismo trabajo. Los pesos abiertos, prometidos para «la semana que viene» el día 2, siguen sin aparecer a 5 de agosto.

Por qué importa: Qwen 3.8 Max compite con GPT-5.6 Sol ($5/$30) y Claude Fable 5 ($10/$50) a $2/$6. Es la apuesta de Alibaba por la escala como ventaja competitiva. El vídeo como entrada nativa es un diferenciador real que ni Sol ni Fable 5 tienen. Pero el coste oculto del razonamiento verboso y la ausencia de pesos abiertos son dos asteriscos importantes.

Para quién importa: Quien necesite visión + vídeo + texto en un solo modelo sin montar pipelines separados. Quien quiera rendimiento de flagship sin pagar precio de flagship. Y quien esté atento a si Alibaba cumple su promesa de abrir los pesos — si lo hace, 95B activos con licencia abierta cambiarían el tablero.

🔗 [Guía completa en aicybr.com](https://aicybr.com/blog/qwen-3-8-max-complete-guide) · [Comparativa vs GPT-5.6](https://www.eesel.ai/blog/qwen38-max-vs-gpt-56) · [Comparativa vs DeepSeek V4 Flash](https://www.eesel.ai/blog/qwen38-max-vs-deepseek-v4-flash)

### 4. Beating vLLM y llama.cpp en TTFT con Gemma4-12B en RTX 5090

Qué ha pasado: Un desarrollador ha publicado un worklog detallado de optimización de inferencia usando kernels GEMM y FlashAttention compilados a medida. El resultado: menor latencia (TTFT) que vLLM y llama.cpp con Gemma4-12B en una RTX 5090. El truco está en kernels generados por compilador específicos para la arquitectura de la GPU, no en cambiar el modelo. El autor aclara que la velocidad de generación (TPOT) no mejora — está limitada por ancho de banda de memoria — pero la latencia inicial sí.

Por qué importa: Para aplicaciones interactivas (chat, coding assistants, agentes que necesitan respuesta rápida), la latencia inicial es tan importante como el throughput. Este trabajo demuestra que todavía hay margen de optimización por debajo de los engines establecidos si estás dispuesto a compilar kernels a medida para tu hardware concreto.

Para quién importa: Desarrolladores que construyen aplicaciones interactivas con LLMs locales y necesitan la mínima latencia posible. Entusiastas del tuning de inferencia que quieran exprimir cada milisegundo de su RTX 5090.

🔗 [Worklog en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1veoe08/beating_vllm_and_llamacpp_ttft_on_gemma412b_on/)

### 5. DeepSeek V4 Flash «Mini» — 54 GB GGUF a 20.5 t/s

Qué ha pasado: Un usuario ha creado una versión ultra-comprimida de DeepSeek V4 Flash 0731 usando la adaptación REAP combinada con cuantizaciones agresivas. El resultado: un GGUF de 54 GB que corre a ~20.5 t/s. Para contexto, el modelo original en FP8 son 167 GB. Esto es una reducción de casi el 70% en tamaño manteniendo velocidad usable.

Por qué importa: Si el modelo base ya es barato en API ($0.14/M), tener una versión que cabe en 54 GB lo pone al alcance de setups con una sola GPU de 80 GB o dos de 32 GB. La comunidad ya está haciendo con Flash lo mismo que hizo con los GGUF: comprimir, cuantizar, y demostrar que el modelo es útil incluso reducido al máximo. Esto es exactamente lo que convierte un lanzamiento de API en un ecosistema local.

Para quién importa: Cualquiera que quiera correr DeepSeek V4 Flash en local sin invertir en un servidor de 8 GPUs.

🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfr3d2/deepseekv4flashmini_54gb_gguf_running_at_205_ts/)

## 🧭 Radar rápido

– **DeepSeek anuncia precios 2× en horas pico** — De 9:00 a 12:00 y 14:00 a 18:00 hora Beijing (01:00-04:00 y 06:00-10:00 UTC). Sin fecha de entrada en vigor. En horas europeas el impacto es limitado pero conviene tenerlo en el Excel. 🔗 [Página oficial de precios](https://api-docs.deepseek.com/quick_start/pricing)
– **Speculative decoding con V4 Flash 0731 en llama.cpp** — Un usuario está intentando activar speculative decoding con el nuevo Flash usando el draft model de am17an y cuantización UD-Q8 de Unsloth. De momento con problemas, pero es el tipo de experimento que aparece a los pocos días de un lanzamiento y que en semanas se convierte en tutorial. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1ven4f7/speculative_decoding_with_deepseek_v4_flash_0731/)
– **MTP para GLM-4.5-Air en llama.cpp** — Un usuario pide ayuda para probar Multi-Token Prediction en GLM-4.5-Air, un modelo que tuvo su momento y todavía tiene fans. Si alguien todavía lo tiene en disco y sabe compilar llama.cpp, el PR está abierto. 🔗 [PR en GitHub](https://github.com/ggml-org/llama.cpp/pull/26534)
– **Mix de modelos frontier + locales para coding con 8 GB VRAM** — Un desarrollador full-stack comparte su setup híbrido: modelos cloud para tareas complejas, modelos locales para tareas repetitivas, todo desde un portátil gaming con RTX 4060 de 8 GB. Un recordatorio de que no hace falta un rig de $5.000 para ser productivo con IA local. 🔗 [Hilo en r/LocalLLaMA](https://www.reddit.com/r/LocalLLaMA/comments/1vfsaab/mix_of_frontier_and_local_models_for_coding_in_a/)
– **Tritium — seguimiento sin novedades** — El motor ternario 1.58 bit de la semana pasada no trae novedades. Se mantiene en observación. 🔗 [Post original](https://www.reddit.com/r/LocalLLaMA/comments/1vbf0nt/open_source_ternary_llm_engine_in_rustcuda_for/)

## 🎯 Mi lectura de la semana

Hay semanas que giran alrededor de un paper, un lanzamiento o un drama. Esta semana ha sido distinta: tres laboratorios con filosofías completamente opuestas han coincidido en la misma conclusión — la IA de frontera tiene que ser asequible.

DeepSeek lo hace con ingeniería: 13B parámetros activos que rinden como 1.6T. OpenAI lo hace con subsidio cruzado: Luna es Sol, a 1/25 del precio. Alibaba lo hace con escala: 2.4T parámetros a $2, cuando sus rivales directos cobran entre $5 y $10. El resultado: por menos de $0.30/M output tienes IA de nivel frontier. En junio eso era impensable. En agosto es la nueva normalidad.

Y lo que más me gusta es lo que pasó en la comunidad apenas 48 horas después del lanzamiento de Flash: ya hay kernels optimizados compitiendo con vLLM, ya hay un GGUF de 54 GB corriendo a 20 t/s, ya hay gente intentando speculative decoding. Ese es el termómetro real de un lanzamiento. No los benchmarks oficiales — la velocidad a la que la comunidad lo hace suyo. Y Flash va camino de récord.

Si tuviera que quedarme con un solo detalle de esta semana, sería el momento en que DeepSeek publicó que su modelo pequeño de 13B activos supera a su modelo grande de 1.6T en tareas de agente. Eso no es un dato técnico — es un aviso a navegantes. La carrera ya no es quién tiene más parámetros, sino quién entrena mejor.

Lo segundo: ver a OpenAI en esta guerra de precios es genuinamente esperanzador. Durante años fueron el sinónimo de «caro». El recorte del 80% en Luna es una admisión implícita de que el mercado ha cambiado y ellos lo saben. Bienvenidos a la fiesta.

¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en [elmonomudo.com](https://elmonomudo.com).