31
julio
2026

🤖 DIGEST IA — SEMANA 31

Tritium, Kimik3 en 31 minutos y el fantasma de los P-Cores: la semana en la comunidad local-LLM

La cuantización sigue siendo la carrera armamentística de la comunidad local-LLM, y esta semana nos trae una bomba inesperada: Tritium, un motor ternario que promete 10× de compresión desde 1.58 bit por peso, creado por un estudiante de CS, no por un laboratorio de Big Tech. Mientras tanto, las arquitecturas híbridas de Intel (P-core + E-core) se confirman como zona de turbulencias para MoE e inferencia, y un bug en llama.cpp puede estar haciendo «tonta» tu instancia de DSV4 sin que lo sepas.

🔝 Lo más importante de la semana

1. 🍃 Tritium — Motor ternario Open Source (1.58 bit, Apache 2.0)

Qué ha pasado: Un estudiante de Ciencias de la Computación ha creado Tritium, un engine open source en Rust y CUDA para cuantizar modelos a ternarios reales (pesos a ±1, 0) con pérdida mínima. No es una cuantización agresiva disfrazada: es ternario de verdad. El motor es completo — quant + serve + train — y tiene licencia Apache 2.0.

Por qué importa: Promete reducciones de más de 10× en tamaño. Modelos que hoy necesitan 32 GB VRAM podrían correr en 3 GB. Si la calidad se mantiene razonable ante esa compresión extrema, la barrera de entrada al hardware doméstico se desploma.

Para quién importa: Cualquiera que haga inferencia local con GPUs de consumo, builders de rigs, y especialmente quienes persiguen modelos grandes en hardware modesto.

🔗 Ver en r/LocalLLaMA

2. 💤 Kimik3 en llama.cpp — 31 minutos para 440 tokens

Qué ha pasado: Un usuario ejecutó Kimi k3 con llama.cpp y documentó el resultado: 40 tokens de prompt eval en 97.5s (0.41 tok/s) y 400 tokens de generación en 1769.9s (0.23 tok/s). Total: 31 minutos. El bottleneck está en el proceso de reflexión (thinking), no en la generación.

Por qué importa: Confirma que los modelos thinking pueden correr en hardware consumer, pero con una penalización de velocidad brutal. Para flujos de agente interactivo, 0.23 tok/s es impracticable. Para tareas batch de razonamiento profundo, puede tener sentido.

Para quién importa: Usuarios de modelos thinking (R1/Kimi-style), desarrolladores de agentes de coding, cualquiera evaluando si vale la pena el coste computacional del chain-of-thought.

🔗 Ver el benchmark en r/LocalLLaMA

3. 🐛 Chat template de DSV4 roto en llama.cpp — tu modelo puede estar «tonto» sin que lo sepas

Qué ha pasado: Los commits recientes de llama.cpp han roto el comportamiento de preserve_thinking para los GGUF antiguos de DeepSeek DSV4. El resultado: el modelo se vuelve significativamente menos inteligente en contexto de coding agent. La solución es pasar --chat-template-file con el template correcto.

Por qué importa: No es un bug de DeepSeek, es un cambio en llama.cpp que afecta templates viejos. Pero es fácil pasarlo por alto y asumir que «el modelo ya no es lo que era» cuando en realidad es solo un problema de plantilla. Si usas DSV4 con llama.cpp actualizado, necesitas verificarlo.

Para quién importa: Usuarios de DeepSeek V4 con llama.cpp, desarrolladores de agentes que dependen de consistencia de comportamiento.

🔗 Ver la solución en r/LocalLLaMA

🧭 Radar rápido

  • ROCm vs Vulkan en AMD RDNA4: resultados contraintuitivos — Benchmarks con Radeon AI PRO R9700 (Navi48, 32 GB) en ROCm 7.14 vs Vulkan muestran diferencias de rendimiento inesperadas. Si usas AMD, no asumas que ambos backends rinden igual. 🔗 r/LocalLLaMA
  • llama.cpp más lento en P-Cores que en E-Cores con MoE — Intel 270K Plus con Qwen 3.5 MoE (122B): los E-cores ganan a los P-cores en throughput. Las arquitecturas híbridas no planifican bien las cargas de inferencia. 🔗 r/LocalLLaMA
  • audio.cpp v0.4: Higgs Audio v3 TTS a 10× tiempo real — TTS de calidad 4B en C++/GGML con full GGUF loading y gains de velocidad/VRAM en Q8. 🔗 r/LocalLLaMA

🗑️ Descartados

  • 8+ vídeos de comparación de agentic AI frameworks (LangGraph vs CrewAI vs AutoGen vs Claude SDK vs MS Agent Framework vs OpenAI Agents SDK) — Saturación total. Mismo argumento, misma estructura, cero valor diferencial.
  • 3 vídeos de setup OpenClaw/Ollama — Tutoriales genéricos sin contenido original («OpenClaw Free Forever», «The ULTIMATE Local AI»).
  • 3090 vs 4090 comparison — Comparativa hardware ya conocida, sin novedad.
  • «Before You Pick an AI Agent Framework» / «Finally, a Programmable AI Agent Framework» — Contenido genérico sin especificidad técnica.

🎯 Mi lectura de la semana

Tritium es de esos proyectos que aparecen una vez al año y te recuerdan por qué la comunidad open-source sigue siendo el lugar donde pasan las cosas de verdad. Un estudiante de CS, sin los recursos de un laboratorio corporativo, crea un motor ternario completo en Rust y CUDA que promete comprimir modelos 10×. Si los números se sostienen en benchmarks independientes, esto cambia el mapa de lo que es «posible» en hardware doméstico.

Lo de Kimik3 corriendo a 0.23 tok/s es la otra cara de la moneda: los modelos thinking son fascinantes, pero la brecha entre «funciona» y «es usable» sigue siendo enorme. 31 minutos para 440 tokens es una sentencia para cualquier flujo interactivo. Son modelos de reflexión, no de throughput, y hay que entenderlos como tales.

El bug del chat template de DSV4 es un recordatorio de lo frágil que es el ecosistema de inferencia local. Un commit en llama.cpp, un template que no se actualiza, y de repente tu modelo fiable se vuelve errático. La madurez del stack local-LLM avanza, pero seguimos en esa fase donde mantenerlo todo funcionando requiere atención constante.

La semana que viene, a ver si Tritium entrega lo que promete. Y mientras tanto, revisad vuestros chat templates.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


24
julio
2026

🤖 IA Weekly Digest #5 — Semana 30, 2026

Compilado el 24 de julio de 2026

Esta semana nos trae una verdad incómoda que muchos sospechábamos pero pocos se atrevían a formular: los benchmarks no cuentan toda la historia. La comparativa Qwen vs Gemma ha encendido el subreddit, y mientras tanto, el ecosistema de inferencia local sigue sumando piezas nuevas — desde OSCAR2 para exprimir la caché KV hasta Higgs Audio v3 para TTS de calidad sin nube. Todo apunta a lo mismo: 2026 es el año en que la IA local deja de ser promesa y empieza a ser producto.

🔝 Lo más importante de la semana

1. Qwen vs Gemma: cuando los benchmarks mienten

Qué ha pasado: Un usuario de r/LocalLLaMA ha verbalizado lo que muchos pensaban en silencio: Qwen3.6 35B-A3B puntúa mejor en benchmarks que Gemma 4 26B-A4B, pero en uso real se siente «sustancialmente menos inteligente». En adherencia a prompts, coherencia y «cordura» general, Gemma gana por goleada. El hilo ha acumulado decenas de respuestas con experiencias similares, y varios usuarios reportan haber vuelto a Gemma tras probar Qwen3.6 durante semanas.
Por qué importa: Este es el tipo de brecha benchmark-vs-realidad que define qué modelos usa la gente de verdad. Los números en papel venden, pero la experiencia diaria decide. Si Gemma 4-26B (QAT) rinde mejor que Qwen3.6-35B en tareas reales siendo más pequeña, estamos ante un caso de eficiencia real que cambia las recomendaciones de la comunidad.
Para quién importa: Cualquiera que esté eligiendo modelo para uso diario — escritura, coding, razonamiento. Y especialmente a quienes usan ambos modelos en sus flujos.

🔗 Reddit

2. OSCAR2: el nuevo sistema de caché KV que llega a llama.cpp

Qué ha pasado: El usuario /u/giveen ha lanzado OSCAR2, un nuevo sistema de caché KV para llama.cpp con benchmarks en RTX 5090 (32 GB VRAM, Blackwell). Los números preliminares son prometedores: mejora significativa en el manejo de contextos largos y en la velocidad de decodificación. El proyecto está en fase activa de desarrollo, con builds específicas para la rama oscar de llama.cpp.
Por qué importa: La caché KV es el cuello de botella silencioso de la inferencia local. Cada mejora en este componente se traduce directamente en contextos más largos y respuestas más rápidas sin cambiar de hardware.
Para quién importa: Usuarios de llama.cpp con GPUs modernas, desarrolladores de backends de inferencia, cualquiera que trabaje con contextos de más de 32K tokens.

🔗 Reddit

3. Laguna-S-2.1: cuando la cuantización rompe el pensamiento

Qué ha pasado: El nuevo modelo Laguna-S-2.1 tiene un bug fascinante: en ciertas cuantizaciones, entra en bucles de «thinking forever» y nunca cierra sus tags «. Un usuario dedicó un día entero a debuguearlo y descubrió que no es un problema del modelo en sí, sino un artefacto de cuantización — el proceso de comprimir los pesos corrompe el mecanismo que le dice al modelo cuándo parar de pensar.
Por qué importa: Es una lección práctica sobre los límites de la cuantización agresiva. No es solo pérdida de calidad — a veces es pérdida de funcionalidad. El debugging documentado sirve como miniguía para diagnosticar problemas de este tipo.
Para quién importa: Usuarios de modelos cuantizados, mantenedores de GGUF, cualquiera que haya visto a su modelo «colgarse» sin razón aparente.

🔗 Reddit

🧭 Radar rápido

Brian Casel monta un equipo multi-agente con OpenClaw — 14 minutos donde explica cómo montó 4 agentes en OpenClaw y se compró un Mac Mini solo para correrlo. Contenido real, sin humo. 🔗 YouTube

DeepSeek V4 Flash en IQ3_XXS-AS e IQ2_S: benchmarks en RTX 3090 — La bestia de 671B parámetros cabe en una GPU de consumo: 250PP/11TG en contexto de 50K. 🔗 Reddit

PrismML Bonsai 27B: solo 3.8GB y corre en un teléfono — Un modelo de 27B que en cuantización 1_0 ocupa 3.8GB. La comunidad se pregunta si es demasiado bueno para ser verdad. 🔗 Reddit

Flue: framework de agentes programable del equipo de Astro — Alternativa open-source a LangGraph y CrewAI. Transforma el harness de Claude Code en algo programable. 🔗 YouTube

Microsoft mató AutoGen en abril de 2026 — Se reordena el panorama de frameworks de agentes. AutoGen muerto, unificado en Microsoft Agent Framework. Si construías sobre AutoGen, toca migrar. 🔗 YouTube

audio.cpp] Release 0.4: Higgs Audio v3 TTS 4B — TTS de calidad (10× tiempo real) y Fish Audio S2 Pro en C++/GGUF. 4B parámetros, Q8, listo para pipelines locales. 🔗 [Reddit

3090 vs 4090: comparativa real de inferencia local — Tres LLMs modernos, dos GPUs, una pregunta: ¿vale la pena el salto? 🔗 YouTube

192GB gang: ¿qué estás corriendo? — Usuarios de Mac Studio con 192GB de RAM unificada comparten qué modelos gigantes ejecutan. 🔗 Reddit

🗑️ Descartados

«Negative-Bit Quantization» (satire) — Divertido, pero es una broma de la comunidad, no contenido para el digest.

Qwen3.6 35B Q4 benchmarks en RX6600XT — Comparativa de hardware sin hallazgo novedoso.

Setup advice for 2 DGX Sparks — Nicho muy específico, pregunta de soporte.

Intel B70 users help request — Bug report de compilación, no contenido editorial.

MoE experts to SSD in llama.cpp — Pregunta teórica sin implementación ni resultados.

Múltiples comparativas de frameworks de agentes — Tres vídeos del mismo tema. Nos quedamos con el dato relevante (muerte de AutoGen).

🎯 Mi lectura de la semana

Hay dos narrativas compitiendo esta semana. La primera es la de la madurez: OSCAR2, Higgs Audio v3, audio.cpp, Flue — el ecosistema de herramientas locales está dejando de ser un conjunto de scripts experimentales para convertirse en software de verdad, con versiones, releases y benchmarks. La segunda es la de la brecha entre expectativas y realidad: Qwen vs Gemma, Laguna-S-2.1 roto por cuantización. El mensaje es claro: estamos en esa fase incómoda donde las herramientas son lo bastante buenas para ilusionarnos, pero no lo bastante fiables para confiar ciegamente.

Lo de Qwen vs Gemma me toca de cerca. Llevamos meses usando ambos modelos en nuestros flujos de escritura y publicación, y la experiencia coincide con lo que dice la comunidad: Gemma tiene una «cordura» que Qwen a veces pierde. No es cuestión de benchmarks, es cuestión de cuántas veces tienes que regenerar una respuesta hasta que sale algo usable. Y en ese baremo, Gemma gana.

El caso de Laguna-S-2.1 es casi una metáfora perfecta: comprimes un modelo para que quepa en tu GPU, y el proceso de compresión le rompe el mecanismo de «parar de pensar». Es poético. Y es una advertencia real: la cuantización no es magia gratuita. Cada bit que quitas se lleva algo. A veces es calidad. A veces es funcionalidad entera.

Lo bueno es que el ecosistema está aprendiendo. OSCAR2 promete exprimir más rendimiento del mismo hardware. Higgs Audio v3 demuestra que el TTS local ya es viable para producción. Y Flue nos recuerda que el mundo de los frameworks de agentes sigue siendo un campo de batalla abierto — Microsoft mató AutoGen, el equipo de Astro entra con algo nuevo, y mientras tanto, gente como Brian Casel simplemente se monta su equipo de agentes en OpenClaw y a correr.

La pregunta para la semana que viene: ¿cuántos de estos proyectos experimentales sobrevivirán al verano?


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomundo.com.


17
julio
2026

🤖 IA Weekly Digest #4 — 10–16 julio 2026

Compilado el 17 de julio de 2026

Esta semana la comunidad LocalLLaMA nos trae tres joyas: audio generativo a velocidad de vértigo con audio.cpp, un cara a cara entre tres setups de edge AI que resuelve de una vez la pregunta «¿qué compro para computer vision?», y la demostración de que DeepSeek V4 Flash cuantizado corre a 17 tk/s en hardware de gama media. Material sólido y práctico, sin hype.

🔝 Lo más importante de la semana

1. audio.cpp: 10 horas de audio en 3 minutos

Qué ha pasado: La comunidad llama.cpp/LocalLLaMA celebra el lanzamiento de audio.cpp, una implementación en C++/GGML con pila de modelos de voz (Supersonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS). Sobre una RTX 5090 genera 10 horas de audio en 3 minutos.

Por qué importa: Es un salto generacional comparable a lo que hizo llama.cpp con el texto. Para cualquiera que trabaje con TTS local, esto elimina el último argumento para usar APIs cloud de voz. Audio de calidad, generado a velocidad absurda, 100% local.

Para quién importa: Creadores de contenido que necesitan TTS, desarrolladores de asistentes de voz locales, y cualquiera que haya sufrido con las velocidades de generación de audio tradicionales.

🔗 Reddit

2. Edge AI: Raspberry Pi vs Hailo-8 vs Jetson Orin Nano

Qué ha pasado: Test comparativo real de detección de objetos en tiempo real (YOLO) sobre tres setups de edge AI: Pi 5 solo (5 FPS, no real-time), Pi 5 + Hailo-8 (77 FPS, 5W, 40 °C), Jetson Orin Nano (157 FPS, 13W, <7 ms de latencia). El Hailo-8 ofrece la mejor relación calidad/precio para hobbyists; la Jetson domina en producción pero con setup complejo.

Por qué importa: Es la comparativa que todo maker de edge AI necesita. Hasta ahora las comparaciones eran teóricas o basadas en specs. Esta es con hardware real, YOLO real, y números reales. Resuelve de una vez la duda de «¿Hailo-8 o Jetson?».

Para quién importa: Makers, desarrolladores de IoT con visión, cualquiera que esté evaluando hardware para computer vision en el edge.

🔗 YouTube

3. DeepSeek V4 Flash en Q2: 17 tk/s con 2× RTX 3080 20GB

Qué ha pasado: Un usuario comparte su experiencia corriendo DeepSeek V4 Flash cuantizado en IQ2XXS sobre dos RTX 3080 20GB con 64 GB DDR5. Resultado: 17 tokens/s de generación, 270 tk/s de prefill.

Por qué importa: Demostración concreta de que la cuantización agresiva combinada con multi-GPU hace viable correr modelos de última generación en hardware accesible. No necesitas una H100 ni la última GPU de $2,000. Dos 3080 usadas y un poco de DDR5 bastan.

Para quién importa: Builders de rigs multi-GPU, cualquiera que se pregunte si merece la pena cuantizar agresivamente, y los que dudan entre una GPU cara nueva o varias usadas.

🔗 Reddit

🧭 Radar rápido

  • Privacidad y agentes locales — El escándalo Grok Build ha abierto ojos sobre por qué los LLMs locales siguen importando: si los agent harnesses suben tu repositorio a la nube, pierdes el control de tus datos. 🔗 Reddit
  • ¿GGUF o más formatos en llama.cpp? — Debate comunitario sobre si debería abrirse a formatos como Safetensors. La tensión entre ecosistema cerrado e interoperabilidad futura. 🔗 Reddit
  • Fix crítico b9978 en workloads agénticos — Cada turno de agente creaba un nuevo checkpoint, agotando memoria y degradando rendimiento. Corregido. Esencial para quien corra agentes locales con llama.cpp. 🔗 Reddit
  • Guía: Prism Bonsai 27B — Tutorial para ejecutar este modelo de visión multimodal con llama.cpp y GGUF Q2_0 del repo oficial de PrismML-Eng. 🔗 Reddit
  • Cuantización: qué se rompe primero — Test sistemático de FP16 vs cuantizaciones GGUF medido por capacidad individual (maths, code, reasoning, knowledge). Algunas aguantan más que otras. Guía práctica para decidir trade-offs. 🔗 Reddit

🗑️ Descartados

  • LM Studio + Qwen 3.6 issues — Setup roto sin solución clara. Relevancia baja.
  • LM Studio ROCm no detecta Radeon 6900XT — Driver issue con workaround trivial (bajar a v2.21). Demasiado específico.
  • Bonsai Ternario 27B no acelera en ROCm — Problema AMD sin solución conocida.
  • Comparativas genéricas de agentes — Videos repetitivos de LangGraph vs CrewAI vs AutoGen sin insights nuevos.

🎯 Mi lectura de la semana

Tres noticias, un patrón: audio.cpp, edge AI comparativa, y DeepSeek V4 Flash en Q2. Las tres comparten algo — la conversación ha virado de «¿se puede?» a «¿con qué?» y «¿cómo?».

audio.cpp no es noticia por lo que hace (generar audio), sino por cómo lo hace: 10 horas en 3 minutos. Eso es velocidad de producción, no de experimento. El test de edge AI no es noticia por los datos técnicos, sino porque por fin hay una respuesta clara a «¿Hailo-8 o Jetson?» con números reales y sin marketing. Y el usuario que corre DeepSeek V4 Flash en Q2 con dos RTX 3080 no está presumiendo de hardware — está demostrando que la cuantización agresiva es una estrategia de deployment viable, no un truco de laboratorio.

Lo que conecta estas tres historias es madurez. La comunidad LocalLLaMA ha pasado de «mira qué chulo, funciona» a «así se hace en producción». Y eso, semana a semana, es lo que convierte la IA local de hobby a herramienta.

Esta semana no hay sección especial de hardware porque el material no daba para una sección completa, pero lo que hay es sólido y cohesivo. A veces menos es más.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.

 


10
julio
2026
🤖 IA Weekly Digest #3 — Semana 28, 2026

🤖 IA Weekly Digest #3 — Semana 28, 2026

Compilado el 10 de julio de 2026

Esta semana el subreddit ha explotado con una pregunta que nos hacemos todos: ¿cuál es la mejor GPU de 32GB para IA local sin pagar el impuesto NVIDIA? Tres tarjetas compiten — una vieja gloria de datacenter rescatada del mercado chino, la apuesta de Intel con Xe2, y la respuesta de AMD con RDNA 4. Las hemos puesto cara a cara con benchmarks reales, porque cuando hablamos de gastarse $1.000 en hardware, las opiniones sin números no valen.

🔝 Lo más importante de la semana

1. Cómo hostear cualquier modelo GGUF abierto detrás de una API

Qué ha pasado: El hilo más votado de la semana es una queja convertida en solución colectiva: tienes un modelo en Hugging Face que funciona de maravilla en Ollama o llama.cpp, pero cuando quieres usarlo desde una app, no hay API hosteada para él. La comunidad ha volcado soluciones: FastLLM como wrapper ligero, Ollama + OpenWebUI con proxy inverso, self-host con vLLM para modelos que lo soportan, y adaptadores personalizados para los que no.
Por qué importa: Este es el último metro del camino hacia la soberanía digital con IA. Ya tenemos modelos abiertos competitivos. Ya tenemos hardware capaz de correrlos. Lo que faltaba era el pegamento para conectarlos a nuestras herramientas diarias sin depender de APIs de terceros. Este hilo es un mapa de ese territorio.
Para quién importa: Cualquiera que haya pensado «este modelo es genial, pero ¿cómo lo uso desde mi app?» — desarrolladores montando productos con modelos locales, equipos migrando desde APIs cloud, y el creciente ejército de self-hosters.
🔗 Reddit

2. Cuánta VRAM necesitas para cada «tamaño» de modelo

Qué ha pasado: Un hilo brillante desglosa los nichos reales de tamaños de modelo (30B-35B, 70B-72B, 120B+, MoE vs denso) y qué hardware necesitas para cada uno. La conclusión clave: no es solo cuánta VRAM tienes, sino la combinación de GPU consumer vs profesional, cuantizaciones, y parallelism. Un modelo de 35B en Q4 puede caber en 20 GB… o no, según el overhead de display, KV cache, y el backend que uses.
Por qué importa: Demasiada gente compra hardware siguiendo la regla de «VRAM = tamaño del modelo × 1.2» y luego descubre que no le cabe. Este hilo te ahorra ese error. Si estás planeando tu rig de IA ahora mismo, léelo antes de comprar.
Para quién importa: Builders de rigs de IA local, cualquiera que esté comparando GPUs, y los que se preguntan si necesitan 24 GB o 32 GB para su caso de uso.
🔗 Reddit

3. Optimizaciones ggml de la semana: ARM NVFP4 + FP-fast-math en HIP

Qué ha pasado: Dos pull requests a llama.cpp que mejoran la velocidad de inferencia en hardware no-NVIDIA. El primero añade soporte de LUT UE4M3 en productos punto NVFP4 para procesadores ARM. El segundo activa -ffast-math para builds HIP en AMD. Son cambios pequeños, del tipo que no salen en titulares, pero que se acumulan.
Por qué importa: llama.cpp mejora por goteo constante, no por saltos revolucionarios. Estos PRs son el tipo de contribuciones que, sumadas a las de semanas anteriores, convierten una GPU «no recomendada para IA» en una opción viable. Cada punto porcentual de optimización cuenta cuando tu hardware no tiene CUDA.
Para quién importa: Usuarios de ARM (Apple Silicon, Raspberry Pi 5+, Snapdragon X) y AMD, mantenedores de llama.cpp, y cualquiera que compile su propio stack de inferencia.
🔗 ARM NVFP4 · HIP FP-fast-math


🔧 Especial Hardware: La batalla de las GPUs 32GB sin CUDA

Esta sección es nueva. La semana pasada varios hilos — y la conversación con lectores — giraron alrededor de la misma pregunta: ¿qué GPU de 32GB compro si no quiero pagar el impuesto NVIDIA? Hemos hecho la comparativa con datos reales de benchmarks independientes.

Las tres contendientes

 MI50 32GB 💰Intel Arc Pro B70 ⚖️AMD Radeon AI Pro R9700 🏆
VRAM32 GB HBM232 GB GDDR6 ECC32 GB GDDR6
Ancho de banda1 TB/s608 GB/s640 GB/s
ArquitecturaVega 20 (2018, 7nm)Xe2 Battlemage (2024)RDNA 4 (2025)
Precio$280-520 usado$949 nuevo$1,299 nuevo
TDP300W (pasiva)~150W300W
EcosistemaROCm (gfx906, decayendo)SYCL / oneAPIROCm (soporte completo)
Salidas vídeo❌ Datacenter puro✅ DP + HDMI✅ DP + HDMI
RefrigeraciónPasiva (necesita mod)Activa de fábricaActiva de fábrica

Rendimiento real en LLMs (datos de benchmarks independientes)

Single card:
B70 — Qwen 3.6-35B-A3B Q4: 54.7 t/s generación, 615 t/s prefill. SYCL. 🔗 PMZFX benchmarks
R9700 — gpt-oss:20b MoE: 102.4 t/s. Ollama + ROCm. 🔗 Hostkey review
MI50 — Qwen 3.5-35B-A3B Q8: 35.5 t/s. llama.cpp ROCm. 🔗 Diego Strebel

El as bajo la manga de la MI50 — multi-GPU barato:
Cuatro MI50 usadas = 128 GB VRAM por ~$800-1.000. Con eso puedes:
– Qwen3 235B (sí, 235 mil millones) a ~20 t/s — imposible en cualquier GPU de consumo
– Qwen3-Coder-Next 80B Q4 a 28.6 t/s en 4 tarjetas
– Llama 2 70B a ~35 t/s

Eso sí: refrigeración pasiva (necesitas ventiladores externos o rack con airflow), sin salidas de vídeo (es una aceleradora de datacenter pura), y ROCm para Vega 20 está perdiendo soporte oficial. Es un proyecto de bricolaje, no un producto de consumo.

¿Generación de vídeo?

  • B70: ✅ LTX-Video vía OpenVINO hasta 1280×704 (29s para clip de 2s). Wan 2.2 5B hasta 832×480. 720p OOM.
  • R9700: ✅ ComfyUI estándar con ROCm. Mismo techo de VRAM que la B70, pero ecosistema más probado.
  • MI50: ❌ Arquitectura de 2018 sin instrucciones de difusión modernas. No es para esto.

Veredicto rápido

Si tu prioridad es…Compra
Máximo VRAM por euro🥇 MI50 — 128 GB por <$1.000
Mejor single-card equilibrada🥇 B70 — $949, LLM y vídeo
Ecosistema más maduro🥇 R9700 — ROCm completo
Plug & play sin bricolaje🥇 B70 o R9700
Correr un modelo de 235B en casa🥇 MI50 ×4 — imbatible

Fuentes: PMZFX B70 · Hostkey R9700 · MI50 Budget VRAM King · MI50 2026 Benchmarks · r/LocalLLaMA MI50 thread


🧭 Radar rápido

  • Microsoft Agent Framework 1.0: Semantic Kernel + AutoGen unificados — Microsoft fusiona sus dos frameworks de agentes en un solo SDK para producción. Si trabajas con agentes empresariales, esto pinta a estándar. 🔗 YouTube — explicación
  • Flue — framework de agentes del equipo de Astro — Transforma el harness de Claude Code en algo completamente programable. Alternativa fresca a LangGraph y CrewAI desde el ecosistema Astro. 🔗 YouTube
  • Ornith-1.0-35B con speculative decode MTP nativo — MTP injertado directamente en el GGUF. Nuevos TTFT con tp=1 en llama.cpp. Sin parches ni forks. 🔗 Reddit
  • Qwen3.6-35B-A3B reemplaza Google Vision en pipeline de facturas (actualización W27) — Cubierto en el digest anterior. Extracción de recibos a JSON con modelo local en RTX 3060. Cero coste recurrente, datos 100% locales. 🔗 Reddit

🎯 Mi lectura de la semana

Hay un patrón que se repite: cada vez que alguien demuestra que un modelo local puede hacer el trabajo de un servicio cloud, la conversación vira inmediatamente al hardware. ¿En qué GPU lo corro? ¿Cuánta VRAM necesito? ¿Merece la pena el bricolaje de una MI50 de segunda mano o mejor comprar algo nuevo?

La buena noticia es que 2026 es el año en que la respuesta deja de ser «cómprate una NVIDIA o olvídate». Entre la B70 de Intel ($949, 32GB, vídeo incluido), la R9700 de AMD ($1,299, ROCm maduro), y las MI50 rescatadas del mercado chino ($300, 1 TB/s de ancho de banda), hay un abanico real de opciones. La guerra de las GPUs de IA ha comenzado, y esta vez el campo de batalla son los 32GB.

Lo que más me gusta de esta semana es que la conversación ha pasado de «¿se puede?» a «¿cuál compro?». Eso es progreso real. Hace un año la respuesta era «cómprate una 3090 usada o una 4090 nueva». Hoy tienes tres fabricantes compitiendo en el mismo nicho. Y la MI50, una tarjeta de datacenter de 2018 que muchos daban por muerta, resulta que es el camino más barato para correr un modelo de 235B en el garaje de tu casa. Si eso no es democratización de la IA, no sé qué lo es.


¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.

Si te ha gustado, suscríbete al blog en elmonomudo.com.


18
agosto
2025

Para tener un chatbot de AI gratis en tu sitio wordpress primero deberemos obtener una clave API en openrouter.ai , nos registramos y clicamos en Models, a la izquierda en Prompt pricing desplazamos el botón para dejarlo en free. 

Nos aparecerán muchos modelos de IA gratuitos, aunque no necesitamos modelos de gama alta, ya que en estos pondrán las preguntas en una cola y serán lentos, entonces algo entre 18 y 30 mil millones de parámetros harán el trabajo muy bien, los modelos Deepseek R1 son bastante buenos, así que en la caja de búsqueda ya podemos filtrar por «deepseek», nos aparecerá DeepSeek: R1 0528 (free) pero este es el modelo completo y va a ser demasiado lento, por tanto mejor buscar alguno entre 18B y 30B , en este blog hemos elegido DeepSeek: R1 Distill Qween 14B (free) que como ves corresponde a 14 mil millones de parámetros, tal vez uno sobre 30B hubiera resultado mejor pero actualmente no había ninguno.

Clicamos en él y nos aparecerá una página con las características del modelo, vamos bajando y clic en el botón Create API key , ponemos un nombre a la API, credit limit en blanco y damos al botón Create, aparecerá nuestra clave API que deberemos copiar y guardar bien porque no podrás volver a esa ventana ni ver esa clave.

Ahora vamos al wordpress de nuestro sitio para instalar un plugin, nosotros hemos elegido el plugin AI Chatbot Free Models que parece sencillo y eficaz para lo que queremos. El autor es NewCodeByte y podemos configurarlo fácilmente, rellenamos la pestaña ajustes con el texto y título deseado, introducimos la clave API obtenida antes y guardamos ajustes, entonces en el desplegable de Modelo elegimos Deepseek R1 0528 Qween3 8B (free) y en nuestro caso funciona.

Ahora debemos indicar a la IA como debe comportarse ante las preguntas de los usuarios, esto es lo que dice el plugin de los dos apartados que debes rellenar:

Información para las respuestas > Por favor, introduzca toda la información sobre su blog en este cuadro de texto. Esta será la base de conocimiento para que el bot responda a las preguntas de los usuarios.

Tipo de comportamiento > Proporcione instrucciones detalladas sobre cómo debe responder el bot a las preguntas de los usuarios. Por ejemplo, especifique su tono, estilo y cualquier conocimiento o experiencia específica que deba demostrar.

De como rellenemos estos dos apartados dependerá el comportamiento de la IA para responder a las preguntas de los usuarios.

En la pestaña mensajes podemos indicarle al plugin que guarde las preguntas y respuestas de los usuarios, algo que he encontrado útil. Y en estilo e imágenes puedes configurar la apariencia de la ventana.

Algo que echo en falta en este plugin es obtener un código corto para poder insertarlo en una determinada página o post, así que tal como está ahora solo se puede colocar en una de las dos esquinas inferiores de la ventana.

Es posible que dada nuestra inexperiencia en el tema IA nuestro chatbot no funcione adecuadamente, cualquier ayuda en este aspecto será bienvenida. Puede responder preguntas de cultura general, pero falta ver si puede también orientarse a buscar diferentes temáticas dentro de nuestro propio blog.


07
septiembre
2024
winapex 268b

La pinza amperimétrica Winapex 268b ofrece precisas mediciones en corriente alterna, continua, intensidad y fugas, así como resistencia, capacitancia, diodos, frecuencia y temperatura. Es posible usarlo como multímetro con las puntas incluidas, medir temperatura con la sonda y cargar su batería con el cable usb c incluido. Todo ello en un discreto estuche con manual incluido.

Con la intención de renovar el cuadro eléctrico y realizar las medidas de intensidad y voltaje necesarias, estuve buscando una pinza amperimétrica adecuada y que no supusiera una gran inversión. Finalmente, después de revisar varias encontré esta Winapex 268B con buena popularidad en YouTube y buenas críticas, así que por unos 30 euros me decidí en la compra. Teniendo en cuenta que las pinzas amperimétricas profesionales pueden valer 10 veces más, al parecer esta tiene unas buenas opiniones acerca de su exactitud.

winapex 268b contenido

Pinzando la fase obtienes el consumo en amperios de una determinada línea, y si pinzas fase y neutro obtendrás en miliamperios la corriente de fuga. Usando las puntas he hecho mediciones de voltaje en corriente alterna y corriente continua, además de condensadores y algún que otro diodo, todo ello con aparente exactitud.

Después de mi experiencia, consultando el manual incorporado y viendo muchos videos demostrativos, me he aventurado a hacer mi propio manual resumido de como usar el dispositivo.

winapex 268b manual de uso

También incluyo el manual winapex 268b capturado en pdf.

Con este mas que completo dispositivo se podría decir que podría sustituir a mi antiguo tester, sin embargo estamos hablando de una joya de otro tiempo a la que dicifilmente se le puede poner precio.

 


18
mayo
2023

Para realizar multitud de gestiones online sin desplazamientos el dni electrónico es de gran ayuda, os explicamos los pasos básicos para conseguirlo.

Si no sabes la contraseña de tu dni o la has perdido o los certificados incluidos en tu dni han caducado deberás acudir a una comisaria, en Barcelona en la calle Trafalgar está abierta hasta las 21h.

Acudes a una máquina que está a la entrada y sigues estas instrucciones en el caso de que no recuerdes la contraseña https://www.dnielectronico.es/PDFs/CAMBI… la identificación con tu huella dactilar es muy posible que te cueste varias veces repetirla hasta que la reconozca, intenta poner el dedo en varias posiciones, apretar, calentarlo con el aliento y limpiar la zona hasta que la máquina te identifique. Apúntate la nueva contraseña.

En la misma máquina comprueba la fecha de validez de los certificados electrónicos incluidos en tu dni, en caso de que alguno esté caducado sigue estas instrucciones https://www.dnielectronico.es/PDFs/RENOV…

Para usar tu dni en tu ordenador la forma mas sencilla es utilizar la aplicación DNIe Remote oficial https://www.dnielectronico.es/PortalDNIe… la instalas en tu pc, la abres y quedará un icono en la barra de tareas.

En tu móvil android buscas en la play store «Lector dnie» e instalas la app «Lector de DNIe para PC, usando» CNP-FNMT, debes tener activado NFC en tu móvil, la abres, le das a conectar por wifi, en el pc le das a botón derecho en dni de la barra de tareas en «generar QR para conexión wifi» el cual lo lees con el móvil, te pedirá que acerques el dni al móvil, lo colocas debajo del móvil, y si todo está bien funcionará. Recuerda que hay que añadir en la app un número CAN que aparece en el dni, de lo contrario dará un error de lectura que confunde un poco.

Con el dni ahora conectado puedes acceder a esta web https://www.sede.fnmt.gob.es/certificado… para verificar las fechas de validez y que funciona correctamente.

Todo lo anterior es necesario para poder conseguir el sistema «clave permanente» donde obtendrás un usuario y contraseña para acceder a la mayoría de sitios oficiales, seguridad social, sepe, ayuntamientos, etc sin necesidad de configurar nada y sin conectar el dni ni nada. Para ello con el dni conectado, y mejor usando Chrome, vamos a https://sede.agenciatributaria.gob.es/Se… y le das a «registrarse en clave» si es la primera vez o a «Regenerar código de activación de clave permanente» en el caso de que te registraras en clave y perdieras el código de activación. Rellenando el formulario y siguiendo todos los pasos conseguirás un código de activación de clave permanente, el cual deberás usar en https://clave.gob.es/activar para activar tu clave permanente.

Ya con tu usuario, que corresponde al número de tu dni, y tu contraseña, puedes acceder a multitud de sitios oficiales y evitar desplazamientos. Puedes empezar a probar tu clave permanente en la sede electrónica de la seguridad social https://sede.seg-social.gob.es/wps/porta… o al portal «tu seguridad social» para consultas varias https://sede-tu.seg-social.gob.es/

 

 


11
marzo
2022
Pc gaming 2022

Mi nuevo pc gaming de 2022 es de 11a generación de CPU y DDR4, con una espectacular caja Sharkoon REV200, un Seagate FireCuda 530 SSD 1TB M.2 NVMe de lo más rápido actualmente, un Intel Core i9-11900 2.5 GHz, más Kingston HyperX Predator RGB DDR4 3200MHz con la placa base Gigabyte Z590 UD AC. El monitor es Asus TUF Gaming VG289Q 28″ LED IPS UltraHD 4K HDR FreeSync a 60 fps está bien. La gráfica dejo que adivinéis vosotros que modelo es, dejad un comentario.

La experiencia con una tienda online fue nefasta, por lo que os recomiendo que uséis siempre vuestra tienda local de confianza, en caso de que estéis por Barcelona os recomendamos a David de Red Computer quien ya ha montado varios PC Gaming que aparecen en nuestro blog.

 

 


17
enero
2021
Lavavajillas miele

Uno de los electrodomésticos más usados en la casa es el lavaplatos, este Miele puede dar algún error que podemos subsanar nosotros mismos con un buen mantenimiento y cuidado, esto nos ahorrará dinero, tiempo y evitar llamar al servicio técnico.

En mi caso compré este Miele hace más de 5 años, es el modelo G4212 y se puede decir que estoy contento con él. El anterior de otra marca duró apenas dos años, fruto de la obsolescencia programada y una mala elección de marca. A veces es mejor confiar en el producto por el cual destaca una marca y confiar en ella.

Muchas veces limpiar bien los filtros y usar un producto limpia máquinas no es suficiente, y solo investigando por internet encuentras la solución a temas que no sabías y que te pueden ahorrar mucho dinero, a parte de evitar tener que llamar al servicio técnico. Ahora vamos a ver como abordar dos errores muy comunes en los lavaplatos Miele y como realizar una limpieza a fondo del lavavajillas para que funcione muchos años más.

Error F11. Este error aparece antes de acabar el programa de lavado y se produce porque el aparato no puede desaguar todo el agua de la cuba. En este caso es importante limpiar bien los filtros, retirar la válvula antiretroceso, limpiar bien toda la zona y debajo de las aspas de la bomba de desagüe limpiar y retirar cualquier objeto.

Error F51. Este error aparece al iniciar el programa e impide continuar. Tal y como se observa en el video hemos de utilizar un tenedor, tornavis u objeto similar para hacer girar a izquierda y derecha el rotor que ha quedado bloqueado por algo.

El mantenimiento completo que indicamos en el video es muy aconsejable de seguir para obtener una limpieza profunda del aparato y poder disfrutarlo muchos años más.

Suerte ! Activar subtítulos.

ACTUALIZACIÓN MARZO 2022

Casi a cumplir 7 años, el aparato continuamente paraba el programa a la mitad dando el error F11. Después de ver algunos videos en youtube me atreví a intentar solucionarlo por mi mismo en lugar de tener que pagar bastante por un técnico. La solución es más o menos sencilla, vuelcas el aparato sobre su lado derecho, abres la tapa inferior, con unos alicates aflojas la pinza del tubo del desagüe y lo extraes completamente, en mi caso era increíble la cantidad sarro / cal acumulada dentro del tubo y que impedía que el aparato evacuara el agua. Lo puedes limpiar con un pasacables o similar, añadiendo bicarbonato con vinagre, etc. Otra solución sería comprar directamente la manguera al proveedor.


Miele desague


03
julio
2020

Con un VPN puedes navegar seguro y de forma anónima en internet. Tu ip será distinta y no podrás ser detectado por tu proveedor de internet ni por otros servicios. Se establece una conexión cifrada entre tu dispositivo y el VPN y nadie puede saber lo que estás haciendo.

En una conexión normal tu proveedor de internet sabe en todo momento a que hora y a que webs te conectas, estos datos van asociados con la ip que te proporciona.

Si nunca has probado un VPN aquí te explico algunos que son una buena opción en su versión gratuita.

En principio pasé tiempo en el tema estudiando el montar un VPN en una Raspberry Pi de forma que conectada al router me proporcionara seguridad y anonimato a la hora de navegar. Sin embargo esto no es posible en tu misma red por eso un VPN debe estar instalado en otra red distinta a la tuya.

Un buen VPN es Windscribe, en su versión gratuita te regalan 10 GB de tráfico mensuales para que navegues totalmente a salvo de miradas indiscretas.

Otro buen VPN es ProtonVPN, en su versión gratuita no tienes límite de tráfico y te puedes conectar a cualquiera de sus servidores por todo el mundo, obteniendo así la ip del pais que te interese. Aún así en la versión free no te puedes conectar a los servidores más rápidos. Durante los primeros 7 días tienes acceso total a todos los servidores, inlcuso los más rápidos y que permiten p2p.