🤖 DIGEST IA — SEMANA 31
Tritium, Kimik3 en 31 minutos y el fantasma de los P-Cores: la semana en la comunidad local-LLM
La cuantización sigue siendo la carrera armamentística de la comunidad local-LLM, y esta semana nos trae una bomba inesperada: Tritium, un motor ternario que promete 10× de compresión desde 1.58 bit por peso, creado por un estudiante de CS, no por un laboratorio de Big Tech. Mientras tanto, las arquitecturas híbridas de Intel (P-core + E-core) se confirman como zona de turbulencias para MoE e inferencia, y un bug en llama.cpp puede estar haciendo «tonta» tu instancia de DSV4 sin que lo sepas.
🔝 Lo más importante de la semana
1. 🍃 Tritium — Motor ternario Open Source (1.58 bit, Apache 2.0)
Qué ha pasado: Un estudiante de Ciencias de la Computación ha creado Tritium, un engine open source en Rust y CUDA para cuantizar modelos a ternarios reales (pesos a ±1, 0) con pérdida mínima. No es una cuantización agresiva disfrazada: es ternario de verdad. El motor es completo — quant + serve + train — y tiene licencia Apache 2.0.
Por qué importa: Promete reducciones de más de 10× en tamaño. Modelos que hoy necesitan 32 GB VRAM podrían correr en 3 GB. Si la calidad se mantiene razonable ante esa compresión extrema, la barrera de entrada al hardware doméstico se desploma.
Para quién importa: Cualquiera que haga inferencia local con GPUs de consumo, builders de rigs, y especialmente quienes persiguen modelos grandes en hardware modesto.
2. 💤 Kimik3 en llama.cpp — 31 minutos para 440 tokens
Qué ha pasado: Un usuario ejecutó Kimi k3 con llama.cpp y documentó el resultado: 40 tokens de prompt eval en 97.5s (0.41 tok/s) y 400 tokens de generación en 1769.9s (0.23 tok/s). Total: 31 minutos. El bottleneck está en el proceso de reflexión (thinking), no en la generación.
Por qué importa: Confirma que los modelos thinking pueden correr en hardware consumer, pero con una penalización de velocidad brutal. Para flujos de agente interactivo, 0.23 tok/s es impracticable. Para tareas batch de razonamiento profundo, puede tener sentido.
Para quién importa: Usuarios de modelos thinking (R1/Kimi-style), desarrolladores de agentes de coding, cualquiera evaluando si vale la pena el coste computacional del chain-of-thought.
🔗 Ver el benchmark en r/LocalLLaMA
3. 🐛 Chat template de DSV4 roto en llama.cpp — tu modelo puede estar «tonto» sin que lo sepas
Qué ha pasado: Los commits recientes de llama.cpp han roto el comportamiento de preserve_thinking para los GGUF antiguos de DeepSeek DSV4. El resultado: el modelo se vuelve significativamente menos inteligente en contexto de coding agent. La solución es pasar --chat-template-file con el template correcto.
Por qué importa: No es un bug de DeepSeek, es un cambio en llama.cpp que afecta templates viejos. Pero es fácil pasarlo por alto y asumir que «el modelo ya no es lo que era» cuando en realidad es solo un problema de plantilla. Si usas DSV4 con llama.cpp actualizado, necesitas verificarlo.
Para quién importa: Usuarios de DeepSeek V4 con llama.cpp, desarrolladores de agentes que dependen de consistencia de comportamiento.
🔗 Ver la solución en r/LocalLLaMA
🧭 Radar rápido
- ROCm vs Vulkan en AMD RDNA4: resultados contraintuitivos — Benchmarks con Radeon AI PRO R9700 (Navi48, 32 GB) en ROCm 7.14 vs Vulkan muestran diferencias de rendimiento inesperadas. Si usas AMD, no asumas que ambos backends rinden igual. 🔗 r/LocalLLaMA
- llama.cpp más lento en P-Cores que en E-Cores con MoE — Intel 270K Plus con Qwen 3.5 MoE (122B): los E-cores ganan a los P-cores en throughput. Las arquitecturas híbridas no planifican bien las cargas de inferencia. 🔗 r/LocalLLaMA
- audio.cpp v0.4: Higgs Audio v3 TTS a 10× tiempo real — TTS de calidad 4B en C++/GGML con full GGUF loading y gains de velocidad/VRAM en Q8. 🔗 r/LocalLLaMA
🗑️ Descartados
- 8+ vídeos de comparación de agentic AI frameworks (LangGraph vs CrewAI vs AutoGen vs Claude SDK vs MS Agent Framework vs OpenAI Agents SDK) — Saturación total. Mismo argumento, misma estructura, cero valor diferencial.
- 3 vídeos de setup OpenClaw/Ollama — Tutoriales genéricos sin contenido original («OpenClaw Free Forever», «The ULTIMATE Local AI»).
- 3090 vs 4090 comparison — Comparativa hardware ya conocida, sin novedad.
- «Before You Pick an AI Agent Framework» / «Finally, a Programmable AI Agent Framework» — Contenido genérico sin especificidad técnica.
🎯 Mi lectura de la semana
Tritium es de esos proyectos que aparecen una vez al año y te recuerdan por qué la comunidad open-source sigue siendo el lugar donde pasan las cosas de verdad. Un estudiante de CS, sin los recursos de un laboratorio corporativo, crea un motor ternario completo en Rust y CUDA que promete comprimir modelos 10×. Si los números se sostienen en benchmarks independientes, esto cambia el mapa de lo que es «posible» en hardware doméstico.
Lo de Kimik3 corriendo a 0.23 tok/s es la otra cara de la moneda: los modelos thinking son fascinantes, pero la brecha entre «funciona» y «es usable» sigue siendo enorme. 31 minutos para 440 tokens es una sentencia para cualquier flujo interactivo. Son modelos de reflexión, no de throughput, y hay que entenderlos como tales.
El bug del chat template de DSV4 es un recordatorio de lo frágil que es el ecosistema de inferencia local. Un commit en llama.cpp, un template que no se actualiza, y de repente tu modelo fiable se vuelve errático. La madurez del stack local-LLM avanza, pero seguimos en esa fase donde mantenerlo todo funcionando requiere atención constante.
La semana que viene, a ver si Tritium entrega lo que promete. Y mientras tanto, revisad vuestros chat templates.
¿Tienes algún comentario o quieres profundizar en algo? Respóndeme.
Si te ha gustado, suscríbete al blog en elmonomudo.com.