Liquid AI presenta nuevos checkpoints Q4_0 para su familia de modelos LFM2.5, entrenados con una técnica que busca resolver uno de los problemas habituales de la cuantización: reducir memoria y aumentar velocidad sin perder demasiada calidad. La propuesta está pensada especialmente para ejecutar modelos de IA en dispositivos con recursos limitados.
Qué aporta la destilación consciente de la cuantización
La técnica se llama Quantization-Aware Distillation, o QAD. En términos simples, un modelo de alta precisión actúa como profesor y transfiere sus capacidades a un modelo estudiante que ya está diseñado para trabajar con pesos cuantizados.
¿Por qué importa? Cuando un modelo se convierte a Q4_0, sus parámetros pasan a representarse con menos bits. Esto reduce el consumo de memoria y puede acelerar la inferencia, pero también suele provocar una caída en las respuestas del modelo.
Con QAD, el entrenamiento toma en cuenta esa reducción de precisión desde el principio. Así, el modelo aprende a compensar parte de la pérdida, en lugar de intentar recuperarla después mediante una cuantización posterior al entrenamiento, conocida como PTQ.
La idea central es sencilla: hacer que el modelo aprenda a vivir con menos bits, no simplemente comprimirlo al final.
Los modelos recuperan hasta 97,4 % del rendimiento
Liquid AI comparó los checkpoints QAD Q4_0 con sus versiones GGUF cuantizadas mediante PTQ. Las pruebas cubrieron razonamiento, seguimiento de instrucciones, uso de herramientas y capacidades agénticas.
El conjunto de evaluaciones incluyó GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF y BFCLv4. También se incorporó una prueba matemática ajustada al tamaño de cada modelo: GSM8K para LFM2.5-230M y LFM2.5-350M, y AIME25 para LFM2.5-1.2B-Instruct y LFM2.5-2.6B.
Los resultados muestran que los cuatro modelos QAD conservaron entre 96,5 % y 97,4 % del rendimiento de sus respectivas versiones BF16:
- LFM2.5-230M: 97,1 %
- LFM2.5-350M: 96,5 %
- LFM2.5-1.2B-Instruct: 97,4 %
- LFM2.5-2.6B: 96,6 %
Las cifras corresponden al promedio de cinco repeticiones. En este análisis, el GGUF BF16 funciona como referencia de máxima calidad dentro del mismo formato.
Más velocidad sin aumentar el consumo de memoria
La ventaja práctica de estos checkpoints es que conservan las características principales de Q4_0: una huella de memoria reducida y un alto rendimiento de decodificación. Esto los hace atractivos para equipos pequeños, teléfonos y dispositivos edge.
Liquid AI midió la velocidad de generación en cuatro plataformas:
- MacBook Pro
- NucBox EVO-X2
- Samsung Galaxy S26 Ultra
- Raspberry Pi 5
En los dos primeros equipos se utilizó inferencia con GPU. En el teléfono Samsung y en la Raspberry Pi 5, las pruebas se realizaron con CPU Arm. Las versiones BF16 y F16 se incluyeron como referencias de precisión completa cuando estuvieron disponibles.
Los resultados también son competitivos frente a formatos más pesados. En los modelos LFM2.5-230M y LFM2.5-350M, los checkpoints QAD Q4_0 alcanzaron una calidad similar a Q5_K_M, con entre 4 % y 33 % más rendimiento de decodificación.
Para LFM2.5-1.2B y LFM2.5-2.6B, la calidad se equiparó a Q4_K_M, mientras que la velocidad fue entre 3 % y 14 % superior. En los casos aplicables, también igualaron el rendimiento de UD-Q4_K_XL de Unsloth, otro checkpoint de cuantización posterior con buenos resultados.
Modelos disponibles en Hugging Face
Los archivos QAD GGUF ya están disponibles para cuatro modelos de la familia LFM2.5:
LFM2.5-230MLFM2.5-350MLFM2.5-1.2B-InstructLFM2.5-2.6B
Puedes utilizarlos con llama.cpp o con cualquier runtime compatible con artefactos GGUF Q4_0. Por ejemplo, para ejecutar el modelo de 350 millones de parámetros con llama-cli:
llama-cli -hf LiquidAI/LFM2.5-350M \\
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \\
-p "What is C. elegans?"
El comando descarga el modelo indicado desde Hugging Face y genera una respuesta a la consulta. En un dispositivo como una Raspberry Pi 5 o un teléfono moderno, este tipo de formato puede marcar la diferencia entre ejecutar un modelo localmente o depender de una API en la nube.
Por qué esto importa para la IA local
La cuantización suele presentarse como una decisión entre calidad y eficiencia. Si quieres ahorrar memoria, aceptas perder algo de precisión. Si buscas mejores respuestas, utilizas formatos más grandes y consumes más recursos. QAD intenta mover ese punto de equilibrio.
No significa que un modelo Q4_0 vaya a superar siempre a uno BF16. La propia comparación de Liquid AI utiliza BF16 como techo de calidad. La propuesta es más concreta: conservar buena parte de esa capacidad con el tamaño y la velocidad de un modelo cuantizado.
Esto puede beneficiar a desarrolladores que construyen asistentes sin conexión, herramientas de programación en dispositivos portátiles, aplicaciones con privacidad local o sistemas embebidos. ¿Necesitas un centro de datos para probar un modelo pequeño? Con estos formatos, la respuesta es cada vez menos obvia.
La publicación también muestra una dirección importante para el desarrollo de modelos compactos: optimizar la arquitectura y el entrenamiento pensando desde el inicio en el hardware donde se ejecutarán. En la práctica, la IA local no depende únicamente de tener modelos más pequeños, sino de entrenarlos para funcionar bien bajo las restricciones reales de memoria, precisión y velocidad.
