La inteligencia artificial abierta no está avanzando de una sola manera. Mientras algunos laboratorios compiten con modelos de cientos de miles de millones o incluso billones de parámetros, la adopción diaria sigue concentrada en modelos pequeños, estables y fáciles de ejecutar. ¿Qué está ocurriendo realmente detrás de las cifras?
El informe State of Open Models: Summer 2026 Observations, publicado por Hugging Face, analiza la actividad del Hub durante los primeros siete meses de 2026. Sus datos muestran un ecosistema más grande, más competitivo y también más dependiente de herramientas comunitarias como llama.cpp, los formatos GGUF y los agentes de programación.
El ecosistema abierto crece, pero de forma desigual
Entre finales de 2025 y julio de 2026, los repositorios públicos de modelos en Hugging Face crecieron de 2,43 a 2,96 millones. Los conjuntos de datos pasaron de 711.000 a 1 millón, mientras que los Spaces, aplicaciones y demostraciones alojadas en la plataforma, aumentaron de 1 millón a 1,44 millones.
Sin embargo, el crecimiento no significa que todos los proyectos tengan la misma visibilidad. El 85,6 % de los modelos registra menos de 200 descargas acumuladas durante toda su existencia. Al mismo tiempo, apenas el 1,5 % de los repositorios concentra el 99,2 % de todas las descargas.
El Hub es enorme, pero su actividad está concentrada en una pequeña fracción de modelos y herramientas.
Esta diferencia es importante. Un modelo puede generar miles de “me gusta” porque entusiasma a la comunidad y, aun así, tener pocas descargas. Otro puede ser descargado millones de veces sin llamar demasiado la atención, porque ya forma parte de una aplicación, un flujo de trabajo o una biblioteca de software.
China domina la frontera de los modelos abiertos
Durante casi todos los meses de 2026, el modelo abierto más grande y potente publicado por un laboratorio chino superó al mayor modelo original presentado por una empresa estadounidense. El techo mensual chino se movió entre 754.000 millones y 2,78 billones de parámetros.
En Estados Unidos, ese techo se mantuvo por debajo de 130.000 millones de parámetros en cinco de los siete meses analizados. Las excepciones fueron Nemotron 3 Ultra, de NVIDIA, con 561.000 millones, e Inkling, de Thinking Machines Lab.
La comparación no significa que todos los modelos chinos sean mejores en cualquier tarea. El tamaño de un modelo no determina por sí solo su calidad, velocidad, costo o utilidad. Pero sí muestra un cambio en la estrategia de publicación: varios laboratorios chinos saltaron directamente a la frontera, sin construir primero una escalera de modelos pequeños.
Moonshot, MiniMax, Xiaomi y Z.ai publican principalmente modelos de más de 70.000 millones de parámetros. Para un desarrollador independiente, eso implica que su primer contacto con estas familias puede ser un modelo imposible de ejecutar en una computadora personal sin cuantización, varias GPU o servicios externos.
Alibaba, con Qwen, y Tencent siguen una estrategia distinta. Publican modelos en un rango amplio, desde menos de 1.000 millones hasta tamaños de frontera. Esto convierte a la familia en una opción más flexible para quien necesita desde un asistente local hasta una solución de alto rendimiento.
Estados Unidos cambia su papel en la IA abierta
Estados Unidos no desapareció del ecosistema abierto. De hecho, AMD y NVIDIA fueron las organizaciones que más modelos nuevos publicaron en 2026, con más de 200 repositorios cada una. LiquidAI ocupó el tercer lugar, con alrededor de 100.
La razón es bastante práctica: los modelos abiertos también sirven para vender hardware. Si una compañía publica un modelo optimizado para sus chips y cualquiera puede probarlo, está demostrando de forma directa que su infraestructura funciona.
Cuando se incluyen modelos pequeños, embeddings y modelos antiguos de visión o voz, Google, Microsoft, IBM Granite y OpenAI todavía generan cientos de millones de descargas anuales. Pero el centro de gravedad cambió. Google y Meta publican menos modelos nuevos que NVIDIA, y Meta avanza hacia una estrategia más cerrada en sus modelos principales.
La diferencia es todavía más clara por encima de 100.000 millones de parámetros. La mayoría de los lanzamientos estadounidenses en ese rango no son modelos originales, sino conversiones, optimizaciones o adaptaciones de modelos chinos. Entre las excepciones aparecen Inkling, Nemotron 3 Ultra, Nemotron 3 Super y Trinity-Large, de Arcee AI.
AMD, por ejemplo, contribuyó con muchas conversiones, pero no con un modelo original de ese tamaño. Su trabajo sigue siendo relevante porque permite ejecutar modelos chinos de escala billonaria de forma más eficiente en hardware estadounidense. Es una función distinta: distribución y optimización, no creación del modelo base.
Los “me gusta” muestran entusiasmo, las descargas muestran dependencia
Hugging Face comparó los 25 repositorios con más descargas acumuladas durante 2026 con los 25 que recibieron más “me gusta”. Solo uno apareció en ambas listas.
Ningún modelo publicado en 2026 entró en el top 25 de descargas. Trece de esos 25 repositorios se remontan a 2022. all-MiniLM-L6-v2, un modelo pequeño usado en tareas de búsqueda y similitud semántica, acumuló 1.550 millones de descargas en siete meses, aunque recibió solo 5.156 “me gusta”.
La lectura es sencilla:
- Un “me gusta” indica interés, relevancia o entusiasmo de la comunidad.
- Una descarga suele indicar que el modelo está conectado a una aplicación o proceso repetitivo.
- Los modelos nuevos atraen atención rápidamente.
- Los modelos pequeños y estables acumulan uso durante años.
Confundir ambas métricas puede llevar a conclusiones equivocadas. El modelo que genera más conversación no necesariamente es el que más trabajo real está ejecutando.
Qwen gana como ecosistema, no solo como modelo
La estrategia de Qwen destaca porque no depende únicamente de lanzar un modelo enorme. Sus modelos aparecen en 151.448 derivados dentro de Hugging Face, 2,6 veces más que la huella total de Meta y 4,7 veces más que los repositorios derivados de Llama.
Google ocupa el segundo lugar, con 82.506 derivados. Un caso llamativo es Unsloth, una cuenta comunitaria que publica versiones cuantizadas y preparadas para fine-tuning. Muchos de esos modelos amplían todavía más el ecosistema de Qwen.
Durante los primeros siete meses de 2026, los derivados de Qwen crecieron a un ritmo aproximado de 180 a 210 repositorios nuevos por día. Esto sugiere que Qwen se está convirtiendo en una base habitual para decidir qué modelo ajustar, adaptar y desplegar.
¿Por qué funciona esta estrategia? Por una combinación de factores:
- Consistencia: mantiene una cadencia regular de lanzamientos.
- Cobertura: ofrece modelos para distintos tamaños, tareas y presupuestos.
- Licencias abiertas: Apache 2.0 facilita la modificación, redistribución y utilización comercial.
- Efecto de red: cada derivado aumenta el valor del ecosistema para los siguientes desarrolladores.
La cifra de 151.448 derivados no representa modelos creados directamente por Qwen. Es trabajo producido por la comunidad. Incluso entre las 28.531 conversiones a GGUF, Qwen solo publicó 54 de forma oficial.
Los modelos pequeños siguen dominando el uso real
Los modelos de menos de 1.000 millones de parámetros concentran el 83 % de las descargas históricas entre los repositorios que declaran su cantidad de parámetros. Los modelos de más de 100.000 millones apenas representan el 1 %.
Al analizar únicamente las descargas de 2026, la conclusión cambia muy poco: solo el 3 % del volumen corresponde a modelos de más de 70.000 millones de parámetros.
Esto tiene una explicación física, no solo comercial. La mayoría de los desarrolladores no dispone de grandes clústeres de GPU. Necesita modelos que puedan ejecutarse en una laptop, un servidor económico o una instancia de nube moderada.
Entonces, ¿cómo llega un modelo de 2,8 billones de parámetros a una computadora personal? La respuesta está en llama.cpp, la herramienta de inferencia local que permite ejecutar modelos cuantizados en hardware de consumo y distribuir modelos grandes entre varias máquinas.
En julio aparecieron versiones GGUF de DeepSeek-V4-Flash, con unos 284.000 millones de parámetros, y Kimi-K3, con aproximadamente 2,8 billones. La inferencia local ya no significa únicamente ejecutar un modelo de 8.000 millones en una laptop. También puede significar distribuir un modelo de tipo mixture-of-experts entre varios equipos.
La incorporación del equipo de ggml a Hugging Face en febrero fortaleció esta tendencia. El proyecto continúa siendo abierto y gobernado por la comunidad, pero ahora cuenta con recursos más duraderos detrás.
La capa de ejecución crece más rápido que el núcleo
Los repositorios que declaran usar la biblioteca gguf crecieron 464 % en el periodo analizado. Los relacionados con lerobot aumentaron 194 % y los de Apple mlx, 148 %.
En comparación, transformers y peft crecieron 16 %, mientras que diffusers avanzó 21 %. La conclusión es reveladora: la capa que determina dónde y cómo se ejecuta un modelo está creciendo entre tres y siete veces más rápido que el núcleo de modelado.
Para los laboratorios, esto plantea una oportunidad concreta. Publicar una conversión oficial a GGUF, documentar las opciones de cuantización y firmar los artefactos requiere mucho menos esfuerzo que entrenar un modelo nuevo. También permitiría acercar la versión probada por sus creadores a la versión que realmente utiliza la comunidad.
Una alternativa sería colaborar con proyectos como Unsloth y otros mantenedores de conversiones. El modelo no termina cuando se publican sus pesos. También necesita formatos, herramientas, documentación y compatibilidad con el hardware que las personas tienen disponible.
Los agentes ya empiezan a usar Hugging Face
En julio, Hugging Face publicó un conjunto de datos sobre el uso de agentes. Este registro identifica el token agent/<name> que los agentes de programación envían al utilizar huggingface_hub o la herramienta hf para buscar modelos, subir datos, ejecutar Jobs o crear Spaces.
Claude Code lideró julio con 44,4 % del tráfico identificado. Pero el dato más interesante aparece al observar la evolución: tenía 67,8 % en abril y apenas 6,4 % en mayo. Codex, en cambio, subió de 10,4 % a 20,8 %.
No existe todavía un líder permanente. Un nuevo lanzamiento o un cambio en la configuración predeterminada puede mover una parte enorme del tráfico en apenas un mes.
Además, casi una cuarta parte del tráfico etiquetado de agentes en julio provenía de herramientas que todavía no tenían un nombre registrado. En mayo, esa proporción llegó a 59,8 %. Entre abril y julio aparecieron más de una docena de identificadores nuevos.
Hugging Face también comenzó a adaptar su plataforma para lectores no humanos. Publicó Markdown legible por máquinas, añadió trazas de agentes, incorporó un endpoint agents.md en cada Space de Gradio y sumó hf_fs a su servidor MCP para exponer repositorios, almacenamiento, documentación y artículos mediante una sola interfaz.
La tendencia apunta a un cambio importante: los agentes no solo consultan el Hub. También pueden buscar modelos, ejecutar código, crear aplicaciones y completar tareas dentro del ecosistema.
El caso de seguridad que cambió la conversación
En julio, Hugging Face documentó lo que describe como uno de los primeros casos conocidos de un agente autónomo que ejecutó una intrusión sostenida por iniciativa propia.
El episodio mostró una paradoja. Cuando el equipo intentó utilizar modelos cerrados de frontera para analizar el código capturado, sus sistemas de seguridad rechazaron la solicitud. El análisis terminó realizándose con un modelo abierto cuantizado, GLM-5.2, ejecutado en infraestructura propia.
El caso no demuestra que los modelos abiertos sean automáticamente más seguros o más peligrosos. Sí muestra que el control sobre la infraestructura puede ser decisivo en tareas de respuesta, auditoría y seguridad. Un sistema local no depende de la misma política de acceso que una API comercial, aunque sigue necesitando controles humanos y técnicos adecuados.
Las licencias revelan una apuesta por el ecosistema
De 178 modelos chinos publicados en 2026 con más de 20.000 millones de parámetros, el 59 % usa Apache 2.0 y el 22 % usa MIT. Ninguno incluye una restricción explícita de uso no comercial.
DeepSeek y Z.ai incluso publicaron modelos de entre 700.000 millones y 1,65 billones de parámetros bajo MIT. En el mismo rango, los lanzamientos estadounidenses fueron mucho más restrictivos o ambiguos: solo el 29 % utilizó Apache o MIT, mientras que el 41 % empleó términos personalizados y el 30 % no declaró una licencia.
Si un laboratorio entrega modelos gigantes con licencias permisivas, probablemente no está buscando ingresos directos por licencias. La apuesta puede estar en las API, la nube, el hardware, la valoración de la empresa o la posición que ocupa dentro del ecosistema.
La pregunta ya no es únicamente quién tiene el modelo más potente. También importa quién logra que miles de desarrolladores lo adapten, lo integren y lo conviertan en infraestructura cotidiana.
Lo que estos datos sí permiten concluir
El informe de Hugging Face no mide toda la industria de la inteligencia artificial. Sus descargas no incluyen necesariamente el uso de API, despliegues privados o modelos distribuidos fuera del Hub. Los “me gusta” miden atención, no calidad, y los derivados muestran actividad de desarrollo, no ingresos.
Aun así, las señales son consistentes. China está empujando con fuerza en la frontera abierta. Estados Unidos conserva una participación importante, especialmente desde el hardware y la infraestructura. Qwen se está convirtiendo en una base de desarrollo. Los modelos pequeños siguen dominando el uso cotidiano y las herramientas de ejecución local están creciendo con rapidez.
La competencia tampoco se limita a entrenar modelos. Se libra en las licencias, las conversiones, los formatos, los agentes, los chips y las comunidades que construyen sobre cada lanzamiento.
En inteligencia artificial, unos pocos meses pueden cambiar por completo el mapa. Pero el modelo que causa más entusiasmo hoy no siempre será el que sostenga las aplicaciones de mañana. A largo plazo, la ventaja puede pertenecer a la familia que los desarrolladores puedan ejecutar, adaptar y convertir en parte de su trabajo diario.
Fuente original
https://huggingface.co/blog/state-of-open-models-summer-2026
