Predecir la demanda, el consumo energético o el tráfico suele implicar entrenar un modelo distinto para cada conjunto de datos. IBM propone una alternativa: usar un modelo fundacional capaz de generar pronósticos sin entrenamiento específico, incluso cuando nunca ha visto antes esa serie temporal.
La compañía lanzó Granite Time Series PatchTST-FM-r2, una nueva versión de su familia de modelos Granite TSFM. Con aproximadamente 385 millones de parámetros, combina una arquitectura actualizada, pronósticos probabilísticos, soporte para valores faltantes y un rendimiento destacado en evaluaciones de predicción zero-shot.
Un modelo general para series temporales
En un escenario zero-shot, el modelo recibe el historial reciente de una serie y calcula sus posibles valores futuros sin requerir fine-tuning ni un modelo entrenado específicamente para esa tarea. ¿El dato representa ventas, sensores, precios o consumo eléctrico? La misma arquitectura puede trabajar con todos esos casos, siempre que la información esté organizada como una serie temporal.
PatchTST-FM-r2 admite contextos de hasta 8.192 pasos, longitudes de pronóstico flexibles y una salida de 99 cuantiles. Esto permite obtener tanto una predicción puntual como un rango de incertidumbre.
Por ejemplo, en lugar de recibir únicamente una respuesta como "la demanda esperada será de 1.200 unidades", el sistema puede estimar distintos escenarios y ayudar a responder otra pregunta más útil: ¿qué tan probable es que la demanda se ubique entre 1.100 y 1.350 unidades?
Resultados en GIFT-Eval
IBM reporta que, al 8 de septiembre de 2026, PatchTST-FM-r2 ocupa el segundo lugar entre los modelos replicables y zero-shot del benchmark GIFT-Eval, tanto en CRPS como en MASE. En ambas métricas, los valores más bajos indican un mejor rendimiento.
El modelo logró un CRPS de media geométrica de 0,467 y un MASE de 0,6846. Quedó inmediatamente detrás de TimesFM-3 en la comparación de modelos zero-shot y fue el modelo con licencia permisiva de mejor rendimiento dentro de esa categoría.
GIFT-Eval reúne conjuntos de datos y escenarios heterogéneos para evaluar modelos de predicción. La comparación también distingue entre modelos estrictamente zero-shot y modelos preentrenados que pudieron haber incluido durante su entrenamiento los datos de evaluación.
Cuando se incorporan ambas categorías, PatchTST-FM-r2 se mantiene cerca de la parte superior: ocupa el tercer lugar en CRPS y el cuarto en MASE entre los modelos replicables. IBM señala que supera a alternativas como Chronos-2, Timer-S1 y algunas variantes de Toto, aunque varios competidores tienen un tamaño considerablemente mayor.
Un resultado de benchmark no garantiza el mismo rendimiento en tu empresa. La frecuencia de los datos, los cambios de comportamiento y la calidad del historial siguen siendo determinantes.
Qué cambia en la arquitectura
PatchTST-FM-r2 conserva la idea de dividir una serie temporal en pequeños segmentos llamados patches. Esta representación permite procesar ventanas de datos de forma eficiente, pero la arquitectura interna fue rediseñada para capturar mejor las relaciones de corto y largo plazo.
La versión anterior, PatchTST-FM-r1, utilizaba bloques estándar de tipo Transformer. La nueva versión emplea bloques Conformer, que combinan dos mecanismos:
- Atención multi-cabeza, útil para identificar relaciones distantes entre diferentes partes de la serie.
- Convolución temporal, que ayuda a detectar patrones locales y variaciones de corto plazo.
Esta combinación proviene originalmente de arquitecturas utilizadas en procesamiento de voz. Aplicada a series temporales, permite que la convolución capture interacciones cercanas mientras la atención se concentra en dependencias más lejanas.
Los bloques Conformer utilizan kernels de convolución de tamaños 3 y 5 siguiendo un patrón alternado de {5, 5, 3, 3}. Además, el modelo amplía la arquitectura de 20 a 30 bloques.
Predicciones más suaves y con incertidumbre
El modelo usa patches con un 50 % de solapamiento y ponderación mediante una ventana de Hamming. Después aplica una estrategia de reconstrucción conocida como overlap-and-add, que ayuda a suavizar los límites entre segmentos y puede mejorar la precisión de las predicciones.
La salida de 99 cuantiles permite construir distribuciones de pronóstico e intervalos de incertidumbre. Esta capacidad resulta especialmente importante en operaciones reales, donde una predicción promedio puede ser insuficiente para planificar inventario, capacidad o recursos.
Datos de entrenamiento y licencias
IBM documenta cuatro fuentes principales para el preentrenamiento de PatchTST-FM-r2:
- Conjuntos seleccionados de GiftEvalPretrain.
- Datos sintéticos generados con KernelSynth y kernels periódicos modificados.
- Un corpus TSMixup inspirado en el enfoque de Chronos, limitado a datos fuera del conjunto de evaluación de GIFT-Eval.
- Cerca de 500.000 secuencias sintéticas CauKer, cada una con una longitud de 4.096 pasos.
Esta información no elimina la necesidad de revisar la gobernanza, la privacidad o el cumplimiento normativo antes de desplegar el modelo. Sin embargo, ofrece más contexto que un sistema cuyo corpus de entrenamiento es completamente opaco.
PatchTST-FM-r2 está disponible bajo una licencia dual: Apache 2.0 y OpenMDW 1.0. Los usuarios pueden elegir cualquiera de las dos. Ambas ofrecen permisos amplios para usar, modificar y distribuir el modelo, algo especialmente relevante para empresas que necesitan incorporar IA en productos comerciales.
Los pesos, la arquitectura, el pipeline de inferencia y el código utilizado para reproducir los resultados del benchmark también están disponibles. La implementación forma parte del repositorio Granite-TSFM y mantiene compatibilidad con checkpoints de PatchTST-FM-r1.
Cómo probarlo con Python
La forma más directa de evaluarlo es con una serie temporal propia. Primero instala el paquete de IBM:
pip install "granite-tsfm>=0.3.9"
Después puedes cargar el modelo desde Hugging Face y crear un pipeline de pronóstico:
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512,
prediction_length=64,
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9],
explode_forecasts=True,
freq="1h",
)
forecast = pipe(df.iloc[-512:])
El ejemplo utiliza datos públicos de consumo eléctrico, pero el mismo flujo puede adaptarse a demanda, telemetría, utilización de CPU, energía, transacciones, tráfico o precios. No necesitas ajustar el modelo a cada tarea para generar un primer pronóstico.
Eso sí, conviene validar el resultado contra métodos tradicionales y contra datos históricos de tu propia operación. Un modelo fundacional puede acelerar la experimentación, pero no sustituye la evaluación de errores, la detección de cambios en los datos ni la supervisión del negocio.
De los datos estáticos a los flujos en tiempo real
IBM también conecta la familia Granite Time Series con aplicaciones de streaming mediante una integración de acceso anticipado con Confluent Cloud. El enfoque utiliza Apache Flink para generar pronósticos y detectar anomalías directamente sobre datos que llegan de forma continua.
La cartera inicial incluye PatchTST-FM-r1, FlowState-r1.1, TTM-r3 y TSPulse. En lugar de mover los datos a un entorno separado de aprendizaje automático, las organizaciones pueden ejecutar inferencia sobre flujos operativos, como sensores industriales, métricas de infraestructura o transacciones.
La importancia de este lanzamiento no está únicamente en el segundo lugar de una tabla. IBM está apostando por modelos de series temporales abiertos, replicables y con licencias compatibles con usos comerciales. Para un equipo técnico, eso puede reducir el tiempo necesario para pasar de un experimento a una prueba con datos reales.
La pregunta ahora no es si una IA puede pronosticar el futuro. La pregunta práctica es si sus datos tienen la calidad, estabilidad y contexto necesarios para que ese pronóstico sea útil.
Fuente original
https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-series
