El 31 de agosto de 2026, Google Research presentó TimesFM-3, un modelo fundacional zero-shot destinado a las series temporales multivariantes. El editor anuncia 330 millones de parámetros, un preentrenamiento con más de un billón de puntos temporales y compatibilidad nativa con varios objetivos, así como con variables históricas o conocidas para el futuro. Estas capacidades hacen que el modelo resulte interesante para acelerar proyectos de previsión. Sin embargo, no eliminan la necesidad de realizar una comparación local, analizar los datos y establecer un marco de gobernanza.
Idea clave: TimesFM-3 debe tratarse como un candidato adicional, no como una verdad universal. Un piloto serio lo compara con una baseline ingenua, un modelo estadístico y el enfoque utilizado actualmente, sobre ventanas temporales reproducibles y métricas vinculadas a las decisiones empresariales.
1. Qué aporta realmente TimesFM-3
Las primeras versiones de TimesFM se centraban en previsiones univariantes: el modelo observaba el histórico de una serie y predecía su continuación. TimesFM-3 añade una representación multivariante. Puede prever varias series relacionadas y utilizar variables que influyen en el fenómeno.
Google distingue tres familias de entradas. Los objetivos son las series que se deben prever, por ejemplo las ventas de varios productos. Las covariables pasadas solo se conocen en el histórico, como el tráfico observado. Las covariables dinámicas se conocen para el horizonte futuro, por ejemplo un calendario de promociones, días festivos o una previsión meteorológica disponible en el momento de tomar la decisión.
La arquitectura alterna atención temporal causal y atención entre variables. El modelo produce todo el horizonte en un único paso no autorregresivo y proporciona nueve cuantiles entre el percentil 10 y el 90. Esta salida probabilística permite representar varios escenarios en lugar de una sola línea.
Google anuncia el primer puesto medio en varios benchmarks públicos frente a otros modelos preentrenados. Se trata de resultados comunicados por el equipo que lo diseñó, sobre conjuntos de datos y protocolos definidos. Indican un potencial, pero no predicen el rendimiento en sus series, sus rupturas, sus granularidades ni sus limitaciones operativas.
2. Por qué el zero-shot cambia el inicio de un proyecto
Un modelo zero-shot puede aplicarse sin entrenamiento específico para cada serie. Esta propiedad reduce el tiempo necesario para obtener una primera referencia. Un equipo puede cargar el histórico, definir el horizonte y comparar rápidamente el resultado con sus métodos actuales.
Esta ventaja resulta especialmente útil cuando una organización posee muchas series cortas o heterogéneas: ventas por punto de distribución, volúmenes de tickets por categoría, consumo de infraestructura por servicio o necesidades de stock por referencia. Entrenar y mantener un modelo distinto para cada serie se vuelve costoso.
Zero-shot no significa «sin trabajo de datos». Siempre hay que definir la frecuencia, gestionar los huecos, distinguir los ceros reales de los valores ausentes, tratar los cambios de perímetro y elegir el periodo histórico pertinente. Un modelo potente no puede deducir que una tienda cerró, que un sensor cambió o que una regla contable desplazó los volúmenes.
El inventario, la calidad, los permisos y la trazabilidad deben preceder por tanto a la elección del modelo, como en nuestra guía para preparar los datos para un proyecto de IA generativa. Para la previsión, añada a esta base la fecha real de disponibilidad de cada variable.
También hay que comparar el tiempo total. El modelo puede evitar una fase de entrenamiento, pero exigir más cálculo en la inferencia o una infraestructura específica. El coste relevante es el de una previsión producida, supervisada y utilizada, no solo el del cuaderno inicial.
3. Casos en los que el multivariante puede crear valor
El enfoque multivariante resulta útil cuando las series comparten realmente una dinámica. Las ventas de productos complementarios, las cargas de varios servicios de una plataforma o los volúmenes de agencias sometidas al mismo calendario pueden informarse mutuamente.
Las variables conocidas para el futuro suelen ser aún más importantes. Un calendario de promociones, un cierre planificado, un lanzamiento, un día festivo o una reserva ya registrada pueden modificar el horizonte. Un enfoque univariante ve el efecto pasado, pero ignora el acontecimiento próximo; un modelo que acepta estas covariables puede integrarlo.
Sin embargo, la calidad depende de la estabilidad de la relación. Una promoción no siempre tiene el mismo efecto según el precio, el canal, la disponibilidad o la temporada. Una previsión meteorológica también contiene incertidumbre. Introducir más variables no garantiza una mejor generalización y puede crear una dependencia de datos que no estén disponibles en producción.
Antes del piloto, construya una matriz sencilla: variable, disponibilidad en el momento de la previsión, frecuencia de actualización, calidad histórica, responsable y justificación empresarial. Toda variable desconocida en el momento real de la decisión debe excluirse del conjunto futuro, aunque esté presente en el almacén de datos posteriormente.
4. Evitar fugas entre pasado y futuro
La fuga temporal es el error más peligroso de un proyecto de previsión. Se produce cuando se utiliza información del futuro, directa o indirectamente, para generar una predicción que supuestamente se habría realizado en el pasado.
Un ejemplo clásico es un dato promocional registrado después de la campaña, pero asociado a su fecha de inicio. Un backtest realizado hoy considera entonces que la información estaba disponible, aunque no lo estuviera en el momento de la decisión. El mismo problema afecta a las correcciones de datos, los agregados calculados sobre un periodo completo y las variables actualizadas retroactivamente.
Cada columna debe tener dos fechas: la fecha del evento y la fecha de disponibilidad. La división utiliza la segunda. Para una previsión realizada el 1 de junio, el modelo solo recibe lo que se conocía realmente el 1 de junio.
La normalización también puede provocar una fuga si las estadísticas se calculan sobre todo el conjunto de datos. Aunque el modelo tenga su propia normalización, las transformaciones de negocio, la imputación y la selección de series deben ajustarse únicamente con el pasado de cada ventana.
Por último, conserve un conjunto de prueba final intacto. Los numerosos ensayos sobre el mismo horizonte convierten progresivamente ese conjunto en datos de entrenamiento implícitos para el equipo.
5. Construir un backtesting fiable
Una única división entre pasado y futuro ofrece una visión frágil. Utilice una validación con origen deslizante: elija varias fechas históricas de previsión, entrene o configure los métodos con los datos disponibles en cada fecha y mida después el horizonte siguiente.
Las ventanas deben representar situaciones importantes: temporada alta, periodo tranquilo, lanzamiento, interrupción del suministro y cambio de tendencia. Un modelo que funciona bien de media puede fallar precisamente durante los periodos en los que la decisión resulta más costosa.
Compare como mínimo cuatro niveles:
- una baseline ingenua, como el último valor o el mismo periodo anterior;
- un método estadístico adaptado a la estacionalidad;
- la solución que utiliza actualmente la empresa;
- TimesFM-3 en modos univariante y multivariante cuando los datos lo permitan.
La baseline ingenua es indispensable. En muchos contextos estables sigue siendo difícil de superar. Un modelo que mejora ligeramente un benchmark, pero no supera «el mismo día de la semana anterior», no aporta suficiente valor operativo.
Documente las versiones de los datos, del código, del modelo y de las dependencias. El resultado debe poder reproducirse varios meses después, especialmente si una nueva versión del modelo modifica las previsiones.

6. Medir la incertidumbre, no solo el error medio
Las métricas deben corresponderse con la decisión. La MAE mide el error absoluto medio y sigue siendo legible en la unidad empresarial. La WAPE relaciona el error con el volumen total, pero puede estar dominada por las series grandes. La MASE compara el modelo con una previsión ingenua y facilita las comparaciones entre series.
Para los cuantiles, utilice una pérdida cuantílica y compruebe la calibración. Si el intervalo anunciado al 80 % contiene el valor real solo el 50 % de las veces, la incertidumbre está subestimada. Por el contrario, un intervalo muy amplio cubre casi todo, pero ayuda poco a la decisión.
Añada métricas de negocio. Prever menos stock del necesario puede costar más que prever de más. Un error del 10 % en una referencia pequeña no tiene el mismo impacto que en un producto estratégico. Calcule las roturas de stock evitadas, el inventario inmovilizado, las horas planificadas o el presupuesto cloud reservado.
Evalúe también la estabilidad. Una previsión que cambia mucho ante una pequeña modificación de entrada puede ser difícil de utilizar. Compare las versiones sucesivas a medida que llegan nuevos datos y mida la revisión del horizonte.
La salida probabilística de TimesFM-3 constituye una ventaja potencial, siempre que los cuantiles estén calibrados para el contexto local y se utilicen realmente en las reglas de decisión.
7. Decidir entre un modelo fundacional, un modelo especializado y uno híbrido
Un modelo fundacional es adecuado cuando el número de series es elevado, el tiempo de puesta en marcha es corto y la organización desea una base común. También puede servir como challenger permanente o como solución de respaldo cuando un modelo especializado no tiene suficiente histórico.
Un modelo local sigue siendo pertinente cuando el fenómeno es muy específico, las variables están bien controladas y unos pocos puntos de rendimiento tienen un valor elevado. Puede integrar restricciones empresariales, funciones de coste asimétricas o una estructura causal que no esté representada en el modelo generalista.
El enfoque híbrido suele ser el más sólido. TimesFM-3 proporciona una previsión base y cuantiles; una capa de negocio aplica restricciones, combina información local o corrige un sesgo observado. Puede seleccionarse otro modelo para determinadas familias de series.
La decisión debe integrar el rendimiento, el coste, la latencia, la licencia, la confidencialidad, la explicabilidad y la facilidad de explotación. Compruebe también la disponibilidad de las integraciones anunciadas: el 31 de agosto de 2026, Google indicaba que TimesFM-3 estaba disponible en GitHub y Hugging Face, mientras que la integración con BigQuery estaba anunciada para las semanas siguientes.
8. Un piloto en seis etapas
Comience con un perímetro en el que la decisión y el valor estén claros: entre veinte y cien series, un horizonte definido y una baseline existente. Evite seleccionar únicamente las series más limpias.
En segundo lugar, construya la tabla de disponibilidad de las variables y elimine las fugas. En tercer lugar, prepare entre cinco y diez orígenes de backtest que cubran varias situaciones empresariales. En cuarto lugar, ejecute todos los métodos con el mismo protocolo y los mismos datos.
En quinto lugar, organice una revisión con los usuarios. Presente los errores, los intervalos y algunos casos concretos sin revelar primero el nombre del modelo, para reducir el sesgo de novedad. Pregunte qué decisión habría cambiado y con qué impacto.
En sexto lugar, despliegue en modo de observación. El sistema genera las previsiones, pero el método actual sigue siendo decisorio durante varios ciclos. Mida la calidad, el coste, la estabilidad y la disponibilidad antes de cualquier cambio.
Fije los criterios de éxito antes de la prueba: mejora mínima respecto a la baseline, calibración aceptable, coste máximo, tiempo de ejecución y proporción de series para las que el modelo no empeora el resultado. Sin un umbral previo, el equipo siempre encontrará una forma de justificar el modelo más reciente.
Conclusión
TimesFM-3 representa una evolución interesante de los modelos fundacionales para series temporales: previsión multivariante zero-shot, variables conocidas para el futuro y salida probabilística en un único paso. Estas características pueden reducir el coste de entrada y ampliar el número de series cubiertas.
No obstante, el valor solo se demostrará mediante un protocolo local, sin fugas temporales, frente a baselines sólidas y con métricas vinculadas al negocio. Partitech acompaña la preparación de los datos, la construcción del backtesting, la industrialización MLOps y la traducción de las previsiones en decisiones medibles.
Referencias
- Google Research — «TimesFM-3: A zero-shot foundation model for multivariate forecasting», 31 de agosto de 2026: https://research.google/blog/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting/
- Google Research — repositorio TimesFM: https://github.com/google-research/timesfm
- Hugging Face — modelo TimesFM-3: https://huggingface.co/google/timesfm-3.0-pytorch