IBM Lança Granite Time Series PatchTST-FM-r2 com Licença Comercial Amigável

A IBM anunciou o lançamento do Granite Time Series PatchTST-FM-r2, o modelo mais recente da família Granite TSFM, disponível sob licença comercial amigável. Este novo modelo representa uma evolução significativa na arquitetura e capacidade de previsão de séries temporais, permitindo que usuários gerem previsões zero shot sem necessidade de treinar modelos separados para cada conjunto de dados.

Detalhes Técnicos e Desempenho

O PatchTST-FM-r2 substitui o anterior PatchTST-FM-r1, incorporando uma arquitetura atualizada, um corpus de pré-treinamento maior, previsão probabilística, suporte à imputação de valores faltantes e desempenho excepcional em previsão zero shot. Com aproximadamente 385 milhões de parâmetros, o modelo atinge o topo entre os modelos de previsão zero shot replicáveis e com licença permissiva, conforme o ranking do GIFT-Eval até 8 de setembro de 2026.

De acordo com o blog oficial da Hugging Face, o PatchTST-FM-r2 alcança um CRPS geométrico médio de 0,467 e um MASE geométrico de 0,6846, posicionando-se em segundo lugar entre os modelos replicáveis e com licença aberta. Esses resultados colocam o modelo logo atrás do TimesFM-3 em métricas de CRPS e primeiro entre aqueles com licenças permissivas.

Figuras 1 e 2 ilustram o desempenho comparativo no GIFT-Eval, mostrando que o PatchTST-FM-r2 lidera categorias específicas de modelos com licenças comerciais acessíveis.

Além dos números, a equipe da IBM destacou mudanças estruturais importantes na arquitetura. A transição de camadas padrão de transformador para blocos conformer, que combinam convoluções com auto-atenção multi-cabeça, permite capturar relações tanto de longo quanto de curto prazo de forma mais eficiente. Os blocos conformer utilizam tamanhos de kernel alternados de 3 e 5, criando um padrão repetitivo que melhora a modelagem temporal.

Para garantir precisão nas bordas dos patches, o modelo emprega sobreposição de 50% com ponderação por janela de Hamming e previsão overlap-and-add. Essas técnicas, juntamente com normalização adicional e expansão para 30 blocos, resultam em contexto muito longo de até 8.192 passos e capacidade de previsão robusta.

Com o peso do modelo, a arquitetura de inferência e o código completo disponíveis, pesquisadores podem reproduzir os resultados do benchmark e explorar aplicações em produção, incluindo integração com soluções Confluent para fluxos de dados contínuos.

Com informações de: Hugging Face Blog