模型發布/時序預測
IBM Granite時系列モデル、Conformerとオーバーラップ・パッチングを採用し、99分位予測を出力
PatchTST-FM-r2は、畳み込みで補完したAttention、8,192ステップのコンテキスト、確率的予測を採用し、ファインチューニング不要の汎用時系列予測を目指す。GIFT-Evalの再現可能なゼロショット部門で2位に入ったが、結果は依然としてIBMによる提出値であり、ベンチマークプロジェクトへのマージによる確認を待っている。

IBM Researchは、約3億8,500万パラメータのGranite Time Series PatchTST-FM-r2を公開し、オープンウェイト、推論パイプライン、アーキテクチャのコードを提供した。ライセンスはApache 2.0またはOpenMDW 1.0から選択できる。これは既存のPatchTSTに単に学習データを追加したものではなく、標準的なTransformerブロックをConformerに置き換えている。2つのハーフステップFeed-Forward層がMulti-Head Self-Attentionと時間畳み込みを挟み、畳み込みカーネルは`{5,5,3,3}`の順で交互に使用される。これにより、局所的な変化は畳み込みが処理し、Attentionは長距離の依存関係に集中しやすくなる。[モデルカード](https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2)に記載されたその他の変更点には、ブロック数を20から30へ増加したこと、pre-head layer normalizationの追加、長さ16、stride 8の50%オーバーラップ・パッチングの採用が含まれる。学習時にはHamming windowによる重み付けを行い、推論時にはoverlap-and-addで隣接する予測を統合することで、パッチ境界に起因する不連続性の低減を狙っている。
モデルは最長8,192タイムステップをサポートする。99-quantile headは点推定、予測分布、不確実性区間を同時に生成でき、欠損値の補完にも対応する。事前学習データには、GIFT-Eval以外の公開時系列、KernelSynth/TSMixupによる派生データ、および約50万系列からなるCauKer合成データが混合されている。CauKerの各系列は4,096ステップで構成される。こうしたデータ開示はテストセット汚染の検証に役立つが、特定業界のデータを用いたバックテストの代わりにはならない。
IBMの報告によると、テストデータの漏洩を排除し、再現可能なコードを求めるGIFT-Evalのゼロショット部門で、CRPSの幾何平均は0.467、MASEは0.6846となり、いずれも2位だった。同社は、この部門で最も高い成績を収めた寛容なライセンスのモデルだとしている。[リリース記事](https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-series)でも、結果が依然としてリーダーボードに提出されたマージ待ちのPRであることを認めているため、現段階では公開元による評価とみなすべきだ。エンジニアリングチームは、公開されている[Granite-TSFMライブラリ](https://github.com/ibm-granite/granite-tsfm)を使って結果を再現できる。今後より注目すべきなのは、単一のリーダーボード順位だけではなく、不規則サンプリング、分布シフト、異なる予測ホライズン、オンライン・ストリーミング負荷におけるレイテンシーとキャリブレーションである。