模型發布/時序預測
IBM Granite 時序模型改用 Conformer 與重疊分塊,輸出 99 分位數預測
PatchTST-FM-r2 以卷積輔助注意力、8,192 步上下文及機率式預測,瞄準免微調的通用時序預報。模型在 GIFT-Eval 的可重現零樣本組名列第二,但成績仍由 IBM 提交、尚待基準專案合併確認。

IBM Research 發布約 3.85 億參數的 Granite Time Series PatchTST-FM-r2,開放權重、推論管線與架構程式,並允許使用者在 Apache 2.0 或 OpenMDW 1.0 之間選擇授權。它不是替既有 PatchTST 單純增加訓練資料,而是把標準 Transformer 區塊換成 Conformer:兩個半步前饋層包住多頭自注意力與時間卷積,卷積核依 `{5,5,3,3}` 交替,讓局部變化交給卷積處理,注意力則較能集中於跨長距離的依存關係。[模型卡](https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2)列出的其他改動包括把區塊數由 20 增至 30、加入 pre-head layer normalization,以及使用長度 16、stride 8 的 50% 重疊分塊。訓練採 Hamming window 加權,推論再以 overlap-and-add 合併相鄰預測,意圖降低分塊邊界造成的不連續。
模型支援最長 8,192 個時間步,99-quantile head 可同時產生點估計、預測分布與不確定區間,也能處理缺值填補。預訓練資料混合 GIFT-Eval 以外的公開序列、KernelSynth/TSMixup 衍生資料,以及約 50 萬條、每條 4,096 步的 CauKer 合成序列;這種資料揭露有助於檢查測試集污染,但仍不能取代特定產業資料上的回測。
IBM 報告其在排除測試洩漏、要求可重現程式的 GIFT-Eval 零樣本組中,CRPS 幾何平均為 0.467、MASE 為 0.6846,兩項皆排名第二,並稱它是該組中成績最高的寬鬆授權模型。[發布文章](https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-series)同時承認結果仍是提交至排行榜的待合併 PR,因此現階段應視為發布者評測。工程團隊可用公開的 [Granite-TSFM 程式庫](https://github.com/ibm-granite/granite-tsfm)重跑結果;接下來更值得觀察的是不規則取樣、分布漂移、不同預測長度及線上串流負載下的延遲與校準,而不只是單一排行榜名次。