返回首頁

多模態與遙測

LongEarth-R1 用最長 30 幀衛星序列推理,12 項時空任務均勝比較模型

LongEarth-Bench 將 117,000 張遙測影像整理成約 120,000 組長序列問答,要求模型追蹤地貌演變、異常與缺失狀態。以 Qwen2.5-VL-7B 為底的 LongEarth-R1 加入幀編號、結構化推理及時空獎勵,但資料、權重與程式尚未公開。

â„… alastairharding · CC BY-SA 4.0 · Image source
zh-Hant

遙測視覺語言模型通常處理單張、前後兩張或很短的時間序列,難以回答「洪水何時開始、影響區域如何擴張、之後是否恢復」這類跨階段問題。LongEarth-Bench 因此整合 SpaceNet 7、DynamicEarthNet、PASTIS-R 等五套資料,建立 120,367 組問答;每組平均含 15.14 幀、最多 30 幀,21.1%至少有 24 幀,涵蓋演變摘要、空間推理、異常辨識與邏輯預測共 12 項任務。

團隊以 Qwen2.5-VL-7B 為底座,凍結視覺編碼器,只在語言層訓練 rank 128 的 LoRA。第一階段替每張影像加入明確序號,再用 30,000 組結構化推理軌跡教模型指出關鍵幀、變化區域與時間順序;第二階段以 GRPO 比較同一輸入的多個回答,分別給予格式、時間定位及空間一致性獎勵,而非只看最終答案。

LongEarth-R1 在論文的 12 項長序列測試全部居首,例如重複幀偵測為 90.28%,基礎 Qwen2.5-VL 為 39.78%;時間順序違反偵測則由 12.38%升至 50.80%。消融也顯示三類獎勵缺一不可。不過結果來自作者自行建立及訓練的基準,同源資料可能讓比較模型吃虧;部分推理標註先由 Qwen3-VL-8B-Thinking 生成,亦可能把其偏好帶入評分。論文截至發布時未附公開資料、權重或訓練程式,工程團隊應等待可重現版本,並特別驗證跨地區、跨感測器及季節干擾下的泛化能力。

來源

  1. LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning
  2. Qwen2.5-VL-7B-Instruct Model Card
  3. SpaceNet 7 Multi-Temporal Solutions