返回首頁

應用研究/科學資料工程

Astro-COLIBRI 以受約束 LLM 解析天文通報,十年自由文字轉成 68,393 筆觀測

新管線把 NASA GCN Circulars 的測光、紅移與觀測時間轉成事件層級結構化資料,並已投入即時運作。內部稽核錄得 99.80% 欄位判定正確率,但時間與觀測設施歸屬仍是主要錯誤來源,研究用途須回查原文。

Suyash Dwivedi · CC BY-SA 4.0 · Image source
zh-Hant

Astro-COLIBRI 團隊公開一套已投入運作的 LLM 資料管線,用來處理天文台以自由文字發布的 NASA GCN Circulars。系統先由持續執行的 listener 接收通報、關聯伽瑪射線暴等瞬變事件並做確定性預分析,再呼叫具固定 schema 的大型語言模型,抽取測光值、濾鏡、時間、上限、紅移、聯絡資訊及觀測設施。結果經單位與時間正規化後寫入 Astro-COLIBRI API,供網頁、行動程式、CSV、VOTable 和光學餘暉圖表使用。

論文報告,調校後的流程成功處理 2026 年上半年全部 1,775 份評估通報,沒有工作流層級失敗。研究者人工檢查 210 份 Circulars,在 25,880 個可明確判定的欄位中確認 25,827 個,欄位正確率為 99.80%;53 個錯誤集中在八份通報的時間解讀與設施歸屬。與獨立 GRBweb 資料比較時,雙方共有的 249 個事件中有 228 個紅移值一致,其餘差異來自上限、候選宿主估值或後續修訂,而非單純把數字讀錯。

團隊亦把管線套用至 2016 年以來的完整檔案,從 26,811 份報告整理出 5,787 個事件的 68,393 筆觀測,現時並會即時處理新通報。可重用部分已作為 Python 套件 `astro-colibri-circular-parser` 發布,包含確定性預分析、schema 約束抽取、事件關聯、資料增補與一致性檢查。這是比一般文件摘要更值得留意的應用:模型輸出受資料契約和後處理包圍,並以人工欄位稽核及外部目錄交叉驗證。然而樣本來自單一專業文體,稽核亦由團隊內部完成;時間語句、非標準濾鏡及 Vega/AB 校準轉換仍可能造成科學偏差。任何正式分析都應保留 Circular ID,回查原始通報,而不能把高平均正確率視為逐筆保證。

來源

  1. AI-Assisted Extraction of Follow-up Observations from GCN Circulars in Astro-COLIBRI
  2. astro-colibri-circular-parser 1.0.0
  3. Automatic AI parsing of GCN circulars