電腦視覺
CogVis 共用遙測影像變化先驗,十類查詢延遲降至 10.03 秒
CogVis 將跨時間影像比較與文字類別判斷拆開,使多個開放詞彙查詢可重用同一份場景變化特徵。作者在七套基準報告領先結果及 28.5% 吞吐量增益,但模型權重並未隨程式碼發布。

開放詞彙變化偵測要回答的不只是「哪裡改變」,還包括改變是否符合使用者臨時輸入的文字類別。既有流程常為每個查詢重新比較兩期衛星或空拍影像,將時間差異、文字語意與區域篩選綁在一起;查詢類別增加時,相同的視覺運算也會重複執行。
CogVis 將流程拆成三層。Scene Change Perceptron 先從凍結的雙時相特徵抽取與類別無關的變化先驗,一組影像只計算一次。Semantic Memory Calibrator 再依影像與文字查詢估計動態判斷門檻,修正不同類別的分數尺度。最後,Adaptive Region Filter 綜合語意、時間及區域結構可靠度,濾除陰影、季節差異與殘餘配準誤差造成的候選區域。底層 SAM3 與 CLIP ViT-B/16 維持凍結,只訓練三個小型 adapter。
作者在 SECOND、SCSCD、CLCD、DSIFN、LEVIR-CD、WHU-CD 與災損資料集 xBD 上報告最佳結果。增益並不平均:LEVIR-CD 與 WHU-CD 僅比既有最佳值高 0.05、0.14 點,xBD 的 mIoU 則由 24.51 升至 32.68。RTX 3090、512×512 輸入的測試中,CogVis 達 0.230 FPS、峰值記憶體 4.82 GiB,比次快方法的吞吐量高 28.5%;查詢十個類別需 10.03 秒,逐類別基線為 12.56 至 956.60 秒。延遲仍會隨類別數增加,因為校準器與區域過濾器尚未共用。
儲存庫已提供訓練、推論、dry-run 與七基準設定,讓工程團隊可檢查資料介面和重跑流程。不過,三個 adapter、SAM3 與 CLIP checkpoint 均未包含在 Git 中,資料集也需另行準備;效能比較則來自單一硬體與作者選定的基線。後續應觀察完整權重是否釋出、跨感測器與不同解析度能否維持校準,以及共享先驗在大量文字查詢時是否仍具線性成本優勢。