AI 評測與安全
D2C-Routing 將 AI 文字偵測拆成內容與表達來源,低誤報四分類 TPR 達 0.8603
北航團隊不再只問文字是否由 AI 生成,而是分別判斷內容構思與表面表達的來源。系統在重建的 MixD2C 測試集領先同資料切分的 RACE 重跑,但跨資料集泛化與完整重現仍有限。

北京航空航天大學研究團隊提出 D2C-Routing,將人機協作文字的來源判定由單一二元標籤,改寫成兩個相互關聯的維度:資訊與組織出自人或 AI,以及最終措辭與文風出自人或 AI。兩軸組合成 HH、HA、AH、AA 四類,可區分人寫內容經 AI 潤飾、AI 草稿經人類重寫,以及完整 AI 生成等情況。
架構先把不同語言證據送入內容與表達的監督式分類頭,再由可學習的 gated composition layer 合成四分類結果。公開程式包含文字模型、雙編碼器與融合模型,以及實體連貫性、修辭結構和表達特徵的抽取腳本;評估器同時支援 HART 的三級二元任務與四分類診斷。
作者把 HART 已釋出的開發、測試資料重新分層,建立含 11,200 筆訓練、1,600 筆驗證及 3,200 筆測試資料的 MixD2C。最終融合系統在四類平均 TPR@1%FPR 取得 0.8603,比相同切分上重跑的 RACE-local 高 6.5 個百分點。這項低誤報指標比一般準確率更接近學術誠信或內容治理場景,因為大量誤判真人作品通常不可接受。
但結果不能直接外推至真實中文內容。MixD2C 是由既有資料重建,AH 類在訓練集僅 710 筆;論文也承認 AI 內容經人類表達的 AH 與完整 AI 生成 AA 最難區分,直接轉移至另一個 MixSet 重建資料甚至呈負面結果。儲存庫未附大型資料、預訓練編碼器、checkpoint 或生成預測,完整重現仍須另取 HART、抽取特徵並重新訓練。下一步應關注跨語言、跨模型與未知改寫流程的盲測,而非只看同一重建切分上的排名。