AI 評測與安全
D2C-Routing 將 AI 文字偵測拆成內容與表達來源,低誤報四分類 TPR 達 0.8603
北航團隊不再只問文字是否由 AI 生成,而是分別判斷內容構思與表面表達的來源。系統在重建的 MixD2C 測試集領先同資料切分的 RACE 重跑,但跨資料集泛化與完整重現仍有限。
Archive
共 949 篇技術新聞
AI 評測與安全
北航團隊不再只問文字是否由 AI 生成,而是分別判斷內容構思與表面表達的來源。系統在重建的 MixD2C 測試集領先同資料切分的 RACE 重跑,但跨資料集泛化與完整重現仍有限。
AI safety research
新研究指出,逐軌跡重設的 guardrail 無法辨識被拆散到多次迭代的攻擊證據,單純讓風險分數隨時間衰減亦可被等待繞過。LoopHarness 在作者控制的 1,000 個攻擊 episode 中保留 96.9% 乾淨任務完成率,但結果尚待獨立重現與真實系統驗證。
AI coding tools
GitHub 將 MCP 2026-07-28 帶入 CLI、SDK 與 IDE,並新增跨 hook 的 OpenTelemetry trace 關聯。新版同時移除舊 `/plugins` 入口,升級前須檢查外掛管理、自動更新及企業政策行為。
模型訓練
新研究以參數擾動和純前向評估訓練推理模型,發現演化策略可減輕 GRPO 的熵崩塌與大樣本覆蓋下降。結果涵蓋 1.5B 至 7B 模型,但訓練規模、任務範圍與可重現性仍有限。
AI 安全
新研究發現,子代理、持久目標與排程任務可能把工具輸出重新包裝成高權限使用者指令。攻擊在六款代理上涵蓋全部 13 類目標,啟用自動權限審查仍未阻擋受測路徑。
資料集與多模態研究
LAION-BVD 從 Common Crawl 建立跨影片、音訊與影格的開放研究資料,並釋出 5,500 萬段合成字幕 clip 與 3 億張影格等子集。ViCLIP 評測最多領先 InternVid 基線 2.1%,但資料僅限研究用途,來源權利、網址失效與合成標註誤差仍須另行治理。
AI 基礎設施
AMD 發布 ROCm 10,並讓整合 Hyperloom、AMD Skills 與統一 CLI 的 ROCm.AI 正式可用。官方宣稱同硬體推論與訓練平均提升 3.3 倍及 2.4 倍,但數字涵蓋整套最佳化流程,不能視為單純升級執行環境的收益。
AI 程式開發工具
新旗標把檔案工具限制在工作目錄,並略過使用者與專案設定,方便評測平台或共享主機執行代理。它仍可由啟動參數重新加入工具,也不是作業系統層級的沙箱。
AI 推論系統
Atlas 公開 Qwen3.8-27B-NVFP4 的可重跑測試,在 DGX Spark 的 1 至 128 路併發均領先 vLLM。結果只涵蓋單一模型與短輸入、長輸出負載,尚不能推廣至一般資料中心部署。
RAG/向量檢索
txtai 9.13 正式整合 LEMUR,以學習式固定維度向量近似逐 token 的 MaxSim 分數。初步測試兼顧索引容量與檢索品質,但預設 IVF 在較大資料集上可能明顯降低召回率。
AI 代理安全
AWS 提出在模型輸入、工具參數與工具輸出分別呼叫 Bedrock Guardrails,填補只檢查提示詞與回答的空隙。範例可按工具套用不同規則,卻未公布延遲、誤判率或對結構化動作的安全評測。
模型後訓練研究
BPCO 結合受限 value head、Monte Carlo target 與長度自適應 GAE,讓 critic 從單一回應估計逐 token advantage。作者在 1.5B 至 30B-A3B 模型上追平或超越多樣本方法,但尚未證明整體訓練成本較低。