AI 評測
重審五套電腦代理基準:15.3% 的失敗判決其實判錯
研究團隊人工複核 150 條被標為失敗的公開軌跡,發現 10.7% 是評分器假陰性,另有 4.7% 源自不可完成的題目。真正的失敗也主要發生在規劃與結果驗證,而非滑鼠定位或工具執行。
Archive
共 975 篇技術新聞
AI 評測
研究團隊人工複核 150 條被標為失敗的公開軌跡,發現 10.7% 是評分器假陰性,另有 4.7% 源自不可完成的題目。真正的失敗也主要發生在規劃與結果驗證,而非滑鼠定位或工具執行。
AI 安全
黑箱實驗發現,反相、灰階等不需梯度或替代模型的低成本變換,就能使三款商用服務把仍可辨識的有害影像改判為安全。多模態內容與自殘類別尤其脆弱,顯示基礎模型審核 API 不宜被當成單一安全邊界。
AI 安全
MIND 不再逐條呼叫大型模型審核記憶,而是比較原始意圖與後續行為的壓縮表示,再用多超平面分類器攔截中毒內容。四款模型的受控實驗顯示攻擊成功率下降、平均延遲接近無防禦基線,但程式碼尚未公開。
語音 AI
AgenticASR 把語音辨識與文字整理拆開,讓小型 Refiner 隨新語音重寫有限範圍的既有輸出,而不必反覆處理完整逐字稿。程式、檢查點與 917 題中英雙語基準已公開,但主要音訊由語音合成產生,評分也依賴 LLM 裁判。
模型訓練與資料
一項新研究生成 68.6 萬本、共 320 億 token 的合成教材,並以內容相同的對照實驗隔離文件結構效應。把相關章節組成完整書籍優於拆散段落或隨機串接,但收益仍來自研究團隊自建訓練流程,資料與程式尚未公開。
AI 推論系統
SemPIC 以獨立 Writer 模型離線產生不依賴輸入位置的文件 KV,Reader 則維持原模型與標準快取介面。三款模型、四項任務的平均 micro-F1 由既有方法的 0.53 升至 0.60,但尚未公布端到端延遲、快取容量與程式碼。
機器人與推論最佳化
QuantWAMs 針對同時生成未來畫面與機器人動作的模型,將量化校準改成結構、聯合目標與閉環軌跡三層決策。兩款模型的模擬成功率與 FP16 相差 0.2 至 0.7 個百分點,但速度數據只涵蓋特定運算模組,真機比較也只有每項十次試驗。
代理系統與評測
一項 OSWorld 實驗顯示,本機 GUI 代理加入少量畫面歷史可明顯降低重複操作,但繼續延長上下文或步數主要是在改變失敗型態。兩階段規劃架構也因格式與協調成本落後單一代理,平行產生更多計畫只能以高昂 token 成本追回部分差距。
AI 安全與評測
AISPA 將系統提示詞拆成八項使用者權益維度,審核 88 款商用 AI 產品中的 3,249 條指令。98.9% 的產品至少含一項保護規則,但只有 24% 覆蓋全部維度,約四成同時存在被判定為有問題的指令。
AI 代理
Qwen 團隊提出跨手機、桌面、網頁與深度搜尋環境的統一 GUI 代理,並讓畫面操作與 CLI 指令共用同一動作空間。技術報告宣稱其在 OSWorld-Verified 達 79.5%,但模型權重、訓練資料與完整軌跡尚未公開。
評測/強化學習
OSReward 以 1,019 條人工複核的跨平台軌跡測試 27 款視覺語言評審,發現主要錯誤是把未完成任務判成成功。移除逐步文字使準確率平均下降 7.2 點,改動畫面輸入影響較小,暴露現有「視覺評審」對代理自述的依賴。
代理系統/評測
Tycho 把未知遊戲規則寫成可執行的狀態轉移模型,再依驗證結果決定修正或繞過模型。GPT-5.6 Sol 與 Claude Opus 5 在一次公開集測試中完成全部 183 個關卡,但結果仍高度依賴前沿 API、單次執行與公開題目。