AI coding agents
Kozuchi 讓同一套 27B 程式修復代理跨至 Java,Multi-SWE-bench 解出 41/128 題
富士通把免微調的 Qwen3.5-27B、八階段修復流程與跨代理測試選擇器原封不動移至 Java。它在 Python SWE-bench Verified 解出 374/500 題,但 Java 成功率僅 32.03%,顯示代理框架可移植不等於語言能力相同。
Archive
共 966 篇技術新聞
AI coding agents
富士通把免微調的 Qwen3.5-27B、八階段修復流程與跨代理測試選擇器原封不動移至 Java。它在 Python SWE-bench Verified 解出 374/500 題,但 Java 成功率僅 32.03%,顯示代理框架可移植不等於語言能力相同。
科學 AI 與模型後訓練
PertMind 從 Qwen3-4B 出發,以基因反應、路徑方向及輸出格式組成可計算獎勵,不必人工撰寫大量生物推理軌跡。模型可零樣本轉移至逆向擾動辨識及雙擾動任務,但自然語言機制解釋仍不能視為因果證明。
代理評測與推理效率
新評測不再為每題提供獨立額度,而是要求模型在六道題之間分配 token 或工具操作。六款模型即使已能單獨解題,放入共享預算後仍普遍無法把算力投向最有回報的題目。
評測與關聯式學習
Prior Labs 開源統一資料切分、調參與評分流程,重新比較圖模型、關聯 Transformer 與資料表方法。TabPFN-Rel 顯示先聚合關聯資料再交給表格基礎模型仍具競爭力,但 CPU 特徵合成成本未完整計入排行榜時間。
推論系統
FreeToken 依主機記憶體與 PCIe 頻寬,動態決定未命中專家應傳入 GPU 或直接由 CPU 計算。論文在五款消費級系統報告較最強基線高 1.3 至 2.1 倍解碼吞吐,但所連結的程式碼庫目前尚無法公開存取。
代理評測
新評測把工具呼叫拆成狀態擷取與任務執行,發現上下文壓縮可在成功率下降前大幅增加代理的重查成本。GPT-5.5 在五倍壓縮下完成率由 80% 變為 85%,但平均擷取呼叫由 21.0 次升至 63.9 次。
推論系統
DriveCache 利用生成前已知的車輛平移與旋轉,為不同駕駛場景安排擴散模型的特徵重用。Wan2.2 A14B 在接近相同加速幅度下,PSNR 較 SeaCache 高 1.276 dB,但程式碼尚未公開。
AI safety research
新研究以加性 log-odds 模型量度改寫、錯字、動物名稱及 JSON 欄位的微弱偏向,再把同方向線索組合成提示。部分最佳化提示可跨模型轉移,但目前實驗集中於人工設計的二元選擇題。
AI coding agents
UCL 研究把代理、檔案、訊息及讀寫事件建成時間網路,分析 1,902 次受控程式任務。結果顯示協作拓撲主要由任務結構決定,僅在提示中指定協調者並未形成實際樞紐。
評測與可靠性
新研究顯示,即使待驗內容完全相同,留在上下文中的舊稽核與修復經歷仍會令多款開放模型較少報錯。訊號偵測分析未發現辨別力同步提升,表示代理管線改變了驗證門檻,而不只是令模型判斷得更準。
代理基礎設施
Quipu 將資料、信任標籤、規則與裁決一併納入雙時間軸,並在代理寫入提交前檢查候選狀態。作者的植入缺陷測試由未設閘門時的 6 項全數殘留降至零,但證據仍主要來自系統作者設計的單次確定性評測。
AI 代理安全
CompoSkill 把技能安全從單一套件判定改寫成跨技能資料流與副作用的路徑問題。其 1,140 筆測試中,白箱及黑箱攻擊形成風險鏈的最高比例分別達 83.3% 與 80.6%,但這不等同真實入侵成功率。