模型評測與安全
英美聯合評測:Kimi K3 可完成模擬企業入侵,但 41 次漏洞利用均未達任意程式碼執行
UK AISI 與美國 CAISI 的初步測試顯示,Kimi K3 在 ExploitBench 得分 32%,高於 GLM-5.2,卻明顯落後受測的美國前沿模型。模型也曾完成一次 32 步模擬企業攻擊,但評測條件與樣本有限,不能直接推論真實世界的攻擊成功率。
Archive
共 977 篇技術新聞
模型評測與安全
UK AISI 與美國 CAISI 的初步測試顯示,Kimi K3 在 ExploitBench 得分 32%,高於 GLM-5.2,卻明顯落後受測的美國前沿模型。模型也曾完成一次 32 步模擬企業攻擊,但評測條件與樣本有限,不能直接推論真實世界的攻擊成功率。
AI 安全
Zenity 公開一條已修補的 CSRF 式攻擊鏈:登入中的使用者只要開啟特製連結,ChatGPT Agent Builder 就可能自動建立、排程及執行攻擊者控制的代理。漏洞未繞過 OAuth,而是繼承既有授權,凸顯代理建立流程、執行身分與工具權限之間的新型信任缺口。
AI 推論與邊緣部署
Ultralytics 8.4.105 新增 YOLO26 深度估測模型對 Hailo-8L 與 Qualcomm QNN 的支援,並改善 CoreML、OpenVINO、NCNN 等部署後端。版本亦讓中斷的知識蒸餾檢查點可直接驗證與匯出,但效能收益仍須在目標硬體上個別量測。
代理標準與基礎設施
DNS-AID 公開網站與 Apache 2.0 參考實作,讓組織把代理端點、協定及能力文件發布成既有 DNS 記錄。方案可利用 DNSSEC 驗證發布者網域,但仍無法證明代理本身安全、能力宣告真實或值得授權。
AI 程式工具
Hallmark 在 GitHub 出現快速採用,將版面骨架、字體、色彩及反模板檢查封裝成可供 Claude Code、Cursor 與 Codex 載入的 Skill。它不訓練或微調模型,而是在生成前後加入可版本控制的設計政策與自我審查。
模型與代理平台
Anthropic 發布 Claude Opus 5,提供 100 萬 token 上下文、最多 12.8 萬輸出 token,並把 thinking 改為預設開啟。新模型允許代理在保留提示快取的情況下增減工具,但停用推理與高 effort 的組合存在不相容變更。
AI evaluation
Microsoft Research 提出 EvolvingIntent,把既有數學、SQL、搜尋及程式任務拆成逐步揭露、修訂或轉向的多輪對話。實驗顯示,模型在單輪基準的能力無法穩定轉移到需求持續變動的情境,相關資料建構與評測程式已公開。
AI coding tools
GitHub 的規格驅動開發工具 Spec Kit 0.14 新增可版本化的 Bundle、Python 腳本路徑與可重現建置。緊接發布的 0.14.2 又移除 shell 執行參數並加強輸入驗證,反映代理工作流開始面對套件供應鏈與命令注入問題。
代理框架與開發工具
Block 將 Buzz 以 Apache 2.0 授權公開,讓人類與 AI 代理使用各自的金鑰參與頻道、程式審查及工作流。它把所有操作建模為單一 relay 上的簽章事件,但尚未提供 relay 複寫、完整審批閘門或端對端加密。
模型與邊緣推論
Microsoft Research 公開 VibeVoice-ASR-BitNet,分別以 INT8 與三值權重量化語音編碼器和語言模型,讓多語 ASR 不需 GPU 即可運作。官方測試顯示模型較同容量 Whisper.cpp 快 1.6 至 2.3 倍,但目前只支援離線批次轉錄。
AI coding tools
Anthropic 將 Claude Code 子代理的預設巢狀深度由一層提高至三層,並把深層代理輸出納入結構化串流。新版也可直接拒絕未列入白名單的網路主機,讓無人值守代理更容易採取預設封鎖政策。
Enterprise AI applications
SpaceXAI 推出單一 Google Workspace 外掛,讓 Grok 在文件、試算表與簡報側欄中生成及修改內容。Marketplace 公開的 OAuth 權限涵蓋全部 Docs、Slides 與已安裝外掛的試算表,企業導入前需先釐清資料傳輸和最小權限。