AI 代理安全
AWS 以三段 Strands hook 審查代理工具流,但不能取代權限控制
AWS 提出在模型輸入、工具參數與工具輸出分別呼叫 Bedrock Guardrails,填補只檢查提示詞與回答的空隙。範例可按工具套用不同規則,卻未公布延遲、誤判率或對結構化動作的安全評測。
Archive
共 951 篇技術新聞
AI 代理安全
AWS 提出在模型輸入、工具參數與工具輸出分別呼叫 Bedrock Guardrails,填補只檢查提示詞與回答的空隙。範例可按工具套用不同規則,卻未公布延遲、誤判率或對結構化動作的安全評測。
模型後訓練研究
BPCO 結合受限 value head、Monte Carlo target 與長度自適應 GAE,讓 critic 從單一回應估計逐 token advantage。作者在 1.5B 至 30B-A3B 模型上追平或超越多樣本方法,但尚未證明整體訓練成本較低。
AI 代理基礎設施
Switch 把 Slack、Teams、Discord 等頻道映射至共享房間,讓 Codex、Claude Code 與其他代理保留共同上下文。程式碼可自行部署,但 Commons Clause 限制商業轉售,且成本防護與部分安全控制尚未完成。
軟體代理與評測
ASIL 讓代理讀取 JSON 軟體狀態,再透過檔案解析器、原生腳本或服務 API 執行語意動作。它在 380 項任務顯著超越螢幕控制,但比較同時改變了代理可見資訊與操作粒度,不能單純解讀為模型能力提升。
代理與實體系統
Model Hardware Standard 把設備狀態與操作抽象成可發現的 `read`、`write` 等原語,並可透過 MCP、CLI 或程式介面調度。它已用於液體處理器、機械臂與量子電腦雷射,但規格及程式碼仍未公開,安全性證據主要來自合作夥伴的概念驗證。
推論基礎設施
Google 與 vLLM 為 Qwen3 embedding 模型加入張量對齊、編譯預熱及可跨分段累積的 pooling 狀態。官方在四顆 Ironwood TPU 上報告約 8.4 萬 token/s,但尚未提供同成本 GPU 對照或真實檢索品質測試。
多模態模型
Google 將對話式影片模型推進正式版,新增首尾幀插值、最長 40 秒場景延伸與四級解析度控制。新介面增加工作流程可控性,但 1080p、4K 均由升頻產生,複雜動作與文字一致性仍有限。
多模態評測/AI 安全
新共享任務要求系統逐字定位並分類視覺語言模型的幻覺,而非只判斷整段回答是否可信。27 個團隊提交逾 600 個系統,但封閉測試與不穩定的相鄰排名限制了結論。
AI coding/軟體工程研究
研究團隊以 441 個企業版本庫建立四級 Repository AI Maturity Profile,再重新分析 509 個採用 coding agent 的開源專案。具共同規則或代理設定的版本庫品質指標較佳,但觀察性研究尚不能證明設定檔本身造成改善。
AI 晶片與資料中心基礎設施
NVHBM 以客製 base die 與 PHY 把部分記憶體介面邏輯移離運算晶粒,並納入 NVLink Fusion。NVIDIA 宣稱它較標準 HBM4E 提高最多 30%頻寬、降低15%記憶體功耗,但尚未公布量產晶片實測。
開放模型與代理訓練
IBM 發布 3B、8B、30B 三款 Apache 2.0 密集模型,加入可切換推理模式與原生工具呼叫。8B、30B 額外在程式庫、終端及搜尋沙箱中接受代理式強化學習,但官方資料對基礎訓練沿革的描述並不一致。
AI 晶片與資料中心
OpenAI 首度公布自研推論 ASIC 的實測結果,並以單一加速器架構同時處理 prefill 與 decode。SemiAnalysis 現場核對測試過程,但數據仍由 OpenAI 提供,量產晶片與 AgentX 成績尚待驗證。