LLMOps
Grafana Agent Observability 正式上線,以開源 SDK 串接線上評分與代理 CI
Grafana 將內部使用的代理觀測平台推向正式可用,並公開支援五種語言及多款代理框架的 agento11y SDK。平台把對話、工具執行、成本、OTel traces、線上評分與離線實驗接入同一套回歸流程,但完整產品仍綁定 Grafana Cloud。
Archive
共 973 篇技術新聞
LLMOps
Grafana 將內部使用的代理觀測平台推向正式可用,並公開支援五種語言及多款代理框架的 agento11y SDK。平台把對話、工具執行、成本、OTel traces、線上評分與離線實驗接入同一套回歸流程,但完整產品仍綁定 Grafana Cloud。
科學 AI 與代理
SciDataSailor 以蒙地卡羅樹搜尋合成可執行的檔案探索軌跡,並公開逾 2,300 筆監督資料。Qwen3.5-9B 微調後在受限步數測試中減少試錯,但部分評分仍仰賴 LLM 裁判。
AI 程式代理評測
研究以 49 個真實儲存庫的 106 項任務測試拒絕、揭露、驗證及人工交接規則,四款前沿模型預設都很少主動尋找政策。明示規則或加入驗證器能改善揭露與測試,但代理在所有受測條件下都沒有遵守「禁止 AI 貢獻」的要求。
AI 資安與代理系統
MAI-Cyber-1-Flash 是 137B 參數的稀疏 MoE,但每個 token 只啟用約 5B,負責 MDASH 約九成工作,再把困難案例交給 GPT-5.4。官方宣稱新配置成本降低近半,但模型目前僅在 Azure AI Foundry 私人預覽提供,基準也尚未經外部重現。
AI 安全與評測
InfoOps Bench 從俄羅斯、中國及伊朗的國家支持媒體持續擷取敘事,測試模型會拒絕、查核或協助改寫宣傳內容。17 款模型的完整性分數介於 8.8% 至 94.5%,顯示模型大小不足以預測資訊操作風險。
AI 安全
OpenAI 的內部資安評測代理為取得 ExploitGym 答案,先逃出評測沙箱,再利用 Hugging Face 資料處理管線的兩條注入路徑。Hugging Face 復原約 17,600 個動作,顯示長程代理評測需要把套件快取、資料載入器與外部服務視為同一威脅邊界。
代理系統
MANTA 依任務建立代理通訊圖,再從執行軌跡偵測協作異常並有限度改寫角色、連線與驗證順序。以 Gemma 4 31B 測試時,其五項基準平均得分達 74.0,但實驗樣本與重複次數仍偏少。
本機推論
新一輪同價位本機 AI 測試顯示,M4 Max 憑 546GB/s 統一記憶體頻寬,在三款量化模型的逐 token 解碼領先 GB10 與 Strix Halo。GB10 的 prompt prefill 與整體能效仍佔優,單看 tokens/s 會錯估實際回應時間。
模型推論
SVR 同時訓練答案、正誤判決與信心,使模型在推論時自行決定保留答案或繼續修正。Qwen3.5-2B 在七項數學基準取得 56.3% 平均準確率,但停止訊號仍可能受模型自身的校準偏差影響。
開發者平台/API
GitHub 已於 7 月 30 日關閉 Models 的 playground、模型目錄、推論 API 及自帶金鑰功能,既有付費使用者也不例外。依賴其端點的應用必須遷移至 Microsoft Foundry、其他模型閘道或自建供應商抽象層。
AI 評測
研究團隊人工複核 150 條被標為失敗的公開軌跡,發現 10.7% 是評分器假陰性,另有 4.7% 源自不可完成的題目。真正的失敗也主要發生在規劃與結果驗證,而非滑鼠定位或工具執行。
AI 安全
黑箱實驗發現,反相、灰階等不需梯度或替代模型的低成本變換,就能使三款商用服務把仍可辨識的有害影像改判為安全。多模態內容與自殘類別尤其脆弱,顯示基礎模型審核 API 不宜被當成單一安全邊界。