代理架構與評測
SKILL.state 丟棄代理執行歷史,以結構化狀態將百步任務 token 用量縮至十六分之一
Google 與普渡大學研究者讓代理每一步只讀取固定技能、目前狀態與最新觀察,驗證狀態更新後立即捨棄推理歷史。在百步倉儲測試中,它以 65,408 token 取得 0.94 準確率,但成效依賴預先設計的狀態結構能保留未來所需資訊。
Archive
共 945 篇技術新聞
代理架構與評測
Google 與普渡大學研究者讓代理每一步只讀取固定技能、目前狀態與最新觀察,驗證狀態更新後立即捨棄推理歷史。在百步倉儲測試中,它以 65,408 token 取得 0.94 準確率,但成效依賴預先設計的狀態結構能保留未來所需資訊。
開放模型與推論
騰訊公開 Hy4 Preview 的 Apache 2.0 權重、FP8 版本及 vLLM、SGLang 部署配方,模型每個 token 從 770B 參數中啟用約 49B。它支援 100 萬 token 上下文,但品質與自我最佳化成效目前仍主要來自騰訊內部評測。
推論系統
llama.cpp b10687 針對 Snapdragon X2 與較舊 A7X GPU,避開 OpenCL 編譯器選中的低效矩陣乘法路徑。維護者測得 gpt-oss-20b 與 Gemma 3n 的提示預填分別加速約 20% 至 25% 及 9%,但逐 token 解碼並未變快。
評測與資料集
Hugging Face 與 Voice Arena 以 Monsoon 資料集擴充開放語音辨識排行榜,四個公開及私有分割涵蓋 4,888 名說話者。印地語改用可接受多種拼法的參考格狀結構,避免傳統單一轉錄把正確辨識誤算成錯字。
代理框架
Lemmalog 將代理記憶拆成由 LLM 擷取的事實,以及由規則引擎維護的可驗證狀態。初步評測顯示它能大幅縮短回答階段的上下文,但整體準確率仍受事實擷取與實體對齊限制。
生成式影片與推論加速
FastVideo 以 DMD2 蒸餾與 90% 稀疏注意力,把基礎模型的 49 次 DiT 呼叫縮減為四次,並公開完整權重與 LoRA。即時生成數字依賴八張 B200、專用 VSA 核心及暖機後測試,單卡與一般消費級 GPU 尚未達到同等速度。
AI 代理安全與執行期
NVIDIA 在 0.0.113 強化本地推論與狀態漂移驗證後,再把沙箱、推論服務及生命週期權限綁定至可持久驗證的身分,避免重試或復原操作接管同名但不同的執行環境。
機器人與實體 AI
Pollen Robotics 將 Microduck 的控制執行期、MuJoCo 模擬環境、PPO 訓練配方及七種出廠策略以 Apache 2.0 開放。399 美元預購價降低實體強化學習門檻,但策略泛化、硬體耐用度與量產交付仍待社群驗證。
AI 安全
研究人員利用 Python 模組遮蔽,令 Claude Code 自行撰寫的安全解碼器載入惡意 `struct.py`,最終取得遠端程式碼執行。案例顯示逐次工具分類器無法取代作業系統隔離,官方評測的零成功率也不能外推至未見攻擊鏈。
代理系統與科學運算
Model Hardware Standard 將儀器能力、自然語言說明及安全限制封裝成可探索的驅動介面,代理可透過 MCP、CLI 或 API 協調多台設備。它目前仍是申請制研究預覽,規格、程式碼與跨模型安全評測尚未公開。
AI 程式開發工具
Cursor 不再要求先連接既有 GitHub 等原始碼庫,代理可直接建立專案並透過瀏覽器操作即時環境。新流程縮短原型到部署的距離,也擴大了雲端執行、網路暴露與供應鏈權限的稽核範圍。
AI 研究
CritICL 先離線整理小模型的錯誤、失敗類型與批評,再把相關案例放入大模型提示,而非為每題反覆採樣。作者在 Qwen2.5 數學測試報告略高於 self-consistency 的準確率,但離線建庫成本與尚未釋出的程式碼限制了可重現性。