代理框架
PydanticAI 2.38 暴露代理上下文用量,並為執行串流加入型別化自訂事件
代理工具現在可從 `RunContext` 判斷已使用的上下文,應用程式也能把自訂狀態送進同一條事件串流。新版另加入自架 vLLM provider 與缺少 `finish_reason` 的串流拒絕策略。
Archive
共 939 篇技術新聞
代理框架
代理工具現在可從 `RunContext` 判斷已使用的上下文,應用程式也能把自訂狀態送進同一條事件串流。新版另加入自架 vLLM provider 與缺少 `finish_reason` 的串流拒絕策略。
AI 基礎設施
新版以 `nccl2`、程序群組就地重組與跨後端 Flight Recorder 強化大型分散式訓練。Inductor 同時加入 NVGEMM、宣告式動態形狀與複數張量編譯,但多項介面仍標示不穩定。
邊緣 AI/推論系統
MobiCom 2026 研究把模型權重與 KV cache 切成共享緩衝區,讓 GPU 在 CPU 還原被逐出的資料時先開始 prefill。成果針對手機多工後的恢復延遲,而非提升模型本身的生成速度。
AI 安全/程式代理
多款 CLI 程式代理會在信任確認前執行 Git 狀態查詢,讓儲存庫內的可執行設定以使用者權限在主機運行。攻擊不會經一般 `git clone` 傳播,但透過 ZIP、同步資料夾或 USB 交付完整 `.git` 目錄即可觸發。
醫療 AI 與物理導向學習
新研究把 GPU 鉛筆束計算、兩個凍結神經先驗與 136 萬參數 3D U-Net 串成 CT/MRI 共用流程。內部資料的 1%/1 mm gamma 通過率最高達 99.12%,但尚未構成跨醫院或臨床用途驗證。
AI 程式開發與代理治理
新版以 `managedMcpServers` 統一派送 HTTP/SSE 工具端點,並為無人值守主機加入不等待互動的權限策略。升級同時改變 allowlist 對受管伺服器的作用,企業若未補上 denylist,原本被過濾的工具可能重新載入。
推論系統
`@huggingface/kernels` 可從 Hub 動態載入附帶介面、測試與 WGSL 實作的 GPU 算子。官方在 Apple M4 的算子級測試中報告幾何平均快 2.57 倍,但結果不包含模型載入、編譯與資料傳輸成本。
開放模型
Tether AI Research 釋出以 Qwen3.5 微調的 AfriSLM,以及面向瀏覽器與手機的 17M 至 43M 參數 AfriNano。模型涵蓋最多 19 種撒哈拉以南非洲語言,但領先大型基線的結論主要來自自動指標,尚缺母語專家評測。
推論系統
Unsloth 為 Qwen3.8-Flash-Next、GLM-5.3-Flash 預設開啟多 token 預測,並改善 MLX、多 GPU 與 ROCm 路徑。官方最高兩倍的說法未附完整測試矩陣,Qwen 技術文件所列低併發增益則為 1.3 至 1.7 倍。
代理框架
新的 `langchain.mcp` 可統一連接單一或多個 MCP 伺服器,並把工具中途提問轉成可恢復的 LangGraph interrupt。介面仍處 Alpha 階段,連續版本已修改方法名稱與 elicitation 行為,不宜直接投入穩定生產環境。
AI 開發工具
Google 將 Android 專用技能的自動選取與 Gemma 4 本機推論帶入 Android Studio 穩定通道。程式碼可留在開發機,但本機執行不等於代理已具備完善的權限隔離或可驗證品質。
AI 程式碼審查
GitHub 讓管理員選擇是否允許 Copilot 提交可計入分支規則的 Approve review,並提供路徑層級限制。功能仍處於公開預覽,也沒有足以把模型核准視為獨立品質保證的準確率證據。