代理框架/開發工具
OpenAI Agents SDK 0.21 加入無 API 測試層,代理、沙箱與語音流程可重播驗證
新版提供可腳本化的模型與沙箱測試工具,讓多輪代理流程毋須呼叫模型供應商也能在 CI 重現。升級亦接軌 OpenAI Python 3 與 HTTPX 2,並修補中斷狀態、工具審批及敏感錯誤外洩問題。
Archive
共 968 篇技術新聞
代理框架/開發工具
新版提供可腳本化的模型與沙箱測試工具,讓多輪代理流程毋須呼叫模型供應商也能在 CI 重現。升級亦接軌 OpenAI Python 3 與 HTTPX 2,並修補中斷狀態、工具審批及敏感錯誤外洩問題。
開源推論
NInfer 的 Ampere 分支把 Qwen3.8-27B、MTP3、分頁 KV 與相容前綴重用塞進單張 24GB RTX 3090。作者測得八路解碼合計 165.33 token/秒,但結果集中於短提示、長輸出的固定工作負載。
多代理系統
StateBridge 將發送代理的末層 hidden state 對齊接收端 embedding 空間,作為連續前綴直接注入。四款開放模型的26組測試中有22組並列或取得最佳結果,但方法仍限於可存取內部狀態的同模型代理。
推論系統
社群實測指出,Apple Silicon 推論框架仍無法同時穩定提供內建 MTP 推測解碼、混合狀態前綴快取與批次服務。問題不只影響跑分,也會令長時程式代理在每輪對話重新支付 prefill 成本。
代理安全與標準
新開源協定讓代理為記憶、身份與行動建立Ed25519簽章及可見證的追加式紀錄,並提供零依賴離線驗證器。它把持久記憶投毒轉成可偵測的完整性問題,但仍不能證明記憶最初為真,亦尚未成為IETF標準。
模型與開發者平台
Google 將 Gemini 3.7 Flash 推向 API、Antigravity、Android Studio及企業代理平台,並以限時半價切入高流量代理工作負載。首批整合顯示多模態、工具呼叫與跨 API 格式已可用,但推理參數和成本資料仍有遷移陷阱。
模型與開發者 API
Mistral OCR 4.1 集中修補六類文件解析錯誤,包括 bounding box 漂移、漏失區塊、參考文獻合併及由右至左表格。`mistral-ocr-latest` 已指向新版,依賴浮動別名的生產管線可能在沒有改碼或版本鎖定下改變輸出。
生成式 AI 工具
ComfyUI 0.33.1 把 MiniMax Music 3 的模型載入及推理節點納入核心,並加入可供後端使用的 CUDA Graph 支援。版本亦修正固定 VRAM 配置無法執行 Music 3,以及部分 MiniMax 權重 QKV 版型辨識問題。
AI 安全與代理
SkillMisevo-Bench 追蹤代理如何從執行軌跡產生、檢索並重用技能,發現所有 21 組具進化能力的設定都曾寫出不安全產物。SafeEvolve 可降低後續傷害,但證據目前限於四款 CLI 代理與受控電腦操作任務。
世界模型/影片生成
AlayaWorld 沒有更換15B主幹或訓練資料,而是重寫視覺條件、記憶與相機控制的介面。新版在158個導航案例取得最高一致性平均分,但物理因果與導航指標仍未領先。
AI coding agents/評測
QuoteBench 固定模型輸出,只改變 Bash 指令的傳輸與再解析路徑,直接量出代理介面造成的故障。結果顯示,格式合法率接近滿分仍可能掩蓋大量 quoting 與 escaping 錯誤。
代理評測
新評估把代理研發拆成定題、執行與回饋控制,並以反事實實驗測量記憶是否真的改善下一次決策。七款前沿模型多數能重用經驗,但跨任務轉移不穩,甚至誘發快取答案等評測投機。