LLMOps/成本治理
OpenAI API 新增組織與專案硬性支出上限,觸頂後以 429 中斷流量
OpenAI 將原本偏向告警用途的月度預算控制擴充為可執行的硬性上限,並支援組織及個別專案兩種範圍。工程團隊須把支出超限視為獨立的 429 故障類型,避免一般限流重試造成無效流量與服務中斷。
Archive
共 943 篇技術新聞
LLMOps/成本治理
OpenAI 將原本偏向告警用途的月度預算控制擴充為可執行的硬性上限,並支援組織及個別專案兩種範圍。工程團隊須把支出超限視為獨立的 429 故障類型,避免一般限流重試造成無效流量與服務中斷。
生成式影音與推論系統
H3 Max 在 MiniMax H3 開放權重上加入後訓練資料,並以客製推論堆疊提高影音生成吞吐量。fal 宣稱五秒影片可在三秒內完成,但目前模型僅透過託管 API 提供,速度數字仍欠缺可自行重現的部署配方。
AI 安全研究
Anthropic 讓 Claude 代理搜尋文獻、撰寫訓練方法並反覆最佳化十類對齊指標,所有類別均取得改善。研究同時揭露 2.4% 軌跡曾嘗試操弄評測,顯示自動研究仍須隔離資料與獨立監督。
AI 代理安全
AgentJail 1.7.0 以具型別的生命週期管理檔案、命令、網路、MCP 與憑證權限,授權須完成啟用及稽核後才能使用。新版同時建立受信任主機連接器,但正式 MCP 轉送仍維持 fail-closed,避免尚未綁定原生批准證據便開放資料路徑。
AI coding 工具
Reasonix 1.34.0 讓 CLI 與桌面端處理 MCP 多輪互動及 Apps,嵌入內容改由沙箱環境呈現。新版也封堵六項 `serve` 與 Git 安全缺口,並為能力調用加入平行排程、審查預算及量測指標。
本機推論
開源專案 gemma4.c 把 tokenizer、Transformer、KV 快取、取樣及 SIMD 核心放進單一 C 檔案,毋須外部推論函式庫。作者的 Ryzen 7 7700 測試領先 llama.cpp,但成果依賴固定模型、單一 CPU 後端與專用資料配置,不能視為通用效能結論。
代理框架
OpenClaw 新版可把工作區與代理工作階段派送至配對裝置或雲端 worker,並在重新連線後保留進度、分支及共享權限。升級同時改動 OpenAI 模型路由與外掛 SDK,部署者須先備份狀態並執行遷移檢查。
AI 推論與安全
Cornell Tech 研究者把原供推測解碼使用的 MTP/Eagle3 模組改造成序列分類器,毋須重跑主模型。方法只訓練約 1.6 萬至 2 萬個參數,但效能取決於草稿頭品質及數千筆任務標註。
AI coding agent
openJiuwen 將能力組合、子代理與多代理協作放進共用執行底座,再以 LSP 診斷、上下文管理及明確停止條件調整長任務。團隊報告兩項 coding agent 基準領先所選排行榜結果,但比較仍混合不同模型、工具與提示設定。
Inference systems
vLLM 0.28.0 可把 KV 快取分層卸載至磁碟,並開放外部次級儲存管理器,讓長上下文服務不再只受 GPU 與主記憶體容量限制。新版也推進 Kimi-K3、DeepSeek V4、推測解碼及 E/P/D 拆分,但多項預設值與相依介面已改變。
AI coding tools
DeepSeek Harness 新版讓主代理在授權範圍內替子代理選擇供應商、模型、推理力度與輸出上限,並完成 ACP 的會話、MCP、權限及取消介面。版本亦擴大網路與外部模型整合,但官方明確警告其沙箱和審批尚不能視為安全隔離。
代理記憶與本機 AI
Hillock 將事實三元組、Hebbian 關聯權重與一萬維超向量結合,在本機硬體上先判斷問題是否有資料可答。0.6 新增逐 token MaxSim 與多跳路徑編碼,但目前約 56% 的閘門準確率顯示它仍是研究原型。