OpenAI 將 GPT-5.6 分成 Sol、Terra、Luna,統一百萬 token 上下文與代理工具介面
GPT-5.6 家族進入一般供應,以 Sol、Terra、Luna 分別覆蓋最高能力、均衡成本與大量低價工作負載。三款模型共享長上下文與工具介面,但推理成本、安全行為及實際品質仍需分別評估。
Archive
共 31 篇技術新聞
GPT-5.6 家族進入一般供應,以 Sol、Terra、Luna 分別覆蓋最高能力、均衡成本與大量低價工作負載。三款模型共享長上下文與工具介面,但推理成本、安全行為及實際品質仍需分別評估。
機器人資料與工具
Pollen Robotics 發布約 490 歐元的手持式 Grabette,利用雙相機、IMU 與夾爪編碼器記錄六自由度操作。瀏覽器處理流程會執行 SLAM、檢查軌跡並輸出標準 LeRobot 資料。
程式代理評測
AgentLens 不只檢查代理是否解出程式題,而是審查完整互動軌跡與實際產品結果。開源基準可用於比較模型版本、定位行為退化,並接入持續整合流程。
代理評測
OmniaBench 建立具明確狀態空間的跨工具、跨互動形式代理測試,並提供 644 題精簡困難集。結果顯示,規劃、約束維持與錯誤後調整仍是前沿代理的共同弱點。
模型與開發平台
Muse Spark 1.1 首次透過 Meta Model API 公開預覽,並提供 OpenAI 相容介面。模型把百萬 token 上下文、搜尋引用、結構化輸出與平行工具呼叫整合成代理基座。
推論與量化
Diffusers 現可直接載入 Nunchaku Lite 的 INT4 與 NVFP4 檢查點,不必另裝模型專用推論引擎。SVDQuant 同時量化權重與啟用值,目標是在節省顯存之外真正縮短去噪時間。
實體 AI 與機器人
Cosmos 3 Edge 是 40 億參數的開放世界模型,可同時進行場景理解、未來預測與動作生成。官方稱其在 Jetson Thor 上每次產生 32 個動作,控制頻率可達 15 Hz。
模型與資安
Google 同步推出 Gemini 3.6 Flash、3.5 Flash-Lite 與受限存取的 3.5 Flash Cyber。更新把代理系統的成本、延遲與專用資安模型視為同一套部署問題。
模型安全評估
Anthropic 的 Responsible Scaling Policy 3.4 修改自動化研發能力門檻、內部未刪節報告分享範圍與外部審查方式。更新看似偏治理,實際會影響模型能力評估、部署閘門與安全報告的工程流程。
UniVR 嘗試只從視覺示範共同學習複雜推理、物理動態與長期規劃。ByteDance 同步公開 34B Planning 檢查點,為不依賴文字思考鏈的視覺代理研究提供可測試基線。
檢索與推論
Nemotron 3 Embed 提供 8B、1B BF16 與 1B NVFP4 等文字嵌入模型。低精度版本把檢索模型的記憶體與吞吐效率納入第一級設計目標,但品質仍需在目標語料上驗證。
開放權重模型
Moonshot AI 發布 Kimi K3,採 2.8 兆總參數、每 token 啟用 16 個專家的 MoE 架構,並支援百萬 token 上下文與視覺輸入。完整權重排定稍後釋出,因此目前仍應區分 API 表現與可自行部署的實證。