AI 程式開發工具
Cursor Cloud Agents 可從空白專案啟動,程式庫、預覽與部署全移入雲端流程
Cursor 不再要求先連接既有 GitHub 等原始碼庫,代理可直接建立專案並透過瀏覽器操作即時環境。新流程縮短原型到部署的距離,也擴大了雲端執行、網路暴露與供應鏈權限的稽核範圍。
Archive
共 947 篇技術新聞
AI 程式開發工具
Cursor 不再要求先連接既有 GitHub 等原始碼庫,代理可直接建立專案並透過瀏覽器操作即時環境。新流程縮短原型到部署的距離,也擴大了雲端執行、網路暴露與供應鏈權限的稽核範圍。
AI 研究
CritICL 先離線整理小模型的錯誤、失敗類型與批評,再把相關案例放入大模型提示,而非為每題反覆採樣。作者在 Qwen2.5 數學測試報告略高於 self-consistency 的準確率,但離線建庫成本與尚未釋出的程式碼限制了可重現性。
AI 開發工具
Experiential 把雲端、自帶金鑰及本機模型統一到 OpenAI 相容介面,並提供身分範圍、模型白名單與硬性預算控制。它還能用 OpenTelemetry 代理軌跡建立任務路由器,但節省成本的數字目前主要來自團隊自行評測。
Open-source governance
Debian 開發者選出「負責任使用生成式 AI」方案,沿用既有品質與授權標準,由提交者對 AI 輸出負全責。決議不強制揭露 AI 使用,但明確限制敏感資料外送,並要求大規模自動化修改先經討論。
AI coding tools
新版加入 `on_mcp_tool_result` 生命週期介面,讓擴充套件檢查或替換 MCP 的成功與錯誤結果。這提供資料遮罩與輸出正規化的新控制點,也把擴充套件提升為需要稽核的代理信任邊界。
AI 開發工具
OpenAI Python SDK 已將同步與非同步預設客戶端從 HTTPX 換成 HTTPX2,並停止把舊版 `httpx` 與 `certifi` 當作傳遞相依套件。一般 API 呼叫大致不變,但企業代理、客製 transport、RESPX 測試及憑證信任設定可能在升級後失效。
AI 代理研究
PILOT 以雙向通道連接監督者與工作代理,允許前者在長任務尚未結束時提供指示或中止錯誤路徑。作者在三項代理基準報告準確率與 token 效率提升,但「自我改進」只更新 harness、技能與記憶,沒有修改模型參數。
機器人與世界模型
CLAP 先以潛在動作從無標註影片學習物理規律,再把表徵接回機器人末端執行器座標。研究團隊已開放程式碼與多種 checkpoint,但生成影片的物理幻覺仍限制其直接參與安全關鍵控制。
模型訓練系統
Puro-2B 把兩階段資料課程、區塊式 FP8 與 MuonH 最佳化整合到消費級 GPU 叢集。作者報告 4,370 美元的縮短訓練版本已超越 Qwen2-1.5B 平均分,但成本只計加速器租用等價值。
代理框架與開發工具
PRAXIST 讓多個研究代理分代提出改動,再把評測結果、機制與血緣寫入可稽核證據圖,避免每輪重新探索。作者在 75 項 MLE-bench 報告 60 面獎牌及 3,054 美元模型費用,但系統剛公開,成績與成本仍主要由開發團隊量測。
模型訓練與推理
TTPO 不把多數決答案直接當真,而是蒸餾與共識一致的軌跡,再以群組強化學習懲罰高信心的分歧錯誤。作者報告 Qwen3-1.7B 在三項數學競賽的 Avg@12 由 38.0 升至 45.2,但這仍是直接使用測試題更新參數的轉導式設定。
LLM 推論/測試時計算
Prefix Sliding 在生成期間淘汰中段推理 token,只保留系統提示、任務前綴及最近數千個 token,毋須重新訓練即可套用。研究報告長推理的整體思考時間可縮短約三倍,但現有實作依賴分支版 vLLM 與 FlashAttention,短輸出及需回看早期細節的任務收益有限。