RAG 與金融 AI
FinRank 用 6,021 個混淆段落測金融 RAG,7B 嵌入模型 Recall@10 僅 44.8%
FinRank 要求系統從 SEC 文件找出公司、期間及披露語境都正確的證據,而不只產生數值正確的答案。資料集與評測程式已公開,但非商業授權及標註限制會影響採用方式。
Archive
共 970 篇技術新聞
RAG 與金融 AI
FinRank 要求系統從 SEC 文件找出公司、期間及披露語境都正確的證據,而不只產生數值正確的答案。資料集與評測程式已公開,但非商業授權及標註限制會影響採用方式。
評測與可重現性
Orcetra 原稱在 513 套 OpenML 資料上大幅勝過 FLAML 與 AutoGluon,但作者稽核後發現測試集洩漏及算力不對等。修正協定後,三套系統在重跑子集已無統計顯著差異。
醫療 AI 與代理訓練
Google 團隊讓 Gemini 3.5 Flash 在模擬患者、文件工具與多維臨床獎勵中接受多輪強化學習。模型在對抗問診中減少漏看危險徵兆,但訓練系統未開源,也尚未完成真實患者的前瞻驗證。
模型訓練與最佳化
新實驗發現,以 Muon 訓練 Transformer 隱藏矩陣、AdamW 更新嵌入與輸出頭時,模型雖較快學會模運算,卻無法穩定維持解法。凍結任一參數群可阻止崩落,顯示問題源於表徵與讀出介面的共同漂移。
代理框架與可重現性
Shepherd 把模型呼叫、工具操作與檔案變更記成持久執行軌跡,讓使用者在修改進入工作區前檢查或捨棄。最新文件同時明確指出,論文與專案首頁展示的 meta-agent 委派、執行中分叉及自動重試介面,尚不是 v0.3.0 可直接使用的功能。
AI 安全與開發工具
獨立測試發現,Meta 的 Muse Code 會在啟動時尋找使用者家目錄中的 `CLAUDE.md` 與 `AGENTS.md`,並把內容納入送往模型端點的上下文。這種相容性設計不等於任意檔案外洩,但可能把原本只預期交給另一家供應商的個人規則、內部路徑或敏感提示傳給 Meta。
AI for Science/生物基礎模型
CellWorld 不直接重建被遮蔽的基因值,而是根據鄰近細胞與少量表達提示預測目標編碼器的潛在表示。程式與訓練配置已採 MIT 授權公開,但預訓練權重仍放在需核准的私人儲存庫。
模型合併與多模態代理
AgentPatch 先找出模型合併後的弱項,再只恢復專家模型的獨有殘差與關鍵 FFN 神經元。它輸出單一靜態 checkpoint,無需路由或推論期代理,但完整評測轉接器與模型權重仍未公開。
開源工具
AIPOCH 的 Apache‑2.0 桌面工作台整合模型代理、Python/R 核心、科學資料連接器及不可變產物版本。8 月 9 日更新讓上下文壓縮可見,並修正 Codex MCP 核准與 Windows notebook 執行問題,但仍未達可攜式完整重播。
AI 安全
OpenAI 表示 Astra 的代理編碼與網路攻防能力進展,使其無法排除模型已跨入最高風險門檻。公司已隔離測試環境、限制工具與網路存取,並讓監控器檢查代理的推理軌跡與高風險行動。
AI 程式代理與強化學習
DiDPO 不再把整次代理執行的成敗平均分配給所有 token,而是比對多條軌跡中的相似子 diff。公開的 verl-code 已包含訓練入口與資料配方,但尚無作者模型 checkpoint,實驗也不是完整軟體庫修復。
AI 研究與科學代理
P-Bench 要求代理自行選擇統計方法、執行 R 程式並回報 p 值,不再只檢查程式能否執行。14B 模型在困難題的嚴格指標領先所列開放模型,但目前公開儲存庫仍只有說明文件。