AI 安全與內容來源
Anthropic 為新 Claude 輸出加入模型級文字浮水印,檔案採 C2PA 簽章
Anthropic 表示,8 月 2 日起推出的 Claude 模型會在文字內嵌入不可見標記,並為支援的圖片與文件加入簽章式來源資料。技術規格與第三方偵測工具尚未公開,現階段不能把標記視為完整的生成證明。
Archive
共 970 篇技術新聞
AI 安全與內容來源
Anthropic 表示,8 月 2 日起推出的 Claude 模型會在文字內嵌入不可見標記,並為支援的圖片與文件加入簽章式來源資料。技術規格與第三方偵測工具尚未公開,現階段不能把標記視為完整的生成證明。
模型安全研究
新研究指出,從自回歸模型改造而來的擴散式 LLM,可能連同集中在少數神經元的安全機制一起繼承。研究者亦用開放擴散模型離線生成攻擊提示,但承諾的完整程式尚未發布。
開發者平台
OpenAI 於 8 月 10 日停止 API 的 `gpt-5.2-chat-latest`,官方建議改用 GPT‑5.5。這次退場針對會追隨 ChatGPT 行為的別名,工程團隊仍須重新驗證提示、工具呼叫與輸出格式,不能把遷移視為等價路由切換。
推論系統
社群公開可重現的 vLLM 配方,以四張 24GB RTX 3090 部署 Laguna S 2.1 INT4,並用精度匹配的 DFlash 草稿模型跑過 190K-token 實際請求。282.5 token/s 是特定設定下的峰值而非持續吞吐,低位元量化的品質與相容性也仍高度依賴 checkpoint 和執行引擎。
PTQ4SNN 把脈衝神經網路長期保留的浮點膜電位納入後訓練量化,按通道配置 2、4 或 8 位元。論文在分類與語意分割上接近浮點模型,但硬體收益仍來自分析模型,且專用程式尚未公開。
AI 代理/評測
SkillProx 不直接保留模型提出的技能修改,而是重新執行任務、回滾退步版本,再刪除效用為負的知識單元。三款 Qwen 模型在表格任務均獲得增益,但作者目前只公開兩次提交的空殼儲存庫。
RAG/文件理解
DocMemo 不把首次檢索的 top-k 頁面視為定案,而是把推理回饋寫回頁面相關性分布並重新取樣。三層記憶在長文件問答帶來增益,但評分依賴 GPT-4.1,公開儲存庫也仍相當精簡。
推論系統
CoBa 先少量生成候選答案,再依分歧與驗證分數決定是否追加取樣或啟用較強驗證器。它在五套推理測試取得 85.13% 宏平均準確率,但結果來自離線候選池重播,尚非線上服務實測。
AI 安全與網路攻防
OpenAI 把專門降低網攻研究拒答率的 GPT‑5.6‑Cyber 放進需審核的 Daybreak Red,而非一般 API。公司評估其網攻能力屬 High、未達 Critical,但完整 system card 尚待發布。
開放模型與端側推論
Muse Glimmer 將多模態輸入、工具呼叫與失敗重試放進可在消費級硬體部署的 30B 密集模型。Apache 2.0 權重與官方 GGUF 已上線,但性能與安全數字目前仍主要來自 Meta 自評。
代理評測與可觀測性
上海人工智慧實驗室公開 A²E,以 Agent Task Protocol 解耦基準、代理外殼與軌跡評分。1,035 次配對實驗顯示外殼會改變工具使用與 token 成本,但樣本量不足以支撐框架排行榜。
代理記憶研究
TEPA 為長期記憶加入可撤銷的有效狀態,讓被新證據推翻的內容退出一般檢索但保留稽核紀錄。方法能修復單跳衝突,遇到多跳或 262K 長上下文時卻幾乎失效。