返回首頁

AI 評測與安全

Google 以 H100 安全飛地實測雙盲模型評估,模型權重與保密題庫互不公開

Google DeepMind、MLCommons 等機構把 Gemini 2.5 Flash Lite 與未公開安全題庫送入同一個可驗證安全飛地,雙方只能取得受限結果。這套設計降低基準污染風險,但信任仍落在硬體根金鑰、可信運算基礎與跨機構程式碼審查上。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Google DeepMind 與 MLCommons、OpenMined、AVERI、新加坡 AI Safety Institute 完成一項雙盲模型評估概念驗證:模型供應商不取得測試提示,評測方也看不到模型權重及推論程式碼。實驗以 Gemini 2.5 Flash Lite 配合保留、從未交給模型處理的 AILuminate 安全提示,另測試符合新加坡情境的有害內容誘發題目。

雙方先審查介面及執行政策,再把加密資產經 mTLS 串流至 Google Cloud A3 Confidential VM。主機使用 Intel TDX 加密記憶體,NVIDIA H100 Confidential GPU 保護顯存,OpenMined PySyft 負責提交、核准與執行工作。遠端證明會簽署韌體、核心、容器及應用映像的量測值;只有雙方確認執行環境相符,權重與題庫才會解密。評估完成後僅輸出受限的彙總指標,臨時金鑰及執行環境隨飛地銷毀。

技術意義不在於又一個 Gemini 分數,而是讓封閉模型接受未曝光的資安、CBRNE、自殘及暴力等高敏感測試,同時避免題庫進入供應商日誌或後續訓練資料。這也可讓銀行、政府或研究機構在不移交資料主權的情況下測試外部模型。

安全飛地並非完全「無需信任」。CPU、GPU 廠商的根金鑰與底層封閉韌體仍是信任基礎;可信運算基礎任何一層有漏洞,保密及完整性都可能失效。技術報告亦指出,現階段主要瓶頸已由不到 5% 的已引用運算開銷,轉為法律協議、程式碼逐方核准與人工協調。工程團隊下一步應關注可重現建置、輸出洩漏限制、證明撤銷機制,以及這套流程能否擴展至需要 activation probing 或逐 token log-likelihood、而不只是黑箱輸出的評估。

來源

  1. Piloting the world's first double-blind AI evaluations
  2. The key to trustworthy AI evaluation is secrecy by design
  3. Double Blind Evals: Resolving the Dual Confidentiality Dilemma in AI Safety Auditing