AI 評測
MatrAIx 以 1,290 維屬性合成 83 億 persona,開源百萬筆核心集測試 AI 產品
MatrAIx 將相關人口屬性組合成 83 億筆模擬使用者,並讓 persona 代理操作問卷、聊天機器人、網站與應用程式。團隊開放約百萬筆核心資料與評測程式,但目前驗證只能證明代理遵循指定角色,不能證明其可取代真人測試。

新釋出的 [MatrAIx](https://arxiv.org/abs/2608.04205)試圖把 AI 評測從固定問答擴展至「不同使用者如何操作產品」。其 Persona 8B 以 1,290 個類別屬性描述人口、裝置、職業、偏好及行為背景;紀錄一部分取自人類撰寫的公開個人資料,其餘由保留屬性相依性的圖模型取樣。所謂 83 億是可生成的 persona 紀錄總量,不是 83 億名真人,也不是逐筆人工蒐集的資料。
系統另提供 Survey、AI Chatbot、Web 與 App 四種互動環境,以及橫跨商務、軟體、金融和醫療等逾 25 個領域的 1,010 項應用任務。研究以 Claude Opus 4.8、GPT-5.5 和 Claude Haiku 4.5 執行八個代表任務,共取得 18,189 次評測軌跡。400 次受控測試中,persona 代理在十項行為屬性上有 366 次正確表現或抑制指定行為,遵循率為 91.5%。[開源儲存庫](https://github.com/MatrAIx-ai/MatrAIx-Persona-8B)包含評測基礎設施、任務範例與 MIT 授權程式;團隊也在 [Hugging Face](https://huggingface.co/datasets/MatrAIx2026/MatrAIx2026)提供約百萬筆品質篩選核心集,其中 599,847 筆為 human-grounded、40 萬筆為合成資料。
技術價值在於可對同一版聊天代理或前端流程進行大規模、條件化的回歸測試,尋找只在特定背景或裝置設定出現的失敗。但角色遵循不等於人類行為預測準確:主要驗證樣本只有 400 次,部分品質判定仍依賴 LLM 裁判,模型也可能把刻板印象放大成「族群反應」。工程團隊應把它定位為覆蓋率工具,並以真人研究校準高風險結論。