据研究团队发布在 arXiv 的论文,哈佛大学、麻省理工学院以及 OpenAI、谷歌 DeepMind 等机构参与的团队推出了名为 MatrAIx 的模拟用户评估系统。该系统的核心数据集 Persona 8B 包含约 83亿条人格记录,每条记录由1290个分类维度描述,用于生成具有不同背景、偏好和行为特征的模拟用户。

这83亿条记录并不代表83亿个拥有独立意识的数字人,也不是对现实个体的一一复制。论文将 MatrAIx 定义为面向 AI 系统和数字产品的“大规模模拟用户评估基础设施”。其中部分人格记录来自人类撰写的用户画像,其他记录则通过保留属性相关性的依赖图进行采样。研究团队同时发布了一个经过质量筛选、约100万条记录组成的核心数据集,其中包括599847条基于真人资料构建的记录和40万条合成记录。
MatrAIx Playground 提供四类交互环境,分别是问卷、AI 聊天机器人、网页和 App。论文还整理了覆盖25多个领域的1010项应用任务,涉及电商、软件、金融和医疗等场景。在论文报告的实验中,团队围绕8项代表性任务开展了18189次评估试验,模拟人格由 Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5 等大语言模型驱动。
研究团队重点验证了模拟用户是否能够稳定表现出预设的人格特征。在一项包含400次测试的对照研究中,测试覆盖10个行为属性和全部四类交互环境,模拟用户在366次测试中表现出相应特质,或在不相关场景中正确抑制该特质,整体符合率为91.5%。论文举例称,这类模拟可以观察不同人格背景的用户在涨价后是否犹豫、AI 助手出错后是否继续使用,以及对响应延迟的容忍程度。
这项工作的实际价值,主要在于降低数字产品依赖真人大规模测试的成本和时间,并让评估覆盖更多用户差异。不过,91.5%的结果衡量的是预设人格特征在实验中的遵循程度,并不等同于模拟行为已经准确还原真实人类行为。论文也将 MatrAIx定位为评估工具,而非能够完整预测社会运行的“人类世界模拟器”。