← 最新论文
💬 NLP

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

本文介绍了 ProfileFoundry,这是一个确定性生成器及包含 10 万个合成、跨领域一致的“人物对象”的固定参考发布版本,旨在通过克服真实用户数据和不一致的合成替代方案的局限性,实现对基础模型在记忆、隐私和工具使用任务方面的负责任评估。

原作者: Sriram Selvam, Anneswa Ghosh

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sriram Selvam, Anneswa Ghosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图拍摄一部复杂家庭剧的导演,但你不能使用真人。你不能使用真实演员的私人照片、他们的实际住址或他们真实的家谱,因为那会构成严重的侵犯隐私。如果你只是编造随机的名字和数字,故事就会崩塌,因为“哥哥”可能住在不同的国家,而“妹妹”却住在别处;或者“丈夫”的工作与他的年龄完全不匹配。

ProfileFoundry 就像是一个高科技的数字木偶工厂,它解决了这个问题。

以下是它的工作原理,通过简单的概念进行拆解:

1. “数字木偶”(人物对象)

它不仅仅是给你一个虚假的名字和虚假的地址,ProfileFoundry 构建的是一个完整的、相互关联的数字人。你可以把它想象成一个自带属性的“数字木偶”,它拥有:

  • 快照: 他们现在的状态(职业、地址、年龄)。
  • 家谱: 谁是他们的父母、兄弟姐妹和配偶。
  • 住户: 谁和他们住在一起。
  • 历史: 他们的人生时间线(何时搬家、何时结婚、何时更换工作)。
  • 连接图谱: 他们如何与其他“木偶”建立联系(例如:“这个人与那个人在同一家公司工作”)。

其核心在于一致性。如果木偶说自己 25 岁,他就不可能有博士学位(因为这通常需要更长的时间);如果他已婚,系统知道谁是他的配偶,并确保配偶的年龄逻辑合理。

2. “主蓝图”(生成器)

论文描述了一个确定性生成器。把它想象成一位在盖房子之前先绘制蓝图的总建筑师。

  • 第 1 步: 建筑师决定:“我要建造一个四口之家:两位父母和两个成年子女。”
  • 第 2 步: 基于这个决定,系统填充细节。父母拥有共同的地址;子女与父母建立关联。
  • 第 3 步: 系统根据当前年龄倒序编写他们的人生故事(例如,他们不可能在出生前就搬到了新城市)。

这确保了如果你询问系统:“显示所有与父母同住的人”,它给出的列表在逻辑上是成立的。

3. “安全沙盒”(为什么我们需要它)

研究人工智能(如大语言模型)的研究人员需要测试各种功能,例如:

  • 记忆力: AI 在 100 次对话后还能记得用户的名字吗?
  • 隐私: AI 是否会无意中泄露一个虚构人物的地址?
  • 工具使用: AI 能否为特定的人正确使用日历应用?

为了测试这些,他们需要数据。但他们不能使用真实的人类数据(这是违法且不道德的)。如果使用随机的虚假数据,测试就会失败,因为数据看起来不像真实生活(例如,AI 会感到困惑,因为“父亲”竟然比“儿子”还要年轻)。

ProfileFoundry 提供了一个安全沙盒,其中包含 10 万个虚构人物。这就像是一个 AI 的训练健身房,这里的“重量”(数据)既沉重又真实,但没有任何真实的人面临风险。

4. “审计追踪”(收据)

这项研究中最酷的部分之一是它的可追溯性
通常,当你生成虚假数据时,它是一个“黑箱”。你得到了结果,但不知道它是如何生成的。ProfileFoundro 随附了每一个人的**“收据”**。

  • 它准确说明了是哪一个“种子”(随机数起始值)创造了他们。
  • 它证明了“哥哥”和“妹妹”是同时生成的,而不是分别生成的。
  • 它会检查是否会出现两个虚构人物意外拥有完全相同的生日和姓名的情况(即“碰撞”)。
  • 它使用特殊的电子邮件地址(如 name@profilefoundry.example),这些地址保证是虚构的,绝不会属于真实存在的任何人。

它不是什么

作者非常明确地说明了这个工具不是什么:

  • 不是一个能完美预测人类行为的预言球。它是一种模拟,而不是人口普查。
  • 不是一个隐私屏蔽器。你仍然不能用这些虚假名字去给真实的人打电话或欺骗银行。
  • 不是为特定游戏或电影制作的成品。它是一种原材料(一种“基质”),研究人员可以用它来构建自己的测试。

核心总结

ProfileFoundry 是一个可重复使用、可审计且具有一致性的虚构人物集,旨在帮助研究人员安全地测试 AI。它就像是给科学家们提供了一盒 10 万个制作精良、相互关联的人体模型,这样他们就可以练习手术(或者在这种情况下,练习 AI 测试),而无需接触任何真实的人类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →