← 最新论文
🤖 AI

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

针对本地文件系统中 AI 助手个性化训练数据匮乏的难题,本文提出了 FileGram 框架,通过构建可模拟真实工作流的 FileGramEngine 引擎、基于文件行为轨迹的 FileGramBench 评测基准以及从原子操作直接构建用户画像的 FileGramOS 记忆架构,实现了基于细粒度文件行为轨迹的 Agent 个性化与记忆增强。

原作者: Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 FileGram 的新框架,它的核心目标是让 AI 助手真正变成你的“数字生活伴侣”,而不仅仅是一个只会听指令的机器人。

为了让你更容易理解,我们可以把现在的 AI 助手比作一个刚入职的实习生,而 FileGram 则是让这位实习生变成懂你心意的老搭档的一整套方案。

以下是用通俗语言和生动比喻对这篇论文的解读:

1. 核心痛点:为什么现在的 AI 不够“懂”你?

想象一下,你有一个新来的实习生(AI 助手)。

  • 现状:你每次跟它说话,它都只记得你刚才说了什么(对话记录)。如果你让它整理文件,它只能看到你当下的指令。
  • 问题:它不知道你的习惯。比如,你习惯把文件按日期命名,还是按项目分类?你是喜欢把文件层层嵌套(像俄罗斯套娃),还是喜欢全部平铺在桌面上?
  • 后果:因为缺乏这些深层的“行为记忆”,每次你都要重新解释一遍你的喜好,它无法主动帮你预判需求,协作起来很生疏。

FileGram 的突破点:它不再只盯着“对话”,而是盯着你在电脑里实际做了什么(比如你打开了哪个文件、修改了哪行字、把文件拖到了哪个文件夹)。它把这些行为痕迹变成了 AI 的记忆。


2. FileGram 的三大法宝(三大组件)

为了解决上述问题,作者设计了三个核心部分,我们可以把它们想象成打造“超级实习生”的三个步骤:

第一步:FileGramEngine(模拟训练场)

  • 比喻“全息模拟训练室”
  • 作用:在现实世界中,收集每个人的电脑操作数据非常困难(因为涉及隐私,没人愿意把私人文件给 AI 看)。所以,作者造了一个“模拟训练室”。
  • 怎么做:他们设定了 20 种不同性格的“虚拟人”(有的喜欢井井有条,有的喜欢随性发挥),让 AI 在这些虚拟人的指导下,在模拟的电脑里进行成千上万次操作。
  • 成果:生成了海量的“行为数据”,让 AI 学会观察:哦,原来“喜欢整理的人”会频繁创建文件夹,而“随性的人”喜欢直接覆盖旧文件。

第二步:FileGramBench(终极考试)

  • 比喻“行为侦探考试”
  • 作用:以前测试 AI,主要是看它能不能回答对话问题(比如“昨天我们聊了什么?”)。现在,FileGram 设计了一套新考试,专门考 AI 能不能通过文件操作猜出用户的习惯。
  • 考什么
    • 理解:给你一堆文件操作记录,你能猜出这个人是“强迫症”还是“随性派”吗?
    • 推理:如果用户突然改变了一个习惯(比如以前喜欢存 PDF,现在突然开始存视频),AI 能发现这个变化吗?
    • 多模态:不仅看文字,还要看图片、视频文件的操作记录。
  • 现状:目前的顶尖 AI 在这套考试里表现一般,说明这确实是个很难的领域。

第三步:FileGramOS(记忆大脑)

  • 比喻“三层记忆法”
  • 作用:这是 AI 真正干活时用的“大脑架构”。以前的 AI 喜欢把长长的操作记录总结成一段话(比如“用户今天整理了很多文件”),但这会丢失细节。FileGramOS 采用了自下而上的方法,把记忆分成三层:
    1. 程序层(Procedural):记动作习惯。比如“这个用户每次写报告前,都会先搜索 3 个关键词”。这是像肌肉记忆一样的统计规律。
    2. 语义层(Semantic):记内容风格。比如“这个用户喜欢写长文章,语气很正式,喜欢用表格”。
    3. 情景层(Episodic):记时间线。比如“上周三用户突然开始整理旧照片,这可能是因为要搬家了”。
  • 优势:当用户问“帮我找去年的合同”时,AI 不会只搜文件名,而是会结合“你平时喜欢把合同放在‘财务’文件夹”(程序层)和“你最近正在处理税务”(情景层)来精准定位。

3. 实验结果:为什么它更厉害?

论文做了大量测试,发现了一个有趣的现象:

  • 传统方法(只记对话总结):就像让实习生只记“老板今天很忙”,结果老板让他找文件,他完全不知道老板习惯把文件藏在哪。
  • FileGramOS(记行为细节):就像实习生记下了“老板每次找文件前都会先按日期排序”。
  • 结果:FileGramOS 在识别用户习惯的准确率上(约 60%)显著高于其他方法(约 45%-50%)。特别是当需要发现用户习惯突然改变(比如从“喜欢嵌套文件夹”突然变成“喜欢扁平化”)时,FileGramOS 能敏锐地捕捉到,而其他 AI 往往反应迟钝。

4. 总结与展望

FileGram 的核心思想是

不要只听用户说什么,要看用户做什么。

通过观察你在电脑里留下的每一个微小痕迹(打开、删除、重命名、修改),AI 可以构建出一个立体的、动态的“用户画像”。

未来的愿景
想象一下,未来的 AI 助手不再是等你下指令,而是当你刚打开电脑,它就自动帮你把今天的会议资料整理好,并提示:“根据你上周的习惯,这些文件可能需要按项目归档,我已经帮你建好文件夹了。”

这就是 FileGram 想要实现的——从“工具”进化为“懂你的同事”。虽然目前还在实验室阶段(主要用模拟数据),但它为未来个性化 AI 的发展指明了一条清晰的路:扎根于文件系统的行为痕迹,让记忆变得真实而具体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →