← 最新论文
💻 computer science

NEvo: Neural-Guided Evolutionary Video Synthesis for Dynamic Visual Selectivity

本文介绍了 NEvo,一种神经引导的进化框架,该框架通过合成旨在最大化特定视觉区域预测脑活动的动态视频刺激,从而揭示复杂的时空选择性,并推动了超越静态图像限制的动态视觉处理的计算机模拟探索。

原作者: Yingtian Tang, Sogand Salehi, Ming Zhou, Amir Zamir, Leyla Isik, Martin Schrimpf

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingtian Tang, Sogand Salehi, Ming Zhou, Amir Zamir, Leyla Isik, Martin Schrimpf

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你的大脑是一个庞大而繁忙的城市,每个社区都有专门负责的工作。有些社区是识别面孔的专家,有些则是捕捉移动物体的能手,还有些则致力于理解社交互动。长期以来,试图弄清楚这些社区是如何“运转”的科学家们,大多使用静态图像——比如举起一张猫的照片,看看“猫社区”是否会亮起来。但现实世界不是照片;它是电影。事物在移动、在变化、在互动。

这篇论文介绍了一个名为 NEvo 的新工具,它就像一个智能的进化导演,旨在寻找那些能让特定大脑区域产生极大兴奋感的完美“电影片段”。

以下是其工作原理的拆解,通过简单的概念进行说明:

1. “数字孪生”大脑

首先,研究人员利用计算机模型构建了一个人类大脑的数字孪生体。这个模型是基于真实人类在核磁共振(MRI)扫描仪内观看视频的数据训练而成的。你可以把这个模型看作一个超级精准的模拟器,它能预测:“如果我给这个人看这段特定的视频,他们大脑的这个特定部分会亮起多强的光。”

2. 进化搜索(自然之道)

与其手动尝试寻找完美的视频(这就像试图在一根根稻草中寻找针头,而不是一次只看一根),NEvo 使用了进化搜索

  • 提示词花园: 想象一个花园,每一株植物都是一段视频描述(例如:“一张微笑的面孔”、“一个旋转的楼梯”、“一条正在攻击的蛇”)。
  • 育种过程: NEvo 种植数以千计的这些描述。它要求“数字孪生体”模拟向大脑展示这些视频的过程。
  • 适者生存: 那些能让目标大脑区域亮起最强光芒的视频会被选为“父母”。NEvo 会将它们的描述进行混合与匹配(比如将“微笑”替换为“跳舞”)并加入微小的随机变化(突变)。
  • 结果: 经过许多代演化后,“视频描述”会进化成高度特异、具有超强激活能力的片段,它们被完美地调校到了符合大脑偏好的程度。

3. 两阶段策略:搭建舞台,然后表演

为了提高效率,NEvo 将这项工作分为两个幕次,就像一场戏:

  • 第一幕(静态锚点): 首先,它寻找大脑喜爱的完美静态图像。如果目标是“面孔区域”,它就会找到一张完美的脸部照片。
  • 第二幕(动态动作): 一旦找到了完美的脸,NEvo 就会锁定这张图像,转而只搜索完美的运动方式。这张脸是在微笑?在转头?还是在跳舞?
    这就像是先找好完美的演员,然后再导演他们的表演,以获得观众的最佳反应。

4. 他们发现了什么?

通过使用这种方法,研究人员不仅证实了已知的事实,还发现了关于大脑如何处理运动和社交互动的全新细节:

  • 运动的重要性: 他们发现,对于某些大脑区域来说,一段动态视频比同一事物的静态图片更能引起兴奋。这就像看汽车赛车和看汽车照片的区别;赛车会让大脑亮起来得多。
  • 社交高速公路: 他们沿着大脑侧边(“外侧流”)追踪了一条路径,并发现了一个清晰的递进过程:
    • 早期站点: 这些区域喜爱简单的、高对比度的纹理和图案。
    • 中间站点: 这些区域开始关注身体的移动和物理互动(例如人们在跳舞或打斗)。
    • 后期站点: 这些区域痴迷于复杂的社交动态,例如两人面对面交谈或协调一致的动作。
  • 从抽象到现实: 他们甚至用抽象形状(如两个漂浮的圆团)进行了测试。当他们要求“社交大脑”产生兴奋感时,这些圆团开始以看起来像脸部或协调互动的形式进行运动,这证明了大脑寻找的是社交模式,而不只是写实的图像。

核心结论

NEvo 是一个工具,它让科学家能够进行“计算机内”(in-silico)实验,去发现究竟什么样的动态、移动场景是人类大脑天生热爱的。它超越了静态照片,向我们展示了大脑是如何深度适应现实世界的节奏、运动和社交舞蹈的。该论文声称,这一框架允许创建新的、由假设驱动的视频刺激物来进一步测试这些理论,但它并未止步于将其应用于临床治疗或未来技术,而是专注于理解人类视觉机制本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →