SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors
SJEPA 是一种无需重构的联合嵌入预测架构,它通过将符号定律与正则化神经修正相结合来学习优雅的潜在动力学,从而在预测保真度、表示质量和符号简约性之间实现可控的权衡,同时通过算子压缩来防止表示崩溃。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
=== 摘要 ===
技术总结:SJEPA —— 通过混合符号-神经预测器学习优雅的潜在动力学
1. 问题定义
联合嵌入预测架构(JEPA)通过从上下文嵌入预测目标嵌入来学习抽象状态,从而将预测语义与像素级变异性分离。然而,标准的 JEPA 通常采用不透明的神经转换模型。虽然这些模型很准确,但它们无法揭示哪些变量在相互作用、动作如何改变未来,或者所学习的坐标是否支持简洁的动力学描述。
本文解决了一个特定的差距:JEPA 能否不仅学习预测状态,还能学习这些状态之上的“优雅”动力学? 在这里,“优雅”被操作性地定义为一种紧凑、简约且对于预测仍然足够的法则。挑战在于:如何在不导致表示坍缩(为了使转换变得平凡而抹除信息)或动力学欠拟合的前提下,找到最简单的充分控制法则。
2. 方法论:SJEPA 框架
作者引入了 符号 JEPA (SJEPA),这是一个无重构的框架,它将潜在转换算子分解为符号控制律与正则化神经修正的混合体。
2.1 混合预测器架构
给定上下文嵌入 和侧向信息 (例如,动作、时间偏移),目标嵌入 的预测公式为:
- 符号律 (): 一个具有结构 (来自算术、多项式、超越函数或特定领域原语的语法)和系数 的紧凑表达式。它捕捉主导的、可复用的动力学。
- 神经修正 (): 一个神经网络,用于修正符号语法无法充分表达的影响(例如摩擦力、未解决的相互作用或近似误差)。
2.2 受约束的算子压缩
核心原则是受约束的算子压缩。目标是在确保表示保持信息化且不坍缩的同时,最小化转换算子的复杂度。
优化问题公式化为:
- 目标: 最小化符号复杂度 和对修正项的依赖 。
- 预测约束 (): 防止欠拟合;模型必须具备足够的准确性。
- 表示约束 (): 防止编码器将状态坍缩为常数向量以使转换变得平凡。这通过正则化(例如 VICReg 式的方差保持)来强制执行,以确保状态保持信息化且非坍缩。
2.3 学习策略
该框架支持两种模式:
- 端到端交替学习: 联合优化编码器(表示)与符号/神经动力学。过程在以下两者之间交替:
- 动力学搜索: 固定编码器,为当前坐标寻找最简单的符号律。
- 空间搜索: 固定符号结构,更新编码器使表示能够支持更简单的转换。
- 冻结编码器学习: 使用预训练的编码器(如 ViT, DINO, I-JEPA),仅学习符号律和修正项,作为衡量现有表示是否暴露了紧凑动力学的诊断工具。
2.4 贝叶斯扩展
本文提出了一个贝叶斯公式,将不确定性置于符号结构、系数和高斯过程 (GP) 修正之上。这使得模型在数据不足以确定单一法则时,能够保留多个竞争性的解释。
3. 关键理论见解
- 预测坐标的不可识别性: 预测坐标不是唯一的;任何可逆的潜在空间变换都能保持预测准确性。然而,转换律的符号复杂度会随坐标系的变化而变化。算子压缩作为一种归纳偏置,用于选择使转换最简单的坐标。
- 坍缩捷径: 如果没有显式的表示约束,最小化算子复杂度会产生直接的表示坍缩捷径。编码器可以将所有观测映射为常数向量 ,从而使恒等预测器以零复杂度实现零误差。表示约束对于防止这种坍缩至关重要。
- 分配控制: 动力学在符号组件与神经组件之间的分解无法仅通过预测损失来识别。需要对修正项进行正则化 (),以防止神经组件吸收符号语法本可以表达的动力学,从而确保符号律保留主导机制。
4. 实验结果
作者使用受控的单摆实验验证了该框架。
实验 1:联合坐标与方程学习
- 设置: 一个具有高维、噪声观测值的单摆系统。对比了 Neural JEPA、事后符号回归(对冻结的 Neural JEPA 坐标进行拟合)以及 SJEPA(联合学习)。
- 发现:
- 简洁性: 与事后拟合相比,联合 SJEPA 将平均符号复杂度降低了约 5.6 倍(从 26.0 降至 4.67)。
- 准确性: 虽然灵活的 Neural JEPA 在原始预测方面最为准确,但 SJEPA 在物理状态展开误差和分布外 (OOD) 偏差方面显著低于事后符号回归。
- 坍缩验证: 一个无约束的一步诊断(移除表示约束)导致了近乎常数的嵌入和零向量场,证实了理论上的坍缩捷径。
实验 2:语法误设下的混合动力学
- 设置: 真实的动力学包含了二次阻尼 (),但符号语法被刻意限制,排除了该项。
- 发现:
- 正则化效应: 在有修正正则化的情况下,符号组件保留了可表示的项(如 ),而神经修正专注于残余阻尼。归一化修正能量比很低 (0.06)。
- 无正则化: 在无正则化的混合模型中,神经修正吸收了可表示的动力学,导致符号系数缩小,修正能量比上升至 0.55。
- 结论: 正则化成功控制了分配,为可表示的动力学保留了符号机制,同时利用神经组件处理残余部分。
5. 重要性与主张
本文声称 SJEPA 为 JEPA 家族提供了一个互补的方向,区别于标准的神经预测器或事后符号拟合。
- 可控权衡: SJEPA 并不声称在原始预测准确性上具有普遍优于灵活神经网络的地位。相反,它提供了一个在预测保真度、表示质量、符号简洁性和符号-神经分配之间的可控权衡。
- 优雅动力学: 它证明了算子压缩可以选出诱导出简单且充分动力学的预测坐标,前提是表示约束能防止坍缩。
- 可解释性: 所得模型提供了紧凑、可检查的控制律(例如振荡器式的交叉耦合),这些控制律可以被微分、线性化并用于规划,不同于不透明的神经预测器。
- 模块化: 该框架是模块化的,支持交替学习、冻结编码器、贝叶斯不确定性和动作条件控制。
作者保持了谦逊,指出实验是在特定的单摆系统上进行的受控诊断,而向高维视觉数据、现实世界科学数据集以及复杂控制任务的泛化仍是未来的工作。其主要贡献是将“学习最简单的充分动力学”形式化为一个平衡算子压缩与表示完整性的约束优化问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。