The World Is a Hypothesis: Epistemic Control for Executable World-Model Agents in Novel Interactive Environments
本文介绍了 THEA,一种由提示词定义的修正策略,它将可执行的世界模型视为可证伪的理论,用以编排父代理与专家子代理,在显著降低成本的同时,在 25 个 ARC-AGI-3 游戏中的 22 个上实现了最先进的性能,并确保假设修正过程是显式的、可审计的且具有成本效益的。
898 篇论文
本文介绍了 THEA,一种由提示词定义的修正策略,它将可执行的世界模型视为可证伪的理论,用以编排父代理与专家子代理,在显著降低成本的同时,在 25 个 ARC-AGI-3 游戏中的 22 个上实现了最先进的性能,并确保假设修正过程是显式的、可审计的且具有成本效益的。
这项受控研究表明,针对低标签细胞实例分割的预训练策略排名并非仅由骨干网络权重本身决定,而是关键性地取决于所使用的特定迁移与适配协议,同时也强调了标准评估上限显著低估了在密集显微图像上的性能表现。
这项针对公开基准数据集的元分析表明,与单一的特征提取方法和分类器相比,混合特征表示结合集成学习方法在检测虚假新闻方面提供了更优越的预测稳定性和有效性。
本文提出了一种用于图像篡改定位的新型两阶段模块化框架,该框架首先通过融合 RGB 和 SRM 特征的双流分类器对篡改类型进行分类,随后利用带有混合损失函数的专门化条件扩散模型来生成精确的篡改掩码,在基准数据集上实现了具有竞争力的性能。
本文提出了一种新颖的主动图像篡改检测与定位(AIMDL)框架,该框架利用 TransUNet 实现鲁棒的水印生成与恢复,并结合多头 UNet 取证模块,旨在实现高精度的篡改检测与像素级定位,同时动态平衡水印的透明度与鲁棒性。
本文介绍了 StrokePlan-RNN,这是一种以图像为条件的自回归模型,通过在一个新构建的数据集上进行训练,该模型成功地从静态面部线条画中预测有序的笔画序列,在实现高几何准确度的同时,也强调了改进过程性评估指标的必要性。
本文通过引入一个新的领域特定 PLASTIC 数据集并提出自适应训练控制器(ATC)——一种超越了 Optuna 等现有工具、在实现 ResNet101 高达 94.89% 准确率的同时降低了计算资源需求的与架构无关的自动调优框架——来解决塑料垃圾分类的挑战。
这项实证评估表明,尽管大语言模型在配备检索工具时能够识别出人类审查员遗漏的真实错误并显著提高研究召回率,但由于存在显著性偏差、跨论文混淆以及虚构不存在的不一致性等持续性问题,它们仍然无法成为人类验证的可靠替代品。
本文提出并验证了一种集成双向数字孪生、深度强化学习智能体以及可解释人工智能层的信息物理架构,用于优化急诊科调度,在证明其能显著降低高需求压力下的峰值占用率的同时,也批判性地揭示并解决了验证过程中出现的特定仪器伪影问题。
本文介绍了神经符号 MBST,这是一个通过集成 L* 学习、语法约束的大语言模型以及凸优化,将自然语言需求自动合成形式化验证的马尔可夫使用模型,从而实现高保真故障检测与覆盖率,在显著超越纯神经基准模型的同时,消除了安全关键系统中人工建模瓶颈的框架。