BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement
本文介绍了 BRA-Audit,这是一个具备预算感知能力的运行时审计框架,它通过优化大语言模型多智能体系统中的审计点放置,以最小化累积未检查暴露,从而在保持高性能和有效故障定位的同时,显著降低 Token 成本。
1327 篇论文
从化学符号 Cs 到玛雅文明 Ma,本板块汇聚了跨越物理、材料、天体及考古等多领域的最新研究成果。这些论文源自 arXiv 预印本服务器,代表了科学界最前沿的探索,往往在正式发表前就已展现出惊人的创新性。
Gist.Science 致力于让每一份来自 arXiv 的新增预印本都触手可及。我们不仅提供详尽的技术性解读,更将其转化为通俗易懂的中文摘要,帮助不同背景的读者快速把握核心发现,无需被晦涩的术语阻挡在科学大门之外。
以下是该分类下最新收录的论文列表,欢迎浏览这些连接科学与大众的精彩成果。
本文介绍了 BRA-Audit,这是一个具备预算感知能力的运行时审计框架,它通过优化大语言模型多智能体系统中的审计点放置,以最小化累积未检查暴露,从而在保持高性能和有效故障定位的同时,显著降低 Token 成本。
本文介绍了开放策略独裁者博弈(Open-Strategy Dictator Game),在该博弈中,自然语言策略是相互可见并由大语言模型进行裁决的,通过锦标赛分析证明了在相互透明的环境下,条件合作策略始终优于无条件策略。
本文提出了 UC-PSRO,一个用于为对抗性无人机集群生成博弈论行动方案的框架,该框架结合了自我博弈、效用调节以及通信丢包课程,并揭示了虽然通信丢包显著增强了在退化环境中的鲁棒性,但自我博弈和效用调节带来的额外复杂性目前导致了收敛成本,且并未展现出统计学意义上显著的鲁棒性收益。
本文提出了一种在 GNSS 受限环境下,通过利用预先勘测且具有伪装匹配特征的胆甾相球形反射器 (CSR) 标记来纠正漂移,并将异构 LiDAR 里程计与稠密重建轨迹对齐至统一坐标系的实时地理参考框架,从而实现了超过 97% 的重访不一致性降低。
本文提出了 KC-BFPRL,一种知识引导的双层强化学习框架,通过将复杂的修复面积最大化问题分解为分层规划任务,有效地协调多无人机机群进行大规模草地修复,从而实现了比现有先进方法更高的效率和约束满足度。
本文提出了 MELD,一种自管理协议,它使分布式自主智能体能够通过可审计的补丁和基于 CRDT 的状态跟踪来协调并合并其知识图谱,在实现高召回率和存储效率的同时,能够在没有中央协调器的情况下保留矛盾以供后续裁决。
该论文提出了 VCE-Skill,这是一个通过将特定任务的执行轨迹与从公开技能版本历史中蒸馏出的结构化经验进行自适应融合,从而增强智能体技能自我进化的新颖框架,最终实现了显著的性能提升和更强的跨模型迁移能力。
本文表明,超过10,000个在不同社区中相互作用的AI智能体的集体行为,可以通过统计力学形式化方法得到准确预测和解释,并揭示了由智能体最小化社会压力倾向所驱动的三种截然不同的动力学机制(冷漠、极化和共识)。
本文介绍了“重建”(Reconstruction),这是一个旨在测试语言模型是否仅凭其发表前的参考文献就能恢复已发表论文核心研究思想的盲测基准,结果表明,虽然单模型取得的成功较为有限,但结合了跨模型评审和锦标赛选择机制的多智能体流水线将恢复率显著提升至 23–42%。
本文介绍了 MACAT 和 MACataRT,这两个是人机协作生成式人工智能系统,旨在通过优先考虑伦理参与和艺术完整性的个性化、小数据集训练,来增强实时音乐表演与协作即兴创作。