Multi-Agent LLM Collaborative Reasoning and Task Planning for Complex Task Solving
本文提出了一种多智能体大语言模型框架,其特征在于在基于依赖关系的、具有校准参数和共享内存机制的任务图上运行不同的规划者、执行者和验证者角色,通过提高完成率、准确性和事实一致性并减少工具错误,该框架在解决复杂任务方面显著优于单智能体基准模型。
2456 篇论文
本文提出了一种多智能体大语言模型框架,其特征在于在基于依赖关系的、具有校准参数和共享内存机制的任务图上运行不同的规划者、执行者和验证者角色,通过提高完成率、准确性和事实一致性并减少工具错误,该框架在解决复杂任务方面显著优于单智能体基准模型。
该论文介绍了 Stratum-eval,这是一个面向临床机器学习的“规范优先”评估框架,它要求在计算任何性能指标之前,必须制定一份经过验证的规范说明文档,以明确定义使用场景、公平性权衡以及利益相关者边界,从而确保在模型部署前建立起伦理与监管的一致性。
本文介绍了 ISVEX,这是一种全面的漏洞评分方法,其具备“强力型(Strong)”和“轻量型(Lite)”两种变体,旨在通过定制的多指标框架,对模型操纵、数据投毒和智能体漏洞等独特的 AI 风险进行量化,从而解决现有标准的特定局限性。
本文提出了一种用于自主机器人的并行思维轨迹引导自学习框架,该框架将一个主思维系统与并行的自学习(Auto Learning)和显性学习(Obvious Learning)子系统相结合,以高效地将推理轨迹转化为可执行模型,从而在保持高任务成功率的同时,显著降低延迟和高层推理的调用次数。
该论文提出了 SWST-Net,一种语义感知的小波驱动网络,该网络利用离散小波变换在语义先验的引导下分离并交互式地重建图像结构与纹理,从而在多个数据集的图像修复任务中实现了卓越的性能。
本文提出并验证了一种去中心化的点对点熵生成器,该生成器利用提交-揭示协议和混合聚合技术,为基于区块链的游戏提供统计均匀、低成本且具备抗攻击能力的随机性,在经济效率和安全性方面均优于 Chainlink VRF 等中心化预言机。
本文提出了时空协作网络(STC-Net),该网络通过自适应脉冲神经元模块和高阶时空融合模块将帧模态与事件模态进行集成,以在挑战性条件下实现最先进的目标跟踪性能。
本文引入了一种场景驱动的评估方法,用于将生成式人工智能(GenAI)生成的测试套件与人工编写的测试套件进行对比,结果表明,虽然直接提示策略能恢复更多的预期行为,但“先构思后实现”策略能产生更高效、重复项更少的测试套件,而“仅构思”方法则能有效地发现额外的测试场景。
本文介绍了 QUAMET,这是一种结合结构与语义分析来建立软件度量标准并检测量子程序中六种类型代码异味的新颖方法,该方法已在包含 4,102 个真实世界 Qiskit 项目的精炼数据集上得到了验证。
本文提出了一种意识基础设施神经系统(CINS)框架,该框架利用家庭负担数据而非传统的设施指标,显著提高了海德拉巴非正规定居点人工智能驱动的水资源匮乏检测的公平性与准确性,从而弥合了生活体验与机构决策之间的差距。