ECN-BENCH: Design, Systems Engineering, and a Forensic Audit of Multi-Agent Forecasting
ECN-BENCH 论文对一个多智能体预测测试床进行了系统工程审计,揭示了基于大语言模型的概率提取对配置选择和评估器选择高度敏感,从而削弱了近均匀预测的可靠性,并限制了比较性能结果的统计显著性。
2275 篇论文
ECN-BENCH 论文对一个多智能体预测测试床进行了系统工程审计,揭示了基于大语言模型的概率提取对配置选择和评估器选择高度敏感,从而削弱了近均匀预测的可靠性,并限制了比较性能结果的统计显著性。
本文介绍了 DiligenceProv,这是一种利用带有注册缺陷的合成交易室(synthetic deal rooms)进行构建的新型基准测试方法,旨在评估并提升大语言模型在高风险金融尽职调查中的可验证性、证据检索能力以及定义准确性。
本文提出了一种鲁棒的多层音频加密算法,该算法结合了用于初始密钥生成的洛伦兹混沌系统与基于异或(XOR)的混淆技术,以及利用 Elzaki 变换和双曲麦克劳林级数展开的第二层技术,通过实验验证和对比性能分析展示了其高安全性和高效率。
本文提出了 TADNet,一种层次化编码器-解码器网络,该网络集成了一个带有透明度感知注意力和结构特征增强模块的级联 Swin-Transformer 编码器,以有效解决透明物体深度补全中的深度噪声和几何畸变问题,并在 ClearGrasp 和 TransCG 数据集上实现了卓越的性能。
本结构化综述批判了现有对工具使用型大语言模型智能体评估中未能证实其关于防止未经授权资源影响之主张的问题,并提出了最小授权保证剖面(MAAP)作为一个新颖的、基于证据的框架,旨在标准化执行语义、观察边界及残余假设的报告,以实现透明的安全比较。
本文提出了一种“验证优先”的智能体 RAG 框架,该框架通过集成确定性验证智能体来确保城市网络物理系统的监管准确性并防止幻觉,证明了其在废止检测和合规推理方面较现有方法具有更优越的性能。
这项针对土耳其政治话语的跨语言智能体审计表明,虽然提示词语言对生成式人工智能响应的政治立场影响极小,但会显著改变模型所依赖的证据来源,且模型身份和用户人格对最终输出的影响力比提示词本身的语言更为强烈。
本研究提出了一种基于集成学习模型、并利用 SMOTE 技术进行增强的预警决策支持框架,该框架通过在 OULAD 数据集上进行训练,旨在有效预测第一季度阶段性节点处处于风险中的学生表现,并证明了 LightGBM 在识别需要及时学术干预的学生方面具有卓越的准确性。
本文提出了一种用于 6G 边缘网络的创新框架,该框架集成了保护隐私的联邦学习、基于灰狼优化算法的信任模型优化以及许可链技术,旨在实现针对对抗性攻击的鲁棒、弹性且私密的信任管理。
本文表明,基于大语言模型的概念映射系统通过将候选集构建为可比较且可排除的格式,可以显著减少针对不可映射术语的过度对齐错误,这一设计原则被证明比单纯提供正确答案或改进检索更为有效。