Multi-Tenant Edge-Cloud Hybrid LLM Serving using Speculative Decoding and Quantization
本文提出了一种多租户边云混合大语言模型(LLM)推理架构,该架构结合了 W4A16 量化投机采样解码、异步通信以及多租户验证编排器,旨在同时解决隐私、延迟和资源利用率方面的挑战。
2456 篇论文
本文提出了一种多租户边云混合大语言模型(LLM)推理架构,该架构结合了 W4A16 量化投机采样解码、异步通信以及多租户验证编排器,旨在同时解决隐私、延迟和资源利用率方面的挑战。
本文介绍了 JPAL-HA,这是一种用于安全关键环境的安全学习模型,它利用人类行为解释来生成假设性查询,从而在显著提高安全性和样本效率的同时,减轻了人类的训练负担。
本研究表明,利用可解释机器学习分析项目级安全气候数据,揭示了由管理响应性、培训和经验驱动的非线性、阈值依赖型行为风险模式,这挑战了传统的线性聚合模型,并为主动事故预防提供了更精确的基础。
本文提出了一种稀疏 正则化的二次曲面支持向量机(QSVM),旨在解决无核非线性分类中的过拟合与可解释性问题,并引入了一种具有可证明最优性和收敛保证的惩罚分解算法,该算法在基准数据集和真实信贷数据集上均展示了具有竞争力的性能与稀疏性。
本文通过一项基于 PRISMA 的系统综述,揭示了当前以听觉为中心的解决方案对聋哑学习者的局限性,并提出了一种集成语音识别、自然语言处理和手语生成的 AI 驱动多模态通信框架,旨在实现实时视觉支持,从而在课堂中实现真正的包容。
本文揭示了标准的基于骨架的评估方法通过错误地将化学异质性的“无骨架”分子视为单一单元,引入了一种隐藏的分配偏差,从而扭曲了常见基准测试中的泛化指标,并提出了一种“空骨架感知”修复方案,以恢复平衡的表示和准确的性能评估。
本文介绍了 C3Q-MARL,这是一个连通性感知框架,它将基于图论的拓扑控制与受 QAOA 启发的优化模块集成到多智能体强化学习中,以增强在部分可观测性和通信约束下的无人机集群协同、避障及连通性保持能力。
本研究首次对 BCCD 数据集上的 YOLOv11 和 YOLOv12 变体进行了逐尺度基准测试,结果表明,尽管它们的整体平均性能几乎相同,但 YOLOv12 在针对延迟敏感型应用的纳米级(nano)尺度上表现出色,而 YOLOv11 在中型和大型尺度上则优于其表现,这表明模型选择应由特定的尺度和召回率需求驱动,而非基于统一的优越性假设。
本文介绍了 RLHOARNet,这是一种基于 MONAI 的 3D U-Net 架构,其配备了一个轻量级残差边界细化模块,在 BraTS 2020 数据集的多模态脑肿瘤分割任务中实现了最先进的性能和实时推理速度。
FedHyperM 是一个面向边缘设备的隐私保护联邦学习框架,它通过采用基于超图的预测和模态敏感聚合来解决模态异构性问题,从而在准确率和 F1 分数方面显著优于现有基准模型。