SemPix3D: Hybrid approach to generalized 3D aware image Synthesis and Generation using Conditional GAN
SemPix3D 提出了一种结合了用于 3D 感知标签图生成的神经辐射场与基于 StyleGAN 的生成器的混合框架,用以合成高质量且一致的多视图 RGB 图像,在多样性和 FID 分数方面较现有方法取得了显著提升。
2363 篇论文
SemPix3D 提出了一种结合了用于 3D 感知标签图生成的神经辐射场与基于 StyleGAN 的生成器的混合框架,用以合成高质量且一致的多视图 RGB 图像,在多样性和 FID 分数方面较现有方法取得了显著提升。
本文提出了一种改进的轻量化 YOLOv8n 模型,用于基于无人机的森林火灾检测,该模型集成了动态卷积、多感知检测头和跨空间注意力机制,旨在显著提高小目标检测精度并降低误报率,同时保持适合实时机载部署的紧凑尺寸。
该论文提出了 SCEESR,一种新型的一步扩散超分辨率框架,它利用 ControlNet 机制进行语义边缘引导,并使用混合损失函数,以在实际图像修复中有效平衡结构完整性、感知质量和推理速度。
本文提出了 FMA-DETR,一种自适应 Transformer 框架,该框架通过集成特征细化网络、多尺度空间-通道混合注意力模块以及自适应频率感知融合模块,以有效克服相干斑噪声和背景复杂性,从而实现合成孔径雷达(SAR)图像中高精度密集小目标检测。
本研究通过构建专门的数据集并采用自动化与人工评估相结合的方法,评估了各种大语言模型理解韩语间接言语行为的能力,结果表明,尽管像 Claude3-Opus 这样的闭源模型优于开源替代方案,但目前尚无模型能在解释依赖于语境的意图方面达到人类水平。
本文提出了 EGDIS,一种边缘引导的文档图像隐写方法,该方法利用自适应 Canny 算法和基于 Transformer 的交叉注意力融合网络将边缘特征与原始图像及秘密消息进行集成,从而在标准数据集上实现了卓越的嵌入性能和视觉质量。
本文提出了一种用于无人艇(USV)的自主避障决策方法,该方法结合了无人机视觉感知、基于优先经验回放增强的双重深度双Q网络(PD3QN)算法以及符合国际海上避碰规则(COLREGs)的奖励函数,以实现安全、高效且具适应性的航行。
本文提出了一种可解释的计算框架,该框架利用多感官触觉数据,特别是来自按压、静态和滑动交互的热学与顺应性线索,来有效地模拟人类材料感知并增强机器人的触觉识别。
本文提出了一个用于评估偏见检测的人工标注保加利亚语数据集,揭示了人类标注者之间的高度一致性,以及人类与大语言模型之间的显著分歧,同时证明了保加利亚语提示词能提高模型与人类判断的一致性。
本文提出了一种改进的基于 Informer 的模型,该模型结合了基于标准差的动态去噪算法和波动感知自适应采样机制,以增强企业成本预测的准确性和稳定性,并在企业数据集和基准数据集上均展示出优于现有方法的卓越性能。