Research and Development of High-Efficiency Compressed Transmission Technologies for Holographic Communication in Beyond 5G Networks
本报告概述了北海道大学在NICT资助下,关于开发超越5G网络中全息通信高效率压缩传输技术的项目研究成果,并以面向广泛受众的通俗易懂的形式呈现了专业发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给你的朋友发送一个完美的、三维的兔子全息图。在过去,这就像是为了展示一张图片而邮寄了一整个图书馆的书籍。数据量如此巨大,以至于会堵塞互联网,而且用于生成它的计算机需要花费数小时才能完成单帧画面。
这份来自北海道大学的报告描述了他们如何构建了一个“魔法流水线”来解决这些问题,旨在为下一代互联网(Beyond 5G)实现全息电视(Holo-TV)的现实。
以下是他们是如何做到的,通过简单的概念进行了拆解:
1. “通用翻译官”(通用数据格式)
问题: 想象一下你正在给朋友发送一部电影。如果你的朋友有一台巨型电视、一部平板电脑或一副眼镜,你通常需要专门为他们的设备重新编辑这部电影。如果你有1000个拥有1000种不同设备的朋友,你就必须制作1000个不同的版本。这是不可能实现的。
解决方案: 研究人员为光创造了一个“通用翻译官”。他们不是发送针对特定屏幕定制的电影,而是从广播站发送一个单一的、原始的“光之配方”(称为物体光/Object Light)。
- 运作方式: 把这个配方想象成一套关于光在你的眼睛里“应该”呈现何种样子的指令。当信号到达你的设备(无论是头戴式显示器还是桌面投影仪)时,你的设备就像是一个翻译官。它接收那个通用的配方,并立即将其转换为其屏幕所需的特定格式。
- 结果: 广播商只发送一个信号,但每个用户都能在其特定的设备上获得完美的3D图像。
2. “超级快厨房”(高速计算)
问题: 制作这些全息图就像是在烤一个蛋糕,而你必须计算每一粒面包屑的精确路径。对于实时视频,这样做过去需要耗费数小时。
解决方案: 他们利用由18块强大的图形处理器(GPU)组成的集群构建了一个庞大的“厨房”,这就像是有90,000名厨师在协同工作。
- 窍门: 他们像组装流水线一样组织这项工作。当一组厨师在准备食材时,另一组在烹饪,还有一组在摆盘。
- 结果: 他们成功地在不到一秒的时间内(约25帧每秒)“烹饪”出了全一秒的全息视频。这意味着屏幕上的“兔子”可以跳跃、弹跳并移动,且没有延迟。
3. “魔镜”(真实的反射)
问题: 在现实世界中,光线会从门把手或汽车保险杠等曲面反射。旧的计算机方法难以计算这些反射路径,导致全息图看起来很扁平或虚假。
解决方案: 他们开发了一种新的数学技巧,用于追踪从曲面镜中反射的光线。
- 类比: 想象一下,如果你把球扔向一面弯曲的墙,尝试预测球会如何反弹。他们没有靠猜测,而是使用了名为“Bézier裁剪”(Bézier clipping)的方法来完美映射曲线。
- 结果: 他们创造了可以在其后方的镜子中看到兔子倒影的全息图,甚至能看到第二次反射的倒影。它看起来极其真实,具有正确的深度感和阴影。
4. “智能眼镜”(头戴式显示器)
问题: 如果你转动头部,3D图像需要立即更新,否则它看起来就像贴在你额头上的一个扁平贴纸。
解决方案: 他们制造了一款轻便的头戴式显示器(Holo-HMD),可以追踪你的头部动作。
- 窍门: 当你转头时,设备并不需要重新计算整个图像,而只是对光的角度进行微小的“微调”。
- 结果: 你可以向左、向右、向上或向下看,而3D兔子依然保持在原位。它的更新速度足够快(超过每秒30次),以至于你的大脑察觉不到计算机正在工作。
5. “懒眼”技巧(注视点渲染)
问题: 全息图需要海量的数据。传输一个4K全息图就像是在尝试串流一部8K分辨率的电影——这对于目前的网络来说太沉重了。
解决方案: 他们利用了基于人类视觉原理的技巧。你的眼睛只有在注视中心(即你正在看的地方)才能看到高细节度;而视野边缘则是模糊的。
- 类比: 想象你在画一幅肖像画。你用极高的细节度去描绘眼睛,但用宽阔、松散的笔触去处理背景。
- 结果: 计算机只计算图像中高细节度的“中心”部分。模糊的“边缘”则以较低的成本进行计算。这使数据量缩小了三倍以上,并使计算机运行速度提升了八倍,而你几乎感觉不到区别。
6. “漂浮的兔子”(现实测试)
证明: 他们不仅仅是在做数学题;他们还进行了测试。他们对一个人物和一个兔子进行了真实的3D扫描,通过他们的系统发送数据,并在头显上进行展示。
- 结果: 当研究人员移动头部时,兔子和人物随之移动,展现出不同的角度并躲在物体后面,就像现实生活中的物体一样。
总结
该项目成功构建了观看3D全息电视所需的“引擎”。他们解决了三个最大的障碍:
- 数据大小: 通过使用通用格式和“懒眼”压缩技术。
- 速度: 通过使用超级计算机集群和智能数学方法。
- 真实感: 通过计算复杂的反射并匹配人类视觉。
报告结论指出,虽然各个独立部分运行完美,但下一步是将它们全部连接成一个完整的、端到端的系统,向世界展示3D通信的未来景象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。