Privacy-Preserving Clothing Classification using Vision Transformer for Thermal Comfort Estimation
本文提出了一种基于视觉 Transformer(ViT)的隐私保护服装分类方法,该方法通过在加密图像上保持高精度来实现以居住者为中心的安全热舒适控制,从而克服了传统隐私保护图像分类方案通常伴随的严重精度下降问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你希望家里的空调保持完美的舒适温度,但又不想把家人的照片展示给管理该系统的公司。这正是本文所要解决的问题。
以下是他们如何实现这一点的简略故事:
问题:“玻璃屋”困境
为了让房间感觉恰到好处,供暖和制冷系统需要知道人们穿着什么。厚重的外套意味着房间需要更暖一些;而 T 恤则意味着房间可以凉快一些。
通常,摄像头会拍摄人们的照片来推测他们的穿着。但是,将原始照片发送到云服务器,就像把日记交给陌生人阅读一样。这是一场隐私噩梦。
科学家们曾尝试通过在发送前对照片进行加扰(加密)来解决这个问题。然而,这里有一个陷阱:加扰通常会破坏试图读取照片的“大脑”(即人工智能)。 这就像当有人把拼图碎片切成微小且无法辨认的碎块时,你试图去拼凑它。旧方法在读取加扰照片方面表现极差,导致人工智能的猜测准确率几乎有一半是错误的。
解决方案:“乐高积木”大脑
本文的作者发现了一种新的照片加扰方法,不会破坏人工智能的“大脑”。他们使用了一种特殊类型的人工智能,称为视觉 Transformer(ViT)。
可以将普通的人工智能(如 CNN)想象成一名侦探,它像一次读一个字母那样,逐个像素地查看照片。如果你打乱了字母的顺序,侦探就无法读懂故事。
然而,视觉 Transformer 就像一名侦探,它以大块(像乐高积木一样) 的方式查看照片。它并不关心积木内部微小像素的确切顺序;它只关心整个积木的形状和颜色。
魔法技巧:秘密洗牌
以下是他们方法的巧妙之处:
- 设置: 人工智能开发者使用一个预训练的“大脑”,并用一个秘密密钥将其锁定。
- 加扰: 当用户想要检查自己的着装时,他们会将照片切割成那些相同的“大块乐高积木”。然后,利用秘密密钥,他们打乱这些积木的顺序,并混合每个积木内部的像素。
- 类比: 想象一张猫的照片。旧方法会将其变成静态噪点。而这种方法将其变成一张猫头在左侧、尾巴在右侧、毛发颜色不同的照片,但猫的形状依然存在。
- 结果: 因为视觉 Transformer 只关注大块积木,所以即使照片在人类眼中看起来是一团混乱的加扰图像,它仍然能够识别出“猫”(或“外套”)。
他们的发现
研究人员在一个庞大的服装照片数据库上测试了这种方法,将其分为四组:无袖、短袖、长袖和厚重外套。
- 旧方法(基于像素): 当他们加扰照片时,人工智能的准确率显著下降。对于厚重外套,其准确率从 73% 降至 65%。它难以区分毛衣和夹克。
- 新方法(基于 ViT): 当他们使用新的“乐高积木”洗牌法时,人工智能的准确率达到了95.65%。
- 奇迹: 加扰照片的准确率与原始未加扰照片的准确率完全相同。加扰完全没有损害人工智能的能力。
结论
本文表明,我们现在可以将“加扰”的照片发送到云端,以判断人们穿着什么从而调节温度,而不会削弱人工智能正确猜测的能力。
这就像将一个上锁且打乱顺序的拼图发送给一位拥有特殊技能的朋友,他能瞬间解开谜题,同时让其他人无法看到图片内容。这使得在保护隐私的同时,拥有智能、舒适的家居成为可能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。