PriDyG: Privacy-preserving Dynamic Graph Inference with LLM-GNN Collaboration
PriDyG est un cadre de préservation de la vie privée pour l'inférence de graphes dynamiques qui combine l'apprentissage structurel basé sur les GNN avec le raisonnement sémantique basé sur les LLM pour atteindre une confidentialité différentielle au niveau des arêtes avec un coût cumulatif constant, surpassant de manière significative les bases de référence existantes en termes d'utilité tout en atténuant l'accumulation de la perte de confidentialité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez l'internet comme une carte géante de connexions en perpétuel changement. Certaines lignes sur cette carte sont des amitiés, d'autres sont des transactions financières, et certaines sont des consultations médicales secrètes. Cette carte est appelée un « graphe », et les ordinateurs l'utilisent pour faire des prédictions, comme deviner avec qui vous pourriez vouloir devenir ami ou quel produit vous achèterez ensuite. Mais voici le hic : si vous demandez à un ordinateur d'étudier cette carte de trop près, il pourrait accidentellement révéler ces lignes secrètes, exposant ainsi des relations privées. Pour empêcher cela, les scientifiques utilisent un bouclier mathématique appelé « Confidentialité Différentielle » (Differential Privacy). Imaginez cela comme l'ajout d'un peu de bruit statique à un signal radio ; cela rend le signal juste assez flou pour que personne ne puisse entendre un secret spécifique, mais assez clair pour comprendre toujours la musique générale.
Le problème devient plus complexe lorsque la carte ne cesse de changer. Dans le monde réel, de nouvelles amitiés se forment et de nouvelles transactions ont lieu chaque seconde. Si un ordinateur essaie de mettre à jour ses prédictions chaque fois qu'une nouvelle ligne est tracée, il doit examiner toute la carte encore et encore. Chaque fois qu'il regarde, le bouclier de confidentialité s'affaiblit un peu et le bruit devient un peu plus fort, jusqu'à ce que les prédictions deviennent des données inutiles. Cet article s'attaque à la grande question : comment pouvons-nous continuer à mettre à jour nos prédictions sur une carte changeante sans épuiser la confidentialité ou nous noyer dans le bruit ?
Les auteurs de cet article, Yuyang Xia, Ruixuan Liu et Li Xiong, proposent un nouveau système ingénieux appelé PriDyG. Au lieu d'essayer de forcer l'ordinateur à rescanner toute la carte désordonnée chaque fois qu'une nouvelle ligne apparaît, ils ont construit une équipe en deux parties. Une partie est un « détective structurel » (un Réseau de Neurones sur Graphe) qui observe les connexions, et l'autre est un « lecteur sémantique » (un Grand Modèle de Langage) qui lit les descriptions textuelles des personnes ou des articles concernés.
Voici comment leur tour de magie fonctionne. Le « détective structurel » est celui qui a besoin du bouclier de confidentialité car il observe les connexions secrètes. Habituellement, chaque fois que la carte change, ce détective doit réexaminer l'ensemble, ce qui consomme le budget de confidentialité et ajoute tellement de bruit qu'il finit par être confus. PriDyG change la donne en utilisant un système de « tampon » (buffer). Au lieu de relire toute la carte, le système regarde simplement les nouvelles lignes arrivées depuis la dernière vérification. Il calcule la différence et l'ajoute à la réponse précédente, comme lorsqu'on met à jour un tableau de score en ajoutant simplement les nouveaux points plutôt qu'en recomptant tout le match. Cela signifie que le coût de la confidentialité reste le même, peu importe le nombre de mises à jour de la carte.
Cependant, cette méthode de « différence » n'est pas parfaite ; elle manque certaines connexions complexes et à longue distance qu'un balayage complet capterait. C'est là que le second membre de l'équipe, le « lecteur sémantique », intervient. Ce lecteur ne regarde que les descriptions textuelles publiques (comme la biographie d'une personne ou la description d'un produit) et ignore totalement les connexions secrètes. Comme il ne touche pas aux données privées, il n'a besoin d'aucun budget de confidentialité ! Il agit comme un filet de sécurité. Lorsque le détective structurel devient trop flou ou incertain à cause du bruit, le système s'appuie davantage sur l'opinion du lecteur sémantique.
L'article montre que cette collaboration fonctionne incroyablement bien. Lors de tests sur quatre ensembles de données différents (incluant des réseaux sociaux et des catalogues de produits), PriDyG a réussi à maintenir la précision de ses prédictions même lorsque le graphe changeait des milliers de fois. Il a prouvé qu'en combinant une mise à jour structurelle respectant la confidentialité avec un lecteur de texte exempt de contraintes de confidentialité, on peut maintenir une haute précision sans que le coût de la confidentialité ne devienne incontrôlable. Les auteurs ont constaté que cette méthode est bien meilleure que les anciennes méthodes de préservation de la confidentialité, qui aboutissaient généralement à un ordinateur si bruyant qu'il ne pouvait plus faire de prédictions utiles après quelques mises à jour. Ils ont démontré que leur approche maintient le coût total de la confidentialité constant, quel que soit le nombre de mises à jour, tout en délivrant des résultats compétitifs par rapport aux systèmes qui n'utilisent aucune protection de la confidentialité.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.