← नवीनतम पेपर
💻 computer science

SecCodePRM: A Process Reward Model for Code Security

SecCodePRM एक सुरक्षा-उन्मुख प्रोसेस रिवॉर्ड मॉडल है जो कार्यात्मक शुद्धता से समझौता किए बिना भेद्यता पहचान (vulnerability detection) और सुरक्षित कोड जनरेशन में सुधार करने के लिए कोड ट्रेजेक्टरीज के साथ सूक्ष्म, स्टेप-स्तरीय फीडबैक प्रदान करता है।

मूल लेखक: Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को उच्च-दांव वाला कानूनी अनुबंध (legal contract) लिखना सिखा रहे हैं।

अधिकांश वर्तमान AI उपकरण एक "फाइनल एग्जाम" ग्रेडर की तरह काम करते हैं: छात्र पूरा 50 पन्नों का दस्तावेज़ लिखता है, उसे जमा करता है, और फिर शिक्षक अंत में एक बड़े लाल "FAIL" के साथ उसे अंक देते हैं। छात्र निराश है क्योंकि उसे पता नहीं है कि वह कहाँ गलत हुआ, और जब तक उसे फीडबैक मिलता है, तब तक वह पूरा काम खत्म कर चुका होता है।

SecCodePRM एक "लाइव सुरक्षा कोच" की तरह है जो छात्र के बगल में बैठा है, हर उस वाक्य को देख रहा है जिसे टाइप किया जा रहा है।

समस्या: "सब-कुछ-या-कुछ-भी-नहीं" का जाल (The "All-or-Nothing" Trap)

वर्तमान में, जब AI कोड लिखता है, तो हम आमतौर पर केवल तभी जाँचते हैं कि क्या वह "सुरक्षित" है जब वह पूरी तरह से समाप्त हो जाता है। यह दो कारणों से समस्याग्रस्त है:

  1. यह बहुत देर हो चुकी होती है: यदि AI पेज 1 पर कोई सुरक्षा संबंधी गलती करता है, तो यह अगले 10 पन्नों तक उसी गलती के ऊपर एक "ताश का महल" बनाने में समय बिता सकता है।
  2. यह "अधूरे" काम के प्रति अंधा है: अधिकांश सुरक्षा उपकरणों को स्कैन करने के लिए पूरे प्रोग्राम के काम करने की आवश्यकता होती है। लेकिन वास्तविक दुनिया में, डेवलपर्स एक बार में कोड के छोटे टुकड़ों पर काम करते हैं। वर्तमान उपकरण एक ऐसे जासूस की तरह हैं जो पूरे शहर के बनने तक अपराध की जांच करने से इनकार कर देता है।

समाधान: "सिक्योरिटी जीपीएस" (SecCodePRM)

शोधकर्ताओं ने एक प्रोसेस रिवॉर्ड मॉडल (PRM) बनाया है। तैयार उत्पाद को देखने के बजाय, यह मॉडल प्रक्रिया (process) को देखता है।

इसे एक खतरनाक इलाके में गाड़ी चलाने वाले ड्राइवर के लिए जीपीएस (GPS) की तरह समझें:

  • पारंपरिक AI: एक मानचित्र की तरह है जो केवल आपको बताता है कि "आप अपने गंतव्य पर पहुँच गए हैं" या "आप दुर्घटनाग्रस्त हो गए।"
  • SecCodePRM: एक जीपीएस की तरह है जो लगातार कहता है, "सावधान, आप एक संदिग्ध सड़क पर मुड़ रहे हैं," या "धीमे हो जाइए, वह चौराहा जोखिम भरा लग रहा है।"

यह हर एक कदम (हर लाइन या कोड ब्लॉक) के लिए एक "सुरक्षा स्कोर" निर्धारित करता है। यदि AI कोड की ऐसी लाइन लिखना शुरू करता है जो हैकर्स के लिए "बैकडोर" खोल सकती है, तो SecCodePRM तुरंत उस "भेद्यता संकेत" (vulnerability signal) का पता लगा लेता है और उसे कम स्कोर देता है।

यह कैसे काम करता है (द "सीक्रेट सॉस")

शोधकर्ताओं ने इस "कोच" को दो चतुर तरीकों से प्रशिक्षित किया है:

  1. "सुधार" से सीखना: उन्होंने मॉडल को कोड का एक "खराब" संस्करण और एक "सुधारा हुआ" संस्करण दिखाया। उनकी तुलना करके, मॉडल ने सीखा कि कौन सी विशिष्ट लाइन "जहर" थी और कौन सी लाइन "अमृत" थी।
  2. "जोखिम-संवेदनशील" कान: जब मॉडल कोड के एक लंबे हिस्से को देखता है, तो वह केवल औसत नहीं निकालता। यह "रिस्क-सेंसिटिव एग्रीगेशन" का उपयोग करता है। इसका मतलब है कि यदि यह एक छोटी, अत्यधिक खतरनाक गलती देखता है, तो यह दस छोटी, हानिरहित टाइपो की तुलना में अधिक जोर से चिल्लाता है। यह "रेड अलर्ट" को प्राथमिकता देता है।

यह क्यों मायने रखता है (द "विन-विन")

आमतौर पर, AI में, एक "सुरक्षा बनाम उपयोगिता" (Safety vs. Utility) ट्रेड-ऑफ होता है। यदि आप AI को बहुत सुरक्षित बनाते हैं, तो यह "बोरिंग" या "बेकार" हो जाता है (जैसे एक कार जो एक कंकड़ से डरकर गाड़ी चलाने से मना कर देती है)। यदि आप इसे बहुत उपयोगी बनाते हैं, तो यह खतरनाक हो जाता है।

SecCodePRM इस ट्रेड-ऑफ को तोड़ देता है। क्योंकि यह प्रक्रिया के दौरान फीडबैक प्रदान करता है, इसलिए AI:

  • भेद्यताओं का पता लगा सकता है उस कोड में भी जो अभी तक पूरा नहीं हुआ है।
  • सुरक्षित कोड बना सकता है विभिन्न विचारों को "रैंक" करके और उच्चतम संचयी सुरक्षा स्कोर वाले विचार को चुनकर।
  • स्मार्ट बना रहता है: यह जटिल, कार्यात्मक कोड लिखने की अपनी क्षमता नहीं खोता है; यह बस रास्ते में आने वाले "गड्ढों" से बचना सीख जाता है।

संक्षेप में: SecCodePRM AI को फाइनल एग्जाम में फेल होकर सीखने वाले छात्र से बदलकर, एक पेशेवर में बदल देता है जो वास्तविक समय में एक मास्टर क्राफ्ट्समैन के मार्गदर्शन का पालन करके सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →