आपके कीबोर्ड ने लाखों लोगों की टाइपिंग से सीखा और किसी ने कुछ पढ़ा ही नहीं। असहज बात यह है कि मॉडल फिर भी रिसा सकता है
🌐 Read this article in English
संक्षेप में: फ़ेडरेटेड लर्निंग मॉडल को डिवाइसों तक भेजकर और सिर्फ़ अपडेट वापस लेकर साझा मॉडल सिखाती है, जिससे कच्चा डेटा फ़ोन से बाहर नहीं जाता। यह लेख बताता है कि यह कैसे चलती है और असमान डिवाइस-डेटा तथा बीच में छूट जाने वाले फ़ोन इसे कठिन क्यों बनाते हैं, ख़ुद अपडेट उन उदाहरणों के बारे में जानकारी क्यों रिसाता है, सिक्योर एग्रीगेशन अलग-अलग योगदान कैसे छिपाता है, डिफ़रेंशियल प्राइवेसी असल में क्या गारंटी देती है और वह सटीकता का सौदा क्यों अनिवार्य बनाती है, और नाम हटाने से डेटा गुमनाम क्यों नहीं होता।
आपके फ़ोन का कीबोर्ड आपके इस्तेमाल किए शब्दों का अनुमान बेहतर लगाने लगता है — उन शब्दों का भी जो किसी शब्दकोश में नहीं हैं। यह किसी को उन शब्दों से सीखना पड़ा जो लोग सचमुच टाइप करते हैं। इसके लिए सबके संदेश किसी सर्वर पर भेज देना नाक़ाबिले-बर्दाश्त होता, और कुछ न सीखना घटिया उत्पाद देता। उद्योग का जवाब तकनीकों का एक ऐसा समूह है जिसे समझना ज़रूरी है — क्योंकि वह साफ़-साफ़ दो हिस्सों में बँटा है, और मशीन लर्निंग में निजता पर बात करने वाले लगभग सब लोग सिर्फ़ पहला हिस्सा जानते हैं।
मॉडल को डेटा के पास भेजिए
पहला विचार कह देने पर सीधा लगता है। डेटा एक जगह इकट्ठा करने के बजाय मौजूदा मॉडल उन डिवाइसों तक भेज दीजिए जिनके पास डेटा है।
हर फ़ोन उस मॉडल को अपने स्थानीय डेटा पर थोड़ा सिखाता है — आपके संदेश, आपके सुधार, आपकी आदतें — और वापस डेटा नहीं, अपडेट भेजता है: वह समायोजन जो उसकी अपनी ट्रेनिंग ने सुझाया। सर्वर ऐसे बहुत सारे अपडेट इकट्ठा करता है, उनका औसत निकालता है, उसे साझा मॉडल पर लगाता है, और सुधरा हुआ रूप दोबारा भेज देता है। कोई उदाहरण किसी डिवाइस से बाहर नहीं जाता। यही फ़ेडरेटेड लर्निंग है, और यह कोई प्रस्ताव नहीं है; मोबाइल कीबोर्ड और डिवाइस पर चलने वाले बोली-फ़ीचर सालों से इसी तरह चल रहे हैं।
यह जितना सुनाई देता है उससे कठिन है — और वजहें ज़्यादातर निजता से जुड़ी ही नहीं हैं।
डेटा सबसे बुरे ढंग से असमान बँटा है। आम ट्रेनिंग मानकर चलती है कि उदाहरणों का हर बैच पूरे डेटा का निष्पक्ष नमूना है। किसी एक व्यक्ति का फ़ोन बेहद अप्रतिनिधि नमूना है — एक भाषा, एक शब्द-भंडार, एक तरह की आदतें — इसलिए बिल्कुल अलग-अलग वितरणों पर निकाले गए अपडेट का औसत लेना सामान्य ट्रेनिंग जैसा बर्ताव नहीं करता। मॉडल भटक जाते हैं, और शोध-साहित्य का बड़ा हिस्सा इसे रोकने पर ही है।
डिवाइस सर्वर नहीं हैं। वे ऑफ़लाइन हो जाते हैं, बैटरी ख़त्म हो जाती है, नपे-तुले डेटा वाले कनेक्शन पर होते हैं। आप उन्हीं के साथ ट्रेनिंग करते हैं जो उस वक़्त उपलब्ध, चार्ज पर और अच्छे नेटवर्क पर हों — और यह अपने आप में आपके उपयोगकर्ताओं का पक्षपाती नमूना है।
अपडेट बड़े होते हैं। पूरे मॉडल जितनी संख्याएँ फ़ोन से बार-बार भेजना महँगा है, इसीलिए अपडेट को दबाकर छोटा करना डिज़ाइन का हिस्सा है, कोई बाद की सुविधा नहीं।
अपडेट मासूम नहीं है
यहीं वह मोड़ है जो मायने रखता है, और जिसे आम तौर पर छोड़ दिया जाता है।
अपडेट डेटा से निकाला गया है। वह उन्हीं ख़ास उदाहरणों का फलन है, इसलिए वह उनके बारे में जानकारी ढोता है। यह कोरी सैद्धांतिक बात नहीं: शोधकर्ताओं ने कुछ परिस्थितियों में ग्रेडिएंट से पहचानने लायक़ ट्रेनिंग इनपुट दोबारा बना लिए हैं, और अलग से यह भी दिखाया है कि सिखाए गए मॉडल दुर्लभ उदाहरण याद रख लेते हैं और उन्हें दोहरवाया जा सकता है। किसी व्यक्ति का असामान्य पासवर्ड, पता या चिकित्सा-ब्योरा ट्रेनिंग में एक बार भी आया हो, तो पर्याप्त ज़िद्दी सवाल उसे कभी-कभी बाहर खींच सकता है।
इसलिए "हम सिर्फ़ अपडेट भेजते हैं, डेटा नहीं" उजागर होने में असली कमी है, निजता की गारंटी नहीं। यह अपनी डायरी किसी को न देने और अपने हफ़्ते के बारे में कुछ भी न बताने के बीच का फ़र्क़ है।
डेटा छिपाना और यह छिपाना कि उस डेटा ने क्या किया — दोनों एक बात नहीं। किसी व्यक्ति के रिकॉर्ड से निकाली गई हर चीज़ उसके बारे में कुछ जानकारी ढोती है, और मॉडल रिकॉर्ड से निकाली गई ही चीज़ है।
अलग-अलग योगदान अदृश्य बनाना
दो और व्यवस्थाएँ इस खाई के अलग-अलग हिस्से भरती हैं।
सिक्योर एग्रीगेशन क्रिप्टोग्राफ़ी से यह कर देता है कि सर्वर हज़ारों अपडेट का जोड़ देख सके, पर उनमें से कोई एक न देख सके। डिवाइस आपस में ऐसे नक़ाब तय कर लेते हैं जो जोड़ने पर आपस में कट जाते हैं: हर एक का अपडेट बेतरतीब मानों से ढका रहता है, और जब काफ़ी अपडेट मिल जाते हैं तभी वे नक़ाब ग़ायब होकर कुल जोड़ सामने आता है। सर्वर को जो चाहिए वह मिल जाता है और वह बनावट से ही किसी एक योगदान को देख पाने में असमर्थ रहता है — जो अहम है, क्योंकि सर्वर चलाने वाला ख़ुद उन पक्षों में है जिनसे आप बचना चाह सकते हैं।
डिफ़रेंशियल प्राइवेसी बची हुई समस्या पर चोट करती है, और इसे ठीक से सीखना ज़रूरी है क्योंकि इसका नाम बहुत ढीले ढंग से लिया जाता है।
इसकी परिभाषा अभेद्यता का वादा है: कोई एल्गोरिदम डिफ़रेंशियली प्राइवेट है अगर उसका नतीजा लगभग उतना ही संभावित हो, चाहे किसी एक व्यक्ति का डेटा उसमें शामिल किया गया हो या नहीं। अगर आपका रिकॉर्ड नतीजे को पकड़ में आने लायक़ बदल ही नहीं सकता, तो नतीजा आपको धोखा भी नहीं दे सकता। यह सधे हुए हिसाब से बेतरतीब शोर मिलाकर हासिल किया जाता है — ट्रेनिंग के दौरान ग्रेडिएंट में, या आँकड़े जारी करने से पहले उनमें।
इससे तीन नतीजे निकलते हैं, और तीनों को नियमित रूप से ग़लत पेश किया जाता है।
यह एक बजट है। गारंटी की मज़बूती एक पैरामीटर है, और हर सवाल या हर ट्रेनिंग-चक्र उसमें से कुछ ख़र्च करता है। एक ही डेटा से पर्याप्त सवाल पूछिए और गारंटी घिसकर शून्य हो जाती है, क्योंकि बार-बार मिले जवाबों में शोर औसत होकर कट जाता है। निजता का हिसाब रखना ऐसी बहीखाता है जिसे छोड़ा नहीं जा सकता।
यह सटीकता की क़ीमत लेती है, साफ़-साफ़ और अनिवार्य रूप से। निजता के लिए मिलाया गया शोर वही शोर है जिसके इर्द-गिर्द मॉडल को काम करना पड़ेगा। ऐसी कोई सेटिंग नहीं जिसमें वही नतीजा मुफ़्त मिल जाए; ईमानदार इंजीनियरिंग सवाल यह है कि कितने उजागर होने के बदले कितनी उपयोगिता ख़रीदी जा रही है।
और यह प्रक्रिया का गुण है, किसी डेटासेट का नहीं। जारी की गई तालिका देखकर आप तय नहीं कर सकते कि वह डिफ़रेंशियली प्राइवेट है या नहीं। आपको यह जानना पड़ेगा कि उसे बनाने में किया क्या गया था।
"हमने गुमनाम कर दिया" कोई दावा नहीं है
यह व्यावहारिक हिस्सा है, और यही वह ग़लती है जो ज़्यादातर संस्थाएँ करती हैं।
नाम, फ़ोन नंबर और पहचान संख्याएँ हटा देने से डेटासेट गुमनाम नहीं होता। पीछे जो बचता है वह आम विशेषताओं के ऐसे मेल हैं जो लगभग अनोखे होते हैं। एक मशहूर विश्लेषण में पाया गया कि किसी राष्ट्रीय आबादी का बड़ा बहुमत सिर्फ़ पिन कोड, जन्मतिथि और लिंग से पहचाना जा सकता है। गुमनाम बताकर जारी किए गए डेटासेट — फ़िल्म रेटिंग, टैक्सी यात्राएँ, आवागमन के निशान — सार्वजनिक जानकारी से मिलाकर बार-बार दोबारा पहचाने जा चुके हैं, कभी जारी होने के सालों बाद; और उस मोड़ पर कुछ भी वापस नहीं लिया जा सकता।
डिफ़रेंशियल प्राइवेसी ठीक इसीलिए मौजूद है कि हटाने-आधारित गुमनामी चलती ही नहीं। फ़र्क़ ऐसे दावे और वैसे दावे का है — एक जिसे आप गणित में कहकर बचा सकते हैं, और दूसरा जो आपने उस फ़ाइल के बारे में बस कह दिया है जिसे आप साझा करने जा रहे हैं।
विद्यार्थियों और शोधकर्ताओं के लिए क्यों मायने रखता है
भारत में यह अब नैतिकता की संगोष्ठी का विषय नहीं रहा। डिजिटल पर्सनल डेटा प्रोटेक्शन अधिनियम व्यक्तिगत डेटा सँभालने पर ज़िम्मेदारियाँ तय करता है, यानी "क्या हम इस पर मॉडल सिखा सकते हैं?" का जवाब अब तकनीकी भी है और क़ानूनी भी — और तकनीकी जवाब तय करता है कि आपको बनाने की इजाज़त क्या है। स्वास्थ्य रिकॉर्ड, क्रेडिट और भुगतान का डेटा, टेलीकॉम के निशान और शिक्षा का डेटा — सब बड़े हैं, संवेदनशील हैं, और ठीक वही डेटासेट हैं जहाँ काम के मॉडल सबसे ज़्यादा मदद करते।
आम और महँगी ग़लती यह है कि व्यवस्था इस मान्यता पर गढ़ी जाए कि डेटा अभी इकट्ठा कर लेंगे और गुमनाम बाद में कर देंगे। हटाकर गुमनाम करना ऐसा क़दम नहीं जो आख़िर में जोड़ा जा सके; वास्तुकला कच्चा डेटा केंद्र से बाहर रखती है या नहीं रखती — और यह फ़ैसला बाद में बदलने का मतलब दोबारा बनाना है।
सीखने लायक़ आम हुनर सुनने से ज़्यादा सँकरा है: यह पहचान लेना कि निजता का कौन-सा गुण किसी प्रक्रिया के बारे में सिद्ध किया गया है और कौन-सा किसी नतीजे के बारे में बस कह दिया गया है। छपे हुए ज़्यादातर दावे दूसरी क़िस्म के हैं। कमरे में वह व्यक्ति होना जो इन्हें अलग कर सके, असामान्य रूप से क़ीमती है — और उसके लिए इन व्यवस्थाओं को समझना पड़ता है, उनके नाम याद रखना काफ़ी नहीं।
अक्सर पूछे जाने वाले सवाल
फ़ेडरेटेड लर्निंग क्या है?
यह साझा मॉडल को उन डिवाइसों तक भेजकर सिखाना है जिनके पास डेटा है; हर डिवाइस स्थानीय रूप से ट्रेनिंग करता है और सिर्फ़ मॉडल अपडेट वापस भेजता है, जिनका औसत केंद्र में लिया जाता है। कच्चा डेटा डिवाइस से बाहर नहीं जाता।
अगर डेटा मेरे फ़ोन से बाहर नहीं जाता, तो क्या मेरा डेटा निजी है?
पूरी तरह नहीं। वापस भेजा गया अपडेट आपके डेटा से निकला है और उसके बारे में जानकारी ढोता है, और सिखाए गए मॉडल दुर्लभ उदाहरण याद रख सकते हैं। फ़ेडरेटेड लर्निंग उजागर होना काफ़ी घटाती है, पर अकेले कोई गारंटी नहीं है।
डिफ़रेंशियल प्राइवेसी क्या है?
यह इस बात की गणितीय गारंटी है कि किसी एक व्यक्ति का डेटा शामिल हो या न हो, एल्गोरिदम का नतीजा लगभग बराबर संभावित रहेगा — और यह सधे हुए बेतरतीब शोर से हासिल होता है। यह प्रक्रिया का गुण है, किसी डेटासेट का नहीं।
डिफ़रेंशियल प्राइवेसी सटीकता क्यों घटाती है?
क्योंकि सुरक्षा जानबूझकर मिलाए गए शोर से आती है, और मॉडल या आँकड़े को उसी शोर के इर्द-गिर्द काम करना पड़ता है। ज़्यादा मज़बूत निजता का मतलब ज़्यादा शोर और कम बारीक़ी, इसलिए यह सेटिंग हमेशा एक स्पष्ट सौदा है।
क्या नाम हटा देना डेटा गुमनाम करने के लिए काफ़ी है?
नहीं। पिन कोड, जन्मतिथि और लिंग जैसी आम विशेषताओं के मेल ही ज़्यादातर लोगों को अनोखे ढंग से पहचान लेते हैं, और गुमनाम बताकर जारी किए गए डेटासेट दूसरी उपलब्ध जानकारी से मिलाकर बार-बार दोबारा पहचाने जा चुके हैं।