Nolege News

कंप्यूटर साइंस

आपकी फ़ीड चुनने वाला मॉडल पूरे भंडार का बड़ा हिस्सा देखता ही नहीं। उसे एक सस्ता मॉडल पहले ही फेंक चुका होता है

लेखक ·27 सितंबर 2026·10 मिनट का पठन

🌐 Read this article in English
आपकी फ़ीड चुनने वाला मॉडल पूरे भंडार का बड़ा हिस्सा देखता ही नहीं। उसे एक सस्ता मॉडल पहले ही फेंक चुका होता है

संक्षेप में: सिफ़ारिश करने वाली व्यवस्थाएँ चरणों में चलती हैं: एक सस्ता चरण लाखों चीज़ों को कुछ सौ तक घटाता है, और उसके बाद ही महँगा रैंकिंग मॉडल उन्हें अंक देता है। यह लेख बताता है कि यह बँटवारा अनिवार्य क्यों है और पहले चरण से छँटी चीज़ों का क्या होता है, कोलैबोरेटिव फ़िल्टरिंग साथ-साथ होने को ज्यामिति में कैसे बदलती है, कोल्ड स्टार्ट लोकप्रियता के झुकाव को संपादकीय नहीं ढाँचागत क्यों बना देता है, दर्ज किए गए क्लिक ऐसा चक्र कैसे बनाते हैं जिसमें मॉडल अपनी ही ग़लती का सबूत बनाना बंद कर देता है, और नियंत्रित प्रयोग ही इकलौती ईमानदार नाप क्यों है।

सिफ़ारिश करने वाली व्यवस्था लगभग निश्चित रूप से दुनिया में सबसे ज़्यादा तैनात मशीन लर्निंग है। वही तय करती है कि आगे क्या चलेगा, दुकान की सूची में क्या दिखेगा, और पिछला वीडियो ख़त्म होने से पहले कौन-सा लोड हो रहा है। "एल्गोरिदम" के बारे में हर किसी की एक राय है, और उनमें से लगभग कोई यह नहीं बताती कि वह व्यवस्था दिखती किस शक्ल की है — जो अफ़सोस की बात है, क्योंकि वह शक्ल इन रायों से ज़्यादा समझाती है।

अरबों चीज़ों को अंक देना मुमकिन नहीं

उस बंदिश से शुरू कीजिए जो पूरा ढाँचा तय करती है। जो मॉडल यह परखने लायक़ अच्छा है कि ख़ास आप को ख़ास यह चीज़ पसंद आएगी या नहीं, उसे चलाना महँगा है — वह आपका इतिहास देखता है, चीज़ के गुण, दिन का समय, दर्जनों या सैकड़ों संकेत। उस मॉडल को एक करोड़ चीज़ों के भंडार पर, हर अनुरोध पर, उस पल-भर के भीतर चलाना जितना उपयोगकर्ता बर्दाश्त करेगा — यह कई गुना असंभव है।

इसलिए कोई असली व्यवस्था ऐसा करती ही नहीं। हर काम-चलाऊ सिफ़ारिश व्यवस्था चरणों में बँटी है।

एक सस्ता रिट्रीवल चरण लाखों उम्मीदवारों को कुछ सौ तक घटा देता है, ऐसे तरीक़ों से जो उस पैमाने पर चल सकें। फिर महँगा रैंकिंग मॉडल उन्हीं कुछ सौ को अंक देकर क्रम में लगाता है। अक्सर एक तीसरा चरण अंतिम सूची में विविधता, ताज़गी या कारोबारी नियमों के हिसाब से फेरबदल करता है — क्योंकि दस लगभग एक जैसी चीज़ों की सूची अंकों में अच्छी लगती है और पढ़ने में बुरी।

नतीजा वही हिस्सा है जो छूट जाता है। अच्छा मॉडल वह कुछ भी नहीं देखता जिसे सस्ते मॉडल ने छाँट दिया। अगर रिट्रीवल किसी चीज़ को ऊपर नहीं ला पाया, तो आगे की कितनी भी परिष्कृतता उसे बचा नहीं सकती — वह उम्मीदवार ही नहीं थी। आपको जो दिखता है उसकी गुणवत्ता बड़े हिस्से में उसी पहले, भोथरे चरण से तय होती है — और यह ठीक वही ढाँचागत बात है जो RAG पर लागू होती है: चतुर पुर्ज़ा अपने आगे खड़े भोथरे पुर्ज़े से बेहतर नहीं हो सकता।

उम्मीदवार मिलते कैसे हैं

सबसे पुराना और आज भी सबसे अहम विचार है कोलैबोरेटिव फ़िल्टरिंग, और इसके लिए सामग्री को समझने की ज़रूरत ज़रा भी नहीं।

एक विशाल विरल तालिका बनाइए कि किसने किस चीज़ से जुड़ाव किया। आपको यह जानने की ज़रूरत नहीं कि दो फ़िल्में थ्रिलर हैं; आपको यह जानना है कि जिन लोगों ने एक देखी उन्होंने दूसरी भी देखी। यह साथ-साथ होना ही संकेत है। तालिका को गुणनखंडों में तोड़िए और हर उपयोगकर्ता तथा हर चीज़ के लिए संक्षिप्त वेक्टर मिल जाते हैं, ऐसे बिठाए हुए कि पास होने का मतलब "साथ-साथ आने की प्रवृत्ति" हो — और उस मोड़ पर सिफ़ारिश करना निकटतम पड़ोसी खोजना बन जाता है, ठीक जैसे सिमैंटिक सर्च में।

आज की व्यवस्थाएँ ज़्यादातर दो-मीनार मॉडल इस्तेमाल करती हैं: एक नेटवर्क उपयोगकर्ता को एन्कोड करता है, दूसरा चीज़ को, और उन्हें इस तरह सिखाया जाता है कि उपयोगकर्ता का वेक्टर उन्हीं चीज़ों के पास जा बैठे जिनसे उसने जुड़ाव किया। फ़ायदा सांख्यिकीय से ज़्यादा परिचालन का है — चीज़ों के वेक्टर पहले से निकालकर अनुक्रमित किए जा सकते हैं, यानी किसी अनुरोध पर सिर्फ़ एक उपयोगकर्ता एन्कोड करना और खोजना पड़ता है, पूरा भंडार अंकित नहीं करना पड़ता।

इसके साथ-साथ चीज़ के अपने गुणों पर आधारित रिट्रीवल भी चलता है, जो मुख्यतः उस हालत के लिए है जिसे कोलैबोरेटिव फ़िल्टरिंग सँभाल ही नहीं सकती।

कोल्ड स्टार्ट लोकप्रियता के झुकाव को ढाँचागत बना देता है

बिल्कुल नई चीज़ का कोई जुड़ाव-इतिहास नहीं होता। साथ-साथ होने की तालिका में उसकी पंक्ति ख़ाली है, इसलिए कोलैबोरेटिव संकेत कमज़ोर नहीं — नदारद है। बिल्कुल नए उपयोगकर्ता के साथ भी यही बात है।

इसलिए व्यवस्थाएँ उसी पर लौटती हैं जो उनके पास है: चीज़ के गुण, और लोकप्रियता। नई चीज़ें इसलिए दिखती हैं कि वे उन पुरानी चीज़ों जैसी हैं जो चल गई थीं, और जिनसे ज़्यादा जुड़ाव हुआ वे इसलिए दिखती हैं कि जुड़ाव ही वह संकेत है जो कभी ग़ायब नहीं होता।

इसे सावधानी से कहना ज़रूरी है, क्योंकि आम तौर पर इसे प्लैटफ़ॉर्म का मूल्य-निर्णय बताया जाता है। मुख्यतः यह वह नहीं है। लोकप्रियता का झुकाव विरल डेटा से निकलता है। जिस व्यवस्था के पास किसी चीज़ की कोई जानकारी नहीं है और जो औसतन सही होने के लिए बनी है, वह समझदारी से उसी चीज़ को चुनेगी जिसके बारे में सबूत मौजूद है — और असर चक्रवृद्धि में बढ़ता है, क्योंकि दिखाया जाना ही वह डेटा पैदा करता है जो उसे दोबारा दिखाने का आधार बनता है। इसे रोकने के जानबूझकर उठाए क़दम मौजूद हैं, और वे तुरंत नपने वाले प्रदर्शन की क़ीमत लेते हैं — इसीलिए उन्हें साफ़ फ़ैसले की ज़रूरत पड़ती है, वे अपने आप नहीं होते।

मॉडल इस पर नहीं सिखाया गया कि लोगों को क्या पसंद है। वह इस पर सिखाया गया है कि लोगों ने क्या किया — उन चीज़ों के बारे में जो उसने ख़ुद उन्हें दिखाने के लिए चुनी थीं।

वह चक्र जो अपनी ही ग़लती छिपा लेता है

यहीं इस क्षेत्र की सबसे गहरी समस्या है, और वह अनुकूलन की बात ही नहीं है।

ट्रेनिंग डेटा लॉग से आता है: चीज़ दिखाई गई, उपयोगकर्ता ने क्लिक किया या नहीं। पर जो चीज़ें दिखाई गईं वे मॉडल के पिछले रूप ने चुनी थीं। आपके पास भरपूर डेटा है कि मॉडल की पसंदीदा चीज़ें दिखाने पर क्या होता है, और उन चीज़ों के बारे में कुछ भी नहीं जिन्हें उसने दिखाने से मना कर दिया। जो अवलोकन गायब हैं वे बेतरतीब नमूना नहीं हैं — वे ठीक वही चीज़ें हैं जिन्हें व्यवस्था पहले ही कमज़ोर मान चुकी थी।

इसलिए जो मॉडल चीज़ों की किसी श्रेणी के बारे में ग़लत है, वह उस सबूत को पैदा करना ही बंद कर देता है जो उस ग़लती को उजागर करता। वह उन्हें कम दिखाता है, इसलिए उनका जुड़ाव-इतिहास नहीं बनता, इसलिए वे और कमज़ोर दिखती हैं, इसलिए वह उन्हें और कम दिखाता है। ग़लती ख़ुद को पुष्ट करने लगती है — और ऑफ़लाइन मूल्यांकन में दिखती भी नहीं, क्योंकि ऑफ़लाइन मूल्यांकन उन्हीं पक्षपाती लॉग पर चलता है।

इसके मानक जवाब सब अधूरे हैं और सब जानने लायक़ हैं। जानबूझकर खोज: कुछ जगहें उन चीज़ों के लिए रखिए जिनके बारे में मॉडल अनिश्चित है, और अभी की नपी-तुली क़ीमत चुकाकर जानकारी ख़रीदिए। महत्व के हिसाब से भार: दर्ज घटनाओं को इस हिसाब से दोबारा तौलिए कि पुरानी व्यवस्था उन्हें दिखाने की कितनी संभावना रखती थी — इससे कुछ पक्षपात सुधरता है, बशर्ते आपने वे संभावनाएँ दर्ज की हों, और वह तभी होगा जब किसी ने पहले से सोचा हो। ऑफ़-पॉलिसी मूल्यांकन: पुराने लॉग से अनुमान लगाइए कि नया मॉडल कैसा करता — जो सीमाओं के भीतर चलता है और तब नाकाम हो जाता है जब नया मॉडल सचमुच अलग चीज़ें दिखाना चाहे।

और वह जो बहस सचमुच ख़त्म करता है: नियंत्रित ऑनलाइन प्रयोग। चूँकि व्यवस्था ख़ुद उस डेटा को प्रभावित करती है जो उसे नापता है, ऑफ़लाइन माप अक्सर असली नतीजों से उलट बोलते हैं, और असली परीक्षण ही ईमानदार फ़ैसला देता है। जो टीमें इसे छोड़ देती हैं वे ऐसे "सुधार" तैनात कर देती हैं जो सुधार नहीं हैं।

जो नापा जा सकता है, उसी को साधना

संक्षेप में, क्योंकि यह वही नमूना है जिसकी बात इस साइट पर मॉडल-ट्रेनिंग के सिलसिले में हो चुकी है: जो संकेत जुटाना सबसे आसान है वह क्लिक है, और क्लिक इस बात का घटिया बदल है कि कुछ क़ीमती हुआ या नहीं। सीधे उसी को साधिए और ऐसी व्यवस्थाएँ मिलती हैं जो भड़काऊपन और पछतावे को इनाम देती हैं। जवाब में बहु-उद्देश्य ट्रेनिंग आई — देखने का समय, बाद में लौटकर आना, साफ़-साफ़ दी गई रेटिंग, सर्वे से अंशांकित संतुष्टि के अनुमान — जो मदद करती है और असली मुश्किल हल नहीं करती, क्योंकि जो चीज़ आप सचमुच बढ़ाना चाहते हैं वह महीनों में घटती है और किसी एक सिफ़ारिश के खाते में नहीं डाली जा सकती।

"फ़िल्टर बबल" का मतलब क्या है और क्या नहीं

लोकप्रिय कहानी में कोई मॉडल तय करता है कि आपकी दुनिया सँकरी कर दी जाए। ऐसा नहीं होता; उस व्यवस्था में किसी चीज़ की आपके विश्वदृष्टिकोण के बारे में कोई पसंद ही नहीं है। असली चीज़ ऊपर बताया गया चक्र है — जो व्यवस्था उसी से सीखती है जो उसने दिखाया, वह उसी को और दिखाने की ओर झुकती जाएगी, और विकल्प चुपचाप सबूत जुटाना बंद कर देंगे।

इससे लोगों के राजनीतिक रुझान नपने लायक़ बदलते हैं या नहीं, यह सचमुच विवादित है, और कई बड़े क्षेत्रीय प्रयोगों में असर लोकप्रिय कहानी के अनुमान से छोटा मिला है। चक्र पर कोई संदेह नहीं। व्यक्तिगत मान्यताओं पर उसके नतीजों पर है — और यह फ़र्क़ किसी भी दिशा में ढहाए बिना थामे रखने लायक़ है।

विद्यार्थियों और शोधकर्ताओं के लिए क्यों मायने रखता है

भारत में यह मशीनरी अब मनोरंजन से ज़्यादा कारोबारी नतीजे तय करने लगी है। किसी तीसरी श्रेणी के शहर के छोटे विक्रेता की चीज़ बाज़ार की सूची में कभी ऊपर आएगी या नहीं, किसी क्षेत्रीय भाषा के रचनाकार को दर्शक मिलेंगे या नहीं, कोई ऋण उत्पाद पहली बार क़र्ज़ लेने वाले तक पहुँचेगा या नहीं — ये सब रिट्रीवल और कोल्ड स्टार्ट से होकर गुज़रते हैं। इतिहास वाली चीज़ों की ओर ढाँचागत झुकाव का मतलब है हर नए के ख़िलाफ़ झुकाव — और तेज़ी से बढ़ते बाज़ार में "नए" ही ज़्यादातर होते हैं।

सीखने लायक़ सबक़ सिफ़ारिश व्यवस्थाओं से कहीं बड़ा है। जिस भी व्यवस्था के नतीजे उस डेटा को प्रभावित करते हैं जिस पर वह आगे सीखेगी, उसमें यही गुण आ जाता है: वह आत्मविश्वास के साथ, टिकाऊ ढंग से ग़लत हो सकती है, और उसके अपने माप उसे बताएँगे नहीं। क्रेडिट स्कोरिंग, भर्ती की छँटाई, पुलिस की तैनाती और धोखाधड़ी के नियम — सबकी बनावट यही है। इसे पहचान लेना — और यह जानना कि इलाज बेहतर ऑफ़लाइन अंक नहीं, बल्कि जानबूझकर की गई खोज तथा एक असली प्रयोग है — डेटा से कुछ बनाने वाले किसी के लिए भी सबसे क़ीमती आदतों में है।

अक्सर पूछे जाने वाले सवाल

सिफ़ारिश प्रणाली असल में कैसे काम करती है?

चरणों में। एक तेज़ रिट्रीवल चरण लाखों में से कुछ सौ उम्मीदवार चुनता है, फिर धीमा और ज़्यादा सटीक रैंकिंग मॉडल उन्हीं को अंक देकर क्रम में लगाता है। आख़िर में एक और चरण अक्सर सूची को विविधता या ताज़गी के हिसाब से ठीक करता है।

कोलैबोरेटिव फ़िल्टरिंग क्या है?

यह सामग्री के बजाय साथ-साथ जुड़ाव के नमूनों पर सिफ़ारिश करना है: अगर जिन लोगों ने एक चीज़ से जुड़ाव किया उन्होंने दूसरी से भी किया, तो उन दोनों को संबंधित माना जाता है। जुड़ाव की तालिका को वेक्टरों में तोड़ दिया जाता है, जिससे समानता दूरी बन जाती है।

कोल्ड स्टार्ट की समस्या क्या है?

यह किसी नई चीज़ या नए उपयोगकर्ता का जुड़ाव-इतिहास न होना है, जिससे कोलैबोरेटिव तरीक़ों के पास काम करने को कुछ बचता ही नहीं। व्यवस्थाएँ गुणों और लोकप्रियता पर लौट आती हैं, इसीलिए नए आने वालों को ढाँचागत नुक़सान होता है।

सिफ़ारिश प्रणालियाँ अपनी ही ग़लतियाँ क्यों पुष्ट करती रहती हैं?

क्योंकि वे उन्हीं लॉग पर सीखती हैं जो उनके दिखाए चुनावों से बने। जिन चीज़ों को मॉडल ने दिखाने से मना किया, उनका कोई जुड़ाव-डेटा नहीं बनता, इसलिए वे कमज़ोर दिखती रहती हैं और ग़लती वह सबूत कभी पैदा नहीं करती जो उसे सुधारता।

ऑफ़लाइन माप मौजूद हैं तो ए/बी परीक्षण क्यों ज़रूरी है?

क्योंकि ऑफ़लाइन माप उस डेटा से निकलते हैं जो पिछले मॉडल ने बनाया था, इसलिए वे उसका पक्षपात साथ लाते हैं। असली नियंत्रित प्रयोग ही वह नाप है जो बताता है कि नई व्यवस्था के चुनाव करने पर होता क्या है।