मॉडल आपकी तस्वीर नहीं देखता। वह उसके छोटे-छोटे वर्गों के कुछ सौ सारांश देखता है
🌐 Read this article in English
संक्षेप में: दृष्टि-भाषा मॉडल किसी भी तर्क से पहले तस्वीर को पैच टोकनों की शृंखला में बदल देते हैं। यह लेख बताता है कि पैच बनाना और स्थिति दर्ज करना कैसे होता है, टोकनों का तय बजट रिज़ॉल्यूशन और ब्योरे के बीच सौदा क्यों बनाता है, टाइलिंग और थंबनेल इससे कैसे निपटते हैं, प्रोजेक्टर की मदद से भाषा मॉडल तस्वीर के टोकन शब्दों की तरह कैसे पढ़ लेता है, उसके बाद भाषा की पूर्व-धारणा हावी होकर न मौजूद वस्तुएँ और ग़लत पढ़े चार्ट कैसे पैदा करती है, तस्वीर के भीतर लिखा टेक्स्ट तस्वीर पर भारी क्यों पड़ जाता है, और नतीजे सचमुच किससे सुधरते हैं।
किसी बिल की तस्वीर लीजिए, चिपकाइए, और कुल रक़म पूछिए। मॉडल सही पढ़ देता है। अब वही काम किसी घने बिल के साथ कीजिए — छोटे अक्षर, ज़्यादा पंक्तियाँ, एक कॉलम पर पड़ी मुहर — और वह ऐसी रक़म लौटा देता है जो उस पन्ने पर कहीं नहीं है, और उतनी ही सहजता से कहता है जितनी सहजता से एक मिनट पहले सही रक़म कही थी।
पहला ख़याल इसे तर्क की नाकामी कहने का आता है। आम तौर पर यह वह नहीं है। जब तक कोई तर्क शुरू होता है, तस्वीर तब तक टोकनों की तय संख्या में बदल चुकी होती है — और जिन अंकों की आपको परवाह थी वे उस बदलाव में बचे ही न हों, यह मुमकिन है। जैसे टेक्स्ट में, यहाँ भी मॉडल के कुछ देखने से पहले तय हुआ प्रतिनिधित्व ही उसकी छत बाँध देता है।
तस्वीर एक शृंखला बन जाती है
ट्रांसफ़ॉर्मर शृंखलाएँ खाता है, इसलिए तस्वीर को शृंखला बनाना पड़ता है।
मानक तरीक़ा लगभग भोथरा है। तस्वीर को छोटे वर्गों की जाली में काट दीजिए — पैच, आम तौर पर चौदह या सोलह पिक्सल के किनारे वाले। हर पैच को संख्याओं की सूची में चपटा कर दीजिए, और उसे ऐसे सीखे हुए प्रक्षेपण से गुज़ारिए जो उसे उसी आकार का वेक्टर बना दे जिसे मॉडल हर चीज़ के लिए इस्तेमाल करता है। चपटा करने से यह समझ मिट जाती है कि पैच कहाँ से आया था, इसलिए उसकी जाली में जगह दर्ज करने के लिए एक स्थिति-एम्बेडिंग अलग से जोड़ दी जाती है।
पूरी तरकीब यही है। तस्वीर अब कुछ सौ वेक्टरों की शृंखला है, उसी गणितीय क्षेत्र में जिसमें टेक्स्ट के टोकन हैं, और वही आर्किटेक्चर दोनों सँभाल लेता है। इसी वजह से एक ही मॉडल एक तस्वीर और उसके बारे में सवाल, दोनों एक साथ ले पाता है।
पूरी कहानी टोकनों के बजट की है
यहीं वह नतीजा है जो रोज़मर्रा के बर्ताव का बड़ा हिस्सा समझा देता है। पैचों की तय संख्या का मतलब है जानकारी का तय बजट — और वह संख्या बड़ी नहीं है: पूरी तस्वीर के लिए कुछ सौ टोकन, जो मोटे तौर पर दो-तीन अनुच्छेद टेक्स्ट जितना ही पड़ता है।
इसलिए बड़ी तस्वीर को उसी बजट में निचोड़ना पड़ता है। उसे छोटा कीजिए और पैच से महीन हर चीज़ — बारीक़ छपाई, चार्ट की पतली लकीर, हाथ से लिखा कोई अंक — मॉडल के शुरू करने से पहले ही औसत में घुल जाती है। वह जानकारी कम अहमियत पर नहीं डाल दी गई; वह नदारद है, और कितनी भी सावधानी से प्रॉम्प्ट लिखने पर वापस नहीं आती।
आज के सिस्टम इससे टाइलिंग से निपटते हैं: ऊँचे रिज़ॉल्यूशन की तस्वीर को कई टाइलों में बाँटिए, हर टाइल को पूरे ब्योरे के साथ एन्कोड कीजिए, और साथ में पूरी तस्वीर का छोटा थंबनेल भी जोड़िए ताकि समग्र संदर्भ बना रहे। इससे सचमुच फ़ायदा होता है, और इसकी क़ीमत सीधे अनुपात में टोकनों में चुकती है — इसीलिए किसी ब्योरे-भरे दस्तावेज़ की तस्वीर आपकी कॉन्टेक्स्ट विंडो का उतना ही हिस्सा खा सकती है जितना कई पन्नों का लेखन।
इससे इन मॉडलों के साथ सबसे काम की आदत भी समझ आती है: जिस हिस्से की परवाह है उसे क्रॉप कर देने से सटीकता नाटकीय रूप से सुधर जाती है — वही मॉडल, वही सवाल। आपने मॉडल को होशियार नहीं बनाया। आपने पूरा बजट उसी हिस्से पर ख़र्च कर दिया जो मायने रखता था।
मॉडल आपकी तस्वीर नहीं देख रहा। वह उसके छोटे-छोटे वर्गों के कुछ सौ सारांश देख रहा है — और वर्ग से महीन जो कुछ था, वह तर्क शुरू होने से पहले ही जा चुका था।
तस्वीर और शब्द जुड़ते कैसे हैं
यह काम दो विचार करते हैं, और इन्हें अक्सर गड्डमड्ड कर दिया जाता है।
पहला है कंट्रास्टिव प्री-ट्रेनिंग: तस्वीर वाला एन्कोडर और टेक्स्ट वाला एन्कोडर साथ सिखाइए ताकि कोई तस्वीर और उसका कैप्शन एक ही साझा क्षेत्र में पास-पास बैठें। इससे तस्वीरों और उनके विवरणों का मिलान बहुत अच्छा होता है — और इमेज सर्च तथा इमेज जनरेटरों को टेक्स्ट से दिशा देना इसी पर टिका है।
दूसरा वह है जो आज के सहायक असल में इस्तेमाल करते हैं। दृष्टि-एन्कोडर पैच वेक्टर बनाता है, और एक छोटा सिखाया हुआ प्रोजेक्टर उन्हें ठीक उसी क्षेत्र में बिठा देता है जिसे भाषा मॉडल शब्द-टोकनों के लिए इस्तेमाल करता है। इसके बाद भाषा मॉडल उन्हें ऐसे पढ़ता है जैसे किसी ने टाइप कर दिए हों। यह सुंदर है और इसका एक नतीजा गाँठ बाँधने लायक़ है: प्रक्षेपण के बाद कमान भाषा मॉडल की पूर्व-धारणाओं के हाथ में है। जहाँ दृश्य-साक्ष्य कमज़ोर, दुविधा भरा या औसत में घुला हुआ है, वहाँ जवाब तस्वीर से नहीं, इस बात से आता है कि टेक्स्ट में आम तौर पर आगे क्या आता है।
इससे कौन-सी नाकामियाँ पहले ही समझी जा सकती हैं
इन मॉडलों की लगभग हर ख़ास ग़लती ऊपर के दो तथ्यों से निकलती है।
न मौजूद वस्तुएँ गढ़ देना। रसोई की तस्वीर में क्या है यह पूछने पर मॉडल कभी ऐसी भरोसेमंद चीज़ गिना देते हैं जो वहाँ नहीं है। यह दृष्टि-एन्कोडर की चूक नहीं, भाषा की पूर्व-धारणा का दृश्य पूरा कर देना है — और इसीलिए ये ग़लतियाँ बेतरतीब नहीं, हमेशा विश्वसनीय होती हैं।
गिनती और ठीक-ठीक स्थान-संबंध। इस पूरी शृंखला में कोई ऐसी चीज़ नहीं जो किसी वस्तु को उसकी जगह के साथ टिकाऊ ढंग से याद रखे; यहाँ पैच टोकन हैं और अटेंशन। "बाएँ से तीसरी चीज़ लेबल के ऊपर है या नीचे" पूछना ऐसी चीज़ माँगना है जो प्रतिनिधित्व में बहुत ढीले ढंग से ही मौजूद है।
घनी तालिकाएँ, हाथ की लिखाई, बारीक़ छपाई। ये बजट की नाकामियाँ हैं। जानकारी निचुड़कर बाहर हो गई थी।
चार्ट। सबसे चुपचाप ख़तरनाक मामला। मॉडल चार्ट की क़िस्म आत्मविश्वास से पहचान लेता है और उसी क़िस्म से मेल खाता रुझान सुना देता है, क्योंकि चार्ट जैसी तस्वीरों के साथ ट्रेनिंग टेक्स्ट में भारी बहुमत से रुझान का वर्णन ही जुड़ा होता है। सुनने में यह आधिकारिक लगता है और अक्षों के मान गढ़े हुए हो सकते हैं।
तस्वीर के भीतर लिखा टेक्स्ट तस्वीर पर भारी पड़ जाना। एन्कोडर ने सीख लिया है कि लिखे हुए शब्द बहुत कुछ बता देते हैं, इसलिए किसी सेब पर चिपका "केला" लिखा लेबल वर्गीकरण पलट सकता है। जो सहायक कुछ कर भी सकता है, उसके लिए यह कैमरे से आने वाला प्रॉम्प्ट इंजेक्शन है: तस्वीर में खींचे गए पन्ने पर लिखे निर्देश वह सामग्री हैं जिसे मॉडल पढ़ता है और मान भी सकता है।
नतीजे सचमुच किससे सुधरते हैं
पूछने से पहले क्रॉप और ज़ूम कीजिए। निष्कर्ष के बजाय यह पूछिए कि दिख क्या रहा है — "तीसरे कॉलम के मान गिनाइए" उससे बेहतर है कि "यह क्या दिखाता है"। जहाँ असली आँकड़े आपके पास हैं, वहाँ मॉडल को आँकड़ों की तस्वीर नहीं, आँकड़े दीजिए। घने दस्तावेज़ों के लिए पहले टेक्स्ट और लेआउट निकालने वाला समर्पित औज़ार चलाइए और मॉडल को टेक्स्ट थमाइए — यही वह मिला-जुला नतीजा है जो खोज पर भी लागू होता है: जिस हिस्से में विशेष औज़ार अच्छा है वह उससे कराइए, और तर्क आम मॉडल से। और जो आँकड़ा मायने रखता है उसे जाँचिए, उसी वजह से जिससे आप कोई हवाला जाँचते हैं।
विद्यार्थियों और शोधकर्ताओं के लिए क्यों मायने रखता है
भारत के प्रशासनिक और कारोबारी जीवन का बड़ा हिस्सा दस्तावेज़ों की तस्वीरों में बसता है: फ़ॉर्म, बिल, ज़मीन के रिकॉर्ड, हाथ से लिखे रजिस्टर, कम रोशनी में तिरछे कोण से फ़ोन पर खींचे प्रमाणपत्र। यही वह काम है जहाँ टोकनों का बजट सबसे ज़्यादा काटता है — और लिपियाँ इसे और कठिन बना देती हैं। तस्वीर में खिंचे दस्तावेज़ों में देवनागरी, तमिल, बांग्ला और बाक़ी लिपियों की पहचान लैटिन लिपि से साफ़ कमज़ोर है, उन्हीं वजहों से जिनसे वह बोली पहचानने और टोकनाइज़ेशन में कमज़ोर है — कम ट्रेनिंग डेटा, और बाद में जोड़ी गई व्यवस्था। यहाँ दस्तावेज़ों का काम अपने आप चलाने वाला कोई भी पाएगा कि दिलचस्प काम मॉडल को प्रॉम्प्ट देना नहीं, यह तय करना है कि पाइपलाइन के कौन-से हिस्से मॉडल होने ही नहीं चाहिए।
साथ ले जाने लायक़ विचार वही है जो टेक्स्ट की तरफ़ से इससे जुड़ता है: ट्रांसफ़ॉर्मर के देखने से पहले हर माध्यम टुकड़ों में बाँटा जाता है, और वही बँटवारा छत तय कर देता है। शब्द उप-शब्द टोकन बनते हैं, तस्वीरें पैच टोकन, आवाज़ फ़्रेम। हर बदलाव कुछ फेंक देता है — कहीं अक्षर, कहीं महीन ब्योरा — और उससे बनी सीमाएँ बुद्धि की नाकामी जैसी दिखती हैं जबकि वे प्रतिनिधित्व की नाकामी हैं। कौन-सी कौन है, यह पहचान लेना ही इन सिस्टमों को ढंग से बरतने का बड़ा हिस्सा है।
अक्सर पूछे जाने वाले सवाल
AI मॉडल तस्वीर पढ़ता कैसे है?
वह तस्वीर को छोटे वर्गाकार पैचों में काटता है, हर पैच को वेक्टर में बदलता है, उसमें उसकी जगह की जानकारी जोड़ता है, और बनी हुई शृंखला को प्रोसेस करता है। तस्वीर अब उसी क्षेत्र के कुछ सौ टोकन है जिसे मॉडल टेक्स्ट के लिए इस्तेमाल करता है।
मॉडल ब्योरे-भरे दस्तावेज़ या बारीक़ छपाई ग़लत क्यों पढ़ता है?
क्योंकि तस्वीर टोकनों के तय बजट में दबा दी जाती है। पैच से महीन ब्योरा छोटा करते समय औसत में घुल जाता है, इसलिए वह किसी भी तर्क से पहले ही नदारद होता है और सवाल दोबारा पूछने से वापस नहीं आता।
तस्वीर क्रॉप करने से जवाब क्यों सुधर जाता है?
क्योंकि तब पूरा टोकन बजट उसी हिस्से पर ख़र्च होता है जिसकी आपको परवाह है, पूरे फ़्रेम पर बिखरने के बजाय — इसलिए काम का ब्योरा कहीं ऊँचे असरदार रिज़ॉल्यूशन पर बचा रह जाता है।
मॉडल ऐसी चीज़ें क्यों गढ़ देते हैं जो तस्वीर में नहीं हैं?
क्योंकि तस्वीर भाषा मॉडल के क्षेत्र में बिठाए जाने के बाद, जहाँ दृश्य-साक्ष्य कमज़ोर है वहाँ भाषा मॉडल की अपेक्षाएँ ख़ाली जगह भर देती हैं। गढ़ी हुई चीज़ वही होती है जो ऐसे दृश्य में भरोसेमंद ढंग से हो सकती थी — इसीलिए ये ग़लतियाँ हमेशा वाजिब सुनाई देती हैं।
क्या तस्वीर के भीतर लिखा टेक्स्ट मॉडल को भरमा सकता है?
हाँ। एन्कोडर के लिए तस्वीर में लिखे शब्द बहुत कुछ बताने वाले होते हैं, इसलिए भ्रामक लेबल दृश्य सामग्री पर भारी पड़ सकता है — और जो सिस्टम कुछ कर भी सकता है, उसके लिए तस्वीर में खिंचे पन्ने पर लिखे निर्देश प्रॉम्प्ट इंजेक्शन का रास्ता हैं।