विरासत में मिली मतिभ्रम
मशीनी अनुवादित · मूल लेख पढ़ें
अध्याय 4 — विरासत में मिली मतिभ्रम
यह शायद पूरी जांच की सबसे शिक्षाप्रद कहानी है, क्योंकि यह एक ऐसे विषय को छूती है जिसे ट्यूटोरियल अनदेखा कर देते हैं और जो वास्तव में सबसे अधिक नुकसान पहुंचाता है: आने वाले डेटा की गुणवत्ता।
एक अमेरिकी साइकिल कंपनी — आइए हम सम्मान के लिए इसे कहें — के पास तस्वीरों का एक विशाल संग्रह था, उत्पाद, घटनाओं, सवारों, प्रचार यात्राओं की हजारों छवियां। यह कंपनी की दृश्य संपत्ति थी, जो पंद्रह वर्षों के अभियानों में संचित हुई थी। दूरदर्शिता के एक क्षण में, किसी ने प्रत्येक तस्वीर में "उपस्थित वस्तुओं" की एक सूची जोड़ने के लिए एक स्वचालित टैगिंग सेवा का उपयोग किया: "साइकिल, हेलमेट, सड़क, पहाड़, व्यक्ति"। सिद्धांत रूप में, भविष्य के दृश्य खोज के लिए उपयोगी मेटाडेटा। तस्वीरों के साथ संग्रहीत, वर्षों से भुला दिया गया, फिर पुनर्प्राप्त किया गया और नए कंपनी RAG में स्वाभाविक विश्वास के साथ डाला गया कि "अधिक मेटाडेटा, बेहतर है"।
अंतर्ग्रहण के बाद, छवि खोजें अतियथार्थवादी परिणाम दे रही थीं। आपने "शहर में साइकिलें" खोजा और आपको एक झील की तस्वीर मिली। आपने "हेल्मेट वाली महिला मॉडल" खोजा और आपको एक पुरानी कार मिली। आपने "पहाड़" खोजा और आपको अनिश्चित रूप से कुछ भी मिला - पूरे संग्रह का एक यादृच्छिक नमूना, जैसे कि सिस्टम ने भाग्य का सहारा लिया हो। टीम ने शुरू में दृश्य एम्बेडिंग मॉडल पर उंगली उठाई। फिर रीरैंकर पर (समझने के लिए पिछला अध्याय देखें कि यह ट्रैक विशेष रूप से आकर्षक क्यों था)। फिर AI द्वारा उत्पन्न विवरणों की गुणवत्ता पर।
वास्तविक जाँच, इस बार सीधे डेटाबेस के लिए एक क्वेरी SQL के साथ की गई, ने एक विचित्र बात दिखाई। 3997 कैटलॉग तस्वीरों में से, सभी, वास्तव में सभी, वस्तुओं की समान सूची रखती थीं। उन्नीस तत्वों की एक सूची — "कार, मोटरसाइकिल, झील, समुद्र, पहाड़, साइकिल, हेलमेट, सड़क, शहर, व्यक्ति..." — जिसका व्यक्तिगत तस्वीर की सामग्री से कोई संबंध नहीं था। इसे वर्षों पहले किसी अन्य वेबसाइट से आयात किया गया था, ताकि सीएमएस के एक अनिवार्य फ़ील्ड को भरने के लिए सामान्य टैग का एक सेट बनाया जा सके। कंपनी में किसी को अब याद नहीं रहा। तस्वीरें एक सिस्टम से दूसरे सिस्टम में चली गईं, उन भूतिया लेबल को अपने साथ ले गईं, जो संदेह पैदा करने के लिए पर्याप्त रूप से प्रशंसनीय थीं, और उन पर आधारित किसी भी खोज को भ्रष्ट करने के लिए पर्याप्त जहरीली थीं। सर्च इंजन, कर्तव्यनिष्ठ, उन्हें सामग्री के लक्षण के रूप में उपयोग करता है। और यह प्रकृति के कानून द्वारा गारंटीकृत निश्चित स्तर के मतिभ्रम के साथ किसी भी क्वेरी के लिए कोई भी तस्वीर लौटाता है।
कठिन सच्चाई, जो समझने पर दुख देती है, वह यह है कि RAG में "शोर" वाला डेटा ऐसा शोर नहीं करता है जो सुना जा सके। यह सिस्टम को धीमा नहीं करता है, त्रुटियां उत्पन्न नहीं करता है, या चेतावनी लाइटें नहीं जलाता है। यह केवल चुपचाप परिणामों की गुणवत्ता को कम करता है। और जब डाउनस्ट्रीम भाषा मॉडल को पांच दस्तावेज़ प्राप्त होते हैं जिनमें से चार विषय से बाहर हैं, तो यह आपको "ये प्रासंगिक नहीं हैं, मुझसे कुछ और पूछें" नहीं बताता है: यह सावधानीपूर्वक एक उत्तर बनाता है जो उन्हें मिलाता है, और उत्तर हमेशा प्रशंसनीय लगता है। हमेशा। अंतिम मतिभ्रम — वह आविष्कार किया गया उत्तर जिसके बारे में हम शिकायत करते हैं — मॉडल से उत्पन्न नहीं होता है, जैसा कि प्रमुख कथा में बताया गया है। यह अपस्ट्रीम, डेटा से उत्पन्न होता है। मॉडल केवल इसे व्याकरणिक रूप से त्रुटिहीन वाक्य में पैक करता है। लेकिन दोष कहीं और है, और भी पीछे, उस चीज़ में जो आपने सिस्टम को कुछ पूछने से महीनों पहले खिलाई थी।
इस अवलोकन के व्यावहारिक परिणाम हैं जो पैसे की लागत आती है। एक गंभीर कॉर्पोरेट RAG बनाने वाले पहले व्यक्ति का काम, पहले कोड की एक भी पंक्ति लिखने से पहले, अपने डेटा का पोस्टमार्टम करना है। वे कहाँ से आए हैं। उन्हें किसने छुआ। किन क्षेत्रों का अवलोकन किया जाता है और कौन से पिछले सिस्टम की जीवाश्म विरासत हैं। किन मेटाडेटा का आज अर्थ है और किनका 2017 में था और किसी ने उन्हें साफ करने की जहमत नहीं उठाई। यह एक कम ग्लैमरस, बहुत पुरालेखीय कार्य है, जो ट्यूटोरियल से पूरी तरह से गायब है, अक्सर "गैर-तकनीकी" के रूप में माना जाता है और इसलिए विकास टीमों द्वारा तिरस्कृत है। लेकिन उस प्रारंभिक स्वच्छता के बिना, कोई भी शानदार वास्तुकला जो आप ऊपर डालते हैं, वह बस बहुत पुराने कचरे का एक बहुत शक्तिशाली एम्पलीफायर बन जाती है।
अमेरिकी कंपनी के मामले में, समाधान क्रूर और सही था: "ऑब्जेक्ट्स" फ़ील्ड को खाली करना, प्रत्येक व्यक्तिगत फोटो पर लागू आधुनिक विज़न मॉडल के साथ मेटाडेटा को खरोंच से फिर से बनाना, और इस बार, ट्रैक करना कि प्रत्येक मेटाडेटा कब और कैसे बनाया गया था। उबाऊ काम। परिणाम: खोज अंततः काम करना शुरू कर दी। क्योंकि उन्होंने मॉडल नहीं बदला। क्योंकि उन्होंने बेसमेंट की सफाई की थी।
कोई टिप्पणी? हमें लिखें
यह संदेश केवल हम तक पहुंचेगा। यदि आपकी टिप्पणी दिलचस्प है तो हम इसे लेख के अंत में प्रकाशित कर सकते हैं, लेकिन केवल मूल्यांकन के बाद।
जैसे ही आप लिखते हैं, आपका ब्राउज़र एक छोटा सा गणितीय समस्या हल कर रहा है—यह स्पैम को रोकने का हमारा तरीका है बिना किसी तीसरे पक्ष की सेवा या आपको ट्रैफिक लाइट पहचानने के लिए कहे। आपसे कुछ नहीं मांगा जा रहा है और कोई भी डेटा इस साइट से बाहर नहीं जाता।