मॉडल लीडरबोर्ड स्कोर क्यों गिर जाते हैं जब टेस्ट सेट को ट्रेनिंग में कभी नहीं देखा गया हो?
अवसर
MMLU जैसे स्टैटिक बेंचमार्क में 45% तक की संदूषण दर होती है, और टेस्ट आइटम के पैराफ्रेज़ या अनुवादित संस्करण एग्जैक्ट-मैच डीकंटेमिनेशन से बचते हुए प्रकाशित स्कोर को बढ़ाते रहते हैं। एक मॉडल संदूषित कार्य पर लीडरबोर्ड में शीर्ष पर हो सकता है और उसी कार्य को साफ तरीके से दोबारा पूछे जाने पर विफल हो सकता है। डायनामिक बेंचमार्क जो समय-समय पर कार्यों को ताज़ा करते हैं, मौजूद हैं लेकिन उनमें मानकीकृत डिज़ाइन मानदंडों का अभाव है, इसलिए उनके बीच परिणामों की तुलना नहीं की जा सकती या यह सत्यापित नहीं किया जा सकता कि वे उस कौशल का प्रतिनिधित्व करते हैं जिसे वे मापने का दावा करते हैं। लीडरबोर्ड पर प्रकाशित हर क्षमता और सुरक्षा दावा उन संख्याओं पर टिका है जिन्हें कोई भी स्वतंत्र पक्ष स्वच्छ के रूप में सत्यापित नहीं कर सकता।
यह क्यों मायने रखता है
विश्वसनीय मूल्यांकन हर डाउनस्ट्रीम सुरक्षा और तैनाती निर्णय की पूर्वशर्त है, और जिन संख्याओं पर ये निर्णय टिके हैं वे वर्तमान में विश्वसनीय नहीं हैं।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIहम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?