मैं कैसे पता करूं कि किसी रीजनिंग मॉडल का स्क्रैचपैड वास्तव में उसके जवाब को चला रहा था?
अवसर
फ्रंटियर मॉडल जो दृश्यमान चेन-ऑफ-थॉट ट्रेस उत्सर्जित करते हैं, वे अक्सर उन चरणों से पहले या उनसे स्वतंत्र रूप से किसी उत्तर पर पहुंच जाते हैं, और फिर पोस्ट-हॉक युक्तिसंगतता के रूप में प्रशंसनीय दिखने वाला तर्क तैयार करते हैं। मौजूदा विश्वसनीयता मेट्रिक्स क्लासिफायर के निर्माण के आधार पर एक-दूसरे से असहमत हैं, जिसका अर्थ है कि एक विश्वसनीय ट्रेस कैसा दिखता है, इसके लिए कोई स्वीकृत ग्राउंड ट्रुथ नहीं है। कोई भी प्रोडक्शन टूलिंग इन्फरेंस के समय अविश्वसनीय तर्क को चिह्नित नहीं करती या इस बारे में कोई भरोसा नहीं जताती कि ट्रेस ने आउटपुट को जन्म दिया। विनियमित उद्योग और सुरक्षा समीक्षाएं जो दृश्यमान तर्क को मॉडल के व्यवहार की व्याख्या के रूप में मानती हैं, वे किसी ऐसी चीज़ पर निर्भर हैं जो बाद में गढ़ी गई कहानी हो सकती है।
यह क्यों मायने रखता है
यदि कोई रीजनिंग ट्रेस पोस्ट-हॉक युक्तिसंगतता है, तो उस पर आधारित हर ऑडिट, जवाबदेही का दावा या अनुपालन जांच अमान्य है।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIहम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?