हम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
अवसर
टीमें लीडरबोर्ड से एक मॉडल चुनती हैं, फिर उसे प्रोडक्शन में बिना किसी निरंतर, सस्ते, कार्य-विशिष्ट मूल्यांकन के चलाती हैं। जब गुणवत्ता में गिरावट आती है, तो किसी को तब तक पता नहीं चलता जब तक कोई यूज़र शिकायत न करे। यह नापने के लिए कि आपका AI फ़ीचर अभी भी ठीक काम कर रहा है या नहीं, ज़्यादातर बिल्डर्स के पास ज़रूरी टूलिंग ही नहीं है।
यह क्यों मायने रखता है
जो चीज़ आप माप नहीं सकते, उसे चला नहीं सकते, और अभी ज़्यादातर AI फ़ीचर बिना किसी माप के चल रहे हैं।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?
AIप्रशिक्षण डेटा में यह बताने का कोई मशीन-पठनीय रिकॉर्ड क्यों नहीं होता कि किसी ने सहमति दी थी या नहीं?