मुझे कैसे पता चलेगा कि मेरे AI असिस्टेंट ने जो कोड लिखा वह वास्तव में सही है?
अवसर
LLMs ऐसा कोड बनाते हैं जो यूनिट टेस्ट पास कर देता है, लेकिन कोई औपचारिक गुण संतुष्ट नहीं करता। एक मॉडल ऐसे टेस्ट बना सकता है जो निर्माण के आधार पर पास हो जाएं, न कि इसलिए कि लॉजिक सही है। फॉर्मल वेरिफिकेशन टूल मौजूद हैं, लेकिन उनके लिए थ्योरम-प्रूवर सिंटैक्स में स्पेसिफिकेशन लिखनी पड़ती है, जो लगभग कोई कार्यरत डेवलपर नहीं करता। हालिया बेंचमार्क दिखाते हैं कि फ्रंटियर मॉडल एंड-टू-एंड वेरिफायेबल कोड जेनरेशन में केवल 3.2 प्रतिशत सफलता हासिल करते हैं, यानी प्रशंसनीय दिखने वाले कोड और साबित-सही कोड के बीच की खाई लगभग पूरी तरह खुली है। AI-लिखित कोड को प्रोडक्शन में भेजने वाली टीमें टेस्ट कवरेज पर दांव लगा रही हैं जिसे मॉडल खुद मैनिपुलेट कर सकते हैं।
यह क्यों मायने रखता है
AI-जनित कोड के लिए स्वचालित शुद्धता की गारंटी ही कोडिंग असिस्टेंट को गति के औजार से विश्वसनीयता के औजार में बदलती है।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIहम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?