मैं एक चलते हुए एजेंट को रोक क्यों नहीं सकता, उसकी दिशा सुधार क्यों नहीं सकता, और उसे सुचारू रूप से फिर से शुरू क्यों नहीं करा सकता?
अवसर
लंबे समय तक चलने वाले एजेंट टास्क सैकड़ों टूल कॉल्स में फैले होते हैं और घंटों तक चल सकते हैं, लेकिन आज उपलब्ध एकमात्र विकल्प हैं कि टास्क को खत्म होने दिया जाए या उसे पूरी तरह बंद कर दिया जाए। एक उपयोगकर्ता जो मध्य-रन में कोई त्रुटि देखता है, उसके पास सुधार इंजेक्ट करने, संचित स्थिति का निरीक्षण करने, या सभी पिछली प्रगति खोए बिना टास्क को पुनर्निर्देशित करने का कोई तरीका नहीं है, और न ही वह एजेंट को ऐसा संदर्भ दे सकता है जो उसे उस विश्व-स्थिति से अलग कर दे जिस पर वह अब तक काम कर रहा था। अप्रैल 2026 का एक arXiv पेपर पर्यावरणीय रूप से प्रतिबंधित एजेंट सेटिंग्स में इंटरप्टिबिलिटी का पहला व्यवस्थित अध्ययन है और दर्शाता है कि जब मध्य-निष्पादन में उपयोगकर्ता का इरादा बदलता है तो वर्तमान एजेंट कितने नाजुक होते हैं। इंफ्रास्ट्रक्चर विक्रेताओं ने 2025 के अंत और 2026 की शुरुआत में टिकाऊ एक्जीक्यूशन रनटाइम्स जारी किए जो क्रैश रिकवरी को संभालते हैं, लेकिन सिमेंटिक इंटरप्शन, यानी एजेंट को केवल पुनः आरंभ करने के बजाय उसके लक्ष्य को बदलने की क्षमता, अभी तक नहीं बनाई गई है।
यह क्यों मायने रखता है
सिमेंटिक इंटरप्टिबिलिटी ही वह चीज़ है जो एक बार चलने वाले डेमो को एक ऐसे प्रोडक्शन टूल में बदलती है जिस पर एक गैर-इंजीनियर भरोसा कर सके।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIहम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?