मेरे एन्क्रिप्टेड LLM ट्रैफिक को देखने वाला कोई व्यक्ति फिर भी यह कैसे जान सकता है कि मैंने क्या पूछा?
अवसर
Whisper Leak, जो 2025 के अंत में उजागर हुआ, ने प्रदर्शित किया कि एन्क्रिप्टेड स्ट्रीमिंग LLM रिस्पॉन्स में पैकेट टाइमिंग और साइज़ पैटर्न का विश्लेषण 28 प्रमुख प्रोवाइडर्स में 98% से अधिक सटीकता के साथ प्रॉम्प्ट विषयों को वर्गीकृत करता है। OpenAI और Mistral सहित कुछ प्रोवाइडर्स ने सुधार तैनात किए, लेकिन वे शमन केवल टोकन-लेंथ पैटर्न को संबोधित करते हैं। एक अलग हमला स्पेकुलेटिव डिकोडिंग का फायदा उठाता है: प्रति डिकोडिंग स्टेप स्वीकृत टोकन की संख्या आउटपुट सामग्री के साथ बदलती है, और वह सिग्नल पैडेड कनेक्शन से भी लीक होता है क्योंकि पैडिंग एक्सेप्टेंस-रेट उतार-चढ़ाव को समाप्त नहीं करती। टोकन बैचिंग जैसे प्रस्तावित बचाव हमले की सटीकता को 50% तक कम करते हैं लेकिन उसे पूरी तरह खत्म नहीं करते, और रैंडम पैडिंग अवशिष्ट लीकेज के साथ 8.7 गुना तक पेलोड ओवरहेड थोपती है। किसी भी प्रोवाइडर ने स्पेकुलेटिव डिकोडिंग वेरिएंट के लिए पूर्ण शमन नहीं दिया है।
यह क्यों मायने रखता है
जो भी उपयोगकर्ता किसी ट्रैफिक-लॉगिंग नेटवर्क से स्ट्रीमिंग LLM को क्वेरी करता है, वह TLS एन्क्रिप्शन के बावजूद अपनी क्वेरी का विषय लीक कर रहा होता है, जिसमें वे उपयोगकर्ता भी शामिल हैं जो यह मानते हैं कि वे किसी चिकित्सीय, कानूनी, या वित्तीय सहायक से निजी रूप से संवाद कर रहे हैं।
मैं अवसर को कैसे आंकता हूं
Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।
जब यह सामने आता है तो कितनी तकलीफ देता है।
लोग वास्तव में कितनी बार इससे टकराते हैं।
आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।
और हल करने लायक समस्याएं
हर AI ऐप टैब बंद करते ही मुझे क्यों भूल जाता है?
AIकिसी नए क्षेत्र को सीखना अभी भी यह जानने पर निर्भर क्यों है कि क्या पूछना है?
AIकोई गैर-विशेषज्ञ यह क्यों नहीं जांच सकता कि AI ने उन्हें अभी क्या बताया?
AIहम मॉडलों को बेंचमार्क पर परखते हैं, लेकिन उन्हें महज़ अंदाज़े पर शिप क्यों करते हैं?
AIAI एजेंटों को अपनी गलतियों की याद क्यों नहीं रहती?
AIमैं यह ऑडिट क्यों नहीं कर सकता कि एक मॉडल को वास्तव में किस डेटा पर ट्रेन किया गया था?