Skip to content
AI

मैं कैसे जानूं कि जिस ओपन-वेट बेस मॉडल को मैं फाइन-ट्यून कर रहा हूं, उसे पॉइज़न नहीं किया गया है?

83

अवसर

प्री-ट्रेन्ड मॉडल वेट्स में लगाए गए बैकडोर, फुल-पैरामीटर फाइन-ट्यूनिंग, एडाप्टर ट्रेनिंग और RLHF अपडेट के बाद भी बने रहते हैं क्योंकि ट्रिगर पैटर्न ऑब्जेक्टिव-शिफ्टिंग और पार्शियल-फ्रीजिंग रणनीतियों से बचे रहते हैं। ये ट्रिगर मानक व्यवहार सुरक्षा परीक्षणों और बेंचमार्क मूल्यांकन में अदृश्य रहते हैं। इनका पता लगाने के लिए व्हाइट-बॉक्स वेट विश्लेषण की आवश्यकता होती है जिसे औसत फाइन-ट्यूनिंग प्रैक्टिशनर कभी नहीं चलाता, और प्रमुख मॉडल हब किसी चेकपॉइंट को सार्वजनिक रूप से डाउनलोड योग्य बनाने से पहले कोई अनिवार्य स्कैनिंग नहीं करते। एक समझौता किए गए बेस मॉडल पर प्रोडक्शन सिस्टम बनाने वाले संगठन को तब तक कुछ गलत होने का कोई संकेत नहीं मिलता जब तक ट्रिगर तैनाती में सक्रिय नहीं हो जाता।

यह क्यों मायने रखता है

ओपन-वेट फाइन-ट्यूनिंग सप्लाई चेन में कोई सुरक्षा द्वार नहीं है, और विफलता का स्वरूप एक ऐसा बैकडोर है जो हर मानक जांच से बचकर निकल जाता है।

मैं अवसर को कैसे आंकता हूं

Opportunity Score मेरा अपना आकलन है, कोई माप नहीं: यह कितना तकलीफदेह है, कितनी बार परेशान करता है, और आज इसे हल करने के लिए कितना कम मौजूद है। जितना ज़्यादा स्कोर, उतना ज़्यादा मुझे लगता है कि इसे बनाना सार्थक है।

गंभीरता9/10

जब यह सामने आता है तो कितनी तकलीफ देता है।

आवृत्ति7/10

लोग वास्तव में कितनी बार इससे टकराते हैं।

व्हाइटस्पेस8/10

आज इसके लिए कितने कम अच्छे टूल मौजूद हैं।

और हल करने लायक समस्याएं