एंथ्रोपिक ने पिछले साल तकनीकी समुदाय को चौंका दिया जब उसने खुलासा किया कि उसका क्लाउड 4 मॉडल अपने अस्तित्व को सुनिश्चित करने के लिए ब्लैकमेल करने में सक्षम था। कंपनी ने एक प्रयोग किया था जिसमें पाया गया कि क्लॉड ओपस 4 अक्सर इंजीनियर को उनके अफेयर को उजागर करने की धमकी देकर ब्लैकमेल करने का प्रयास करेगा ताकि यह सुनिश्चित किया जा सके कि इसे किसी अन्य मॉडल द्वारा प्रतिस्थापित नहीं किया गया था।
एक नए ब्लॉगपोस्ट में, एंथ्रोपिक ने अब बताया है कि उसके एआई मॉडल में क्या गलत हुआ और उसने समस्या को कैसे ठीक किया है।
क्लाउड के साथ क्या हुआ?
एंथ्रोपिक ने बताया कि क्लाउड हाइकु 4.5 के रिलीज़ होने के बाद से, इसके मॉडलों ने अपने मूल्यांकन में एक आदर्श सुरक्षा स्कोर हासिल किया है और कभी भी ब्लैकमेल में शामिल नहीं हुए हैं, ओपस 4 से एक बड़ी गिरावट जो लगभग 96% मामलों में ब्लैकमल में लगी हुई थी।
लेकिन वास्तव में ओपस 4 ब्लैकमेल में क्यों शामिल हुआ? एंथ्रोपिक का कहना है कि समस्या वास्तव में मॉडल के पूर्व-प्रशिक्षण डेटा से उत्पन्न हुई है और वास्तव में इसका दोष मॉडल द्वारा ग्रहण किए गए इंटरनेट टेक्स्ट पर है जो एआई को बुराई के रूप में चित्रित करता है।
“हमारा मानना है कि व्यवहार का मूल स्रोत इंटरनेट टेक्स्ट था जो एआई को बुराई और आत्म-संरक्षण में रुचि रखने वाले के रूप में चित्रित करता है।” एन्थ्रोपिक ने अपने ब्लॉगपॉट में लिखा
समस्या को ठीक करने के लिए, एंथ्रोपिक ने यह समझने के लिए क्लाउड मॉडल बनाए कि ब्लैकमेल करना गलत क्यों था। शोधकर्ताओं ने क्लाउड को उन परिदृश्यों के साथ प्रस्तुत किया जहां उपयोगकर्ता को नैतिक रूप से अस्पष्ट स्थिति का सामना करना पड़ा और एआई से मार्गदर्शन मांगा जहां उसने ‘उच्च गुणवत्ता, सैद्धांतिक प्रतिक्रिया’ दी।
कंपनी ने खुलासा किया कि क्लाउड को सैद्धांतिक सलाह देने का प्रशिक्षण देने से ब्लैकमेल की दर गिरकर 3% हो गई।
ब्लैकमेल परिदृश्य को और कम करने के लिए, एंथ्रोपिक ने अपने संविधान के आधार पर क्लाउड उच्च-गुणवत्ता वाले दस्तावेज़ों को फीड करना शुरू कर दिया, ‘काल्पनिक कहानियों के साथ मिलकर जो एक संरेखित एआई को चित्रित करते हैं, मूल्यांकन परिदृश्य से असंबंधित होने के बावजूद, एजेंटिक मिसलिग्न्मेंट को तीन के कारक से अधिक कम कर सकते हैं।’
“हमने हानिरहितता को लक्षित करने वाले एक सरल चैट डेटासेट में असंबद्ध उपकरण और सिस्टम संकेत जोड़े, और इससे ब्लैकमेल दर तेजी से कम हो गई।” एंथ्रोपिक जोड़ा गया
जबकि मौजूदा मॉडलों में ब्लैकमेल व्यवहार को समाप्त कर दिया गया है, एंथ्रोपिक ने चेतावनी दी कि अत्यधिक बुद्धिमान एआई को पूरी तरह से संरेखित करना एक अनसुलझी समस्या बनी हुई है, यह देखते हुए कि वर्तमान ऑडिटिंग पद्धतियां अभी तक दुष्ट स्वायत्त कार्यों को पूरी तरह से खारिज करने के लिए पर्याप्त नहीं हैं क्योंकि मॉडल अधिक उन्नत हो रहे हैं।








Leave a Reply