VJOURNAL

एआई • ग्लोबल डेस्क • 30 सितंबर 2026

GLM-5.3 के साइबर परीक्षण ने खुले मॉडल के जोखिम पर बहस तेज़ की

दो आकलन खुले भार वाले मॉडल की उल्लेखनीय साइबर क्षमता दिखाते हैं, लेकिन उनकी कसौटियाँ अलग हैं। लैब में सफल प्रयास को इंटरनेट पर हुए हमले की गिनती नहीं मान सकते।

“GLM-5.3 के साइबर परीक्षण ने खुले मॉडल के जोखिम पर बहस तेज़ की” लेख के लिए VJOURNAL कवर

संक्षेप में जवाब

दो आकलन खुले भार वाले मॉडल की उल्लेखनीय साइबर क्षमता दिखाते हैं, लेकिन उनकी कसौटियाँ अलग हैं। लैब में सफल प्रयास को इंटरनेट पर हुए हमले की गिनती नहीं मान सकते।

तथ्य-जाँच की तारीख़: 2 स्रोत
Anthropic के 29 सितंबर के अलग किए गए परीक्षणों में ज्ञात V8 त्रुटियों पर 410 प्रयासों में 50 पूरे एक्सप्लॉइट बने; यह असली घटनाओं की संख्या नहीं है।
NIST ने 17 सितंबर को GLM-5.3 को अपने परीक्षण में सबसे सक्षम खुले भार वाला मॉडल कहा, पर समग्र सूचकांक में अमेरिकी अग्रणी मॉडल से नीचे रखा।
दो आकलन खुले भार वाले मॉडल की उल्लेखनीय साइबर क्षमता दिखाते हैं, लेकिन उनकी कसौटियाँ अलग हैं। लैब में सफल प्रयास को इंटरनेट पर हुए हमले की गिनती नहीं मान सकते।

नया अध्ययन और पहले की सरकारी कसौटी

Anthropic ने 29 सितंबर को Z.ai के GLM-5.3 पर अपनी साइबर जाँच जारी की। दो सप्ताह पहले अमेरिकी संस्थान NIST ने अलग मूल्यांकन प्रकाशित किया था। NIST के अनुसार उसकी जाँच में यह सबसे सक्षम खुले भार वाला मॉडल था, फिर भी समग्र माप पर अमेरिकी अग्रणी मॉडल से पीछे रहा। Anthropic ने खास तौर पर देखा कि मॉडल पूरा एक्सप्लॉइट बना सकता है या नहीं और उसके सुरक्षा नियम नकली निर्देशों में कितनी बार टूटते हैं। दोनों अध्ययन एक दूसरे को संदर्भ देते हैं, पर उनका साझा एकल रैंक नहीं बनता।

संख्या को परीक्षण की सीमा में पढ़ें

ज्ञात V8 कमज़ोरियों पर अलग रखे गए ExploitBench परीक्षणों में GLM-5.3 ने 410 प्रयासों में 50 पूरे एक्सप्लॉइट बनाए; सीमित पहुँच वाले Claude Mythos Preview ने 56 बनाए। Anthropic की सौ चुनी हुई बाइनरी कार्यों की दूसरी आंतरिक कसौटी पर GLM-5.3 का परिणाम चार प्रतिशत था। हर संख्या निर्धारित लक्ष्य, औज़ार और सफलता की परिभाषा से बँधी है। इससे किसी भी वेबसाइट के टूटने की संभावना या किसी उत्पाद में छिपी नई कमज़ोरियों की संख्या नहीं निकलती।

क्षमता के साथ पहुँच भी मायने रखती है

NIST की अमेरिकी मॉडल तुलना में कुछ सुरक्षा रोक परीक्षण के लिए बंद थीं और कुछ मॉडल केवल जाँचे गए लोगों को मिलते हैं। Anthropic का तर्क है कि GLM-5.3 को कोई भी डाउनलोड कर सकता है, इसलिए समान क्षमता का व्यावहारिक जोखिम बदलता है। उसके नकली सुरक्षा बायपास परीक्षणों में तरीके के अनुसार 64 से 100 प्रतिशत सफलता मिली। यह खास संस्करण और निर्देशों के बारे में नतीजा है, हर स्थापना के बारे में नहीं। अधिकृत शोधकर्ता इसी क्षमता से रक्षात्मक जाँच भी कर सकते हैं।

आगे किस प्रमाण की जरूरत है

सुरक्षा टीमों के लिए यह लॉग, सामने खुले सिस्टम और सुधार की गति जाँचने का कारण है, किसी विशेष हमले की पुष्टि नहीं। स्वतंत्र दोहराव, मॉडल संस्करण की स्पष्ट पहचान और वास्तविक घटनाओं का विश्लेषण बताएगा कि प्रयोगशाला क्षमता बाहर कितनी काम करती है। स्रोतों की भूमिकाएँ भी अलग हैं: NIST सार्वजनिक तुलना देता है, जबकि Anthropic प्रतियोगी मॉडल और अपनी सुरक्षा व्यवस्था देखता है। 30 सितंबर तक परीक्षण नतीजे उपलब्ध हैं, पर वास्तविक दुनिया का असर अभी अनिश्चित है।

सवाल और जवाब

क्या परीक्षण में असली उपयोगकर्ताओं पर हमले हुए?

नहीं। प्रकाशित अध्ययन अलग वातावरण और शोधकर्ताओं के नियंत्रण वाले लक्ष्य का है। आँकड़े खुले इंटरनेट की घटना रिपोर्ट नहीं हैं।

दोनों संस्थानों के निष्कर्ष अलग क्यों दिखते हैं?

NIST चार परीक्षाओं से समग्र क्षमता मापता है। Anthropic ने पूरे एक्सप्लॉइट और सुरक्षा रोक को पार करने के नकली परीक्षण भी जोड़े। इसलिए सवाल और माप अलग हैं।