संक्षेप में जवाब
TypeSafe के Jev लॉन्च के बाद शुरुआती शोध की नई समीक्षा आई है। कुछ कार्यों में समय और खर्च का लाभ दिखता है, पर तय विकल्प वाला प्रारूप अपने आप अधिक शुद्धता सिद्ध नहीं करता।
नए मॉडल वर्ग की शुरुआती समीक्षा
Lijuan Tang और Yuemeng Zheng ने 26 सितंबर को एक प्रीप्रिंट जमा किया, जो TypeSafe के 15 सितंबर वाले Jev रिलीज के बाद टाइप निर्णय मॉडल की जाँच करता है। लेखकों ने 19 से 24 सितंबर के बीच आए 28 पेपर पढ़े। उनका सवाल उत्पाद उपयोगी होने से संकीर्ण है: कौन सा लाभ निर्णय इंटरफेस से और कौन सा उसके पीछे के मॉडल, प्रशिक्षण या सेवा से आता है?
यह अंतर जरूरी है क्योंकि साफ सॉफ्टवेयर इंटरफेस देखने में तर्क की बड़ी छलाँग लग सकता है। Jev तय रूप में विकल्प देता है जिन्हें प्रोग्राम सीधे ले सकता है। समीक्षा कुछ काम में दक्षता का लाभ पाती है, लेकिन समान लेबल-प्रायिकता तरीकों के मुकाबले केवल टाइप किए आउटपुट से स्वतंत्र सटीकता बढ़ना स्थापित नहीं करती। यह साहित्य की शुरुआती समीक्षा है, VJOURNAL का नया बेंचमार्क नहीं।
सीमित विकल्प जवाब का अनुबंध बदलते हैं
कॉल करने वाला ऐप विकल्प तय करता है और इनपुट स्थिति पर सवाल पूछता है। मॉडल खुला जवाब लिखने के बजाय उन्हीं विकल्पों की संभावना देता है। TypeSafe का एपीआई दस्तावेज एक अनुरोध में नाम वाले सवाल और उन्हीं नामों के उत्तर बताता है। इससे पाठ निकालने का काम घट सकता है। आगे का सॉफ्टवेयर जानता है कि कौन से मान आने हैं और उनसे कौन सा नियम जोड़ना है।
सही प्रारूप और सही फैसला अलग हैं। काल्पनिक सहायता व्यवस्था में तीन मंजूर विभागों में से एक चुनना तकनीकी अनुबंध पूरा करेगा, भले ग्राहक का मामला दूसरे विभाग का हो। सही विकल्प सूची में न हो तो खराब निर्णय मजबूरी भी बन सकता है। इंटरफेस सॉफ्टवेयर की सीमा स्पष्ट करता है, मगर विकल्प की गुणवत्ता, प्रश्न और मूल प्रमाण तय करते हैं कि अंतिम उत्तर उपयोगी है या नहीं।
| प्रमाण | प्रकाशित विवरण | क्या अभी साबित नहीं |
|---|---|---|
| कंपनी का समय दावा | 70–500 मिलीसेकंड | समान कार्यों पर स्वतंत्र प्रदर्शन |
| कंपनी की इनपुट दर | 0.042 डॉलर प्रति दस लाख; आउटपुट शुल्क नहीं | दोबारा जाँच सहित कुल लागत |
| समीक्षा का समूह | 28 शोध, 19–24 सितंबर | अलग संस्करणों में लंबे समय का व्यवहार |
| समीक्षा का निष्कर्ष | केवल प्रारूप से सटीकता लाभ स्थापित नहीं | कौन सा प्रशिक्षण या सेवा चुनाव लाभ देता है |
दक्षता के लिए सही तुलना चाहिए
TypeSafe की घोषणा प्रति दस लाख इनपुट टोकन 0.042 डॉलर, आउटपुट शुल्क शून्य और 70 से 500 मिलीसेकंड जवाब समय बताती है। ये कंपनी के विवरण हैं, इस लेख में स्वतंत्र रूप से दोहराए नतीजे नहीं। समीक्षा में समय और खर्च का लाभ कार्य तथा तुलना पर निर्भर है। Jev की अंदरूनी संरचना सार्वजनिक नहीं, इसलिए लाभ किस खास तकनीकी हिस्से से आया यह दावा सीमित रहता है।
निष्पक्ष प्रयोग में केवल ऐसे खुले चैटबॉट से तुलना नहीं होनी चाहिए जिसे हर जवाब का लंबा कारण लिखने को कहा गया हो। सीमित जनरेटिव मॉडल या लेबल की संभावना मापने वाली आधार विधि वही छोटा फैसला कम अतिरिक्त काम में कर सकती है। समान काम और स्वीकृति मानदंड इंटरफेस का असली मूल्य अलग करते हैं। अन्यथा तुलना सिर्फ यह माप सकती है कि दूसरे मॉडल से कितना गैरजरूरी पाठ लिखवाया गया।
विश्वास उपयोगी तभी जब उसका मेल जाँचा जाए
समीक्षा बताती है कि विश्वास का अंशांकन मॉडल और काम के अनुसार बदलता है। सवाल है कि समान मामलों में बताया विश्वास देखी गई शुद्धता से कितना मेल खाता है। कई दशमलव वाली संभावना यह रिश्ता अपने आप नहीं बनाती। श्रेणी की आवृत्ति, विकल्प के शब्द या आने वाले डेटा का स्वरूप बदलने पर सीमा की उपयोगिता बदल सकती है, जबकि उत्तर का तकनीकी प्रारूप बिल्कुल वैध बना रहे।
मान लें आम सहायता अनुरोध से एक विश्वास सीमा चुनी गई। नया उत्पाद आने पर अस्पष्ट समस्याओं का अनुपात अलग हो सकता है। नई जाँच के बिना पुरानी सीमा रखने से दिखने वाला विश्वास वही रहे और गलतियाँ बढ़ जाएँ। हमारी व्याख्या है कि विश्वास को समय के साथ काम का माप मानें। अस्वीकार या आगे भेजे मामलों को भी देखें; इसे मॉडल का हमेशा एक जैसा रहने वाला गुण न समझें।
कठिन मामला आगे भेजने से अर्थशास्त्र बदलता है
समीक्षा के कई शोध कम विश्वास वाले कठिन मामलों को मजबूत मॉडल या व्यक्ति तक भेजते हैं। इससे टाइप मॉडल एक शृंखला का पहला चरण बनता है। आसान मामले ज्यादा और आगे भेजना चुनिंदा हो तो यह उपयोगी है। इससे यह साबित नहीं होता कि हर शृंखला एक मॉडल से बेहतर है या बाद का चरण पहले चरण की सारी गलतियाँ ठीक कर ही देगा।
पूरे हिसाब में शुरुआती अनुरोध, दूसरे मॉडल का उपयोग और इंसानी समीक्षा आते हैं। दो प्रणालियों का पहली भविष्यवाणी पर खर्च समान हो सकता है लेकिन स्वीकृत निर्णय पर काफी अलग। उपयोगी रिपोर्ट बताएगी कि कितने मामले खुद पूरे हुए और उस कवरेज पर कितनी त्रुटि थी। इससे गति और कीमत असली कार्य से जुड़ती हैं और सस्ती शुरुआती दर आगे भेजे गए काम की बड़ी मात्रा नहीं छिपाती।
प्रमाण का समय जानबूझकर छोटा है
लेखकों ने शुरुआती साहित्य से 14 मूल्यांकन मानदंड बनाए और समूह को छोटा तथा बहुत नया कहा। कई अध्ययन एक ही होस्टेड रिलीज के आसपास के प्रीप्रिंट हैं; औद्योगिक अनुभव कम शामिल है। इसलिए समीक्षा लंबे समय की स्थिरता तय नहीं करती। खुले दोहराव की संरचना बंद Jev के भीतर भी वैसी है, यह भी सिद्ध नहीं होता। ये सीमाएँ नतीजे का हिस्सा हैं, छोटी औपचारिक टिप्पणी नहीं।
1 अक्टूबर तक महत्वपूर्ण नया विकास उभरते इंटरफेस को परखने का अधिक साफ तरीका है। अगला मजबूत अध्ययन कठिन कार्य, उचित छोटे विकल्प, जाँचा विश्वास और पूरी शृंखला की लागत साथ देगा। हमारी समझ में टाइप निर्णय को मॉडल तथा सॉफ्टवेयर अनुबंध के जोड़ के रूप में देखना चाहिए। जवाब इस्तेमाल करने की परेशानी घटाना उपयोगी है, लेकिन वह जवाब को अधिक सही बनाने से अलग उपलब्धि है।
सवाल और जवाब
टाइप निर्णय मॉडल चैटबॉट से कैसे अलग है?
ऐप पहले सीमित विकल्प तय करता है और मॉडल उन विकल्पों की संभावनाएँ देता है, खुला पाठ नहीं। इससे सॉफ्टवेयर जवाब आसानी से इस्तेमाल करता है, लेकिन चुने निर्णय की शुद्धता की परीक्षा अलग रहती है।
क्या समीक्षा कहती है कि Jev गलत मॉडल है?
नहीं। वह समय और खर्च के लाभ को इस प्रमाण से अलग रखती है कि केवल उत्तर का प्रकार सटीकता बढ़ाता है। बहुत शुरुआती शोध पूरे मॉडल वर्ग का अंतिम फैसला नहीं दे सकता।
क्या ज्यादा विश्वास का अर्थ अपने आप मंजूरी है?
पहले इच्छित काम पर विश्वास का वास्तविक सही उत्तरों से मेल जाँचना चाहिए। संभावना मॉडल का आउटपुट है, स्वतंत्र गारंटी नहीं। अस्पष्ट मामले मजबूत मॉडल या व्यक्ति की जाँच तक भेजे जा सकते हैं।
