संक्षेप में जवाब
Android Bench परिणाम बताते हैं कि आंशिक प्रगति और पूरी सफलता अलग हैं। Google के नए परीक्षण पढ़ते समय एजेंट, विश्वास अंतराल और पूरे समूह की लागत को साथ रखना जरूरी है।
सितंबर के परीक्षण में अधिक कठिन प्रश्न
Google की 17 सितंबर की घोषणा Android Bench परिणाम को छोटे सुधारों से पूरे ऐप के काम की ओर ले जाती है। मोबाइल विकास दल के लिए प्रश्न स्पष्ट है: क्या एजेंट किसी माइग्रेशन या नई सुविधा को चलने योग्य ऐप तक पहुँचा सकता है? नए संस्करण में लंबे कार्य और मॉडल प्रदाताओं के अपने एजेंट शामिल हैं।
जब काम कई सत्रों तक चलता है, तो पहला आकर्षक कोड बदलाव पर्याप्त प्रमाण नहीं होता। उसमें कोई निर्भरता अधूरी या स्क्रीन अनुपयोगी रह सकती है। खरीद का निर्णय पूरे काम की जाँच माँगता है। यह परीक्षण Android इंजीनियरिंग के उम्मीदवार चुनने में मदद करता है, जबकि ऐप जारी करने की शर्तें दल को स्वयं तय करनी होंगी।
अंकों के साथ सही इकाई भी पढ़ें
आधिकारिक पद्धति में तीस कार्य और हर कार्य के पाँच स्वतंत्र प्रयास हैं। तालिका में मॉडल और एजेंट की जोड़ी, विश्वास अंतराल तथा आंशिक पूर्णता सुरक्षित रखी गई है। Google घंटे और डॉलर को पूरे समूह के औसत प्रयास के रूप में बताता है। ये 1 अक्टूबर को देखे गए प्रकाशित माप हैं; VJOURNAL ने परीक्षण नहीं चलाया।
इन आँकड़ों को खरीद की शीट में डालते समय इकाई बदलना अनुचित होगा। कुल खर्च को कार्यों की संख्या से बाँटना योजना का अनुमान दे सकता है, किसी खास माइग्रेशन की असली कीमत नहीं। सारांश में प्रयास की सटीक तारीख और तर्क प्रयास का स्तर नहीं है। इसलिए यहाँ वे अज्ञात हैं, नाम से अनुमानित नहीं।
| मॉडल / एजेंट | सफलता % | विश्वास अंतराल % | पूर्णता % | घंटे / पूरा समूह | डॉलर / पूरा समूह |
|---|---|---|---|---|---|
| GPT-6 Astra / Codex | 28.0 | 13.3–42.0 | 82.2 | 7.9 | 375.7 |
| Claude Fable 5.1 / Claude Code | 22.7 | 10.7–36.0 | 82.4 | 22.2 | 492.6 |
| GPT-5.6 Sol / Codex | 19.3 | 7.3–32.0 | 74.3 | 8.6 | 235.8 |
| Claude Opus 5 / Claude Code | 16.7 | 5.3–29.3 | 77.8 | 27.0 | 861.4 |
| Gemini 3.8 Flash / Antigravity SDK | 8.0 | 3.3–13.3 | 47.4 | 12.1 | 34.5 |
एजेंट का वातावरण भी परिणाम का हिस्सा
Codex, Claude Code और Antigravity SDK मॉडल के आसपास फाइल, उपकरण और संदर्भ संभालते हैं। इस व्यवस्था से पूरा होने वाला काम बदल सकता है। इसलिए तुलना तैयार प्रणालियों की है। हर बाहरी हिस्से को समान रखकर केवल मॉडल की क्षमता मापने वाला प्रयोग इसे नहीं माना जा सकता।
तैयार एजेंट खरीदने वाले दल के लिए यह उपयोगी है। अपना एजेंट बनाने वाला दल उपकरण, अनुमति या संदर्भ प्रबंधन बदलेगा तो प्रणाली भी बदलेगी। SWE-bench के लेखकों के दस्तावेज़ रिपॉजिटरी की समस्याएँ सुलझाने का अलग संदर्भ देते हैं। उसके प्रतिशत इस Android तालिका में मिलाने से कार्य और सत्यापन के अंतर छिप जाएँगे।
अधिक प्रगति के बाद भी जारी करना रुक सकता है
पूर्णता और सफलता दोनों साथ पढ़ने चाहिए। पहला अंतिम असफल प्रयास में भी उपयोगी काम पहचानता है; दूसरा बताता है कि सभी आवश्यकताएँ पूरी हुईं या नहीं। लगभग तैयार ऐप को जारी करने से पहले विशेषज्ञ सुधार चाहिए हो सकता है। दल को बची हुई शर्त और उसे ठीक करने की संभावित मेहनत जाननी चाहिए।
Google ऐप के चलते समय व्यवहार और दृश्य रूप की जाँच शामिल करता है। इससे इंटरफेस का मूल्यांकन केवल कोड संरचना से आगे जाता है। कई जोड़ियों के विश्वास अंतराल एक दूसरे से मिलते हैं। इसलिए तालिका का क्रम किसी नए कंपनी प्रोजेक्ट पर हर एजेंट के प्रदर्शन की सटीक भविष्यवाणी नहीं है।
निर्णय में स्वीकार किया गया ऐप मुख्य है
अपना छोटा मूल्यांकन वास्तविक कार्यों जैसे माइग्रेशन, दोहराए जा सकने वाले शुरुआती रिपॉजिटरी और स्पष्ट निर्माण, व्यवहार तथा सुलभता जाँच से शुरू किया जा सकता है। कुल खर्च, बीता समय और इंजीनियर द्वारा सुधार का समय साथ दर्ज करें। यह सुझाई गई पद्धति है, हमारे किए प्रयोग या तय नतीजे का दावा नहीं।
सितंबर का बदलाव बड़े कोडिंग कार्य सौंपने की जाँच बेहतर बनाता है। जिम्मेदार व्यक्ति एजेंट चुनने से पहले पूर्णता, अनिश्चितता और असफलताओं का प्रकार देख सकते हैं। अगला उपयोगी प्रश्न है कि अपने कार्यों पर कौन सी जोड़ी जाँची हुई इंजीनियर मेहनत घटाती है और अंत में वास्तव में काम करने वाला ऐप देती है।
सवाल और जवाब
क्या 82.2% पूर्णता से ऐप सफल माना जाता है?
नहीं। पूर्णता का माप आंशिक रूप से पूरे हुए निर्देश भी गिनता है। इस लंबे कार्य समूह में Astra और Codex के लिए Google अलग से 28.0% पूरी सफलता बताता है।
क्या यह राशि केवल एक कार्य की लागत है?
नहीं। Google की तालिका में डॉलर पूरे परीक्षण समूह के एक औसत प्रयास की लागत हैं। 375.7 डॉलर को किसी एक माइग्रेशन की कीमत बताना गलत इकाई होगी।
क्या इन्हें सीधे SWE-bench से तुलना कर सकते हैं?
दोनों में कार्य, वातावरण और जाँच के तरीके अलग हैं। हर प्रतिशत को परीक्षण संस्करण और एजेंट के साथ रखें; एक जैसा अंक समान क्षमता साबित नहीं करता।
