संक्षेप में जवाब
Anthropic की नई श्रृंखला में Sonnet 5.5 प्रति टोकन सस्ता है। समान संदर्भ सीमा और कोड परीक्षण का असामान्य परिणाम वास्तविक लागत की तुलना को जटिल बनाते हैं।
कम कीमत वाला विकल्प पहला सवाल बदलता है
Anthropic ने 28 सितंबर को Claude Sonnet 5.5 पेश किया। इससे पहले Opus 5.5 का आधिकारिक ऐलान 22 सितंबर को हुआ था। कोड और दस्तावेज़ टीम के लिए Claude मॉडल लागत अब व्यावहारिक चुनाव है। कौन सा काम बड़े मॉडल को देना चाहिए और कौन सा कम दर वाला मॉडल भरोसेमंद तरीके से पूरा कर सकता है?
कंपनी Sonnet को स्पष्ट रोज़मर्रा के काम और Opus को लगातार निर्णय वाले कठिन काम के लिए प्रस्तुत करती है। यह प्रदाता का वर्णन है, VJOURNAL की अपनी परीक्षा का निष्कर्ष नहीं। उपयोगी संकेत यह है कि मॉडल चुनने से पहले कार्य समझें। एक तय बग और अस्पष्ट वास्तुकला समीक्षा की प्रक्रिया और सफलता मानदंड अलग होंगे।
संदर्भ समान है, सभी दरें समान नहीं
1 अक्टूबर को जाँचे दस्तावेज़ दोनों के लिए दस लाख संदर्भ टोकन और 128,000 आउटपुट टोकन देते हैं। Sonnet की सामान्य इनपुट और आउटपुट दर Opus की आधी है। कैश पढ़ने का शुल्क समान है, जबकि पाँच मिनट कैश लिखने की दर अलग है। तालिका इन श्रेणियों को मिलाकर एक अनुमानित दर बनाने के बजाय अलग रखती है।
बराबर क्षमता लंबे रिपॉज़िटरी से बराबर जानकारी याद रखने का प्रमाण नहीं है। सस्ता इनपुट पूरे कार्य की छोटी बिल राशि भी तय नहीं करता। बार बार भेजा संदर्भ, बना हुआ तर्क और उपकरण के प्रयास खर्च बढ़ा सकते हैं। बजट बनाने से पहले अपने वास्तविक कैश उपयोग और स्वीकार किए गए परिणाम का रिकॉर्ड रखना चाहिए।
| माप | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| इनपुट USD / 10 लाख टोकन | $2 | $4 |
| आउटपुट USD / 10 लाख टोकन | $10 | $20 |
| कैश पढ़ना USD / 10 लाख | $0.20 | $0.20 |
| कैश लिखना USD / 10 लाख | $2.50 | $5 |
| संदर्भ टोकन | 1,000,000 | 1,000,000 |
| आउटपुट टोकन | 128,000 | 128,000 |
| API का सामान्य तर्क स्तर | उच्च (high) | मध्यम (medium) |
| इनपुट के प्रकार | पाठ और चित्र | पाठ और चित्र |
कोड का आश्चर्यजनक परिणाम प्रयास पर निर्भर है
28 सितंबर के ऐलान में FrontierCode v1.1 Main पर Sonnet का xhigh परिणाम 52.1% और max परिणाम 46.2% है। टिप्पणी के अनुसार अधिक समीक्षा से कभी समय खत्म हुआ, कभी अनुरोध से बाहर बदलाव हुए। Opus का प्रकाशित max परिणाम 54.4% है। ये प्रदाता की खास सेटिंग के आँकड़े हैं, हमारी संपादकीय टीम की नई प्रतियोगिता नहीं।
परीक्षा पूछती है कि बदलाव मानवीय संपादन के बिना जोड़ा जा सकता है या नहीं। इसलिए अनावश्यक अतिरिक्त काम स्कोर घटा सकता है। यह सफलता की सीमा लिखने और तर्क स्तर सोचकर चुनने का ठोस कारण है। सबसे बड़ा गणना बजट अपने आप सबसे अच्छा अंतिम परिणाम देगा, ऐसा मानना इन प्रकाशित आँकड़ों से समर्थित नहीं है।
| मॉडल | तर्क का स्तर | FrontierCode v1.1 Main (%) |
|---|---|---|
| Claude Sonnet 5.5 | बहुत उच्च (xhigh) | 52.1% |
| Claude Sonnet 5.5 | अधिकतम (max) | 46.2% |
| Claude Opus 5.5 | अधिकतम (max) | 54.4% |
सामान्य सेटिंग भी दर्ज करनी होगी
Sonnet के API कार्ड में सामान्य तर्क स्तर high है। ऐलान Claude अनुप्रयोग और Claude Code के लिए medium बताता है। Opus के API कार्ड में medium है। यदि चलने की जगह दर्ज नहीं हुई तो दो सामान्य दिखने वाले सत्र अलग तर्क बजट इस्तेमाल कर सकते हैं। उपयोगकर्ता केवल मॉडल का नाम देखकर यह फर्क आसानी से छोड़ सकता है।
Artificial Analysis अपनी साझा व्यवस्था में Terminal-Bench 4.0 का स्वतंत्र मूल्यांकन भी प्रकाशित करता है। यह बाहरी प्रमाण उपयोगी है, लेकिन उसकी सेटिंग और स्रोत साथ रहने चाहिए। प्रदाता का लॉन्च स्कोर और स्वतंत्र टर्मिनल परिणाम अलग अवलोकन हैं। उन्हें दूसरी तालिका में बदलकर रखने से तुलना मजबूत नहीं होती; वास्तविक अंतर छिप जाता है।
ऐसा चुनाव नियम बनाएँ जिसे जाँच सकें
हमारा संपादकीय अनुमान है कि शुरुआत तय कार्य, लिखित रुकने की शर्त और दर्ज प्रयास स्तर से करें। सामान्य सुधार तथा दस्तावेज़ संशोधन को खुली वास्तुकला के फैसले से अलग जाँचें। Sonnet स्वीकृति मानदंड पूरा करे तो दर का लाभ उपयोगी है। बार बार बचाव चाहिए तो पूरी प्रक्रिया की सीधी तुलना Opus से करें।
असफल कोशिश सहित कुल लागत, समय और समीक्षक के सुधार गिनें। मॉडल अपडेट के बाद बँटवारा फिर देखें। 1 अक्टूबर तक रिलीज़ तारीख, क्षमता और सामान्य दरें दस्तावेज़ों से पुष्ट हैं। किसी खास टीम के लिए सबसे सस्ती सेटिंग फिर भी उसके काम, टोकन उपयोग और समीक्षा के मानक पर निर्भर रहेगी, सिर्फ प्रति टोकन कीमत पर नहीं।
सवाल और जवाब
क्या Sonnet हमेशा आधे खर्च में चलता है?
सामान्य इनपुट और आउटपुट दर आधी है, लेकिन कैश पढ़ने का शुल्क समान है। टोकन खपत, दोबारा कोशिश और समीक्षा से पूरे काम की लागत बदल सकती है।
क्या दोनों की संदर्भ सीमा अलग है?
1 अक्टूबर को जाँचे दस्तावेज़ दोनों में दस लाख संदर्भ टोकन और 128,000 आउटपुट टोकन बताते हैं। ये क्षमता की दो स्वतंत्र सीमाएँ हैं।
अधिकतम प्रयास का स्कोर क्यों कम हुआ?
Anthropic के अनुसार अतिरिक्त समीक्षा से कुछ कार्यों में समय समाप्त हुआ या दायरे से बाहर बदलाव हुए। FrontierCode बिना मानवीय संपादन स्वीकार होने वाला बदलाव जाँचता है।
