संक्षेप में जवाब
29 सितंबर का Google शोध विवरण जमे हुए मूल मॉडल को दिशा देने वाला नियंत्रक समझाता है। उसे निर्माण के बीच की जानकारी चाहिए और परीक्षण आज के चित्र सेवाओं की रैंकिंग नहीं है।
शोध की व्याख्या, नया चित्र सेवा लॉन्च नहीं
Google Research ने 29 सितंबर को Diffusion Controller की व्याख्या प्रकाशित की। यह चित्र मॉडल को निर्देश का पालन कराने के लिए नियंत्रण सिद्धांत का तरीका है। जुड़ा पेपर पहली बार 7 मार्च 2026 को जमा हुआ था। इसलिए ताजा घटना विस्तृत शोध संचार है। इससे नया प्रशिक्षित उपभोक्ता जनरेटर या हर चित्र एपीआई में तुरंत मिलने वाली संपादन सुविधा का लॉन्च साबित नहीं होता।
डिफ्यूजन चित्र नियंत्रण में शोर से तैयार चित्र बनने के रास्ते को बदला जाता है। जनरेटर आकर्षक दृश्य बना सकता है, फिर भी कोई वस्तु, संबंध या माँगा गुण छोड़ सकता है। निर्देश का दबाव बहुत बढ़ाने से रूप खराब भी हो सकता है। शोध छोटी सीखी हुई नियंत्रक व्यवस्था देखता है, जो उस रास्ते को सुधारती है और निर्देश तथा मूल व्यवहार के संतुलन को स्पष्ट डिजाइन सवाल बनाती है।
स्थिर पैरामीटर में भी जानकारी की जरूरत
आंशिक पहुँच वाले विन्यास में बड़ा पहले से प्रशिक्षित मूल मॉडल स्थिर रहता है और सहायक नेटवर्क सुधार देता है। नियंत्रक को निर्माण के बीच की जानकारी मिलती है, जिसमें शोर हटाते समय रिवर्स मीन भी शामिल है। स्थिर वजन का अर्थ उस विन्यास में मूल पैरामीटर का दोबारा प्रशिक्षण नहीं होना है। इसका अर्थ यह नहीं कि नियंत्रक बिना प्रक्रिया देखे काम कर सकता है।
इससे बंद मॉडल को बदलने के दावे की सीमा समझ आती है। आम होस्टेड एपीआई केवल निर्देश ले और तैयार चित्र लौटाए तो जरूरी बीच का इंटरफेस उपलब्ध नहीं होगा। पेपर यह साबित नहीं करता कि वैसी सेवा में भी वही नियंत्रक लगा सकते हैं। हमारी व्याख्या है कि निर्माण प्रक्रिया तक पहुँच उत्पाद की अलग आवश्यकता बनती है, भले मूल वजन बदलने की अनुमति जरूरी न हो।
| विन्यास | पहुँच या प्रशिक्षण | तुलना का विषय |
|---|---|---|
| Diffusion Controller | बीच का रिवर्स मीन; मूल मॉडल स्थिर | सहायक नेटवर्क से दिशा बदलना |
| Controller-Naive | रिवर्स मीन और सहायक धारा नहीं | प्रस्तावित नेटवर्क के हिस्सों का महत्व |
| Controller-J | मूल मॉडल और नियंत्रक का साथ प्रशिक्षण | पूरी पहुँच वाला अनुकूलन |
| Controller-S | मूल मॉडल और नियंत्रक का अलग प्रशिक्षण | पूरी पहुँच का दूसरा प्रशिक्षण तरीका |
प्रयोग में चार संरचनाएँ अलग रखी गईं
Google चार नियंत्रक संरचनाएँ और अलग प्रशिक्षण तरीके बताता है। इनमें पर्यवेक्षित प्रशिक्षण, इनाम के अनुसार भारित हानि और प्रॉक्सिमल नीति अनुकूलन हैं। मुख्य आंशिक पहुँच डिजाइन बीच की उपयोगी जानकारी और सहायक धारा लेता है। सरल संस्करण ये हिस्से हटा देता है। पूरी पहुँच के दो संस्करण मूल मॉडल और नियंत्रक को साथ या अलग प्रशिक्षित करते हैं। वे अतिरिक्त पहुँच के अलग लाभ जाँचते हैं।
प्रयोग Stable Diffusion v1.4 पर हुए हैं। इससे अनुकूलन विधि की ठोस जाँच होती है, लेकिन परिचय में बताए गए आज के व्यावसायिक चित्र सेवाओं का सीधा क्रम नहीं बनता। उस आधार पर अच्छा नियंत्रक उसी मॉडल, प्रशिक्षण और मूल्यांकन से जुड़ा परिणाम है। दूसरी संरचना में फायदा दिखाने के लिए अलग प्रमाण चाहिए। पुराने आधार का प्रतिशत अपने आप हर नए जनरेटर का सुधार नहीं हो जाता।
पसंद का स्कोर और इंसानी निर्णय अलग
शोध Human Preference Score v2 नामक सीखे मूल्यांकन मॉडल के साथ इंसानी मूल्यांकन भी इस्तेमाल करता है। खुले HPS-v2 प्रोजेक्ट का संदर्भ बताता है कि स्कोर पसंद का अनुमान लगाने वाला उपकरण है। वह हर नई तस्वीर पर किसी व्यक्ति का वास्तविक निर्णय नहीं लिखता। ऐसे संकेत से मेल को साफ भाषा में बताना चाहिए, खासकर जब वैसा ही संकेत प्रशिक्षण के लक्ष्य में भी काम करता हो।
Google का 90 प्रतिशत जीत वाला प्रमुख दावा पूरी पहुँच वाले बदले गए संस्करण से जुड़ा है। यह सार्वभौमिक सटीकता नहीं और स्थिर आधार वाले हर नियंत्रक पर लागू नहीं है। जीत दर के साथ तुलना वाला मॉडल, निर्देश समूह और निर्णय प्रक्रिया जरूरी हैं। इनके बिना खास आधार से पसंद किए जाने को किसी भी माँग का ठीक चित्र बनने की संभावना समझने की गलती हो सकती है।
चित्र को निर्देशित करना चुनाव भी है
ढाँचे में निर्माण के समय नियंत्रक की ताकत बदलने की सुविधा बताई गई है। सिद्धांततः इससे अतिरिक्त लक्ष्य का प्रभाव कम या ज्यादा हो सकता है। यह नियंत्रण का आयाम है, हर संभव लक्ष्य एक साथ पूरा होने का प्रमाण नहीं। चित्र में सभी वस्तुएँ हो सकती हैं लेकिन प्रकाश अस्वाभाविक हो सकता है। उलटे दृश्य विश्वसनीय लगे फिर भी वस्तुओं की दूरी या स्थिति निर्देश से अलग हो सकती है।
काल्पनिक स्टूडियो काम में फूलदान के पास नाशपाती माँगने पर कई सवाल हैं। क्या दोनों हैं, क्या उनका संबंध सही है और क्या दृश्य एकसार लगता है? केवल कुल पसंद का स्कोर किसी खास शर्त की विफलता छिपा सकता है। पेपर हस्तक्षेप का तरीका सुझाता है। हमारी व्याख्या है कि उपयोगकर्ता अलग स्वीकृति मानदंड रखें, ताकि अधिक सुंदर दृश्य को अधिक सही नियंत्रण समझने की भूल न हो।
अगला प्रमाण दूसरे मॉडल पर दोहराव होगा
सितंबर का विवरण निजीकरण, सुरक्षा और वीडियो को आगे के शोध रास्ते बताता है। वे उपलब्ध उत्पाद की सत्यापित सुविधाएँ नहीं हैं। अगली मजबूत जाँच दूसरे मूल मॉडल, जरूरी बीच की पहुँच और पसंद तथा खास गुण दोनों के परिणाम देगी। साथ ही प्रशिक्षण और निर्माण की अतिरिक्त लागत मापेगी। तभी गुणवत्ता के लाभ को सेवा पर पड़ने वाले नए काम के साथ ठीक तरह समझा जा सकेगा।
1 अक्टूबर तक प्रमाण एक ठोस संरचनात्मक विचार का समर्थन करते हैं: छोटी प्रशिक्षित व्यवस्था तय पहुँच स्थितियों में बड़े चित्र जनरेटर को दिशा दे सकती है। इससे हर बंद चित्र एपीआई बदलना या हर जगह समान प्रतिशत सुधार नहीं सिद्ध होता। काम का मूल्य नियंत्रण, पहुँच और मूल्यांकन को स्पष्ट अलग करना है। इससे बाद में ऐसे मॉडलों के दावे समझना, जाँचना और दोहराना आसान हो सकता है।
सवाल और जवाब
क्या नियंत्रक किसी भी चित्र एपीआई में लगाया जा सकता है?
आंशिक पहुँच वाला तरीका शोर हटाने के बीच की जानकारी लेता है। केवल अंतिम चित्र लौटाने वाली सेवा यह जानकारी नहीं दे सकती। शोध हर बंद एपीआई के साथ काम करने की पुष्टि नहीं करता।
क्या 90% जीत स्थिर मूल मॉडल वाले तरीके की है?
Google यह संख्या पूरी पहुँच के साथ बदले गए संस्करण को देता है। इसे हर नियंत्रक पर लागू करना या किसी भी निर्देश की 90% सफलता मानना सही नहीं होगा।
क्या वैज्ञानिक पेपर सितंबर में पहली बार आया?
जुड़ा हुआ पेपर 7 मार्च 2026 को जमा हुआ था। 29 सितंबर की सत्यापित घटना Google Research की व्याख्या है, पेपर का पहला प्रकाशन या आम उपयोग के लिए उत्पाद जारी होना नहीं।
