Back home

एआई कार्य कुशलता रडार | 2026-07-23

एजेंट, एमसीपी, एआई कौशल और वर्कफ़्लो उत्पादकता उपकरण आज देखने के लिए

आज सबसे मजबूत संकेत यह नहीं है कि “कुछ और एआई प्रोजेक्ट जोड़े गए हैं”, बल्कि यह है कि उपकरण दोनों छोर पर जाने लगे हैं: एक तरफ, कोडिंग एजेंट को अधिक विशिष्ट वर्कफ़्लो में एकीकृत किया गया है, और दूसरी तरफ, एमसीपी, डिबगिंग और सुरक्षा के हार्ड कोर को पूरक किया जा रहा है। दूसरे शब्दों में, हर कोई अब केवल “रोबोट जो कोड लिख सकता है” नहीं चाहता है, बल्कि ऐसे एजेंट चाहता है जो समानांतर में काम कर सकें, बाहरी उपकरणों से जुड़ सकें, और ऑडिट और बाधित हो सकें।

यदि आज मुझे अनुवर्ती दिशा-निर्देशों में से केवल सबसे योग्य चुनना होता, तो मैं तीन श्रेणियों को प्राथमिकता देता: एजेंट कार्यक्षेत्र जिसे स्थापित किया जा सकता है और सीधे प्रयास किया जा सकता है, एमसीपी सर्वर जिसे मौजूदा विकास प्रक्रिया से जोड़ा जा सकता है, और कौशल/सुरक्षा उपकरण जो एजेंट में रेलिंग जोड़ते हैं।

एपेरिव्यू/मेडसी-कौशल

यह क्या है: चिकित्सा अनुसंधान के लिए एजेंट कौशल का एक सेट, जिसमें साहित्य पुनर्प्राप्ति, रिपोर्टिंग मानक और उद्धरण जांच, आंकड़े, पेपर ग्राफिक्स और सबमिशन तैयारी शामिल है। इसका क्लाउड कोड, कोडेक्स, कर्सर और गिटहब कोपायलट के साथ उपयोग किए जाने का दावा किया गया है।

अब यह देखने लायक क्यों है: इस प्रकार का “डोमेन कौशल पैकेज” सामान्यीकृत एजेंटों की तुलना में व्यावहारिकता के करीब है। यह एजेंट की क्षमता को “चैट करने में सक्षम होने” से “विषय प्रक्रियाओं के अनुसार काम करने में सक्षम होने” तक बढ़ाता है, और निश्चित चरणों लेकिन कई विवरणों के साथ ज्ञान कार्य के लिए विशेष रूप से उपयुक्त है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यदि आपकी टीम अक्सर साहित्य समीक्षा, प्रयोगात्मक परिणाम संग्रह और प्री-सबमिशन समीक्षा संभालती है, तो यह कौशल प्रपत्र पुन: प्रयोज्य वर्कफ़्लो मॉड्यूल के समान है। यह “एक निश्चित पेशेवर प्रक्रिया के भीतर किसी एजेंट को कैसे रोका जाए” के लिए एक प्रतिलिपि योग्य टेम्पलेट भी प्रदान करता है। यह आवश्यक नहीं कि यह केवल चिकित्सा के लिए ही उपयुक्त हो। इसका उपयोग कानूनी मामलों, निवेश अनुसंधान और उत्पाद अनुसंधान के संदर्भ के रूप में भी किया जा सकता है।

जोखिम या ध्यान देने योग्य बिंदु: चिकित्सा अनुसंधान में एक मजबूत पेशेवर सीमा होती है, और आउटपुट पर डिफ़ॉल्ट रूप से भरोसा नहीं किया जा सकता है क्योंकि इसे एक कौशल कहा जाता है। सन्दर्भ, आँकड़े, चार्ट और विनिर्देश जाँच सभी को मैन्युअल समीक्षा की आवश्यकता होती है; इसके अलावा, यदि इस प्रकार की क्षमता के लिए कोई स्पष्ट सीमा नहीं है, तो “सहायता” को “स्थानापन्न निर्णय” में बदलना आसान है।

मूल लिंक: https://github.com/Aperivue/medsci-skills

निम्बालिस्ट/निम्बालिस्ट

यह क्या है: क्लाउड कोड, कोडेक्स और ओपनकोड के लिए एक ओपन सोर्स विज़ुअल वर्कबेंच। यह मुख्य रूप से समानांतर में कई कोडिंग एजेंटों को चलाता है, और फिर उनके काम को संशोधित करने के लिए मार्कडाउन, मॉकअप और आरेख जैसे दृश्य तरीकों का उपयोग करता है।

अब यह देखने लायक क्यों है: कई टीमों के लिए वास्तव में जो बात अटकती है वह यह नहीं है कि एजेंट लिख सकता है या नहीं, बल्कि “एक ही समय में कई एजेंटों के आउटपुट की निगरानी कैसे करें।” निम्बालिस्ट जैसे टूल का महत्व एजेंटों को कमांड लाइन से बाहर निकालना और उन्हें एक ऐसे इंटरफ़ेस में डालना है जो मॉनिटर करना, तुलना करना और रोलबैक करना आसान है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यह समानांतर प्रयोगों के लिए बहुत उपयुक्त है, जैसे कई एजेंटों को एक ही कार्य सौंपना, और फिर मैन्युअल रूप से एक समाधान का चयन करना; यह संदर्भ हानि को कम करने के लिए व्यवस्थित आवश्यकता आरेख, रेखाचित्र और दस्तावेज़ों को कार्य के ठीक बगल में लटकाने के लिए भी उपयुक्त है। छोटी टीमों के लिए, “एक ही समय में कई लोगों द्वारा कई एजेंटों को देखने” वाला इस प्रकार का कार्यक्षेत्र एक नया मॉडल जोड़ने की तुलना में अधिक व्यावहारिक हो सकता है।

जोखिम या चेतावनियाँ: एक दृश्य कार्यक्षेत्र की लागत आम तौर पर एक भारी इंटरफ़ेस और उच्च संज्ञानात्मक भार होती है। जितनी अधिक समानता होगी, “व्यस्त दिखने का भ्रम पैदा करना उतना ही आसान होगा, लेकिन वास्तव में किसी ने वास्तव में इसकी समीक्षा नहीं की है”; और डेस्कटॉप अनुप्रयोगों का क्रॉस-प्लेटफ़ॉर्म अनुभव, स्थिरता और अनुमति नियंत्रण सभी निर्णय से पहले वास्तविक परीक्षण के योग्य हैं।

मूल लिंक: https://github.com/nimbalyst/nimbalyst

जोविंके/जाट

यह क्या है: एक स्व-घोषित “एजेंट आईडीई” प्रोजेक्ट जो एक ही इंटरफ़ेस से 20+ एजेंटों की निगरानी के लक्ष्य के साथ लाइव सत्र, कार्य प्रबंधन, कोड संपादक, टर्मिनल, ऑटो-एडवांस नियम और समानांतर वर्कफ़्लो प्रदान करता है।

अब यह देखने लायक क्यों है: इस प्रकार की परियोजना एक स्पष्ट प्रवृत्ति को दर्शाती है: एजेंट अब आईडीई में केवल साइडबार नहीं हैं, बल्कि “कार्य ऑर्केस्ट्रेशन परत” की ओर बढ़ रहे हैं। JAT का यह निर्देश एजेंट के साथ प्रश्नों का उत्तर देने वाले एकल सहायक के बजाय शेड्यूल किए गए श्रमिकों के एक समूह की तरह व्यवहार करता है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यदि यह वास्तव में कार्यों, टर्मिनलों, नियमों और समानांतर निष्पादन को एक ही स्थान पर रख सकता है, तो यह निरंतर एकीकरण-शैली स्वचालित विकास के लिए अधिक उपयुक्त होगा, जैसे कार्यों को विभाजित करना, स्क्रिप्ट चलाना और एक ही समय में स्थिति की निगरानी करना। सहयोग के लिए, यह मानवीय पूछताछ को कम करने के लिए “कौन क्या कर रहा है और उन्होंने इसे कहां किया है” के एकीकृत डैशबोर्ड के रूप में भी उपयुक्त हो सकता है।

जोखिम या सावधानियाँ: इस प्रकार के “सब कुछ डाल दो” उपकरण अक्सर बहुत महत्वाकांक्षी होते हैं, लेकिन लागू होने पर जटिलता के कारण वे आसानी से उलटे पड़ जाते हैं। 20 से अधिक एजेंटों की कहानी बहुत आकर्षक है, लेकिन वास्तविक मुद्दे यह हैं कि अनुमतियों को कैसे प्रबंधित किया जाए, विफलता पर कैसे पीछे हटें, संदर्भ का पुन: उपयोग कैसे करें और अंतिम निर्णय कौन करेगा।

मूल लिंक: https://github.com/joewinke/jat

गूगल/मैन्टिस

यह क्या है: Google द्वारा निर्मित एक मॉड्यूलर टूलकिट जो विशेष रूप से AI कोडिंग एजेंटों के लिए सुरक्षा समीक्षा कौशल प्रदान करता है। लक्ष्य एजेंट को स्वचालित रूप से कमजोरियों की खोज, पुनरुत्पादन और पैच करने की अनुमति देना है।

अब यह देखने लायक क्यों है: जब एजेंट कोड बदलने, परीक्षण चलाने और फ़िक्सेस सबमिट करने में सक्षम होने लगते हैं, तो सुरक्षा समीक्षाएँ केवल “अंतरों का मानव स्कैन” नहीं हो सकती हैं। मेंटिस जैसी परियोजनाएं दर्शाती हैं कि एजेंटों के पास जिस चीज की सबसे ज्यादा कमी है, वह अधिक उत्पादन क्षमताओं की नहीं है, बल्कि विशेष ऑडिटिंग, सत्यापन और बाधा परतों की है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यह सुरक्षा समीक्षाओं के लिए शुरुआती बिंदु के रूप में उपयुक्त है, खासकर उन टीमों में जहां एजेंट पहले ही कोड सबमिट करने में भाग ले चुके हैं। एक अधिक यथार्थवादी उपयोग इसे सीधे “सभी कमजोरियों को खोजने” की अनुमति नहीं दे सकता है, बल्कि इसे हल्के सुरक्षा पाइपलाइन बनाने के लिए पूर्व-मर्ज निरीक्षण, मरम्मत सुझाव और प्रतिगमन सत्यापन में एम्बेड करना हो सकता है।

जोखिम या ध्यान देने योग्य बातें: सुरक्षा कौशल झूठी सकारात्मकता और झूठी नकारात्मकता से सबसे अधिक डरते हैं। यदि स्वचालित समीक्षा में स्पष्ट मैन्युअल समीक्षा लिंक नहीं है, तो यह टीम को “कई महत्वहीन मुद्दों को ठीक करने और वास्तव में खतरनाक मुद्दों को गायब करने” के जाल में ले जा सकता है; इसके अलावा, स्वचालित पैचिंग को भेद्यता को अन्य बग में बदलने से भी रोकना चाहिए।

मूल लिंक: https://github.com/google/mantis

डेनियल3303/इक्विबल्स

यह क्या है: एक खुला स्रोत, स्व-होस्टेड “मिनी ब्लूमबर्ग टर्मिनल” एआई एजेंटों के लिए एमसीपी सर्वर के रूप में उपलब्ध है, जिसमें एसईसी फाइलिंग, संस्थागत होल्डिंग्स, इनसाइडर ट्रेडिंग, कांग्रेसनल ट्रेडिंग और शॉर्ट सेलिंग डेटा सहित डेटा शामिल है।

यह अब देखने लायक क्यों है: यह आज की सबसे “ड्रॉप-इन-वर्कफ़्लो” एमसीपी परियोजनाओं में से एक है। यह मूल रूप से बिखरे हुए वित्तीय सूचना स्रोतों को एक कॉल करने योग्य टूल परत में पैकेज करता है, जो लोगों को वेब पेज ब्राउज़ करने के लिए आगे और पीछे जाने देने के बजाय सीधे डेटा की जांच करने, प्रारंभिक स्क्रीनिंग करने और सारांश उत्पन्न करने के लिए एजेंटों के लिए उपयुक्त है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यदि आप निवेश अनुसंधान, बाजार निगरानी, ​​अनुपालन डेटा संग्रह करते हैं, या बस एक एजेंट चाहते हैं जो आपको पहले सार्वजनिक वित्तीय डेटा एकत्र करने में मदद करे, तो यह एमसीपी सर्वर बहुत व्यावहारिक है। यह एक बहुत स्पष्ट पैटर्न भी दिखाता है: उच्च-आवृत्ति डेटा स्रोतों को स्व-होस्ट किए गए टूल में बनाएं, और फिर उन्हें एजेंट द्वारा समान रूप से कॉल करें।

जोखिम या सावधानी: डेटा अधिग्रहण की तुलना में वित्तीय डेटा की व्याख्या अधिक महत्वपूर्ण है। एमसीपी सर्वर “डेटा प्राप्त करना” हल कर सकता है, लेकिन इसका मतलब “व्याख्या” हल करना नहीं है; इसके अलावा, सेल्फ-होस्टिंग का मतलब है कि आपको डेटा अपडेट, इंटरफ़ेस स्थिरता और एक्सेस कंट्रोल मुद्दों को स्वयं ही सहन करना होगा, खासकर जब संवेदनशील वर्कफ़्लो शामिल हों।

मूल लिंक: https://github.com/daniel3303/Equibles

गो-डेल्वे/एमसीपी-डैप-सर्वर

यह क्या है: एक सर्वर जो एमसीपी और डीएपी (डीबग एडाप्टर प्रोटोकॉल) को जोड़ता है, जो एआई एजेंटों को डीबग करने और चल रहे प्रोग्रामों के साथ इंटरैक्ट करने की अनुमति देता है।

यह अभी देखने लायक क्यों है: यह “एजेंटों को वास्तविक इंजीनियरिंग साइटों से जोड़ने” का एक विशिष्ट उदाहरण है। मॉडल न केवल स्थिर कोड को देखता है, बल्कि रनटाइम, ब्रेकप्वाइंट, वेरिएबल और कॉल स्टैक में भी जाता है, जो केवल कोड उत्पन्न करने की तुलना में जटिल बग के समस्या निवारण के लिए अधिक मूल्यवान है।

विकास/डेटा संग्रह/स्वचालन/टीम सहयोग के लिए इसका क्या उपयोग है: यदि यह स्थिर है, तो सबसे सीधा उपयोग डिबगिंग प्रक्रिया को अर्ध-स्वचालित करना है, जैसे एजेंट को पहले स्टैक पढ़ने देना, समस्या का अनुमान लगाना और फिर मैन्युअल सत्यापन में सहयोग करना। टीम सहयोग के लिए, यह “त्रुटि का वर्णन करने” के घर्षण को भी कम कर सकता है और एजेंट को सीधे चल रहे साक्ष्य को देखने की अनुमति दे सकता है।

जोखिम या ध्यान के बिंदु: एक बार डिबगिंग क्षमता चल रहे प्रोग्राम से जुड़ जाती है, तो अनुमतियाँ और सुरक्षा सीमाएँ बहुत स्पष्ट होनी चाहिए। यह “कनेक्ट कर सकते हैं” के लिए “सही ढंग से निर्णय ले सकता है” की गलती भी कर सकता है, इसलिए इसे ब्लैक बॉक्स के बजाय एक सहायक डिबगिंग इंटरफ़ेस के रूप में उपयोग करना सबसे अच्छा है जो स्वचालित रूप से बग को ठीक करता है।

मूल लिंक: https://github.com/go-delve/mcp-dap-server

उन्हें एक इंच दीजिए और वे एक मील ले लेंगे: एमसीपी-आधारित एआई सिस्टम में कॉलर पहचान भ्रम को समझना और मापना

यह क्या है: एमसीपी सुरक्षा के बारे में एक पेपर। मुख्य फोकस एमसीपी सिस्टम में कॉलर पहचान भ्रम है, यानी कॉलर पहचान भ्रम समस्या।

अब यह देखने लायक क्यों है: MCP जितनी तेजी से व्यापक होता जाता है, पहले इसकी सुरक्षा धारणाओं को समझना उतना ही महत्वपूर्ण होता है। यह विषय बहुत विशिष्ट है. यह “एआई खतरनाक है” के बारे में कोई सामान्य बात नहीं है, बल्कि सवाल “कौन कॉल कर रहा है, कौन अधिकृत है, और टूल किस पर भरोसा करता है” पर पड़ता है। यह वही जगह है जहां एजेंट के एंटरप्राइज टूल चेन से जुड़े होने पर चीजें गलत होने की सबसे अधिक संभावना होती है।

यह विकास/दस्तावेज़ीकरण/स्वचालन/टीम सहयोग के लिए कितना उपयोगी है: यदि आप पहले से ही एमसीपी सर्वर का मूल्यांकन या तैनाती कर रहे हैं, तो यह पेपर सुरक्षा जांच सूची के स्रोत की तरह है। यह आपको केवल “यह कनेक्ट किया जा सकता है या नहीं” सत्यापित करने के बजाय पहचान हस्तांतरण, प्राधिकरण सीमाओं, टूल एक्सपोज़र और कॉल चेन ट्रैकिंग पर ध्यान केंद्रित करने की याद दिलाता है।

जोखिम या ध्यान के बिंदु: पेपर का निष्कर्ष तभी सार्थक है जब बात विशिष्ट कार्यान्वयन की आती है। यह आपको जोखिम मॉडल खोजने में मदद कर सकता है, लेकिन यह आपके लिए उन्हें स्वचालित रूप से ठीक नहीं कर सकता है; यदि टीम के पास सुरक्षा ऑडिट और न्यूनतम विशेषाधिकार डिज़ाइन नहीं है, तो समस्या के बारे में जानने से आप और अधिक चिंतित हो जाएंगे।

मूल लिंक: https://arxiv.org/abs/2603.07473

आज सबसे योग्य अनुवर्ती दिशा, मैं दो चीजों पर दांव लगाऊंगा: एक एजेंट को “प्रश्न और उत्तर के एकल बिंदु” से एक कार्यक्षेत्र में बदलना है जिसे “व्यवस्थित, समानांतर और पर्यवेक्षण” किया जा सकता है; दूसरा है एमसीपी को “एक उपकरण जिसे जोड़ा जा सकता है” से एक इंजीनियरिंग परत तक आगे बढ़ाना है जो “अनुमतियाँ और ऑडिट प्रबंधित कर सके”। पहला यह निर्धारित करता है कि क्या दक्षता में वास्तव में सुधार किया जा सकता है, और बाद वाला यह निर्धारित करता है कि दक्षता का यह सेट नियंत्रणीयता पर आधारित है या नहीं।

FAQ

What to read next

Related

Continue reading