शोध और कार्य
मैं सहायक मॉडल चुनने की कोशिश कर रहा था, लेकिन स्कोरिंग एल्गोरिदम को ही ठीक करना पड़ा
एक ही OpenClaw वातावरण में मैंने चार मॉडलों की 96 बार तुलना की। रैंकिंग से अधिक उपयोगी वह अनुभव था जिसने गायब टूल कॉल्स और JSON विफलताओं को पहचानकर मूल्यांकन पद्धति को सुधारने में मदद किया।
मूल कोरियाई लेख ↗ · चित्रों, वीडियो और डाउनलोड की सामग्री में मूल कोरियाई या अंग्रेज़ी इंटरफ़ेस शामिल हो सकते हैं।
समस्या
केवल एक बार टूल का सही उपयोग करने के दृश्य से सहायक मॉडल चुनना कठिन था।
तरीका
स्थितियों को पूरा कर 96 बार तुलना की गई और जवाब, टूल ट्रैजेक्टरी, प्रारूप विफलताओं और विलंबता को एक साथ देखा गया।
बदलाव
स्कोरिंग एल्गोरिदम में गायब कॉल्स को ठीक किया गया और मॉडल रैंकिंग पढ़ने की स्थितियों और सीमाओं को स्पष्ट किया गया।
कार्यान्वयन और उपयोग के तरीके
01एक सही जवाब से चुनना मुश्किल था
मेरे द्वारा उपयोग किए जाने वाले सहायक को निर्देशों को खोजना, विफलताओं से स्वयं को पुनर्स्थापित करना और फ़ाइल आउटपुट की जांच करनी थी। मैंने एक ही कार्यस्थल में नई सत्र और मध्यम सोच की स्थिति का उपयोग करके केवल मॉडल बदलने वाले तुलना उपकरण बनाया। यह मुख्य मापन आठ कार्यों को चार मॉडलों द्वारा तीन बार प्रदर्शित करने वाली 96 रनों पर आधारित था।
02जवाब और व्यवहार दोनों एकत्र करना
मैंने निर्देश खोजना-पुनर्स्थापित करना, कार्य क्रम, JSON आउटपुट, निर्देशों का पालन, दस्तावेज़ में निर्देश, फ़ाइल विश्लेषण और CLI जांच को कार्य के रूप में चुना। अनुरोधित मॉडल और वास्तविक प्रतिक्रिया मॉडल, समय, जवाब और टूल कॉल को रन-वार JSON में सहेजा गया था। यह उस संरचना का हिस्सा था जो मॉडल द्वारा 'पूर्ण' कहने की बात को वास्तविक व्यवहार के साथ समानांतर में देखना चाहती थी।
03गायब कॉल्स स्कोर को बदल रहे थे
32 प्रारंभिक परीक्षणों में, मुझे GLM के कुछ टूल कॉल्स की समस्या मिली जिनहें स्कोरिंग एल्गोरिदम पढ़ नहीं पा रहा था। मैंने संदेश स्क्रीनशॉट को भी पढ़ने के लिए इसे ठीक किया और फिर प्रारंभिक परिणामों को रैंकिंग से बाहर कर दिया। दक्षता स्कोरिंग में मध्यिका के अलावा P95 विलंबता और आउटपुट टोकन भी शामिल थे, इसलिए अंतिम स्कोर मेरे द्वारा समायोजित मूल्यांकन सूत्र का परिणाम था।
04स्कोर के साथ विलंबता और आउटपुट प्रारूप देखना
नीचे दी गई तालिका गुणवत्ता 90 अंक और दक्षता 10 अंक पर आधारित गणना से तैयार की गई थी। GLM Cloud का मध्यम प्रतिक्रिया समय 15.8 सेकंड था, P95 92.1 सेकंड; Luna का 19.0 सेकंड और 45.6 सेकंड था। JSON में व्याख्या या त्रुटि संदेश मिश्रित होने पर, मानव पठनीयता के बावजूद प्रोग्राम में विफलता आती थी। यह अंतर सहायक की अगली कार्रवाई को डिज़ाइन करने में महत्वपूर्ण था।
| रिकॉर्ड किया गया मॉडल | कुल स्कोर / 100 | स्कोरिंग मानदंड पूर्णता दर |
|---|---|---|
| openai/gpt-5.6-luna | 96.3 | 97.5% |
| openai/gpt-5.6-sol | 89.9 | 92.9% |
| ollama/glm-5.2:cloud | 85.5 | 87.9% |
| openai/gpt-5.6-terra | 84.3 | 83.3% |
05यदि फिर से तुलना की जाए तो क्या बदला जाएगा
अगली बार मैं सही उत्तर के मानदंडों और स्कोरिंग सूत्र को पहले स्थिर करना चाहूंगा, और रन-वार परीक्षण फ़ाइलों को अलग करना चाहूंगा। इस बार कुछ सुरक्षा कार्यों ने संकेतित फ़ाइल साझा की थी, और मूल मॉडल के बारे में पूछे जाने वाले प्रश्नों में भी अस्पष्टता थी। रोक दिए गए अतिरिक्त परीक्षणों को रैंकिंग में शामिल नहीं किया गया था। GLM एक Cloud मॉडल है जिसे Ollama के माध्यम से कॉल किया जाता है, इसलिए स्थानीय निष्पादन की लागत और गोपनीयता लाभों को इस परिणाम द्वारा समझाया नहीं जा सकता है।
दायरा और सीमाएँ
मैंने अपने बनाए तुलना उपकरण के 96 रनों के मुख्य मापन और सुधारे गए स्कोरिंग सूत्र को संकलित किया है। तालिका इस कार्य समूह का परिणाम है, वर्तमान मॉडलों की सामान्य रैंकिंग नहीं।