UPMILab.
☰

शोध और कार्य

मैं सहायक मॉडल चुनने की कोशिश कर रहा था, लेकिन स्कोरिंग एल्गोरिदम को ही ठीक करना पड़ा

एक ही OpenClaw वातावरण में मैंने चार मॉडलों की 96 बार तुलना की। रैंकिंग से अधिक उपयोगी वह अनुभव था जिसने गायब टूल कॉल्स और JSON विफलताओं को पहचानकर मूल्यांकन पद्धति को सुधारने में मदद किया।

मूल कोरियाई लेख ↗ · चित्रों, वीडियो और डाउनलोड की सामग्री में मूल कोरियाई या अंग्रेज़ी इंटरफ़ेस शामिल हो सकते हैं।

समस्या

केवल एक बार टूल का सही उपयोग करने के दृश्य से सहायक मॉडल चुनना कठिन था।

तरीका

स्थितियों को पूरा कर 96 बार तुलना की गई और जवाब, टूल ट्रैजेक्टरी, प्रारूप विफलताओं और विलंबता को एक साथ देखा गया।

बदलाव

स्कोरिंग एल्गोरिदम में गायब कॉल्स को ठीक किया गया और मॉडल रैंकिंग पढ़ने की स्थितियों और सीमाओं को स्पष्ट किया गया।

कार्यान्वयन और उपयोग के तरीके

01एक सही जवाब से चुनना मुश्किल था

मेरे द्वारा उपयोग किए जाने वाले सहायक को निर्देशों को खोजना, विफलताओं से स्वयं को पुनर्स्थापित करना और फ़ाइल आउटपुट की जांच करनी थी। मैंने एक ही कार्यस्थल में नई सत्र और मध्यम सोच की स्थिति का उपयोग करके केवल मॉडल बदलने वाले तुलना उपकरण बनाया। यह मुख्य मापन आठ कार्यों को चार मॉडलों द्वारा तीन बार प्रदर्शित करने वाली 96 रनों पर आधारित था।

02जवाब और व्यवहार दोनों एकत्र करना

मैंने निर्देश खोजना-पुनर्स्थापित करना, कार्य क्रम, JSON आउटपुट, निर्देशों का पालन, दस्तावेज़ में निर्देश, फ़ाइल विश्लेषण और CLI जांच को कार्य के रूप में चुना। अनुरोधित मॉडल और वास्तविक प्रतिक्रिया मॉडल, समय, जवाब और टूल कॉल को रन-वार JSON में सहेजा गया था। यह उस संरचना का हिस्सा था जो मॉडल द्वारा 'पूर्ण' कहने की बात को वास्तविक व्यवहार के साथ समानांतर में देखना चाहती थी।

03गायब कॉल्स स्कोर को बदल रहे थे

32 प्रारंभिक परीक्षणों में, मुझे GLM के कुछ टूल कॉल्स की समस्या मिली जिनहें स्कोरिंग एल्गोरिदम पढ़ नहीं पा रहा था। मैंने संदेश स्क्रीनशॉट को भी पढ़ने के लिए इसे ठीक किया और फिर प्रारंभिक परिणामों को रैंकिंग से बाहर कर दिया। दक्षता स्कोरिंग में मध्यिका के अलावा P95 विलंबता और आउटपुट टोकन भी शामिल थे, इसलिए अंतिम स्कोर मेरे द्वारा समायोजित मूल्यांकन सूत्र का परिणाम था।

04स्कोर के साथ विलंबता और आउटपुट प्रारूप देखना

नीचे दी गई तालिका गुणवत्ता 90 अंक और दक्षता 10 अंक पर आधारित गणना से तैयार की गई थी। GLM Cloud का मध्यम प्रतिक्रिया समय 15.8 सेकंड था, P95 92.1 सेकंड; Luna का 19.0 सेकंड और 45.6 सेकंड था। JSON में व्याख्या या त्रुटि संदेश मिश्रित होने पर, मानव पठनीयता के बावजूद प्रोग्राम में विफलता आती थी। यह अंतर सहायक की अगली कार्रवाई को डिज़ाइन करने में महत्वपूर्ण था।

मॉडल-वार 24 रन · गुणवत्ता 90 अंक + दक्षता 10 अंक · इस परीक्षण का स्कोरिंग सूत्र
रिकॉर्ड किया गया मॉडलकुल स्कोर / 100स्कोरिंग मानदंड पूर्णता दर
openai/gpt-5.6-luna96.397.5%
openai/gpt-5.6-sol89.992.9%
ollama/glm-5.2:cloud85.587.9%
openai/gpt-5.6-terra84.383.3%
05यदि फिर से तुलना की जाए तो क्या बदला जाएगा

अगली बार मैं सही उत्तर के मानदंडों और स्कोरिंग सूत्र को पहले स्थिर करना चाहूंगा, और रन-वार परीक्षण फ़ाइलों को अलग करना चाहूंगा। इस बार कुछ सुरक्षा कार्यों ने संकेतित फ़ाइल साझा की थी, और मूल मॉडल के बारे में पूछे जाने वाले प्रश्नों में भी अस्पष्टता थी। रोक दिए गए अतिरिक्त परीक्षणों को रैंकिंग में शामिल नहीं किया गया था। GLM एक Cloud मॉडल है जिसे Ollama के माध्यम से कॉल किया जाता है, इसलिए स्थानीय निष्पादन की लागत और गोपनीयता लाभों को इस परिणाम द्वारा समझाया नहीं जा सकता है।

दायरा और सीमाएँ

मैंने अपने बनाए तुलना उपकरण के 96 रनों के मुख्य मापन और सुधारे गए स्कोरिंग सूत्र को संकलित किया है। तालिका इस कार्य समूह का परिणाम है, वर्तमान मॉडलों की सामान्य रैंकिंग नहीं।

स्रोत और संदर्भ

    इसी क्षेत्र के अन्य उदाहरण →
    문서 제출 전 체크 · 무료 체험UPMI 익명 방문 통계 안내·중지