研究・実務
秘書モデルを選ぼうとして、採点器から修正しました
同じOpenClaw環境で4つのモデルを96回比較しました。順位よりも有用だったのは、欠落したツール呼び出しやJSON失敗を見つけて評価方法を修正した経験でした。
韓国語の原文 ↗ · 画像・動画・配布資料には、元の韓国語または英語の画面が含まれます。
課題
ツールを一度上手に使う様子だけで秘書モデルを選ぶのは難しかったです。
取り組み
条件を満たして96回比較し、回答・ツール軌跡・形式失敗・遅延を一緒に見ました。
変わったこと
採点器の呼び出し欠落を修正し、モデル順位を読む条件と限界を明確にしました。
実装方法と応用
01一度の優れた回答で選ぶのは難しかった
私が使う秘書は、命令を見つけ、失敗から回復し、ファイル結果まで確認する必要がありました。同じ作業空間で、新しいセッションとmedium thinking条件を使用してモデルのみを変更する比較ツールを作成しました。本測定は、8つの課題を4つのモデルがそれぞれ3回実行した96回のものです。
02答えと行動を一緒に収集する
命令探索・回復、作業順序、JSON出力、指示遵守、ドキュメント内の指示文、ファイル分析とCLI調査を課題としました。要求モデルと実際の応答モデル、時間、回答、ツール呼び出しを実行ごとのJSONに残しました。モデルが完了したと言うことと実際の行動を並べて見ようとする構成でした。
03欠落した呼び出しが点数を変えていた
32回の予備試験で、GLMの一部のツール呼び出しを採点器が読み取れない問題を見つけました。メッセージスナップショットも読めるように修正した後、予備結果を順位から除外しました。効率性採点には中央値以外にもP95遅延と出力トークンも反映されたため、最終点数は私が調整した評価式の結果です。
04点数の隣に遅延と出力形式を見る
以下の表は品質90点と効率性10点で計算しました。GLM Cloudは中央応答時間15.8秒にP95 92.1秒、Lunaは19.0秒に45.6秒でした。JSONに説明やエラー文が混じっていると、人間には読めてもプログラムでは失敗しました。この違いは秘書の次の作業を設計する上で重要でした。
| 記録されたモデル | 総合点数/100 | 採点項目充足率 |
|---|---|---|
| openai/gpt-5.6-luna | 96.3 | 97.5% |
| openai/gpt-5.6-sol | 89.9 | 92.9% |
| ollama/glm-5.2:cloud | 85.5 | 87.9% |
| openai/gpt-5.6-terra | 84.3 | 83.3% |
05再度比較するなら変えること
次は正解基準と採点式を先に固定し、実行ごとの試験ファイルも分離しようと思います。今回は一部の安全課題が表式ファイルを共有しており、基本モデルを問う質問にも曖昧さがありました。中断した追加試験は順位に混ぜていません。GLMはOllamaで呼び出したCloudモデルであるため、ローカル推論のコスト・プライバシーの利点までこの結果で説明することはできません。
適用範囲と注意点
私が作成した比較ツールの96回本測定と修正した採点式を整理しました。表はこの課題セットの結果であり、現在のモデルの一般順位ではありません。