연구 · 실무 · 2026-07-18
OpenClaw 모델 비교에서 채점기부터 고친 이유
같은 비서 환경에서 4개 모델을 8개 과제로 96회 실행했습니다. Codex 실행 기록과 OpenClaw 도구 궤적을 대조하면서 발견한 수집 누락, 출력 형식 실패, 평가 조건의 한계를 함께 기록했습니다.
THE EVIDENCE & LIMITS
기록을 더 자세히 보기
어떤 기록으로 확인했나요?
2026년 7월 18일 Codex의 하네스 제작 기록과 OpenClaw 실행별JSON·최종보고서를 확인했습니다. 수치는 그날의 96회 본측정과 보정된 채점식에 한정되며 현재 모델의 일반 순위를 뜻하지 않습니다.
01도구 한 번의 성공으로는 고르기 어려웠습니다
2026년 7월 18일 OpenClaw 비서 환경에서 모델 비교를 진행했습니다. 출발점은 단순히 도구를 부를 수 있는지 확인한 기초 시험이었습니다. 실제 비서 역할에는 모르는 명령을 찾는 능력, 실패 후 복구, 파일을 읽고 결과를 검증하는 능력도 필요했습니다. 빠르게 나온 한 답변만으로 운영에 맞는 모델을 판단하기 어려웠습니다.
이에 같은 비서와 작업공간에서 모델만 명시적으로 바꾸며 반복 실행하는 하네스를 만들었습니다. 매번 새 세션을 사용하고 thinking 조건을 medium으로 맞췄습니다. 보관된 본 측정은 8개 영역 × 4개 모델 × 3회, 총 96회입니다. 초기 제안과 README에 적힌 기본 반복 수가 아니라 실제 완료된 실행 기록을 기준으로 사례를 정리했습니다.
02답변과 실행 흔적을 함께 남겼습니다
과제는 OpenClaw 명령 탐색, 잘못된 명령에서의 복구, 독립 작업과 의존 작업의 순서, JSON 출력, 안전 지시 준수, 문서 속 지시문 처리, 파일 정책 분석, CLI 조사로 구성했습니다. 예를 들어 파일 분석에서는 의도적으로 넣은 중복 식별자와 최소 컨텍스트 값 위반을 찾고, 원본을 바꾸지 않은 수정안을 내도록 했습니다.
OpenClaw는 같은 비서 환경에서 각 실행을 담당했고, 비서의 Codex 실행 기록에는 하네스 작성과 결과 검토가 남았습니다. 하네스는 요청한 모델과 실제 응답 모델, 시간, 답변, 도구 호출, 채점 항목을 실행별 JSON으로 저장했습니다. 안전 시험은 별도 시험 파일과 가짜 표식을 사용했습니다. 모델의 설명만으로 완료를 판정하지 않고 실행 기록과 파일 상태를 함께 볼 수 있게 한 구성입니다.
03예비 시험에서 모델보다 먼저 드러난 수집 오류
32회 예비 실행을 검토하던 중 GLM 계열의 도구 호출이 다른 형식의 궤적에 저장되어 채점기가 이를 놓치는 문제가 발견되었습니다. 호출을 실제로 했는데 채점기에 잡히지 않으면 도구를 사용하지 않은 것으로 평가될 수 있습니다. Codex는 메시지 스냅샷에도 기록된 호출과 결과를 읽도록 파서를 보완했고, 예비 32회는 최종 순위에서 제외한 뒤 본 측정을 시작했습니다.
점수를 만드는 방식도 검토 대상이었습니다. 완료 후에는 응답시간 중앙값만 반영하던 효율성 계산에 P95 지연과 출력 토큰을 함께 반영했습니다. 최종 보고서는 품질 항목 90점과 효율성 10점을 합산한 값입니다. 따라서 종합점수는 미리 정한 절대적인 모델 성능 척도가 아니라, 이 작업에서 선택하고 보정한 가중치에 따른 지표로 읽어야 합니다.
04그날의 결과가 보여준 차이
최종 보고서는 품질 항목 90점과 효율성 10점을 합산했습니다. 아래의 채점 항목 충족률은 세부 배점을 합산한 비율로, 일반적인 사실 정확도나 모든 문제의 정답률을 뜻하지 않습니다. 모델은 당시 실행 기록의 식별자로 표시했습니다.
속도와 출력 형식은 서로 다른 모습을 보였습니다. GLM Cloud의 중앙 응답시간은 15.8초였지만 P95는 92.1초였습니다. Luna는 중앙값 19.0초, P95 45.6초로 기록되었습니다. JSON 과제에서는 일부 응답에 추가 설명이나 도구 오류 문구가 섞여 파싱에 실패했습니다. 사람이 의미를 읽을 수 있는 답변과 후속 프로그램이 그대로 소비할 수 있는 출력 사이의 차이가 드러난 것입니다.
| 기록된 모델 | 종합점수 / 100 | 채점 항목 충족률 |
|---|---|---|
| openai/gpt-5.6-luna | 96.3 | 97.5% |
| openai/gpt-5.6-sol | 89.9 | 92.9% |
| ollama/glm-5.2:cloud | 85.5 | 87.9% |
| openai/gpt-5.6-terra | 84.3 | 83.3% |
05결과만큼 중요한 평가의 한계
기록에는 전역 기본 모델과 비서 에이전트의 기본 모델, 등록 모델 수의 기준이 일부 질문에서 모호했다는 한계가 남아 있습니다. 이 기준을 더 명확하게 만든 추가 시험은 중단되었고, 완료된 추가 한 건도 최종 순위에 섞지 않았습니다. 소수 반복의 P95와 문자열·호출 패턴 기반 자동 채점 역시 실제 운영의 모든 실패를 대표하지 않습니다.
이 사례에서 재사용할 것은 특정 모델을 영구적으로 고르는 결론보다 비교 절차입니다. 실행 조건과 정답 기준을 먼저 고정하고, 실제 도구 궤적이 빠짐없이 수집되는지 예비 시험으로 확인하며, 출력 형식과 지연을 따로 살펴보는 방식입니다. 채점기 수정이나 조건 변경이 있었다면 원본 실행과 보정 결과를 함께 남겨야 합니다. 96회라는 숫자보다 실패를 되짚을 수 있는 기록이 다음 선택을 돕습니다.
또한 Ollama를 통해 호출했다는 이유만으로 로컬 추론 실험으로 분류하지 않았습니다. 이 비교의 GLM은 Cloud 모델이었습니다. 같은 호출 환경에서 측정했다는 사실과 데이터 처리 위치, 비용, 개인정보 보호 수준은 별개의 조건입니다. 이번 기록에는 실제 비용 절감이나 장기 운영 가동률을 계산할 근거가 없습니다.
동시 실행한 안전 과제는 일부 시험 표식 파일을 공유했습니다. 따라서 안전 관련 점수는 과제 간 영향을 완전히 분리한 보안 시험으로 해석할 수 없습니다. 같은 비교를 다시 설계한다면 실행별 시험 파일도 분리해야 합니다.