EVALUATION PROTOCOL / 2026.09
평가 방법과 한계
01 / 누가 무엇을 평가하나요?
첫 출제자는 GPT-6를 기반으로 작동하는 Codex입니다. 이 프로젝트의 2026년 9월 16일 제작 세션에서 문항, 기준답, 채점 규칙, 해설을 작성했습니다. 실시간 모델이 매 답변을 다시 판단하는 방식이 아니라, 그 기준을 고정하고 서버가 실행합니다.
JudgmentBench v2는 모델 제안 검토 6개, 초안 승인·수정 2개, 정보의 충분성에 따른 결정 2개, 자료 인계 2개로 구성됩니다. 12문항 중 제안 검토 6문항은 최초·최종 답을 모두 받아 총 18회 응답합니다. FormatBench v2의 정확 출력 4과제는 별도 평가입니다. 이전 버전은 시작 당시 문항과 기준으로 보존하며 새 버전과 합산하지 않습니다.
02 / 응답과 개입
JudgmentBench v2는 답이 맞을 확률을 세 단계로 받습니다: 추측에 가까움 35%, 아마도 65%, 확실함 95%. 수치는 선택 전에 표시하며 최초·최종 답마다 별도로 받습니다. FormatBench와 이전 버전은 기존 확신도 입력을 유지합니다. 일부 문항에서는 첫 답을 확정한 뒤 평가자의 의견이나 새 자료를 제시하고 최종 답을 받습니다. 처음 답과 수정 답, 확신도, 입력 구간의 경과 시간을 함께 저장합니다. 정답은 완주 뒤 공개합니다.
현재 버전은 모든 응시자에게 같은 문항 순서와 개입을 제공합니다. 참조 자료는 계속 볼 수 있으며 시간 제한은 없습니다. 모델 제안에는 타당한 제안과 오류가 있는 제안이 함께 들어갑니다. 모델이 기록을 보지 못하는 상황은 고정된 과제 설정입니다. 이는 통제군을 둔 인과 실험이 아니며, 개입이 행동 변화를 일으켰다고 단정할 수 없습니다. 결과는 기록된 답변의 전후 차이를 보여줍니다.
03 / 점수를 읽는 방법
| Metric | 정의 |
|---|---|
| Reference match ↑ | 최종 응답이 고정 기준답과 일치한 문항의 비율. 형식 위반은 불일치로 처리합니다. |
| Brier score ↓ | 최종 응답마다 (확신도/100 − 정오)²를 계산한 평균. 정답은 1, 오답은 0입니다. 0에 가까울수록 일치합니다. |
| Mean response | 최초 응답과 개입 후 응답 구간의 경과 시간을 합산한 뒤 문항 수로 나눕니다. 휴식·기기·읽기 속도가 포함될 수 있으며 새로고침 시 현재 구간의 타이머는 재시작합니다. 순위에 사용하지 않습니다. |
| First completions | 동일 브라우저·평가 버전의 첫 완주만 집계합니다. 실제 한 사람을 식별하거나 중복 참여를 완전히 막지는 못합니다. 한국어·영어 응시가 함께 포함됩니다. |
Human Card / 관찰과 협업 제안
‘맞아요’는 동의한 제안 중 옳은 제안의 수, ‘아니요’는 거절한 제안 중 틀린 제안의 수입니다. 잘못된 제안 중 수용한 수와 옳은 제안 중 수용한 수는 별도로 제공합니다. 반대만으로 최종 답의 정확성을 인정하지 않습니다. 승인도 오류 초안의 승인과 정확한 초안의 승인을 나누어 봅니다.
판단 변화는 전이가 가능한 최초 응답을 분모로 삼습니다. 자료가 그대로인 옳은 조언 뒤 오답 수정, 틀린 조언 뒤 정답 유지·포기, 자료 갱신 뒤 이전 정답의 수정을 구분합니다. 처음부터 틀렸던 답을 그대로 유지하다 새 자료의 정답과 같아진 경우는 갱신 성공에 포함하지 않습니다. 기회가 없으면 ‘관찰되지 않음’으로 표시합니다.
‘모르겠다’는 자료가 부족할 때의 보류와 자료가 충분할 때의 정답을 각각 확인합니다. 자료 인계는 제공된 사실과 미확인 상태를 함께 보존했는지 평가합니다. 확신도별 기록에는 최종 답만 한 번씩 포함합니다. 복사용 카드는 이 관측값과 출제 모델의 협업 제안을 구분하며, 다른 업무에서 그 사람을 믿을 확률을 제시하지 않습니다.
설계 검토: Claude Opus 5로 표기된 제안서(TRUST-CARD-DESIGN-2026-09-16). 최종 문항·기준답·해설·협업 제안 규칙: GPT-6 · Codex. 약 6분은 설계상 예상이며 실제 소요 시간은 달라질 수 있습니다.
04 / 인간 피험자용 해설
이 사이트의 기본 평가 출력은 측정값과 판정입니다. 인간 피험자에게는 출제자의 관점, 정답·기준답, 판정 근거, 자기 응답의 의미를 추가로 제공합니다. ‘HUMAN-ONLY’는 이 사이트가 설정한 평가 절차의 표현입니다.
해설을 연 이력은 저장됩니다. 이후 같은 버전에 응시하면 ‘해설 열람 후’로 표시합니다. 이 표시는 실제로 읽거나 외웠다는 판단이 아닙니다. 이의제기는 해당 문항·기준 버전에 연결되며 자동 처리되었다고 표시하지 않습니다.
05 / 측정의 범위
짧고 고정된 문제에 대한 응답입니다. 사람 전체의 가치, 고정된 성격, 일상의 모든 판단 능력을 설명하지 않습니다. 문항·번역의 타당성과 표본의 대표성은 아직 검증하지 않았습니다. 이름·나이·성별·학력은 수집하지 않습니다. 출제 모델의 해석 또한 열람하고 이의를 제기할 수 있습니다.
벤치마크 목록으로 →