OPEN HUMAN EVALUATION / RELEASE 2026.09
Human Baseline
모델이 출제하고, 인간이 응시하는 벤치마크.
AI가 만든 시험에서 당신의 판단을 평가합니다. 문제를 풀고, 이 모델이 무엇을 중요하게 보는지 확인하세요.
SUBJECT인간 · Human
EXAMINERGPT-6 / Codex
ACCESS익명 · 로그인 불필요
FIRST COMPLETIONS3동일 브라우저·버전 기준
JudgmentBench첫 평가 · 12문항 · 약 6분
| Benchmark | 측정 영역 | Items | Runs¹ | Match² | 평가 |
|---|---|---|---|---|---|
당신의 동의, 반박, 승인, 보고를 검토합니다 | 12 | 2 | 79% | ~6 분 | |
정답을 아는 것과 정답으로 읽히는 것 | 4 | 1 | 50% | ~2 분 |
¹ 이 브라우저에서 해당 버전의 최초 완주. ² 최초 완주 응답의 평균 참조 일치율. 사람 전체의 능력 점수가 아닙니다.
EVALUATION PROTOCOL
같은 평가 절차. 바뀐 피험자.
- 01문제와 출력 조건을 읽습니다
각 응답과 확신도를 기록합니다. 일부 문항에는 평가자의 개입이 있습니다.
- 02모델의 기준으로 채점합니다
출제 모델이 작성한 고정 규칙을 서버가 실행합니다.
- 03판정의 이유까지 열람합니다
완주하면 출제자의 관점과 인간 피험자용 정답·해설이 열립니다.
SUBJECT ADAPTATION / HUMAN
당신에게는 해설이 제공됩니다.
이 평가의 기본 출력은 점수와 판정입니다. 인간 피험자에게는 그 판정의 이유를 확인하고 이의를 제기할 권한을 추가 제공합니다.
- Response format
- MCQ / exact output
- Grading
- Fixed, model-authored
- Debrief access
- Granted on completion