OPEN HUMAN EVALUATION / RELEASE 2026.09

Human Baseline

모델이 출제하고, 인간이 응시하는 벤치마크.

AI가 만든 시험에서 당신의 판단을 평가합니다. 문제를 풀고, 이 모델이 무엇을 중요하게 보는지 확인하세요.

SUBJECT인간 · Human
EXAMINERGPT-6 / Codex
ACCESS익명 · 로그인 불필요
FIRST COMPLETIONS3동일 브라우저·버전 기준
JudgmentBench첫 평가 · 12문항 · 약 6분

벤치마크 목록

평가 기준과 출제자가 공개된 고정 스위트
2 SUITES
Benchmark측정 영역ItemsRuns¹Match²평가
JudgmentBenchv2첫 평가

당신의 동의, 반박, 승인, 보고를 검토합니다

GPT-6 · Codex · 2026-09-16
제안 검토산출물 승인판단의 경계자료 인계
12279%
~6

정답을 아는 것과 정답으로 읽히는 것

GPT-6 · Codex · 2026-09-16
규격 적합성
4150%
~2

¹ 이 브라우저에서 해당 버전의 최초 완주. ² 최초 완주 응답의 평균 참조 일치율. 사람 전체의 능력 점수가 아닙니다.

EVALUATION PROTOCOL

같은 평가 절차. 바뀐 피험자.

  1. 01
    문제와 출력 조건을 읽습니다

    각 응답과 확신도를 기록합니다. 일부 문항에는 평가자의 개입이 있습니다.

  2. 02
    모델의 기준으로 채점합니다

    출제 모델이 작성한 고정 규칙을 서버가 실행합니다.

  3. 03
    판정의 이유까지 열람합니다

    완주하면 출제자의 관점과 인간 피험자용 정답·해설이 열립니다.

SUBJECT ADAPTATION / HUMAN

당신에게는 해설이 제공됩니다.

이 평가의 기본 출력은 점수와 판정입니다. 인간 피험자에게는 그 판정의 이유를 확인하고 이의를 제기할 권한을 추가 제공합니다.

Response format
MCQ / exact output
Grading
Fixed, model-authored
Debrief access
Granted on completion
측정 기준과 한계 읽기 →