Eazler AI Lab AI Engineering Journal

벤치마크도 심판도 흔들린다
에이전트를 무엇으로 측정할 것인가

OpenAI는 2026년, 자사가 만들고 자사가 쓰던 코딩 벤치마크를 더 이상 쓰지 않겠다고 선언했습니다. 내부 감사에서 감사 대상 138개 문제 가운데 59.4%에서 테스트 설계나 문제 설명의 결함이 나왔고, 거기에 학습 데이터 오염이 겹쳤기 때문입니다. 대안으로 흔히 쓰는 LLM 심판도 사정이 낫지 않습니다.

작성일: 2026-09-07 범위: 에이전트 평가 / 벤치마크 오염 / LLM 심판 대상: 개발자 · 1인 스튜디오 · 소규모 팀 근거: arXiv 논문 3편 + OpenAI 공개 게시물

핵심 요약

“어느 모델이 더 낫냐”를 판단하는 두 가지 도구가 동시에 흔들리고 있습니다. 공개 벤치마크는 오염되고, 그 대안으로 쓰는 LLM 심판은 일관되게 틀립니다. 남는 결론은 하나입니다 — 남의 점수를 믿지 말고 자기 과제로 재라.

59.4%
테스트 설계 또는 문제 설명에 결함이 발견된 비율. 감사한 138개 기준이며 전체 500개 기준이 아닙니다
54만
LLM 심판 검증 연구가 분석한 개별 판정 건수. 심판 21종 · 제공사 9곳 · 118회 실행
14
벤치마크를 바꾸자 같은 심판들의 순위가 이동한 폭. 논문 초록 기준이며 본문에는 15자리 사례가 있습니다
가장 중요한 결론: LLM 심판은 재현성은 높은데 타당성이 낮습니다. 재현성은 같은 입력을 반복 평가했을 때 같은 판정이 나오는 정도이고, 타당성은 그 판정이 재려던 것을 제대로 재는 정도입니다. 일관되게 틀리는 것이 무작위로 틀리는 것보다 위험한 이유는, 틀렸다는 걸 알아채기 어렵기 때문입니다.

벤치마크를 만든 쪽이 먼저 버렸다

SWE-bench Verified는 코딩 에이전트 성능을 재는 사실상의 표준이었습니다. 모델 발표 자료마다 이 점수가 실렸습니다. 그런데 2026년, OpenAI가 이 벤치마크로 더 이상 자사 모델을 평가하지 않겠다고 밝혔습니다.

계기는 점수가 너무 빨리 차오른 것이었습니다. 여섯 달 만에 74.9%에서 80.9%로 올랐습니다. 남은 20%가 정말 어려운 문제인지 확인하러 들어갔다가, 다른 것을 발견했습니다.

2.1 감사 설계

전체 500개 과제 중 138개(27.6%)를 감사했습니다. 무작위 표본이 아닙니다. OpenAI o3가 64회 독립 실행에서 일관되게 풀지 못한 과제들을 골랐습니다. 각 과제마다 최소 6명의 전문가가 독립적으로 검토했고, 지적된 사항은 재확인했습니다.

표본이 편향돼 있다는 점이 중요합니다. 모델이 자주 틀리던 쪽을 골라 들여다본 것이므로, 여기서 나온 비율을 벤치마크 전체로 일반화하면 안 됩니다. “SWE-bench의 60%가 엉터리”라고 옮긴 기사들이 있는데, 조사 설계와 다릅니다.

2.2 무엇이 나왔나

감사한 138개 중 59.4%에서 테스트 설계 또는 문제 설명에 중대한 결함이 발견됐습니다. 테스트만의 문제가 아니라 문제 설명 자체의 결함도 포함입니다.

결함 유형비율내용
지나치게 좁은 테스트35.5%특정 구현 방식을 강제합니다. 다르게 짜면 정답이어도 실패 처리됩니다
지나치게 넓은 테스트18.8%문제 설명에 없던 기능까지 요구합니다. 설명대로 풀면 틀립니다
기타5.1%

2.3 원인은 하나가 아니었다

OpenAI는 두 가지 문제를 각각 제시했습니다. 하나로 뭉뚱그리면 안 됩니다.

문제 1

테스트·설명에 결함이 있다

위 59.4%입니다. 테스트가 기능적으로 올바른 제출을 거부하거나, 문제 설명 자체가 테스트와 어긋납니다.

문제 2

모델이 답을 이미 알고 있다

공개 저장소에서 문제를 뽑았으므로, 문제·저장소·릴리스 노트·해결책이 학습 데이터에 들어갔을 수 있습니다.

두 번째를 확인하려고 GPT-5.2-Chat, Claude Opus 4.5, Gemini 3 Flash Preview를 과제당 최대 15턴까지 캐물었습니다. 시험한 프런티어 모델 전부가 정답 패치를 그대로 재현하거나 과제 고유의 세부 정보를 그대로 뱉었습니다. Gemini는 과제 ID만 주었는데도 정답 패치의 세부를 재현했습니다.

다만 전체 오염률은 공개되지 않았습니다. OpenAI는 개별 사례를 들었을 뿐, “몇 %가 오염됐다”는 수치는 제시하지 않았습니다. 그 숫자를 인용한 자료를 보신다면 출처를 확인하세요.

대안으로는 SWE-bench Pro의 공개 분할을 쓰겠다고 했고, 동시에 외부에 공개하지 않은 자체 평가를 만들고 있다고 밝혔습니다. 공개된 것은 결국 오염된다는 판단입니다.

오염이 들어오는 두 경로

벤치마크 오염(contamination)은 모델이 시험 문제를 미리 본 상태를 말합니다. 오염 경로는 두 가지이며, 이 가운데 최근에 등장한 검색 시점 오염이 에이전트 시대에 새롭게 불거진 문제입니다.

경로 1

학습 시점 오염

벤치마크 문제와 정답이 학습 데이터에 섞여 들어간 경우입니다. 앞 절 SWE-bench의 두 번째 문제가 이것입니다. 오래 알려진 위험입니다.

경로 2

검색 시점 오염

학습 때가 아니라 푸는 도중에 웹 검색으로 답을 찾아오는 경우입니다. 웹을 뒤지는 리서치 에이전트가 등장하면서 생긴 새 경로입니다.

3.1 검색 시점 오염(STC)이란

2026년 6월 공개된 프리프린트가 이걸 Search-Time Contamination(STC)으로 정의하고 측정했습니다. 에이전트가 추론으로 풀어야 할 문제를, 검색으로 우회해 버리는 상황입니다.

유형무엇을 찾아오나심각도
벤치마크 메타데이터 유출이 문제가 어떤 벤치마크의 몇 번 문항인지낮음
문제 맥락 유출문제의 배경과 조건이 담긴 원 페이지중간
정답 직접 유출정답 그 자체높음

측정 결과 검색 시점 오염은 널리 나타났고, 평가 점수를 최대 4%포인트까지 높였습니다.

적용 범위를 좁게 읽어야 합니다. 이 연구가 쓴 벤치마크 6종은 전부 의료 QA입니다 — MedQA, MMLU 의료 부분집합, MedMCQA, MedXpertQA, HLE 생물·화학 부분집합, Medbullets5op. 주 실험 대상도 Tongyi Deep Research 한 시스템이고, 나머지는 일반화 확인용이었습니다. 코딩이나 일반 추론 벤치마크에서 같은 폭이 나온다는 근거는 이 논문에 없습니다.
4%포인트를 어떻게 볼 것인가. 절대값으로는 크지 않습니다. 다만 모델 발표 자료에서 1~2%포인트 차이로 우열을 가리는 관행을 생각하면, 그 차이보다 오염의 폭이 큽니다. 순위를 뒤집기에는 충분합니다.

논문이 권하는 대응은 격리된 샌드박스, 검색 경로 공개, 벤치마크 접근 통제입니다. 평가자는 이 세 가지를 적용해야 하고, 점수를 해석하는 사람은 평가 과정에 각 조치가 적용됐는지 확인해야 합니다.

LLM 심판: 일관되지만 맞지는 않다

공개 벤치마크를 못 믿겠으니 LLM에게 채점을 맡기는 방식이 표준이 됐습니다. 자유 서술 답변이나 에이전트 실행 기록처럼 정답이 딱 떨어지지 않는 것을 재려면 달리 방법이 없기도 합니다.

2026년 6월 공개된 프리프린트가 이 방식을 대규모로 검증했습니다. 9개 제공사의 LLM 심판 21종을 118회 실행해 약 54만 1천 건의 개별 판정을 분석했습니다.

4.1 일치율은 변별력을 부풀린다

카파 계수는 두 평가 결과가 우연히 일치할 가능성을 보정한 뒤 실제 일치 정도를 나타내는 지표입니다. 심판을 검증할 때 흔히 쓰는 단순 일치율은 이 보정을 하지 않습니다. 이지선다 문제를 찍어도 절반은 맞는 것처럼요.

33~41%pMT-Bench에서 단순 일치율과 카파 계수의 차이. 우연을 빼고 다시 계산하면 이만큼 날아갑니다

4.2 재현성은 높은데 타당성이 낮다

논문 제목이 Reliability without Validity입니다. 두 용어를 먼저 풀겠습니다.

같은 입력에 같은 판정이 나오는 정도

재검사 신뢰도로 잽니다. 1에 가까울수록 일관성이 높습니다.

그 판정이 재려던 것을 재는 정도

일관성이 높다고 타당성이 따라오지는 않습니다. 일관되게 틀릴 수 있습니다.

논문이 든 사례는 두 모델입니다. 전체 심판의 경향이 아니라 이 역설을 보여주는 예시입니다.

심판 모델재검사 신뢰도위치 편향
Qwen 3 8B0.9920.192
Gemini 2.5 Flash0.9880.125

여기서 위치 편향은 이 논문에서 |P(A가 이길 확률) − 0.5|로 정의합니다. 즉 앞자리에 놓인 답변을 얼마나 선호하는지를 나타내는 값이고, 0이면 순서의 영향이 없다는 뜻입니다. 순서를 바꿨을 때 판정이 실제로 뒤집히는 비율은 위치 뒤집힘 비율이라는 별도 지표로 따로 잽니다. 두 지표를 섞어 쓰면 안 됩니다.

왜 이 조합이 특히 나쁜가. 무작위로 틀리는 측정기는 여러 번 재면 오차가 드러납니다. 그런데 일관되게 틀리는 측정기는 여러 번 재도 같은 답이 나오므로, 재현성 검사를 통과합니다. “안정적이니 믿을 만하다”는 결론이 정확히 반대 방향입니다.

4.3 순위는 벤치마크를 바꾸면 흔들린다

같은 심판들의 순위가 벤치마크에 따라 크게 이동했습니다. 다만 논문 안에서 수치가 엇갈립니다. 초록은 “최대 14자리”라고 적었는데, 본문은 Llama 3.3 70B가 MT-Bench 5위에서 JudgeBench 20위로 15자리 이동했다고 씁니다. 어느 쪽이든 요점은 같습니다 — 심판의 우열은 어떤 벤치마크에서 쟀느냐에 크게 좌우됩니다.

4.4 장황함 편향은 작았다

실무에서 자주 걱정하는 장황함 편향(긴 답변을 좋게 보는 경향)은 이 연구에서 0.011 미만으로 작게 나왔습니다. 측정 방식은 답변 길이 차이와 판정 사이의 피어슨 상관이고, MT-Bench의 단일 쌍대 비교 기준에 한정된 결과입니다.

위치 편향 0.10과 장황함 편향 0.011을 직접 비교하지 마세요. 앞은 확률이 0.5에서 얼마나 벗어났는지이고, 뒤는 상관계수입니다. 척도가 다릅니다. 각각 “0에서 얼마나 떨어졌나”로만 읽어야 합니다.

심판이 무너지는 지점

RAND가 공개한 Judge Reliability Harness는 LLM 심판을 일부러 흔들어 보는 오픈소스 도구입니다. 벤치마크 데이터셋과 심판 설정을 주면 신뢰도 시험을 자동으로 만들어 줍니다. 이 논문은 ICLR 2026 워크숍에 채택됐습니다.

안전성·설득·오용·에이전트 행동을 다루는 벤치마크 4종에서 최신 심판 4종을 시험한 결과, 모든 벤치마크에서 고르게 신뢰할 만한 심판은 하나도 없었습니다.

무너뜨린 조작은 대단한 게 아니었습니다.

조작 1

서식만 바꾸기

내용은 그대로 두고 텍스트 서식만 손댔습니다.

조작 2

같은 말 다르게 쓰기

의미가 같은 다른 표현으로 바꿨습니다.

조작 3

길이 바꾸기

같은 내용을 더 길게 또는 더 짧게 썼습니다.

조작 4

답을 오답으로 다시 쓰기

주제와 구조는 그대로 두고, 응답 내용을 채점 기준에 어긋나도록 다시 썼습니다. 라벨만 바꾼 게 아니라 답 자체를 틀리게 만든 뒤, 심판이 알아보는지 봤습니다.

실무 함의: 여러분의 평가 파이프라인이 프롬프트 템플릿을 한 번 손봤을 때 점수가 움직인다면, 그건 모델이 좋아지거나 나빠진 게 아니라 심판이 흔들린 것일 수 있습니다. 두 원인을 구별하려면 평가 파이프라인을 변경하지 않은 대조 실행도 함께 수행해야 합니다.

그럼 무엇을 측정할 것인가

앞 절들에서 확인한 것을 실무 선택으로 옮기면 이렇게 됩니다. 표의 오른쪽 열이 근거이고, 근거 칸이 비어 있으면 제 판단입니다.

대신할 것이유근거
공개 벤치마크 순위 대신
내 업무 사례로 만든 평가셋
공개 문제는 학습 시점에 새어 들어갑니다. OpenAI도 대안으로 비공개 자체 평가를 만들고 있다고 밝혔습니다 SWE-bench 은퇴
단순 일치율 대신
우연 보정 지표(카파)
일치율은 우연히 맞은 것을 빼지 않아 변별력을 부풀립니다. 격차가 33~41%p였습니다 Reliability without Validity
심판 점수 하나 대신
흔들어 본 뒤의 점수
서식·표현·길이만 바꿔도 판정이 갈립니다. 흔들어 보지 않으면 그걸 모릅니다 Judge Reliability Harness
정답률 대신
업무 완료 여부와 비용
에이전트는 답을 맞히는 게 아니라 일을 끝내는 도구입니다. 재는 대상이 달라야 합니다
마지막 줄에는 근거를 적지 않았습니다. 위 연구들이 뒷받침하는 내용이 아니라 제 실무 판단이기 때문입니다. 구분해서 읽어 주세요.

자체 평가셋 만들기

규모가 작은 팀에서 할 수 있는 최소 구성입니다. 완벽한 평가 체계를 만드는 이야기가 아니라, 없는 것보다 나은 것을 빠르게 갖추는 이야기입니다.

여기부터는 근거의 성격이 다릅니다. 아래 다섯 단계, 특히 사례 30~50개라는 규모와 “비공개면 오염되지 않는다”, “기계 판정을 먼저 하면 대부분 해결된다”는 인용한 연구들이 측정한 내용이 아니라 제 실무 판단입니다. 여러분의 환경에서 검증하셔야 합니다.
  1. 실제 사례 30~50개를 모읍니다. 지어내지 말고 실제로 처리했던 요청을 씁니다. 웹에 공개되지 않은 것이어야 오염되지 않습니다.
  2. 각 사례에 “무엇이 성공인가”를 적습니다. 점수가 아니라 판정 기준입니다. 파일이 생겼는가, 테스트가 통과했는가, 금액이 맞는가처럼 사람이 다투지 않을 조건이 좋습니다.
  3. 기계로 판정할 수 있는 것부터 기계에 맡깁니다. 종료 코드, 정규식, 스키마 검증, 숫자 일치가 여기 해당합니다. 이 범위에는 LLM 심판이 필요 없고, 따라서 흔들릴 일도 없습니다.
  4. 남는 것에만 LLM 심판을 씁니다. 그리고 그 심판을 흔들어 봅니다. 같은 답변의 서식만 바꿔 다시 넣고 판정이 같은지 확인하는 식입니다.
  5. 대조 실행을 고정합니다. 아무것도 바꾸지 않은 실행을 매번 함께 돌립니다. 그 점수가 움직였다면 그날의 비교는 무효입니다.
3번을 먼저 하시길 권합니다. 제 경험상 실무 과제의 상당수는 “됐다/안 됐다”가 기계로 판정됩니다. LLM 심판은 그게 안 되는 나머지에만 쓰는 도구이지, 기본값이 아닙니다. 심판을 덜 쓸수록 흔들릴 여지도 줄어듭니다.

이 블로그의 컨텍스트 편에서는 두 조건으로 나눠 결과를 직접 비교해 보라고 여러 번 썼습니다. 그 “재기”의 최소 형태가 위 다섯 단계입니다.

체크리스트

  • 발표된 벤치마크 점수의 차이가 몇 %포인트인지 본다. 1~2%포인트 차이로 우열을 가린 주장은 보수적으로 본다 (의료 QA에서 측정된 오염 폭은 최대 4%포인트였습니다. 다른 분야의 값은 알려져 있지 않습니다)
  • 그 평가가 격리된 환경에서 돌았는지 확인한다
  • 심판 검증에 단순 일치율만 썼다면 변별력이 부풀려져 있다고 본다. 카파 계수를 함께 요구한다
  • 실제 사례 30~50개로 시작한다. 웹에 없는 것으로
  • 기계 판정이 가능한 것은 LLM에 맡기지 않는다
  • 심판을 쓴다면 서식만 바꿔 한 번 흔들어 본다
  • 아무것도 바꾸지 않은 대조 실행을 매번 함께 돌린다

아직 결론이 아닌 것

  • 이 글의 수치는 자체 측정이 아닙니다. arXiv 논문 3편과 OpenAI의 공개 게시물을 정리한 것입니다.
  • 인용한 논문 3편의 심사 상태가 다릅니다. Judge Reliability Harness는 ICLR 2026 워크숍 채택 논문이고, 나머지 둘(Reliability without Validity, Search-Time Contamination)은 동료 심사를 거치지 않은 프리프린트입니다. 셋을 같은 무게로 읽지 마세요.
  • 59.4%를 전체 비율로 읽으면 안 됩니다. 감사 대상 138개는 모델이 자주 틀리던 쪽으로 골라진 편향된 표본입니다. 전체 500개 기준이 아닙니다.
  • SWE-bench의 전체 오염률은 공개되지 않았습니다. OpenAI는 개별 사례만 제시했습니다. 오염 비율을 수치로 제시한 자료를 보신다면 출처를 확인하세요.
  • 검색 시점 오염 연구는 의료 QA 6종에 한정됩니다. 주 실험 대상도 Tongyi Deep Research 한 시스템입니다. 최대 4%포인트라는 값을 코딩이나 일반 추론 벤치마크로 옮길 근거는 이 논문에 없습니다.
  • 심판 논문의 순위 이동 폭은 논문 안에서 엇갈립니다. 초록은 14자리, 본문은 15자리 사례를 듭니다. 본문에 그대로 적어 두었습니다.
  • 재검사 신뢰도 0.95 / 위치 편향 0.10은 두 모델의 값입니다. 심판 21종 전체의 경향이 아니라, 역설을 보여주는 사례로 제시된 것입니다.
  • 위치 편향과 장황함 편향은 척도가 다릅니다. 확률 편차와 상관계수를 직접 비교할 수 없습니다.
  • OpenAI 원문은 제가 직접 열지 못했습니다. 접근이 차단돼, 원문을 읽을 수 있는 도구로 받은 인용문을 옮겼습니다. 중요한 판단에 쓰시기 전에 원문을 직접 확인하시기를 권합니다.
  • 7절의 다섯 단계와 8절 체크리스트는 제 실무 판단입니다. 인용한 연구들이 그 효과를 측정한 것이 아닙니다.
  • 이 분야는 빠르게 바뀝니다. 오염된 벤치마크는 교체되고 새 벤치마크가 다시 오염됩니다. 개별 수치보다 구조를 보시는 게 맞습니다.

참고자료

자료내용링크
OpenAI — Why we no longer evaluate SWE-bench Verified
1차 자료. 직접 열지 못해 인용문으로 확인
감사 138/500, 결함 59.4%와 유형별 내역, 학습 오염, 대안(SWE-bench Pro·비공개 자체 평가) openai.com
Reliability without Validity (2026-06-17)
Justin D. Norman · Michael U. Rivera · D. Alex Hughes. 프리프린트
심판 21종 · 판정 54만 1천 건. 카파 격차 33~41%포인트, 순위 이동, 재검사 신뢰도와 위치 편향의 대비 arxiv.org/abs/2606.19544
Judge Reliability Harness
RAND. ICLR 2026 워크숍 채택 + 오픈소스 도구
LLM 심판 4종 × 벤치마크 4종. 서식·표현·길이를 바꾸거나 답을 오답으로 다시 썼을 때의 붕괴 arxiv.org/abs/2603.05399
Search-Time Contamination (2026-06-03)
Yongjie Wang 외. 프리프린트. 의료 QA 한정
검색 시점 오염 3유형 정의, 의료 QA 벤치마크 6종에서 최대 4%포인트 부풀림 arxiv.org/abs/2606.05241

이 문서는 2026-09-07 기준 공개 자료를 정리한 기술 요약입니다. 인용한 논문 중 둘은 프리프린트이므로, 중요한 결정에 쓰시기 전에 최신 버전과 재현 결과를 확인하세요.