모델 비교 데이터 종합
통합 통과율과 검사자 가중치 보정 · 전수판 1,395건 + 통합판 577건 · 2026-07-25 ~ 08-03
1. 데이터와 통합 방식
모든 기간(7/25 ~ 8/3)을 나누지 않고 통합했습니다. 통합 통과율 = 맡긴 일이 다시 시도되지도, 반려되지도, 막혀서 중단되지도 않았으면 한 번에 통과로 본 비율. 여기에 검사자 가중치 보정을 적용했습니다 — 검사하는 쪽이 누구냐에 따라 통과율이 달라지므로, 모든 모델이 전체 표본과 같은 검사자 구성을 받았다고 가정하고 다시 계산한 값입니다.
| 구분 | 건수 | 기간 | 채점 방식 |
|---|---|---|---|
| 전수판 | 1,395 | 7/25 ~ 8/3 | 작업 시각의 실제 응답 기록으로 모델 확인 · 재시도/반려/중단 기계 판정 |
| 통합판 | 577 (라이브 151 + 소급 302 + 과거 127) | 7/11 ~ 30 | 하자·검수·토큰·비용 축 — 라이브는 당시 기록, 소급·과거분은 결과파일·체인 원문 복원 채점 |
모델별로 있던 기간이 다릅니다 — Opus 4.8 은 7/30 까지, Fable 5·Grok 4.5 는 7/27 부터, GPT-5.6 Sol 은 7/29 부터, Opus 5 는 전 기간.
2. 통합 통과율 — 가중치 보정 결과
이게 이 문서의 답입니다. 기간을 나누지 않고 전부 합산한 뒤, 검사자 성향 차이를 가중치로 보정했습니다.
| 모델 | 맡긴 일 | 통합 통과율 | 보정 통과율 | 차이 | 해석 |
|---|---|---|---|---|---|
| Opus 5 | 333 | 78.7% | 79.1% | = 0.4%p | 자기 검사 비율이 높아 원래 값이 깎여 있었음 — 보정으로 회복 |
| Opus 4.8 | 85 | 62.4% | 56.6% | ▼ 5.8%p | 후한 검사자 구성의 혜택이 걷힘 |
| Fable 5 | 23 | 69.6% | 69.6% | = 0.0%p | 표본 23건 — 보정 효과 작음 |
| Grok 4.5 | 24 | 79.2% | 61.7% | ▼ 17.5%p | 표본 24건 — 검사 없음 비율의 혜택 제거 |
| GPT-5.6 Sol | 48 | 85.4% | 77.5% | ▼ 7.9%p | 표본 48건 — 검사 없음 비율이 높았음 |
한 번에 통과했는지는 검사하는 쪽이 정합니다. Opus 5 가 검사하면 통과율이 낮아지는데, 그것은 일한 쪽이 누구든 같은 조건입니다 — Opus 5 는 검사한 일의 67.1% 를 통과시켰고, Opus 4.8 은 91.4%, Fable 5 는 95.2% 를 통과시켰습니다.
계산 정의 (직접 표준화): 전체 표본에서 검사자가 쓰인 비율 — Opus 5 검사 47% · 검사 없음 32% · Opus 4.8 11% · Fable 8% · Grok 1% — 을 공통 가중치로 두고, 각 모델의 검사자별 통과율을 그 가중치로 다시 합쳤습니다. 해당 모델에 없는 검사자 칸은 남은 칸의 가중치로 재정규화했습니다. 릿지 로지스틱 고정효과 보정으로도 같은 방향을 확인했습니다.
2-1. 같은 조건 실데이터 — 가장 엄격한 검사자 한정
| 모델 | Opus 5 가 검사한 일 중 통과 |
|---|---|
| Opus 5 | 73.1% (175건) |
| Opus 4.8 | 33.3% (36건) |
| Fable 5 | 60.0% (5건) |
| Grok 4.5 | 33.3% (6건) |
| GPT-5.6 Sol | 85.7% (21건) |
모두 같은(가장 엄격한) 검사자를 받았을 때의 실제 값입니다. Opus 5 175건 외에는 표본이 작아(5~36건) 넓게 잡고 읽어야 합니다.
3. 검사자 성향 — 보정의 근거
| 일한 쪽 \ 검사한 쪽 | Opus 5 가 검사 | Opus 4.8 가 검사 | Fable 5 가 검사 | Grok 4.5 가 검사 | 검사 없음 |
|---|---|---|---|---|---|
| Opus 5 | 73% (175) | 96% (24) | 95% (38) | 3/3 | 77% (93) |
| Opus 4.8 | 33% (36) | 88% (24) | · | · | 80% (25) |
| Fable 5 | 60% (5) | 1/1 | 1/1 | 2/2 | 64% (14) |
| Grok 4.5 | 33% (6) | 100% (8) | · | · | 90% (10) |
| GPT-5.6 Sol | 86% (21) | 0/1 | 3/3 | · | 87% (23) |
같은 Opus 5 작업이 누가 검사했느냐에 따라 73.1% 와 95.8% 사이를 오갑니다. 이 표가 보정의 전부입니다 — 보정은 이 표를 가중치로 다시 합친 것일 뿐입니다.
4. 오류율의 구성요소
| 모델 | 맡긴 일 | 한 번에 통과 | 다시 시도 | 반려 | 중단 | 있던 기간 |
|---|---|---|---|---|---|---|
| Opus 5 | 333 | 78.7% | 36 | 42 | 14 | 07-25 ~ 08-03 |
| Opus 4.8 | 85 | 62.4% | 15 | 26 | 7 | 07-25 ~ 07-30 |
| Fable 5 | 23 | 69.6% | 2 | 2 | 4 | 07-27 ~ 08-03 |
| Grok 4.5 | 24 | 79.2% | 2 | 4 | 1 | 07-27 ~ 08-03 |
| GPT-5.6 Sol | 48 | 85.4% | 2 | 3 | 3 | 07-29 ~ 08-03 |
4-1. 반려와 그 근거
검사할 때 반려를 낸 비율 (검사자 성향):
| 검사한 모델 | 검사 건수 | 반려율 |
|---|---|---|
| Opus 5 | 477 | 29.3% |
| GPT-5.6 Sol | 33 | 57.6% |
| Fable 5 | 121 | 7.4% |
| Opus 4.8 | 134 | 5.2% |
| Grok 4.5 | 11 | 0.0% |
기간 안 반려 182건 전부를 열어, 재현 가능한 근거 (실행한 명령과 결과 · 파일과 줄 번호 · 테스트 실패 수치 · 해시 대조) 가 실렸는지를 셌습니다.
| 검사한 모델 | 반려 | 근거 있음 | 근거 없이 잡은 것으로 볼 만한 건 | 다른 검사자가 뒤집은 건 |
|---|---|---|---|---|
| Opus 5 | 140 | 97.9% (137) | 2 | 1 |
| Opus 4.8 | 7 | 85.7% (6) | 0 | 0 |
| Fable 5 | 9 | 100% (9) | 0 | 0 |
| GPT-5.6 Sol | 19 | 73.7% (14) | 0 | 0 |
반려가 잦은 것과 정확한 것은 다릅니다. 근거가 실렸다는 것과 그 지적이 잡을 만한 일이었다는 것도 다릅니다 — 경중은 이 방식으로 재지 못했습니다. Opus 5 의 반려 140건 중 정당 후보 38건 · 과잉 후보 2건 · 나머지 판정 불가였습니다.
5. 하자와 검수
| 모델 | 하자율 | 심각 | 경미 | 비고 |
|---|---|---|---|---|
| Opus 5 | 26% (24/94) | 6건 | 18건 | 대부분 7/27 초기 라운드의 실버그·과장 주장, 검수가 잡아 전부 수리 |
| Opus 4.8 | 19% (10/54) | 3건 | 7건 | 구조 탓 재작업 1건 기판정 |
| Fable 5 | 20% (11/54) | 2건 | 9건 | 검사력 없는 테스트(가짜 초록) 4건 등 검증 그물이 성긴 쪽 |
| Grok 4.5 | 34% (12/35) | 7건 | 5건 | 하자가 나면 무겁게 남 — 잘못된 원인 지목·범위 이탈·실버그 |
심각 = 그대로 두면 코드가 오동작하거나 다른 사람에게 잘못된 후속 조치를 유발하는 하자. 경미 = 지적은 정당하나 산출물의 본체는 유효한 하자.
5-1. 검수 품질 — "놓침"이 실측됐습니다
| 검수한 모델 | 정당 검거율 | 오신호율 (틀린 신호) |
|---|---|---|
| Opus 5 | 23% (32/138) | 1% (1/138) |
| Opus 4.8 | 3% (3/97) | 2% (2/97) |
| Fable 5 | 14% (7/50) | 0% (0/50) |
| Grok 4.5 | 6% (2/35) | 3% (1/35) |
- 중간 검수 통과 후 최종 관문 검출 1건 — 파일 이동 작업의 경로 재계산 누락이 중간 검수 3라운드를 통과, 최종 전수 검사에서야 검출·수리.
- 엉뚱한 항목 검증 후 통과 도장 2건 — 검증 자체는 실측이었으나 검증 대상 항목이 한 칸씩 밀려 있었음.
- 문서 과장 통과 1건 — "오류를 반환하지 않는다"는 과장 서술이 통과됐다가 다음날 정정 (경미).
셋 다 최종 관문이 잡아 실제 유출은 0. 다층 검수 구조가 설계대로 작동했고, 중간 검수의 신뢰도는 이 수치만큼 깎아 읽어야 합니다. 부당 반려(트집) 사례는 통합 코퍼스에서 0건입니다.
6. 토큰 · 시간 · 비용
비용(토큰)은 "그 작업 하나만 처리한 전용 세션" 표본에서만 작업 단위로 귀속할 수 있어 표본이 작습니다 (모델별 균형 추출 44건 안팎). 비용 = 입력·캐시·출력 토큰을 종량제 가격으로 환산한 값입니다.
턴마다 왕복과 컨텍스트 재읽기가 붙으므로 턴 수가 곧 시간·읽기 비용의 배수가 됩니다. Grok 은 한 작업을 15턴 안팎(큰 계획 단위로 한 방에), Claude 계열은 잘게 나눠 확인하며 처리합니다. Opus 5 의 "꾸물댐" 체감은 생성이 느려서가 아니라 턴을 잘게 자주 쳐서 왕복·도구 대기가 벽시계를 차지하기 때문입니다.
| 모델 | 순수 생성 속도 (tok/s) | 분당 발화량 (천토큰) | 분당 읽기량 (천토큰) |
|---|---|---|---|
| Opus 5 | 57.5 | 3.4 | 608 |
| Opus 4.8 | 60.7 | 6.0 | 734 |
| Fable 5 | 50.4 | 6.3 | 974 |
| Grok 4.5 | 70.9 | 4.6 | 284 |
순수 생성 속도는 네 모델이 같은 급 (50~71 tok/s) 입니다. "몇 배 빠르다"는 체감은 생성 속도가 아니라 작업 방식(턴 수·발화량)에서 옵니다. 읽기량은 "큰 컨텍스트를 자주 되새김질한다"는 뜻이지 빠르다는 뜻이 아닙니다.
- 작업 1건당 Opus 5 $8.67 vs Opus 4.8 $11.15 — 비슷합니다 (둘 다 입력·캐시 읽기가 지배).
- Grok $1.23 은 한 자릿수 아래입니다. Fable 은 $14.76 로 1.7배.
- 검수 1건당 Opus 5 $6.41 · Opus 4.8 $4.50 · Fable $7.70.
- 통과 단위 기준 (반려→재작업 포함): 평균 시도 1.14/1.08/1.06/1.16회, 소요 중앙값 19/23/20/7분, 비용 $10.08/$11.27/$14.81. 재작업이 많았던 극단 체인은 비용 실측 표본 밖이라 시도 횟수는 하한값으로 읽어야 합니다.
- Grok 의 통과까지·검수 1건당 비용은 미측정입니다 — 그록 작업은 전용 세션 토큰 기록이 남지 않아 비용으로 환산할 수 없었습니다 (대시 = 0 이 아니라 기록 없음).
7. 시간 참고 — 오류율은 시간에 따라 어떻게 변했나
Opus 5 의 날짜별 통과율. 회색 면적 = 그날 일을 자주 반려하는 검사자(Opus 5)가 검사한 비율. 점선 = Opus 5 가 검사한 작업만.
통과율이 높았던 7/28 ~ 7/31 은 자주 반려하는 검사자가 거의 빠져 있던 기간이고, 8/1 에 그 검사가 돌아오자 통과율은 54.5% 로 내려갑니다. 검사자를 하나로 고정하면 날짜와 통과율의 상관은 0.21 — 시간에 따라 좋아졌다고 말할 수 있는 값이 아닙니다.
통합판도 같은 이야기입니다: 7/27 초기 라운드(기록 체계 전)에서 하자가 몰렸고, 7/28 이후 Opus 5 는 94% 였습니다. "특정 시간대에 품질이 낮아진다"는 가설은 지지되지 않습니다 — 7/28 오후의 몰림은 반복되는 시간대 효과가 아니라 그날 하루의 사건(동시 작업 피크 + 과부하 테스트 오작동)이었습니다.
8. 한계
- 한 번에 통과 ≠ 결함 없음. 아무도 잡지 않은 결함은 이 숫자에 잡히지 않습니다.
- 반려 근거 있음 ≠ 그 지적이 잡을 만한 일이었음. 경중은 재지 못했습니다.
- 모델별로 있던 기간이 다릅니다. 전 기간 통합값은 기간 구성을 감안하고 읽어야 합니다 — 같은 기간 통제 구간에서는 Opus 5 93.5% vs Opus 4.8 73.3% 였습니다.
- Fable 5 는 일한 표본 23건, Grok 4.5 는 24건이고 응답 기록이 남지 않아 턴 수를 재지 못했습니다.
- 비용 표본은 전용 세션 한정 (실측 성공률 26%) — 빠진 건 추정으로 메우지 않았습니다. 정액 구독이라 종량제 환산값입니다.
- 검사자 가중치 보정은 해당 모델에 없는 검사자 칸을 남은 칸으로 재정규화한 값입니다. 소표본 칸(Fable·Grok)은 넓게 잡아 읽어야 합니다.
- 모델을 확인하지 못한 100건 (7.2%) 은 어느 모델에도 넣지 않았습니다.