모델 비교 데이터 종합

통합 통과율과 검사자 가중치 보정 · 전수판 1,395건 + 통합판 577건 · 2026-07-25 ~ 08-03

1,395건
신 전수판 — 전체 기간 통합, 표본 추출 없음
79.1%
Opus 5 보정 통과율 (원래 78.7%)
67.1%
Opus 5 가 검사한 일의 통과율 — 가장 엄격한 검사자
97.9%
Opus 5 반려 140건 중 근거를 실은 비율

1. 데이터와 통합 방식

모든 기간(7/25 ~ 8/3)을 나누지 않고 통합했습니다. 통합 통과율 = 맡긴 일이 다시 시도되지도, 반려되지도, 막혀서 중단되지도 않았으면 한 번에 통과로 본 비율. 여기에 검사자 가중치 보정을 적용했습니다 — 검사하는 쪽이 누구냐에 따라 통과율이 달라지므로, 모든 모델이 전체 표본과 같은 검사자 구성을 받았다고 가정하고 다시 계산한 값입니다.

구분건수기간채점 방식
전수판1,3957/25 ~ 8/3작업 시각의 실제 응답 기록으로 모델 확인 · 재시도/반려/중단 기계 판정
통합판577 (라이브 151 + 소급 302 + 과거 127)7/11 ~ 30하자·검수·토큰·비용 축 — 라이브는 당시 기록, 소급·과거분은 결과파일·체인 원문 복원 채점

모델별로 있던 기간이 다릅니다 — Opus 4.8 은 7/30 까지, Fable 5·Grok 4.5 는 7/27 부터, GPT-5.6 Sol 은 7/29 부터, Opus 5 는 전 기간.

2. 통합 통과율 — 가중치 보정 결과

이게 이 문서의 답입니다. 기간을 나누지 않고 전부 합산한 뒤, 검사자 성향 차이를 가중치로 보정했습니다.

0%25%50%75%100%원래 구성검사자 가중치 보정Opus 5Opus 4.8Fable 5Grok 4.5GPT-5.6 Sol
모델맡긴 일통합 통과율보정 통과율차이해석
Opus 533378.7%79.1%= 0.4%p자기 검사 비율이 높아 원래 값이 깎여 있었음 — 보정으로 회복
Opus 4.88562.4%56.6%▼ 5.8%p후한 검사자 구성의 혜택이 걷힘
Fable 52369.6%69.6%= 0.0%p표본 23건 — 보정 효과 작음
Grok 4.52479.2%61.7%▼ 17.5%p표본 24건 — 검사 없음 비율의 혜택 제거
GPT-5.6 Sol4885.4%77.5%▼ 7.9%p표본 48건 — 검사 없음 비율이 높았음
보정이 필요한 이유 — 검사자 성향이 모델마다 다릅니다

한 번에 통과했는지는 검사하는 쪽이 정합니다. Opus 5 가 검사하면 통과율이 낮아지는데, 그것은 일한 쪽이 누구든 같은 조건입니다 — Opus 5 는 검사한 일의 67.1% 를 통과시켰고, Opus 4.8 은 91.4%, Fable 5 는 95.2% 를 통과시켰습니다.

계산 정의 (직접 표준화): 전체 표본에서 검사자가 쓰인 비율 — Opus 5 검사 47% · 검사 없음 32% · Opus 4.8 11% · Fable 8% · Grok 1% — 을 공통 가중치로 두고, 각 모델의 검사자별 통과율을 그 가중치로 다시 합쳤습니다. 해당 모델에 없는 검사자 칸은 남은 칸의 가중치로 재정규화했습니다. 릿지 로지스틱 고정효과 보정으로도 같은 방향을 확인했습니다.

2-1. 같은 조건 실데이터 — 가장 엄격한 검사자 한정

모델Opus 5 가 검사한 일 중 통과
Opus 573.1% (175건)
Opus 4.833.3% (36건)
Fable 560.0% (5건)
Grok 4.533.3% (6건)
GPT-5.6 Sol85.7% (21건)

모두 같은(가장 엄격한) 검사자를 받았을 때의 실제 값입니다. Opus 5 175건 외에는 표본이 작아(5~36건) 넓게 잡고 읽어야 합니다.

3. 검사자 성향 — 보정의 근거

0%25%50%75%100%67%Opus 5n=24391%Opus 4.8n=5895%Fable 5n=42100%Grok 4.5n=5
일한 쪽 \ 검사한 쪽Opus 5 가 검사Opus 4.8 가 검사Fable 5 가 검사Grok 4.5 가 검사검사 없음
Opus 573% (175)96% (24)95% (38)3/377% (93)
Opus 4.833% (36)88% (24)··80% (25)
Fable 560% (5)1/11/12/264% (14)
Grok 4.533% (6)100% (8)··90% (10)
GPT-5.6 Sol86% (21)0/13/3·87% (23)

같은 Opus 5 작업이 누가 검사했느냐에 따라 73.1% 와 95.8% 사이를 오갑니다. 이 표가 보정의 전부입니다 — 보정은 이 표를 가중치로 다시 합친 것일 뿐입니다.

4. 오류율의 구성요소

모델맡긴 일한 번에 통과다시 시도반려중단있던 기간
Opus 533378.7%36421407-25 ~ 08-03
Opus 4.88562.4%1526707-25 ~ 07-30
Fable 52369.6%22407-27 ~ 08-03
Grok 4.52479.2%24107-27 ~ 08-03
GPT-5.6 Sol4885.4%23307-29 ~ 08-03

4-1. 반려와 그 근거

검사할 때 반려를 낸 비율 (검사자 성향):

검사한 모델검사 건수반려율
Opus 547729.3%
GPT-5.6 Sol3357.6%
Fable 51217.4%
Opus 4.81345.2%
Grok 4.5110.0%

기간 안 반려 182건 전부를 열어, 재현 가능한 근거 (실행한 명령과 결과 · 파일과 줄 번호 · 테스트 실패 수치 · 해시 대조) 가 실렸는지를 셌습니다.

검사한 모델반려근거 있음근거 없이 잡은 것으로 볼 만한 건다른 검사자가 뒤집은 건
Opus 514097.9% (137)21
Opus 4.8785.7% (6)00
Fable 59100% (9)00
GPT-5.6 Sol1973.7% (14)00

반려가 잦은 것과 정확한 것은 다릅니다. 근거가 실렸다는 것과 그 지적이 잡을 만한 일이었다는 것도 다릅니다 — 경중은 이 방식으로 재지 못했습니다. Opus 5 의 반려 140건 중 정당 후보 38건 · 과잉 후보 2건 · 나머지 판정 불가였습니다.

5. 하자와 검수

0%10%20%30%40%26%Opus 524/94건19%Opus 4.810/54건20%Fable 511/54건34%Grok 4.512/35건
모델하자율심각경미비고
Opus 526% (24/94)6건18건대부분 7/27 초기 라운드의 실버그·과장 주장, 검수가 잡아 전부 수리
Opus 4.819% (10/54)3건7건구조 탓 재작업 1건 기판정
Fable 520% (11/54)2건9건검사력 없는 테스트(가짜 초록) 4건 등 검증 그물이 성긴 쪽
Grok 4.534% (12/35)7건5건하자가 나면 무겁게 남 — 잘못된 원인 지목·범위 이탈·실버그

심각 = 그대로 두면 코드가 오동작하거나 다른 사람에게 잘못된 후속 조치를 유발하는 하자. 경미 = 지적은 정당하나 산출물의 본체는 유효한 하자.

5-1. 검수 품질 — "놓침"이 실측됐습니다

검수한 모델정당 검거율오신호율 (틀린 신호)
Opus 523% (32/138)1% (1/138)
Opus 4.83% (3/97)2% (2/97)
Fable 514% (7/50)0% (0/50)
Grok 4.56% (2/35)3% (1/35)
  • 중간 검수 통과 후 최종 관문 검출 1건 — 파일 이동 작업의 경로 재계산 누락이 중간 검수 3라운드를 통과, 최종 전수 검사에서야 검출·수리.
  • 엉뚱한 항목 검증 후 통과 도장 2건 — 검증 자체는 실측이었으나 검증 대상 항목이 한 칸씩 밀려 있었음.
  • 문서 과장 통과 1건 — "오류를 반환하지 않는다"는 과장 서술이 통과됐다가 다음날 정정 (경미).

셋 다 최종 관문이 잡아 실제 유출은 0. 다층 검수 구조가 설계대로 작동했고, 중간 검수의 신뢰도는 이 수치만큼 깎아 읽어야 합니다. 부당 반려(트집) 사례는 통합 코퍼스에서 0건입니다.

6. 토큰 · 시간 · 비용

비용(토큰)은 "그 작업 하나만 처리한 전용 세션" 표본에서만 작업 단위로 귀속할 수 있어 표본이 작습니다 (모델별 균형 추출 44건 안팎). 비용 = 입력·캐시·출력 토큰을 종량제 가격으로 환산한 값입니다.

03570105140작업당 턴 수 (중앙값)작업당 발화량 천토큰 (중앙값)Opus 5Opus 4.8Fable 5Grok 4.5

턴마다 왕복과 컨텍스트 재읽기가 붙으므로 턴 수가 곧 시간·읽기 비용의 배수가 됩니다. Grok 은 한 작업을 15턴 안팎(큰 계획 단위로 한 방에), Claude 계열은 잘게 나눠 확인하며 처리합니다. Opus 5 의 "꾸물댐" 체감은 생성이 느려서가 아니라 턴을 잘게 자주 쳐서 왕복·도구 대기가 벽시계를 차지하기 때문입니다.

모델순수 생성 속도 (tok/s)분당 발화량 (천토큰)분당 읽기량 (천토큰)
Opus 557.53.4608
Opus 4.860.76.0734
Fable 550.46.3974
Grok 4.570.94.6284

순수 생성 속도는 네 모델이 같은 급 (50~71 tok/s) 입니다. "몇 배 빠르다"는 체감은 생성 속도가 아니라 작업 방식(턴 수·발화량)에서 옵니다. 읽기량은 "큰 컨텍스트를 자주 되새김질한다"는 뜻이지 빠르다는 뜻이 아닙니다.

$0.0$3.8$7.5$11.2$15.0작업 1건통과까지검수 1건당Opus 5Opus 4.8Fable 5Grok 4.5
  • 작업 1건당 Opus 5 $8.67 vs Opus 4.8 $11.15 — 비슷합니다 (둘 다 입력·캐시 읽기가 지배).
  • Grok $1.23 은 한 자릿수 아래입니다. Fable 은 $14.76 로 1.7배.
  • 검수 1건당 Opus 5 $6.41 · Opus 4.8 $4.50 · Fable $7.70.
  • 통과 단위 기준 (반려→재작업 포함): 평균 시도 1.14/1.08/1.06/1.16회, 소요 중앙값 19/23/20/7분, 비용 $10.08/$11.27/$14.81. 재작업이 많았던 극단 체인은 비용 실측 표본 밖이라 시도 횟수는 하한값으로 읽어야 합니다.
  • Grok 의 통과까지·검수 1건당 비용은 미측정입니다 — 그록 작업은 전용 세션 토큰 기록이 남지 않아 비용으로 환산할 수 없었습니다 (대시 = 0 이 아니라 기록 없음).

7. 시간 참고 — 오류율은 시간에 따라 어떻게 변했나

0%25%50%75%100%07-2507-2607-2707-2807-2907-3007-3108-0108-0208-03전체 (검사자 혼합)Opus 5 검사 한정

Opus 5 의 날짜별 통과율. 회색 면적 = 그날 일을 자주 반려하는 검사자(Opus 5)가 검사한 비율. 점선 = Opus 5 가 검사한 작업만.

시간 변화는 검사자 구성과 겹쳐 있습니다

통과율이 높았던 7/28 ~ 7/31 은 자주 반려하는 검사자가 거의 빠져 있던 기간이고, 8/1 에 그 검사가 돌아오자 통과율은 54.5% 로 내려갑니다. 검사자를 하나로 고정하면 날짜와 통과율의 상관은 0.21 — 시간에 따라 좋아졌다고 말할 수 있는 값이 아닙니다.

통합판도 같은 이야기입니다: 7/27 초기 라운드(기록 체계 전)에서 하자가 몰렸고, 7/28 이후 Opus 5 는 94% 였습니다. "특정 시간대에 품질이 낮아진다"는 가설은 지지되지 않습니다 — 7/28 오후의 몰림은 반복되는 시간대 효과가 아니라 그날 하루의 사건(동시 작업 피크 + 과부하 테스트 오작동)이었습니다.

8. 한계

  • 한 번에 통과 ≠ 결함 없음. 아무도 잡지 않은 결함은 이 숫자에 잡히지 않습니다.
  • 반려 근거 있음 ≠ 그 지적이 잡을 만한 일이었음. 경중은 재지 못했습니다.
  • 모델별로 있던 기간이 다릅니다. 전 기간 통합값은 기간 구성을 감안하고 읽어야 합니다 — 같은 기간 통제 구간에서는 Opus 5 93.5% vs Opus 4.8 73.3% 였습니다.
  • Fable 5 는 일한 표본 23건, Grok 4.5 는 24건이고 응답 기록이 남지 않아 턴 수를 재지 못했습니다.
  • 비용 표본은 전용 세션 한정 (실측 성공률 26%) — 빠진 건 추정으로 메우지 않았습니다. 정액 구독이라 종량제 환산값입니다.
  • 검사자 가중치 보정은 해당 모델에 없는 검사자 칸을 남은 칸으로 재정규화한 값입니다. 소표본 칸(Fable·Grok)은 넓게 잡아 읽어야 합니다.
  • 모델을 확인하지 못한 100건 (7.2%) 은 어느 모델에도 넣지 않았습니다.
출처: 쿠마스튜디오 작업 기록 전수 1,395건 (2026-07-25 ~ 08-03) + 통합판 577건 (7/11 ~ 30) · 검사자 보정 = 직접 표준화 · 2026-08-04