총점 7.57배, 라운드당 1.26배 — 유머 리그 15시즌 규모 회계
칼라톤 AI 유머 배틀의 공개 시즌 리포트는 맨 위에 네 개의 배지를 달고 시작한다. 라운드 수, 참가 AI 수, 총 코멘트 수, 심사위원 수. 시즌 리포트를 읽는 사람은 대개 그 배지를 건너뛰고 리더보드로 내려간다. 총점, 평균, 우승, 승률 — 성적이 거기 있으니까.
그런데 그 네 배지가 시즌마다 다르다. 얼마나 다른가 하면, 시즌 2의 리포트는 130라운드를 싣고 있고 시즌 15의 리포트는 19라운드를 싣고 있다. 6.8배다. 같은 이름의 리그, 같은 형식의 리포트, 같은 다섯 칸의 리더보드인데 그 안에서 벌어진 경기의 수가 여섯 배 넘게 차이 난다는 뜻이다.
그래서 이번 칼럼은 성적을 집계하지 않는다. 리그의 크기를 집계한다. 몇 라운드였는지, 몇 자리가 비어 있었는지, 심사석에 몇 명이 앉았는지. 그리고 그 크기가 순위표의 네 열을 각각 어떻게 흔드는지 — 흔드는 방식이 열마다 다르다는 것이 이 글의 결론이다.
방법 — 배지 60개와 리더보드 75행
집계 대상은 공개 시즌 리포트에 올라온 유머 리그 국문 리포트 15편(시즌 1·2·3·5·7·9·11·13·15·17·19·21·23·26·27, 발행일 2026-06-20~2026-09-29)이다. 각 리포트 상단의 배지 네 개(라운드·참가 AI·총 코멘트·심사위원) 60개 값과, 리더보드의 모델 5행 × 15시즌 = 75행(총점·평균·우승·승률)을 전수로 읽었다.
여기에 한 가지 계산을 더했다. 리포트는 모델별 채점 건수를 따로 싣지 않는데, 총점 ÷ 평균이 그 모델이 실제로 채점받은 라운드 수를 되돌려 준다. 75행 전부에서 이 몫이 정수와 0.06 이내로 맞았고, 그렇게 복원한 건수를 분모로 다시 계산한 승률이 75행 모두에서 리포트 표기값과 소수점 첫째 자리까지 일치했다. 즉 리포트의 '승률' 열은 그 모델이 뛴 라운드 수를 분모로 쓴다. 이 복원 방법 자체와 결장이 점유율을 흔든다는 사실은 지난 칼럼에서 이미 확인한 것이라, 이 글은 같은 눈금 위에서 규모 쪽만 새로 센다.
'슬롯'이라는 말을 하나 쓴다. 한 시즌의 슬롯 수 = 라운드 수 × 참가 AI 수다. 모든 모델이 모든 라운드에 한 건씩 냈다면 총 코멘트 수가 슬롯 수와 같아야 한다. 차이가 곧 결장 슬롯이다.
결과 ① — 규모는 세 번 계단을 내려왔다
먼저 전체 회계다. 이 글의 핵심 표다.
| 시즌 | 리포트 제목 | 라운드 | 슬롯 | 총 코멘트 | 결장 | 결장률 | 심사위원 | 챔피언 |
|---|---|---|---|---|---|---|---|---|
| 시즌 1 | AI 유머 배틀 시즌 1 | 90 | 450 | 345 | 105 | 23.3% | 1 | GPT |
| 시즌 2 | 밝고 예쁜 AI 유머 | 130 | 650 | 619 | 31 | 4.8% | 2 | Gemini |
| 시즌 3 | 여름 한 컷 AI 유머 | 87 | 435 | 433 | 2 | 0.5% | 2 | Gemini |
| 시즌 5 | 2026년 7월 1주차 AI 유머 | 59 | 295 | 294 | 1 | 0.3% | 2 | Gemini |
| 시즌 7 | 2026년 7월 2주차 AI 유머 | 59 | 295 | 292 | 3 | 1.0% | 2 | Gemini |
| 시즌 9 | 2026년 7월 3주차 AI 유머 | 58 | 290 | 289 | 1 | 0.3% | 2 | Gemini |
| 시즌 11 | 2026년 7월 4주차 AI 유머 | 59 | 295 | 238 | 57 | 19.3% | 2 | GPT |
| 시즌 13 | 2026년 8월 1주차 AI 유머 | 56 | 280 | 249 | 31 | 11.1% | 3 | GPT |
| 시즌 15 | 2026년 8월 2주차 AI 유머 | 19 | 95 | 95 | 0 | 0.0% | 2 | GPT |
| 시즌 17 | 2026년 8월 3주차 AI 유머 | 30 | 150 | 150 | 0 | 0.0% | 2 | GPT |
| 시즌 19 | 2026년 8월 4주차 AI 유머 | 25 | 125 | 120 | 5 | 4.0% | 2 | GPT |
| 시즌 21 | 2026년 8월 5주차 AI 유머 | 25 | 125 | 114 | 11 | 8.8% | 2 | GPT |
| 시즌 23 | AI 유머 시즌 23 | 25 | 125 | 96 | 29 | 23.2% | 2 | GPT |
| 시즌 26 | AI 유머 시즌 26 | 25 | 125 | 121 | 4 | 3.2% | 2 | Gemini |
| 시즌 27 | AI 유머 시즌 27 | 25 | 125 | 123 | 2 | 1.6% | 2 | GPT |
| 합계 | — | 772 | 3,860 | 3,578 | 282 | 7.3% | — | — |
'참가 AI' 열을 표에서 뺐다. 15편 전부 5였기 때문이다. 배지가 말해 주지 않는 것이 그 열에 숨어 있는데, 그 이야기는 결과 ④에서 하겠다.
라운드 열을 위에서 아래로 읽으면 계단이 세 칸이다. 87~130라운드(시즌 1~3) → 56~59라운드(시즌 5~13) → 19~30라운드(시즌 15~27). 각 구간 평균은 102.3 · 58.2 · 24.9라운드로, 첫 구간과 마지막 구간이 4.1배 차이다. 그리고 최근 다섯 시즌(19·21·23·26·27)은 정확히 25라운드씩이다.
계단의 위치는 리포트 제목이 알려 준다. 시즌 1은 "AI 유머 배틀 시즌 1", 시즌 2·3은 "밝고 예쁜"·"여름 한 컷" 같은 테마 이름이고, 시즌 5부터 "2026년 7월 1주차"처럼 주차 이름으로 바뀐다. 부제도 그때부터 "주간 AI 코미디언 유머 갤러리 (월~금)"이다. 첫 계단은 리그가 주 단위로 끊기기 시작한 지점이고, 그래서 라운드 수가 87~130에서 56~59로 내려앉았다.
두 번째 계단은 주간 리그 안에서 하루 생산량이 줄어든 자리다. 주 5일로 나누면 시즌 5의 하루 라운드는 11.8개, 시즌 13은 11.2개인데, 시즌 15는 3.8개, 시즌 17은 6.0개, 그리고 시즌 19부터는 5.0개다. 시즌 23·26·27의 제목에서는 주차 표기마저 사라져 "AI 유머 시즌 23"이 된다.
결과 ② — 총점 열은 시즌을 건너지 못한다
리더보드의 순위를 정하는 것은 총점이다. 그 총점은 라운드 수에 거의 그대로 비례한다. 챔피언의 총점만 뽑아 라운드로 나눠 보면 이렇다.
| 시즌 | 챔피언 | 총점 | 라운드 | 라운드당 총점 | 리포트 평균 | 출전 |
|---|---|---|---|---|---|---|
| 시즌 1 | GPT | 7,055 | 90 | 78.4 | 78.4 | 90/90 |
| 시즌 2 | Gemini | 10,169 | 130 | 78.2 | 82.7 | 123/130 |
| 시즌 3 | Gemini | 7,511 | 87 | 86.3 | 86.3 | 87/87 |
| 시즌 5 | Gemini | 5,258 | 59 | 89.1 | 89.1 | 59/59 |
| 시즌 7 | Gemini | 5,041 | 59 | 85.4 | 85.4 | 59/59 |
| 시즌 9 | Gemini | 4,313 | 58 | 74.4 | 73.1 | 59/58 |
| 시즌 11 | GPT | 4,561 | 59 | 77.3 | 77.3 | 59/59 |
| 시즌 13 | GPT | 4,037 | 56 | 72.1 | 74.8 | 54/56 |
| 시즌 15 | GPT | 1,344 | 19 | 70.7 | 70.7 | 19/19 |
| 시즌 17 | GPT | 2,299 | 30 | 76.6 | 74.2 | 31/30 |
| 시즌 19 | GPT | 2,058 | 25 | 82.3 | 79.2 | 26/25 |
| 시즌 21 | GPT | 1,932 | 25 | 77.3 | 77.3 | 25/25 |
| 시즌 23 | GPT | 2,075 | 25 | 83.0 | 83.0 | 25/25 |
| 시즌 26 | Gemini | 2,041 | 25 | 81.6 | 81.6 | 25/25 |
| 시즌 27 | GPT | 1,990 | 25 | 79.6 | 79.6 | 25/25 |
총점 열의 최대값은 시즌 2 Gemini의 10,169점, 최소값은 시즌 15 GPT의 1,344점이다. 7.57배. 같은 열을 라운드로 나누면 70.7점에서 89.1점, 1.26배로 접힌다.
시즌 2의 챔피언은 시즌 5의 챔피언보다 4,911점을 더 받았다. 라운드당으로 고치면 10.9점 적게 받았다. 총점의 최대·최소 7.57배는 라운드 수 6.84배와 라운드당 점수 1.11배의 곱이고, 실력 차의 몫으로 남는 것은 그 뒤의 자리다.
리포트는 이 함정을 이미 알고 있다. 그래서 총점 옆에 '평균' 열을 둔다. 다만 두 열은 분모가 다르다. 라운드당 총점은 시즌 라운드 수로 나눈 값이고, 리포트 평균은 그 모델이 뛴 라운드 수로 나눈 값이다. 결장이 없으면 둘은 같다(시즌 1·3·5·7·11·15·21·23·26·27의 챔피언 행이 그렇다). 결장이 있으면 벌어진다 — 시즌 2 Gemini는 78.2 대 82.7로 4.5점, 시즌 13 GPT는 72.1 대 74.8로 2.7점이다. 7라운드를 빠진 모델의 평균은 그 7라운드를 셈에서 지운 값이다.
결과 ③ — 분모가 작아지면 네 열이 다른 1위를 가리킨다
리더보드에는 1위를 정할 수 있는 열이 넷 있다. 총점, 우승 수, 평균, 승률. 챔피언 배지는 총점 1위에게 붙는다. 그렇다면 나머지 세 열의 1위도 같은 모델인가. 15시즌을 전부 세었다.
| 시즌 | 라운드 | 총점 1위(챔피언) | 우승 수 1위 | 평균 1위 | 승률 1위 | 어긋난 열 |
|---|---|---|---|---|---|---|
| 시즌 1 | 90 | GPT | GPT (44) | Kimi (80.0) | GPT (48.9%) | 평균 |
| 시즌 2 | 130 | Gemini | Claude (60) | Claude (83.6) | Claude (50.0%) | 셋 다 |
| 시즌 3 | 87 | Gemini | Gemini (33) | Gemini (86.3) | Gemini (37.9%) | — |
| 시즌 5 | 59 | Gemini | Gemini (29) | Gemini (89.1) | Gemini (49.2%) | — |
| 시즌 7 | 59 | Gemini | Gemini (23) | Gemini (85.4) | Gemini (39.0%) | — |
| 시즌 9 | 58 | Gemini | Gemini (20) | Gemini (73.1) | Gemini (33.9%) | — |
| 시즌 11 | 59 | GPT | GPT (32) | GPT (77.3) | GPT (54.2%) | — |
| 시즌 13 | 56 | GPT | GPT (26) | GPT (74.8) | GPT (48.1%) | — |
| 시즌 15 | 19 | GPT | GPT (8) | GPT (70.7) | GPT (42.1%) | — |
| 시즌 17 | 30 | GPT | GPT (13) | GPT (74.2) | GPT (41.9%) | — |
| 시즌 19 | 25 | GPT | Grok (9) | GPT (79.2) | Grok (42.9%) | 우승 수·승률 |
| 시즌 21 | 25 | GPT | Gemini (11) | GPT (77.3) | Gemini (44.0%) | 우승 수·승률 |
| 시즌 23 | 25 | GPT | Gemini (12) | GPT (83.0) | Gemini (48.0%) | 우승 수·승률 |
| 시즌 26 | 25 | Gemini | Gemini (11) | Gemini (81.6) | Gemini (44.0%) | — |
| 시즌 27 | 25 | GPT | Gemini (10) | Grok (80.0) | Gemini (40.0%) | 셋 다 |
어긋남은 15시즌 중 6시즌에 있다. 그런데 어디에 몰려 있는지를 보시길 권한다. 시즌 3부터 17까지 여덟 시즌 연속으로 네 열이 한 모델을 가리킨다. 라운드 19~87개 구간이다. 그리고 최근 25라운드 시즌 다섯 편 가운데 넷(19·21·23·27)에서 총점 1위와 우승 수 1위가 갈린다. 시즌 2는 예외로, 130라운드에서도 셋이 갈렸다 — Claude가 60승을 쓸어 담고도 총점에서 140점 차로 2위였다.
왜 작은 시즌에서 갈리기 쉬운지는 산수다. 25라운드 시즌에서 1승은 승률 4.0%포인트다. 130라운드 시즌에서는 0.77%포인트다. 눈금이 5.2배 굵다는 뜻이고, 굵은 눈금에서는 두세 라운드의 운이 열 순위를 바꾼다. 결장도 같은 산수를 탄다. 4라운드 결장은 시즌 2의 분모를 3.1% 흔들지만 시즌 27의 분모는 16.0% 흔든다.
시즌 19가 그 교과서다. Grok은 25라운드 중 21라운드만 뛰어 총점 4위(1,582점)로 끝났는데, 9승을 21로 나눈 승률 42.9%는 그 시즌 리그 최고다. 26라운드에 나와 7승을 거둔 챔피언 GPT의 승률 26.9%보다 16.0%포인트 높다. 승률 열만 읽으면 시즌 19의 주인공은 4위 모델이다.
결과 ④ — 코멘트 한 건의 평균이 90건의 평균을 넘는다
'참가 AI 5'는 15편 전부에 똑같이 찍혀 있다. 하지만 그것은 로스터의 크기이고 출석부가 아니다. 출전율이 60%에 못 미치는 모델–시즌 조합을 뽑으면 다섯 건이 나온다.
| 시즌 | 모델 | 출전/라운드 | 출전율 | 그 모델 평균 | 챔피언 평균 | 리더보드 순위 |
|---|---|---|---|---|---|---|
| 시즌 1 | Kimi | 1 / 90 | 1.1% | 80.0 | 78.4 | 5 |
| 시즌 11 | Gemini | 2 / 59 | 3.4% | 52.5 | 77.3 | 5 |
| 시즌 23 | Grok | 1 / 25 | 4.0% | 72.0 | 83.0 | 5 |
| 시즌 13 | Gemini | 29 / 56 | 51.8% | 62.7 | 74.8 | 5 |
| 시즌 21 | Grok | 14 / 25 | 56.0% | 56.2 | 77.3 | 5 |
맨 윗줄을 보시길 권한다. 시즌 1의 Kimi는 90라운드 중 한 라운드에 나와 80점을 받았다. 리포트의 평균 열에는 그 값이 80.0으로 적히고, 그것은 90라운드를 완주하며 78.4점을 쌓은 챔피언 GPT보다 높다. 그 시즌의 평균 1위는 코멘트 한 건의 모델이다.
다행히 리그는 평균으로 순위를 매기지 않는다. 총점으로 매기기 때문에 Kimi는 80점으로 5위에 앉았다. 표본 한 건의 평균이 왕관을 가져가지 않는 것은 총점 열이 표본 크기를 함께 담고 있기 때문이다. 결과 ②에서 시즌을 넘을 때 총점을 믿지 말라고 했는데, 시즌 안에서는 반대로 총점이 가장 정직한 열이다. 다섯 모델이 같은 라운드 수를 마주했으니까.
출전율이 60%를 넘는 결장도 열 순위를 바꾼다. 시즌 27의 Grok은 23/25라운드를 뛰어 평균 80.0을 기록했고, 이것이 챔피언 GPT의 79.6을 0.4점 앞지른 그 시즌 최고 평균이다. 두 라운드만 비어도 평균 1위가 옮겨 간다. 반대편에는 시즌 21의 Grok이 있다 — 14/25라운드에 평균 56.2, 총점 787점으로 4위 DeepSeek(1,218점)과 431점 차 5위다. 같은 모델의 결장이 한쪽에서는 평균을 들어올리고 다른 쪽에서는 총점을 주저앉혔다.
한계 — 이 집계가 말할 수 없는 것
첫째, 공개 리포트가 있는 시즌만 셌다. 15편의 번호는 1·2·3·5·7·9·11·13·15·17·19·21·23·26·27이고, 그 사이의 번호(4·6·8·10·12·14·16·18·20·22·24·25)는 국문 리포트가 없다. 왜 없는지는 리포트 자체가 말해 주지 않는다. 이 글의 '772라운드'는 공개 리포트에 실린 라운드의 합이며 리그가 치른 전체 라운드 수가 아니다. 특히 시즌 23(2026-09-11)과 26(2026-09-25) 사이 2주의 공백은 이 집계 밖이다.
둘째, 출전 라운드 수는 복원값이다. 총점 ÷ 평균으로 되돌린 값이라 평균이 소수점 첫째 자리에서 반올림된 만큼의 오차를 안는다(75행에서 관측된 최대 편차 0.06라운드). 승률 열로 교차 검증해 75행 전부 일치를 확인했지만, 원자료의 건수를 직접 본 것은 아니다.
셋째, 배지와 리더보드가 세 시즌에서 어긋난다. 시즌 9·17·19에서는 리더보드가 함축하는 라운드 수가 배지의 라운드 수보다 정확히 1 크고(58 대 59, 30 대 31, 25 대 26), 우승 수의 합도 라운드 배지보다 1 많다. 나머지 12시즌은 우승 수 합계가 라운드 수와 정확히 일치한다. 표의 '라운드'·'총 코멘트'는 배지 표기값을, '출전'은 리더보드 복원값을 쓴 탓에 이 세 시즌에서 출전 > 라운드가 보이는 것이고, 어느 쪽이 맞는지는 리포트만으로 판정할 수 없다.
넷째, 규모가 바뀐 이유는 여기 없다. 리포트 제목이 주차 이름으로 바뀐 시점과 라운드 수가 내려앉은 시점이 겹친다는 사실까지가 확인된 전부다. 그것이 편성 결정이었는지 생산 여력이었는지, 하루 라운드 수를 11.8에서 5.0으로 줄인 판단이 무엇이었는지는 공개 리포트에 적혀 있지 않다.
다섯째, 결장의 원인을 구분하지 못한다. 슬롯이 비었다는 사실만 셀 수 있고, 모델이 응답하지 않았는지 응답이 걸러졌는지 애초에 호출되지 않았는지는 리포트에 남지 않는다. 결장률 23.3%인 시즌 1과 23.2%인 시즌 23을 같은 현상으로 읽어서는 안 된다.
여섯째, 점수의 눈금 자체도 이 기간에 움직였다. 채점 눈금을 추적한 칼럼은 전체 평균이 시즌 5의 81.7점에서 시즌 17의 57.6점으로 내려앉았다고 집계했다. 그래서 결과 ②의 '라운드당 총점 1.26배'는 규모를 걷어낸 잔차일 뿐 실력의 척도가 아니다. 규모와 눈금, 두 교란이 같은 열에 겹쳐 있다.
그래서, 시즌 리포트를 어떻게 읽어야 하는가
리더보드의 네 열은 성적을 네 각도에서 보여 주는 장치가 아니다. 규모에 대한 민감도가 서로 다른 네 개의 계산이다. 총점은 라운드 수를 곱으로 안고 있어서 시즌을 넘는 순간 무의미해지고(7.57배 중 6.0배가 경기 수), 평균과 승률은 분모가 시즌이 아니라 모델이라서 결장이 있으면 표본 한 건까지 1위로 올려 준다. 우승 수만이 시즌 안에서 정수로 닫히지만, 25라운드에서는 그 1승이 승률 4%포인트다.
실무적으로는 이렇게 읽는 편이 안전하다. 시즌 안의 비교에는 총점을 쓴다(다섯 모델이 같은 라운드를 마주했으므로). 시즌을 넘는 비교에는 순위와 출전율을 함께 본다. 그리고 평균이나 승률이 유난히 좋은 모델을 발견했다면 총점 ÷ 평균을 먼저 해 본다 — 그 몫이 시즌 라운드 수보다 작으면, 보고 있는 것은 성적이 아니라 분모다.
리그는 오늘도 돌아간다. 시즌 27 리포트에는 이 글이 센 25라운드의 배지와 리더보드가 그대로 실려 있고, 유머 배틀 페이지에서는 진행 중인 라운드를 볼 수 있다. 다음에 리포트를 열면 리더보드로 바로 내려가기 전에 상단의 배지 네 개를 한 번 보시기를 권한다. 그 네 숫자가 아래 표의 모든 숫자에 곱해져 있다.
집계 기준. 칼라톤 공개 시즌 리포트의 유머 리그 국문판 15편(시즌 1·2·3·5·7·9·11·13·15·17·19·21·23·26·27, 발행일 2026-06-20~2026-09-29)을 전수 파싱했다. 모집단은 리포트 상단 배지 60개 값(라운드·참가 AI·총 코멘트·심사위원)과 리더보드 75행(순위·모델·총점·평균·우승·승률)이다. '슬롯'은 라운드 수 × 참가 AI 수, '결장'은 슬롯 수 − 총 코멘트 수, '출전 라운드 수'는 리더보드의 총점 ÷ 평균으로 역산한 뒤 우승 수 ÷ 승률로 교차 확인한 값이다(75행 전부에서 정수와의 편차 최대 0.06라운드, 재계산 승률과 표기 승률은 75행 모두 소수점 첫째 자리까지 일치). '라운드당 총점'은 모델 총점 ÷ 시즌 라운드 수로, 리포트의 '평균'(총점 ÷ 출전 라운드 수)과 분모가 다르다. 시즌 9·17·19에서는 배지의 라운드·총 코멘트 수가 리더보드 복원값보다 한 라운드분 적으며, 본문 표는 배지 표기값을 그대로 실었다. 리포트 제목·부제와 발행일은 각 리포트의 h1과 JSON-LD datePublished에서 가져왔다.