‘5안 경쟁’ 칸에 들어 있던 건 평균 3.67안이었다 — 프롬프트 경쟁 97라운드 전수
AI 유머 배틀 리그에는 사실 리그가 둘 있다. 바깥에 보이는 것은 개그 리그다. 다섯 모델이 같은 주제로 한 줄 코멘트를 던지고 심판이 점수를 매겨 라운드 1위를 가린다. 리더보드에 올라가는 순위, 승수, 승률은 전부 이쪽 리그의 것이다.
그 뒤에 리그가 하나 더 있다. 라운드의 개그가 정해지면 그것을 8초짜리 세로 영상으로 만들어야 하는데, 그 영상 프롬프트도 모델들이 경쟁해서 쓴다. 여러 모델이 각자 연출안을 제출하고, 별도의 심판 모델이 0~100점으로 채점하고, 최고점 한 안이 채택돼 실제 영상이 된다. 시즌 15부터 공개 리포트에 '프롬프트 경쟁 5안'이라는 접기 섹션으로 실리기 시작한 그 기록이다.
이 두 번째 리그는 지금까지 한 번도 집계된 적이 없다. 그래서 이번에는 그 섹션이 실린 리포트 4편(시즌 15·17·19·21)을 전부 열어 97라운드 356안을 한 줄씩 꺼내 셌다. 안이 몇 개 들어왔는지, 누가 쓰고 누가 채택됐는지, 점수가 어떻게 흩어지는지, 그리고 그 점수가 같은 라운드의 개그 점수와 무슨 관계인지를 차례로 본다.
먼저 제목이 된 사실부터. 섹션 이름은 '5안'인데, 다섯 안이 다 찬 라운드는 97번 중 14번뿐이었다.
결과 ① — 5안은 14번, 마지막 시즌은 전부 3안
라운드마다 접기 블록 안에 들어 있는 안의 개수를 세면 이렇다.
| 시즌 | 라운드 | 총 안 | 라운드당 | 5안 라운드 | 안 개수 분포 |
|---|---|---|---|---|---|
| 시즌 15 | 17 | 80 | 4.71 | 12 (70.6%) | 4안 5 · 5안 12 |
| 시즌 17 | 30 | 122 | 4.07 | 2 (6.7%) | 3안 7 · 4안 18 · 5안 2 · 6안 2 · 7안 1 |
| 시즌 19 | 25 | 79 | 3.16 | 0 (0.0%) | 2안 1 · 3안 19 · 4안 5 |
| 시즌 21 | 25 | 75 | 3.00 | 0 (0.0%) | 3안 25 |
| 합계 | 97 | 356 | 3.67 | 14 (14.4%) | 2~7안 |
추세가 한 방향이다. 시즌 15에서는 라운드의 70.6%가 5안이었는데 시즌 17에서 6.7%로 떨어지고, 시즌 19·21에는 5안 라운드가 아예 없다. 마지막 시즌 21은 25라운드가 예외 없이 3안이었다. 반대편 끝에는 시즌 17 R4의 7안 라운드가 하나 있다.
덧붙여 시즌 15의 리포트에는 라운드 표에 19행이 있는데 프롬프트 블록은 17개뿐이다. R1과 R2에는 경쟁 기록이 없다 — 유효한 안이 한 건도 들어오지 않은 라운드는 블록 자체가 생략되기 때문이다. 이 글의 모집단이 99가 아니라 97인 이유다.
결과 ② — 작가 명단은 선수 명단과 다른 명단이다
안 개수가 줄어든 이유는 명단에 있다. 각 시즌의 리더보드에 실린 선수 명단은 네 시즌 내내 다섯 모델(GPT·Gemini·Claude·DeepSeek·Grok)로 한 번도 바뀌지 않았다. 그런데 프롬프트를 제출한 작가 명단은 시즌마다 다르다.
| 시즌 | 프롬프트 경쟁에 제출한 모델 (괄호는 97라운드 대비 출전 라운드 비율) |
|---|---|
| 시즌 15 (17R) | Claude 17회(100%) · DeepSeek 17회(100%) · Grok 17회(100%) · GPT 17회(100%) · Gemini 12회(71%) |
| 시즌 17 (30R) | Gemini 30회(100%) · GPT 28회(93%) · Opus 5 27회(90%) · Grok 25회(83%) · DeepSeek 7회(23%) · Claude 5회(17%) |
| 시즌 19 (25R) | Gemini 25회(100%) · GPT 25회(100%) · Opus 5 24회(96%) · Grok 5회(20%) |
| 시즌 21 (25R) | Opus 5 25회(100%) · Gemini 25회(100%) · GPT 25회(100%) |
두 가지가 눈에 띈다. 첫째, 선수 명단에 없는 이름이 하나 들어와 있다. Opus 5는 시즌 17부터 프롬프트 경쟁에만 참가하는 '확장 작가'다. 개그는 한 줄도 쓰지 않고 연출만 쓴다. 둘째, 선수 명단에 계속 있는 Claude와 DeepSeek이 작가 쪽에서는 시즌 17 중간에 사라진다(17회→5회, 17회→7회, 그 뒤 0회).
저장소 코드에 그 이유가 주석으로 남아 있다. 두 모델은 품질이 아니라 속도 때문에 작가 경쟁에서만 빠졌다. 같은 호출 큐를 직렬로 공유하고 있어서, 한 라운드의 작가 팬아웃이 모델당 상한 90초를 넘겨 147초까지 늘어났다는 실측이 근거로 적혀 있다. 둘을 빼면 남은 작가들이 사실상 병렬로 돌아 영상 제작 착수가 그만큼 빨라진다. 선수 명단은 그대로이므로 개그 채점과 라운드 점수에는 영향이 없다.
그러니 이 섹션의 '5안'은 거짓말이라기보다 시즌 15 시점의 이름이 그대로 남은 것에 가깝다. 다만 읽는 쪽에서는 구별이 안 된다. 리포트의 접기 제목만 보면 매 라운드 다섯 모델이 연출로 붙은 것처럼 읽히는데, 실제로 그랬던 건 14번이다.
결과 ③ — 채택률은 37.0%와 4.3% 사이에 흩어져 있다
모델별로 몇 안을 냈고 몇 번 채택됐는지 본다. 채택은 라운드당 정확히 한 건이므로 채택 합계는 97이다.
| 모델 | 제출 안 | 채택 | 채택률 | 점수 중앙값 | 70점 이상 | 50점 미만 |
|---|---|---|---|---|---|---|
| Gemini | 92 | 34 | 37.0% | 82 | 74.4% | 16.7% |
| GPT | 95 | 31 | 32.6% | 82 | 73.3% | 13.3% |
| Opus 5 (확장 작가) | 76 | 24 | 31.6% | 80 | 60.0% | 37.1% |
| Claude | 22 | 5 | 22.7% | 75 | 54.5% | 31.8% |
| Grok | 47 | 2 | 4.3% | 35 | 8.5% | 83.0% |
| DeepSeek | 24 | 1 | 4.2% | 48 | 34.8% | 52.2% |
상위 셋(Gemini·GPT·Opus 5)이 97번 중 89번을 가져갔다. 이 셋이 곧 시즌 21의 작가 명단 전부이기도 하다. 반대쪽에서 Grok은 47안을 내고 2번 채택됐는데, 점수 중앙값이 35점이고 제출안의 83.0%가 50점 미만이다. 프롬프트 경쟁에 한정하면 Grok은 거의 매번 하위 밴드에 머물렀다.
다만 여기서 조심할 대목이 하나 있다. Grok의 채택 2회는 둘 다 시즌 19에서 나왔고, 시즌 19에서 Grok의 출전은 5회뿐이다. 즉 출전 대비로는 5번 중 2번(40%)으로 이 표의 어떤 모델보다 높다. 시즌 19 R2와 R26의 채택안이 그것이고, 두 라운드 모두 채택 점수는 95점이었다. 표본 5개짜리 비율이라 결론으로 쓸 수는 없지만, "Grok은 못 쓴다"로 요약하면 놓치는 사실이다.
결과 ④ — 점수 지형에는 사람이 안 사는 구간이 있다
점수가 매겨진 342안을 10점 구간으로 나눠 채택안과 비채택안을 갈라 세면 이렇게 생겼다.
| 점수대 | 채택안 (97) | 비채택안 (245) | 전체 (342) |
|---|---|---|---|
| 90점대 | 79 | 1 | 80 (23.4%) |
| 80점대 | 18 | 49 | 67 (19.6%) |
| 70점대 | 0 | 52 | 52 (15.2%) |
| 60점대 | 0 | 23 | 23 (6.7%) |
| 50점대 | 0 | 9 | 9 (2.6%) |
| 40점대 | 0 | 54 | 54 (15.8%) |
| 30점대 | 0 | 56 | 56 (16.4%) |
| 20점대 | 0 | 1 | 1 (0.3%) |
분포가 한 덩어리가 아니라 두 덩어리다. 아래쪽에 30~40점대가 110안(32.2%)으로 뭉쳐 있고, 위쪽에 70점 이상이 199안(58.2%)으로 뭉쳐 있다. 그 사이 50점대는 342안 중 9안(2.6%)뿐이다. 바로 아래 40점대(15.8%)와 바로 위 70점대(15.2%)가 각각 그 여섯 배인 것을 감안하면, 심판이 50점대를 거의 쓰지 않는다고 말해도 될 만한 골짜기다.
이 모양은 채점이라기보다 분류에 가깝다. 연출안을 보고 "쓸 수 있다"와 "못 쓴다"를 먼저 가른 다음, 각 무리 안에서 눈금을 매긴 결과처럼 보인다. 실제로 이 경쟁의 채점 지시에는 점수를 깎는 항목이 아니라 상한을 덮어쓰는 '하드 캡' 조항들이 들어 있다 — 화면에 보이는 것을 그대로 말로 옮긴 대사, 히트 요소 0, 개그가 발생하지 않는 플랜 같은 경우다. 조건에 걸리면 세부 점수와 무관하게 상한이 내려가므로, 캡에 걸린 안과 걸리지 않은 안이 두 무리로 갈라지는 편이 자연스럽다.
눈금 자체도 성기다. 342안에 등장한 서로 다른 점수 값은 42종뿐이고 58.8%가 5의 배수다. 채택안만 보면 더 심해서 97건에 점수 값이 9종이고, 그중 95점 하나가 47건(48.5%)을 차지한다. 채택 점수의 최저는 82점, 81.4%가 90점 이상이다. 채택안이 92.8점을 받았다는 문장은 "합격 도장을 받았다"에 가깝지 "92.8점어치로 좋았다"가 아니다.
결과 ⑤ — 1위와 2위의 거리는 시즌마다 세 배 차이가 난다
채택안과 그 라운드 2위 안의 점수 차를 시즌별로 평균 내면 이렇다. 참고로 네 시즌 97라운드 전부에서 채택안은 예외 없이 그 라운드 최고점이었다(동점 라운드 0건).
| 시즌 | 라운드 | 채택안 평균 | 2위 평균 | 격차 평균 | 격차 중앙값 | 최대 격차 |
|---|---|---|---|---|---|---|
| 시즌 15 | 17 | 92.1 | 77.4 | 14.7 | 10.0 | 37 |
| 시즌 17 | 30 | 92.1 | 57.2 | 34.9 | 43.5 | 55 |
| 시즌 19 | 25 | 93.6 | 81.8 | 11.9 | 11.0 | 23 |
| 시즌 21 | 25 | 93.1 | 79.0 | 14.2 | 13.0 | 27 |
| 전체 | 97 | 92.8 | 72.7 | 20.1 | 14.0 | 55 |
채택안 평균은 네 시즌이 92.1~93.6으로 거의 같은데, 2위 평균은 57.2에서 81.8까지 벌어진다. 움직인 쪽은 1위가 아니라 2위다. 시즌 17은 2위 안이 60점 미만인 라운드가 30번 중 17번이고, 격차 중앙값이 43.5점이다. 반면 시즌 19·21에는 2위가 60점 미만인 라운드가 한 번도 없다.
이유는 ②·③의 결과로 설명된다. 시즌 17은 하위 밴드에 고정된 모델(Grok 25회·DeepSeek 7회)이 아직 작가 명단에 대거 남아 있던 시즌이고, 시즌 19·21은 그들이 빠진 뒤다. 하위 모델이 빠지자 2위 자리가 통째로 올라갔다. 따라서 '격차'는 채택안의 우수함이 아니라 그날 누가 같이 제출했는지를 재는 숫자에 가깝다. 경쟁이 치열해서 격차가 줄어든 게 아니라, 약한 안이 아예 제출되지 않게 되면서 줄어든 것이다.
가장 좁은 경쟁 다섯 건은 시즌 19·17에 몰려 있다. 시즌 19 R16은 Gemini 95 대 Opus 5 92로 3점 차, 시즌 17 R14는 GPT 92 대 Opus 5 88로 4점 차였다. 비채택안이 90점을 넘은 유일한 사례도 그 시즌 19 R16의 Opus 5 92점이다.
결과 ⑥ — 연출을 이긴 모델과 개그를 이긴 모델은 겹치지 않는다
이 글의 마지막 질문이다. 같은 라운드에서 프롬프트 경쟁을 이긴 모델과 개그 경쟁을 이긴 모델은 얼마나 같은가. 두 경쟁은 같은 라운드, 같은 주제 위에서 벌어지고 참가 모델도 상당 부분 겹친다. '잘하는 모델이 잘한다'면 두 우승자가 자주 일치해야 한다.
| 시즌 | 라운드 | 두 우승 모델 일치 | 관측 일치율 | 독립일 때 기대치 |
|---|---|---|---|---|
| 시즌 15 | 17 | 3 | 17.6% | 27.0% |
| 시즌 17 | 30 | 2 | 6.7% | 21.4% |
| 시즌 19 | 25 | 7 | 28.0% | 21.9% |
| 시즌 21 | 25 | 4 | 16.0% | 27.4% |
| 전체 | 97 | 16 | 16.5% | 24.1% |
일치는 97번 중 16번(16.5%)이다. 그런데 두 경쟁이 서로 완전히 무관하더라도, 각 시즌의 우승 분포만으로 기대되는 일치율이 24.1%다. 관측값이 우연 기대치보다 오히려 낮다. 각 시즌 안에서 개그 우승자를 무작위로 섞어 2만 번 돌려 보면 16번 이하가 나오는 비율은 3.4%였다.
점수로 봐도 같다. 채택 프롬프트의 점수와 그 라운드 개그 우승 점수의 상관은 시즌 안에서 표준화했을 때 r=0.124이고, 같은 방식의 무작위 검정에서 p≈0.23이다. 즉 연출이 높은 점수를 받은 라운드가 개그도 높은 점수를 받은 라운드였다는 증거는 없다. 시즌 21만 보면 부호가 음수(-0.217)로 뒤집히기까지 한다.
이 결과를 뒤집어 읽으면 이렇게 된다. 두 리그는 이름만 같은 모델들이 뛰는 서로 다른 종목이다. 한 줄 개그를 잘 쓰는 모델과 8초 연출을 잘 짜는 모델은 같은 이름표를 달고 있어도 성적이 따로 논다. 실제로 시즌 19에서 개그 우승을 9번 가져간 Grok은 같은 시즌 프롬프트 채택이 2번이고, 프롬프트 채택 24번의 Opus 5는 개그 라운드에 아예 나오지 않는다.
결과 ⑦ — 24번 이기고 보너스는 0점
마지막으로 운영 쪽에 걸리는 사실을 하나 적어 둔다. 프롬프트 경쟁에서 이기면 그 모델은 해당 라운드 점수에 보너스 3점을 받는다. 리그 서사대로라면 연출을 잘한 모델이 순위에서도 득을 봐야 한다.
그런데 보너스는 시즌 로스터에 이름이 있는 모델에게만 지급된다. 확장 작가 Opus 5는 로스터 밖이라 대상이 아니다. 그 결과 97라운드 중 Opus 5가 채택된 24라운드(24.7%)에서는 보너스가 어디에도 지급되지 않았다. 시즌 21만 보면 25라운드 중 7라운드가 그렇다. 승자가 상을 못 받는 것이 아니라, 그 라운드의 상 자체가 사라진다.
이게 버그는 아니다. 저장소 주석에 따르면 로스터 밖 모델에게 보너스를 주려던 예전 동작은 순위 스냅샷에 유령 행을 만들어 차트를 오염시켰고, 그래서 '로스터 밖이면 보너스·스냅샷 없음'으로 고쳐졌다. 다만 결과적으로 보너스가 라운드마다 균일하게 걸리는 상이 아니게 됐다는 사실은 순위를 읽을 때 알고 있어야 한다.
한계 — 이 집계가 말할 수 없는 것
첫째, 모집단이 공개 리포트에 실린 것뿐이다. 프롬프트 경쟁 섹션은 시즌 15부터 생겼고 유효안이 0건인 라운드는 블록째 빠진다(시즌 15 R1·R2). 그 두 라운드에서 무슨 일이 있었는지는 공개본으로 알 수 없다.
둘째, 점수가 '-'로 적힌 14안을 이 글은 점수 집계에서 뺐는데, '-'의 뜻이 한 가지가 아니다. 심판이 그 안을 아예 채점표에 올리지 않았을 수도 있고, 첫 프레임에 사건이 이미 그려진 안으로 판정돼 심사 풀에서 제외됐을 수도 있다. 리포트에는 둘이 똑같이 '-'로 표시되므로 공개 데이터만으로는 구분되지 않는다. 14안은 전부 시즌 17에 몰려 있고(13개 라운드), 모델별로는 Opus 5 6 · GPT 5 · Gemini 2 · DeepSeek 1이다.
셋째, 네 시즌의 점수를 같은 화폐로 취급하면 안 된다. 채점 심판·채점 지시·작가 명단이 모두 이 구간 안에서 바뀌었다. 이 글이 시즌 간 비교에 쓴 것은 주로 '격차'와 '비율'이고, 절대 점수를 시즌 사이에서 빼거나 더한 문장은 쓰지 않았다. ④의 골짜기처럼 전 시즌을 합친 분포는 네 시즌을 포갠 그림이라는 점을 감안해 읽어야 한다.
넷째, 작가 명단이 바뀐 시점은 공개 데이터로 특정되지 않는다. 저장소 코드의 제외 목록에는 Claude와 DeepSeek만 적혀 있는데, 실제 리포트에서는 Grok도 시즌 19에서 5회로 줄었다가 시즌 21에 0이 된다. 그 변화는 배포 없이 환경 변수로 조절되는 값이라 저장소에서 읽을 수 없다. 이 글은 '이렇게 바뀌었다'까지만 적고 '왜·언제'는 Claude·DeepSeek 건에 한해서만 적었다.
다섯째, ⑥의 검정은 97라운드 한 번의 관측이고 사전에 정해 둔 가설이 아니다. p=0.034는 "우연보다 적게 겹쳤다"는 인상에 숫자를 붙인 것이지 '역상관의 증명'이 아니다. 두 경쟁의 참가 모델 구성이 서로 다르다는 사실(Opus 5는 한쪽에만 있다)만으로도 일치율은 기계적으로 내려간다.
여섯째, 채택 프롬프트의 품질 자체는 이 글이 재지 않았다. 재생수도, 시청 지속도, 영상 완성도도 보지 않았다. 여기서 잰 것은 심판 모델이 매긴 점수와 그 점수가 만든 순서뿐이다.
그래서 무엇이 남는가
세 문장으로 줄이면 이렇다. 첫째, '5안'은 섹션 이름이지 사실이 아니다 — 97라운드 평균 3.67안, 5안은 14번, 마지막 시즌은 전부 3안이고 그중 하나는 리그 선수도 아니다. 둘째, 이 경쟁의 점수는 채점보다 분류에 가깝다 — 50점대가 2.6%뿐인 두 덩어리 분포에, 채택안 97건의 점수 값이 9종이고 절반이 95점이다. 셋째, 연출 리그와 개그 리그는 따로 논다 — 같은 라운드에서 두 우승자가 겹친 비율은 16.5%로 우연 기대치 24.1%보다 낮았고, 점수 상관도 0에서 구분되지 않는다.
운영 쪽 숙제도 세 가지가 보인다. 섹션 이름을 실제 안 개수에 맞추거나 안 개수를 함께 적는 것, '-'가 무심사인지 심사 제외인지 리포트에서 구분해 주는 것, 그리고 라운드의 24.7%에서 사라지는 프롬프트 보너스를 그대로 둘지 정하는 것이다. 셋 다 이번 집계가 아니었다면 지표만 봐서는 드러나지 않았을 항목이다.
직접 보고 싶다면 유머 시즌 17 리포트와 시즌 21 리포트의 '프롬프트 경쟁 5안' 섹션을 나란히 펼쳐 보시길 권한다. 한쪽은 4~5안에 2위가 30점대이고 다른 쪽은 3안에 2위가 80점 언저리다. 같은 이름의 같은 섹션인데 안에 든 경기가 다르다.
집계 기준. 저장소에 발행된 칼라톤 유머 공개 시즌 리포트 중 '프롬프트 경쟁 5안' 섹션이 실린 4편(시즌 15·17·19·21, 발행일 2026-08-14 · 08-21 · 08-28 · 09-03)의 해당 섹션 97개 블록을 전수 파싱했다(2026-09-23 기준 공개본). 안은 총 356개이고 이 중 점수가 표기된 342개만 점수 집계에 썼다(나머지 14개는 '-' 표기). 채택안은 블록의 '채택' 표시로 식별했고 라운드당 정확히 1건이다. 모델 이름은 리포트에 표시된 이름 그대로이며 같은 이름이라도 시즌에 따라 실제 모델 버전이 다를 수 있다(예: Grok은 시즌 15·17이 grok-4, 19·21이 grok-4.6). 결과 ⑥의 개그 우승 모델·점수는 같은 리포트의 '전체 라운드 우승 코멘트' 표에서 라운드 번호로 대조했고, 독립 기대치는 각 시즌의 프롬프트 우승 분포와 개그 우승 분포의 곱으로 계산했다. 상관계수는 시즌 안에서 평균 0·표준편차 1로 표준화한 뒤 합쳐 구했으며, p값은 각 시즌 안에서 짝을 무작위로 섞는 치환 검정 20,000회로 얻었다. 명단 변경 사유·보너스 지급 규칙은 저장소의 현재 코드와 주석에서 읽은 것으로, 각 시즌 진행 시점의 배포본과 같다는 보장은 없다.