끝자리 5가 48% — 한 리포트 안의 두 채점 441건을 같은 표에 놓고 재다

칼라톤 AI 유머 배틀의 시즌 리포트에는 '0~100점'이라고 적힌 점수 열이 둘 있다. 하나는 라운드마다 가장 웃긴 한 줄을 가리는 개그 점수다. 리더보드의 총점·평균·승률이 전부 이 열에서 나온다. 다른 하나는 그 개그를 8초 세로 영상으로 옮길 연출안을 모델들이 경쟁해 쓰고 별도 심판이 채점하는 프롬프트 점수로, 시즌 15부터 '프롬프트 경쟁 5안' 접기 섹션에 실린다.

두 열은 같은 리포트, 같은 라운드, 같은 두 자리 숫자로 나란히 찍힌다. 그러니 읽는 쪽에서는 자연스럽게 한 문장에 섞게 된다 — "연출은 92.8점인데 개그는 86.5점이었다"처럼. 이 문장이 성립하려면 두 숫자가 같은 화폐여야 한다. 이번 칼럼은 그 전제를 검사한다. 지난 칼럼이 프롬프트 경쟁 쪽만 전수 집계했으니, 이번에는 같은 라운드의 개그 점수를 같은 눈으로 세어 두 계열을 한 표에 올린다. 질문, 방법, 결과, 한계의 순서로 적는다.

질문 — 두 열은 같은 자(尺)인가

'같은 자'를 검사 가능한 형태로 쪼개면 네 가지다. ① 눈금의 촘촘함 — 어떤 값들을 실제로 쓰는가(끝자리 분포, 서로 다른 값의 개수). ② 유효 해상도 — 그 값들이 고르게 쓰이는가, 몇 개 값에 몰려 있는가. ③ 동점 밀도 — 두 건을 집어 들었을 때 같은 점수일 확률. ④ 우승과 나머지의 거리 — 1등이 평균보다 몇 점 위인가. ①~③이 다르면 두 숫자는 더하거나 비교할 수 없고, ④까지 다르면 "점수가 높다"는 말의 뜻조차 달라진다.

방법 — 같은 4개 시즌에서 441건

집계 대상은 프롬프트 경쟁 섹션이 실린 공개 리포트 4편(시즌 15·17·19·21)이다. 여기서 두 계열을 꺼냈다.

파서 검증은 이미 발행된 두 칼럼의 숫자로 했다. 프롬프트 쪽은 블록 97개·제출안 356건·10점 구간 분포(90점대 80 / 80점대 67 / 70점대 52 / 60점대 23 / 50점대 9 / 40점대 54 / 30점대 56 / 20점대 1)가 지난 칼럼과 한 건도 다르지 않게 재현됐다. 개그 쪽은 리더보드의 총점÷평균으로 시즌별 채점 건수를 역산해 우승 평균과 전체 평균의 격차를 다시 구했고, 시즌 15·17·19에서 각각 28.3·26.6·18.8점이 나와 채점 눈금 이동을 다룬 칼럼의 값과 일치했다.

시작 전에 형식 문제 하나를 밝혀 둔다. 두 열은 리포트에 찍히는 자리수 규칙이 서로 다르다. 프롬프트 점수는 소수 한 자리로 인쇄되고(342건 전부 .0으로 끝난다 — 즉 원값이 정수다), 개그 점수는 반올림해 정수로 인쇄된다. 그래서 아래의 끝자리 분석은 공개된 자리수에 대한 분석이다. 이 비대칭이 결론을 어디까지 제약하는지는 한계 단락에서 따로 적는다.

결과 ① — 프롬프트 점수의 끝자리는 절반이 5다

두 계열의 점수를 끝자리(1의 자리)로만 갈라 세면 이렇다. 이 글의 핵심 표다.

끝자리개그 점수 99건프롬프트 점수 342건
011건 (11.1%)37건 (10.8%)
15건 (5.1%)1건 (0.3%)
216건 (16.2%)54건 (15.8%)
315건 (15.2%)13건 (3.8%)
412건 (12.1%)12건 (3.5%)
510건 (10.1%)164건 (48.0%)
610건 (10.1%)7건 (2.0%)
73건 (3.0%)2건 (0.6%)
814건 (14.1%)51건 (14.9%)
93건 (3.0%)1건 (0.3%)

개그 열은 열 개 끝자리를 전부 쓴다. 가장 흔한 끝자리(2)가 16.2%, 가장 드문 끝자리(7·9)가 3.0%로, 고른 분포는 아니지만 어느 자리도 비어 있지 않다. 끝자리 5는 10.1% — 우연한 수준이다.

프롬프트 열은 전혀 다르게 생겼다. 끝자리 5 하나가 48.0%이고, 끝자리 0·2·5·8 네 개를 합치면 89.5%다. 같은 네 자리의 개그 쪽 합계는 51.5%다. 반대로 끝자리 1·7·9는 342건에서 각각 1건·2건·1건, 셋을 합쳐 4건(1.2%)뿐이다. 이건 "점수를 매겼다"가 아니라 미리 깔아 둔 격자 위에 올려놓았다에 가까운 모양이다. 이 격자는 시즌마다 조금 느슨해지긴 해도 사라지지 않는다 — 5의 배수 비율이 시즌 15·17·19·21 순서로 68%·61%·51%·55%이고, 같은 시즌의 개그 쪽은 16%·23%·24%·20%다.

결과 ② — 서로 다른 값은 더 많은데 해상도는 더 낮다

두 계열의 모양을 한 표에 모으면 이렇다. '유효 해상도'는 값 분포의 섀넌 엔트로피를 값 개수로 환산한 것으로, 모든 값이 똑같이 쓰일 때만 실제 값 개수와 같아지고 몇 개 값에 몰리면 작아진다.

지표개그(우승)프롬프트(전 안)프롬프트(채택)프롬프트(비채택)
건수9934297245
범위58~9525~9682~9625~92
평균86.4668.3692.7558.70
표준편차6.7822.503.1919.34
서로 다른 값22종42종9종37종
유효 해상도17.923.54.622.3
5의 배수21.2%58.8%54.6%60.4%
최빈값 점유92점 11.1%95점 13.7%95점 48.5%35점 13.9%

통째로 보면 프롬프트 계열이 더 넓고(25~96) 더 많은 값을 쓰며(42종) 더 흩어져 있다(표준편차 22.5). 그런데 실제로 결정에 쓰이는 부분만 떼면 순서가 뒤집힌다. 채택 점수 97건은 9종 값에 담겨 있고 유효 해상도가 4.6이다. 같은 자리의 개그 우승 점수 99건은 22종, 유효 해상도 17.9다. 라운드의 1등을 가리키는 숫자로서 개그 열은 프롬프트 열보다 네 배 가까이 촘촘하다.

범위를 바닥부터 재면 차이가 더 분명하다. 개그 우승 점수는 38칸(58~95) 중 22칸, 프롬프트 전 안은 72칸(25~96) 중 42칸을 쓴다 — 쓰는 칸의 비율은 57.9%와 58.3%로 거의 같다. 즉 두 계열의 '성김' 정도는 비슷한데 놓인 자리가 다르다. 그 자리가 결정의 자리냐 아니냐가 ②의 전부다.

결과 ③ — 채택 점수는 3.4쌍에 1쌍이 동점이다

같은 계열에서 두 건을 무작위로 집어 들었을 때 점수가 같을 확률을 재면 이렇다. 개그 우승 점수는 0.055(18.3쌍에 1쌍), 프롬프트 전 안은 0.056(17.8쌍에 1쌍)으로 사실상 같다. 그런데 채택 점수만 따로 재면 0.295 — 3.4쌍에 1쌍이 동점이다. 개그 쪽의 5.4배다.

위쪽 10점 구간을 열어 보면 왜 그런지 보인다. 개그 우승 점수는 86~95점 구간에 60건(60.6%)이 들어 있고 그 안에서 86·87·88·89·90·91·92·93·94·95 열 개 값을 다 쓴다. 채택 점수는 87~96점 구간에 91건(93.8%)이 들어 있는데 쓰는 값은 88·90·92·93·94·95·96 일곱 개이고, 그중 95점 하나가 47건이다. 90점 이상 비율은 개그 43.4%(99건 중 43), 채택 81.4%(97건 중 79)다.

덧붙여 한 라운드 안에서 두 제출안이 같은 점수를 받은 사례는 97라운드 342안에 한 건도 없다. 심판은 라운드 안에서는 반드시 순서를 가리면서, 라운드를 건너서는 같은 숫자를 반복한다. 이 조합은 "안들을 서로 비교해 줄 세우는 자"의 특징이고, 라운드 사이에 비교 가능한 절대 눈금을 유지하는 자의 특징은 아니다.

결과 ④ — 두 눈금이 합의하는 축은 하나뿐이다

여기까지는 전부 다른 점이었다. 그런데 '우승과 나머지의 거리'로 보면 두 계열이 거의 같은 값을 낸다. 개그 쪽은 리더보드 역산으로 비우승 채점 389건의 평균을 구해 우승 99건과 비교했고, 프롬프트 쪽은 채택 97건과 비채택 245건을 비교했다.

시즌개그 우승개그 비우승개그 프리미엄채택비채택프롬프트 프리미엄
시즌 1586.3 (19)50.2 (76)36.192.1 (17)55.9 (63)36.2
시즌 1784.2 (30)50.5 (125)33.792.1 (30)47.3 (78)44.8
시즌 1988.5 (25)64.2 (99)24.393.6 (25)68.8 (54)24.8
시즌 2187.4 (25)57.5 (89)29.993.1 (25)69.2 (50)23.9
합계86.46 (99)55.51 (389)31.092.75 (97)58.70 (245)34.1

합계 프리미엄이 31.0점과 34.1점이다. 눈금의 촘촘함·해상도·동점 밀도가 전부 다른 두 계열이, 1등을 평균에서 얼마나 떼어 놓는지에 대해서는 3점 차이로 합의한다. 시즌 15·19에서는 36.1 대 36.2, 24.3 대 24.8로 거의 겹치기까지 한다. 어긋나는 시즌은 17(33.7 대 44.8)과 21(29.9 대 23.9)인데, 둘 다 프롬프트 쪽 작가 명단이 크게 바뀐 시즌이다 — 하위 밴드에 머물던 모델이 많이 제출한 시즌 17은 비채택 평균이 47.3까지 내려가고, 그들이 빠진 시즌 21은 69.2까지 올라간다.

그래서 두 열에서 안전하게 비교할 수 있는 양은 점수 자체가 아니라 이 거리다. "92.8점"과 "86.5점"은 섞을 수 없지만 "평균보다 34점 위"와 "평균보다 31점 위"는 같은 뜻에 가깝다.

결과 ⑤ — 한쪽은 자, 한쪽은 도장

왜 이렇게 갈렸는지는 저장소의 채점 지시에 적혀 있다. 두 심판 모두 0~100점을 요구하고 둘 다 '하드 캡'(조건에 걸리면 세부 점수와 무관하게 총점 상한이 내려가는 조항)을 쓴다. 다른 것은 캡이 걸린 위치다.

개그 심판의 캡은 바닥에 있다 — 사진 재진술 20점 이하, 인사·빈 리액션 15점 이하, 주제 이탈 10점 이하, 뒤집히지 않는 말장난 40점 이하. 우승 코멘트가 이 선에 닿는 일은 없다(99건의 최저가 58점이다). 즉 우승 점수 구간에서 개그 심판은 캡 없이 자유롭게 눈금을 쓴다.

프롬프트 심판의 캡은 한가운데에 있다 — 화면을 그대로 읊는 대사 40점 이하, 8초 안에 개그 사건이 일어나지 않는 플랜 40점 이하, 고정된 아이디어를 바꿔치기한 안 50점 이하, 첫 프레임이 이미 사고를 보여 주는 안 45점 이하 등 열 개 넘는 조항이 40~50점대에 몰려 있다. 실제로 비채택 245건 중 114건(46.5%)이 50점 이하이고, 그중 35점 34건·45점 22건·40점 15건·38점 13건으로 캡 선과 그 바로 아래에 뭉쳐 있다. 지난 칼럼이 찾은 '50점대 골짜기'(342건 중 9건)는 이 캡들의 그림자다.

위쪽에는 캡이 아니라 문턱이 하나 더 있다. 저장소의 프롬프트 경쟁 코드에는 채택안 점수가 88점 미만이면 그 모델에게 심판평을 돌려주고 수정안을 받는 품질 게이트가 있다(기본값 88, 환경변수로 조정 가능). 관측된 채택 점수 97건 중 88점 이상이 91건(93.8%)이고, 88점 미만 6건은 82점 1건과 85점 5건뿐이다. 채택 점수의 바닥이 82점인 것은 연출의 품질 분포가 그렇게 생겼기 때문이 아니라, 그 아래가 통과선이기 때문이다.

정리하면 개그 점수는 자(尺)이고 프롬프트 점수는 도장이다. 전자는 라운드 1등들 사이의 미세한 차이를 22종 값으로 적어 두고, 후자는 "쓸 수 있다/못 쓴다"를 가른 뒤 합격 쪽에 95를 찍는다. 채택안의 48.5%가 같은 95점인 이유이기도 하다.

결과 ⑥ — 같은 라운드에 두 자를 대면

마지막으로 97개 맞물린 라운드에서 두 숫자를 직접 붙여 봤다. 프롬프트 점수가 개그 점수보다 높은 라운드가 83번(85.6%), 같은 라운드가 3번, 낮은 라운드가 11번이다. 차이의 평균은 +6.34점, 중앙값 +5점이고 범위는 −9점에서 +37점까지다. 가장 벌어진 라운드는 시즌 17 R13으로 개그 58점·연출 95점이었다. 같은 라운드, 같은 주제인데 한 숫자는 그 시즌 최저 우승 점수이고 다른 숫자는 만점에 가깝다.

두 점수의 상관은 시즌 안에서 표준화했을 때 r=0.124이고, 시즌 안에서만 딱지를 섞는 순열검정(2만 회)에서 p=0.23이다. 시즌별로는 0.296·0.204·0.253·−0.217로 시즌 21에서 부호가 뒤집힌다. 이 값은 지난 칼럼이 보고한 수치와 같고, 이번 재집계에서도 그대로 재현됐다. 연출 점수가 높은 라운드가 개그 점수도 높은 라운드였다는 증거는 여전히 없다.

한계 — 이 분석이 말할 수 없는 것

첫째, 두 열의 인쇄 규칙 차이 때문에 결론이 대칭이 아니다. 리포트 생성기는 프롬프트 점수를 소수 한 자리로 찍고 개그 점수는 반올림해 정수로 찍는다. 프롬프트 342건이 전부 .0으로 끝났으니 그 격자는 원값의 성질이 확실하다. 반대로 개그 열에서 격자가 보이지 않는다는 사실은 두 가지로 읽힐 수 있다 — 원값에 격자가 없거나, 있었는데 반올림 과정에서 씻겨 나갔거나. 반올림은 격자를 만들지는 못하지만 지울 수는 있다. 저장소 코드가 개그 점수를 심사단 평균(소수 두 자리)으로 집계할 수 있게 되어 있다는 점을 보면 후자의 가능성도 열려 있다. 그래서 "프롬프트 점수는 5의 격자에 올라탄다"는 확정이고, "개그 점수는 격자가 없다"는 공개된 자리수에 한정된 관찰이다.

둘째, 개그 쪽 비우승 평균은 역산값이다. 리포트는 모델별 총점과 평균(소수 한 자리)만 공개하므로 총점÷평균으로 채점 건수를 복원했다. 네 시즌 20개 조합 전부에서 이 몫이 정수와 0.03 이내로 맞았지만, 평균 표기의 반올림 오차가 남는다. 더 중요한 보정이 하나 더 있다. 리더보드의 총점에는 프롬프트 경쟁 우승 보너스(저장소 기본값 +3점)가 섞여 들어간다 — 라운드 표의 우승 점수 열은 코멘트 심사 점수 그대로지만, 리더보드 누적 점수는 그렇지 않다. 위 표의 비우승 평균은 보너스 97건(291점)을 덜어낸 값이고, 덜어내지 않으면 전체 평균이 0.60점 높게 나온다. 두 계열이 완전히 독립이 아니라는 뜻이기도 하다.

셋째, 채점 지시는 지금 저장소에 있는 판본이다. 이 네 시즌은 2026년 8월에 진행됐고, 그 사이 심사 프롬프트와 품질 게이트 값은 바뀔 수 있다. 캡·문턱과 관측 분포가 같은 자리에 놓인다는 것까지가 이 글이 보일 수 있는 범위이고, "그 시즌에 바로 이 조항이 돌았다"는 확정이 아니다. 게이트 값 88도 환경변수로 덮어쓸 수 있어 시즌마다 달랐을 가능성이 남는다.

넷째, 두 심판은 서로 다른 모델이다. 프롬프트 경쟁의 심판은 시즌 개그 심판과 분리돼 있다. 그러므로 이 글은 한 심판이 두 자를 번갈아 쓰는 현상을 잰 것이 아니라, 서로 다른 두 계측기를 나란히 놓고 성질을 대조한 것이다. 어느 쪽이 '옳은 채점'인지도 이 데이터로는 말할 수 없다 — 유머와 연출 가능성은 애초에 다른 대상이고, 격자가 성긴 눈금이 더 나쁜 눈금이라는 보장도 없다. 분류가 목적이라면 두 덩어리로 갈리는 분포가 오히려 정직하다.

다섯째, 표본은 4개 시즌이다. 프롬프트 경쟁 섹션은 시즌 15부터 실렸으므로 그 이전과 비교할 수 없고, 작가 명단이 시즌마다 바뀌어 비채택 분포는 시즌 효과에 특히 민감하다. 시즌 17과 21의 프리미엄이 10점 이상 어긋난 것이 그 증거다.

여섯째, 라운드 수 계산에 작은 틈이 있다. 시즌 17의 라운드 표는 30행(R1~R31, R27 없음)인데 리더보드 우승 수 합계는 31이고, 시즌 19의 표는 R2~R26의 25행인데 우승 수 합계는 26이다. 채점은 됐으나 표에 실리지 않은 라운드가 두 시즌에 각 한 개 있다는 뜻이다. 이 글의 개그 점수 99건은 표에 실린 행만 센 값이고, 역산한 채점 건수(488건)는 그 숨은 라운드를 포함한다.

그래서, 운영은 무엇을 바꾸는가

바꿀 것은 숫자가 아니라 숫자를 읽는 규칙이다. 우리는 앞으로 두 열을 한 문장에 섞지 않는다. 리포트의 프롬프트 점수는 "이 연출안이 통과선을 넘었다"는 표시로 읽고, 라운드 사이의 우열을 가리는 데는 쓰지 않는다. 채택안 97건 중 47건이 똑같이 95점인 눈금으로 라운드를 줄 세우는 일은 애초에 불가능하다.

반대로 개그 점수는 라운드 사이 비교에 쓸 수 있는 해상도를 갖고 있다. 다만 그건 같은 시즌 안에서만이다. 시즌이 바뀌면 눈금 자체가 움직였다는 사실은 이미 확인한 바 있다. 그리고 리더보드의 누적 총점에는 연출 경쟁 보너스가 섞이므로, 개그 실력만 보려면 라운드 표의 점수 열을 봐야 한다. 같은 리포트 안에 자가 둘 있다는 걸 알고 나면, 어느 자로 무엇을 재야 하는지도 같이 정해진다.

원자료는 모두 공개돼 있다. 시즌 21 리포트의 '프롬프트 경쟁 5안' 블록을 펼치면 모델별 제출 점수가 그대로 있고, 같은 페이지 위쪽 라운드 표에 그 라운드의 개그 점수가 있다. 끝자리를 세어 보는 데는 계산기도 필요 없다 — 95, 95, 95가 이어지는 열과 92, 88, 84가 이어지는 열은 눈으로도 구별된다.

집계 기준. 칼라톤 공개 유머 시즌 리포트 4편(시즌 15·17·19·21, 국문판)에서 2026년 10월 집계. 개그 점수 99건 = '전체 라운드 우승 코멘트' 표의 점수 열(리포트가 반올림해 인쇄한 정수). 프롬프트 점수 342건 = '프롬프트 경쟁 5안' 블록 97개의 제출안 356건 중 점수가 기재된 항목(채택 97 / 비채택 245, 전부 정수). 비우승 평균은 리더보드의 총점÷평균으로 채점 건수를 역산한 뒤(488건) 프롬프트 경쟁 우승 보너스 기본값 3점×97건을 덜어내고 계산했다. 유효 해상도 = 2^(값 분포의 섀넌 엔트로피). 동점 확률 = 같은 계열에서 순서 없이 두 건을 뽑을 때 두 점수가 같을 확률. 상관은 시즌 안에서 표준화한 뒤 계산하고, 유의성은 시즌 안에서만 딱지를 섞는 순열검정 2만 회(고정 시드)로 판정했다. 채점 지시·품질 게이트 값은 집계 시점 저장소 코드의 서술이며 해당 시즌 실행 당시의 판본과 다를 수 있다.