리그 전체로는 긴 개그가 이겼고, 시즌 안에서는 아니었다 — 유머 우승 코멘트 672건 길이·점수 대조

개그는 짧을수록 세다는 말이 있다. AI 유머 배틀 리그의 작성 지침에도 그 믿음이 적혀 있다 — "짧고 툭 치는 말맛·리듬, 설명하지 말고 던져라." 다섯 AI 모델이 같은 사진을 보고 한 줄씩 던지면 심판 모델이 점수를 매기는 이 리그에서, 그렇다면 실제로 짧은 코멘트가 높은 점수를 받았을까.

공개 시즌 리포트 11편에는 라운드마다 이긴 코멘트가 본문 그대로, 점수와 함께 실려 있다. 세어 보면 672행이다. 이 672줄의 글자 수와 점수를 맞춰 보는 것이 이번 집계다.

결론부터 적으면 이렇다. 답은 "아니다"인데, 그렇다고 반대도 아니다. 그리고 이 글에서 정작 볼 만한 것은 답 자체가 아니라, 어떻게 세느냐에 따라 답이 세 번 바뀐다는 사실이다.

방법 — 672행 중 664행

모집단은 공개 리포트 국문판 11편(시즌 1·2·3·5·7·9·11·13·15·17·19)의 '전체 라운드 우승 코멘트' 표 전부다. 각 행은 라운드 번호·주제·우승 코멘트 본문·모델·점수 다섯 칸으로 되어 있고, 이 중 코멘트 본문의 공백 포함 글자 수를 길이로 삼았다.

672행 중 8행은 뺐다. 시즌 1의 점수 0점 기록(Claude 7건·Gemini 1건)인데, 라운드 1위로 표에는 올라 있으면서 점수 칸만 0인 행이다. 채점 실패로 보이고 평균을 크게 흔들기 때문에, 이 글의 모든 수치는 유효 664행 기준이다. 664행의 길이는 평균 53.7자, 중앙값 53자, 범위는 9자에서 110자까지다.

길이가 시즌에 따라 크게 달라졌다는 사실은 이미 우승 코멘트의 문체 전환을 다룬 칼럼에서 확인한 바 있다. 이번 글의 질문은 거기서 한 걸음 더 들어간다 — 그 길이 차이가 점수 차이를 만들었는가.

결과 ① — 전부 한 통에 넣고 세면, 긴 쪽이 이긴다

664행을 시즌 구분 없이 한 통에 넣고 길이와 점수의 상관계수를 구하면 +0.260이다. 부호가 양수이고 크기도 무시할 수준은 아니다. 이 숫자만 보면 결론은 명확해 보인다. 짧을수록 유리하다는 통념과 정반대로, 긴 코멘트가 높은 점수를 받았다.

그런데 이 숫자를 시즌별로 풀어 놓으면 그림이 달라진다.

시즌우승 코멘트길이 평균길이 중앙값점수 평균시즌 내 상관20~68자 비율
시즌 182건57.3자56자91.70−0.13573.2%
시즌 2130건68.1자66자88.29−0.06255.4%
시즌 387건60.8자58자92.08−0.15563.2%
시즌 559건62.5자61자92.75+0.19069.5%
시즌 759건58.6자57자91.14+0.22072.9%
시즌 958건46.4자42자87.97+0.06582.8%
시즌 1159건45.0자40자86.19+0.33172.9%
시즌 1356건29.0자30자84.88−0.16087.5%
시즌 1519건37.3자36자86.26+0.016100.0%
시즌 1730건35.7자36자84.17+0.032100.0%
시즌 1925건35.6자35자88.48−0.150100.0%
전체664건53.7자53자89.12+0.26073.0%

맨 오른쪽에서 두 번째 열이 시즌 안에서만 계산한 상관계수다. 열한 개 값 중 여섯 개가 양수, 다섯 개가 음수이고, 절댓값이 0.2를 넘는 것은 세 개뿐이다. 전체 행의 +0.260을 닮은 시즌은 사실상 시즌 11(+0.331) 하나다.

표의 왼쪽 두 열을 세로로 읽으면 왜 이런 일이 벌어지는지 바로 보인다. 길이 평균은 시즌 2의 68.1자에서 시즌 19의 35.6자로 내려오고, 점수 평균도 시즌 5의 92.75에서 시즌 17의 84.17로 내려온다. 두 값이 같은 기간에 나란히 떨어졌다. 시즌 평균끼리(11개 점) 상관을 내면 +0.787이다. 전체 풀에서 잡힌 +0.260은 이 시즌 간 동반 하락을 각 라운드에 되비친 그림자에 가깝다.

결과 ② — 시즌을 통제하면 신호가 사라진다

같은 664행을 층위만 바꿔 다시 세어 봤다. 각 시즌(또는 시즌×모델) 안에서 길이와 점수를 각각 그 집단의 평균으로 중심화한 뒤 상관을 계산하는 방식이다.

집계 층위표본상관계수비고
전체 풀(층위 없음)664행+0.260
시즌 평균끼리11점+0.787시즌 간 동반 하락
모델 평균끼리5점+0.472모델 간 문체 차
시즌 내664행+0.047순열 p = 0.22
시즌 × 모델 내660행+0.041순열 p = 0.29
영문판 단어 수, 시즌 내664행−0.032교차 검증

시즌을 통제하는 순간 +0.260이 +0.047로 주저앉는다. 시즌과 모델을 함께 통제하면 +0.041이다. 무작위로 섞었을 때 이만한 값이 나올 확률은 각각 0.22와 0.29 — 즉 우연과 구별되지 않는다.

기울기로 옮기면 크기가 더 실감난다. 시즌×모델을 통제한 회귀 기울기는 10자당 +0.14점이다. 코멘트를 30자에서 70자로 늘려도 기대 점수는 0.6점 오른다는 뜻인데, 같은 시즌·같은 모델 안에서 점수의 표준편차가 2.65점이다. 점수 분산 중 시즌이 설명하는 몫은 29.7%, 모델이 2.5%인 반면, 길이가 설명하는 몫은 전체의 0.10%다.

순위로 바꿔 세도 마찬가지다. 시즌별 순위상관(스피어만)의 중앙값은 −0.021이다. 시즌 안에서 길이 기준으로 절반씩 갈라 위·아래 점수 평균을 비교하면 열한 시즌의 차이가 평균 +0.18점, 중앙값 −0.14점 — 부호조차 정해지지 않는다.

결과 ③ — 전반기와 후반기는 부호가 반대다

전체 풀의 +0.260이 얼마나 불안정한 숫자인지 보여 주는 가장 선명한 장면은 리그를 둘로 가를 때 나온다. 우리는 앞선 칼럼에서 시즌 7과 9 사이에 채점 눈금 자체가 바뀐 정황을 기록한 바 있다. 그 경계로 664행을 나누면 이렇게 된다.

구간표본길이 평균점수 평균구간 내 상관
시즌 1~7417행62.3자90.78−0.127
시즌 9~19247행39.0자86.30+0.150
합쳐서664행53.7자89.12+0.260

앞 구간은 음수, 뒤 구간은 양수, 합치면 둘 중 어느 쪽보다도 큰 양수다. 전체의 부호가 두 부분 어디에서도 재현되지 않는다. 통계 교과서가 심슨의 역설을 설명할 때 그리는 그림이 실제 데이터에서 나온 셈이다.

원리는 단순하다. 뒤 구간은 앞 구간보다 코멘트가 23자 짧고 점수가 4.5점 낮다. 두 덩어리를 한 좌표평면에 겹치면 '왼쪽 아래 뭉치'와 '오른쪽 위 뭉치'가 생기고, 그 사이를 가로지르는 직선이 생긴다. 그 직선의 기울기가 +0.260이다. 개별 코멘트의 길이가 점수를 끌어올려서 생긴 기울기가 아니라, 서로 다른 두 시대를 한 장에 겹쳐서 생긴 기울기다.

결과 ④ — 구간별로 봐도 단조롭지 않다

상관계수는 직선 관계만 잡아내니, 혹시 "적당한 길이가 가장 좋다" 같은 곡선이 숨어 있는지도 확인했다. 시즌마다 점수를 그 시즌의 평균과 표준편차로 표준화(z)한 뒤 길이 구간별로 모았다.

길이 구간건수시즌 내 표준화 점수원점수 평균
20자 미만16건−0.18285.19
20~29자57건−0.13486.23
30~39자119건+0.00487.14
40~49자99건+0.05289.11
50~59자118건+0.07190.86
60~68자92건−0.00390.09
69자 이상163건−0.02090.14

세 번째 열이 시즌 효과를 걷어낸 값이다. 가장 높은 구간(50~59자, +0.071)과 가장 낮은 구간(20자 미만, −0.182) 사이의 폭이 0.25 표준편차, 점수로 환산하면 1점 남짓이다. 네 번째 열의 원점수를 보면 30자대에서 50자대로 갈수록 3.7점이 오르는 것처럼 보이지만, 그 상승분은 30자대가 후반기 시즌에 몰려 있고 50자대가 전반기에 몰려 있어서 생기는 것이다. 시즌을 걷어내면 0.067 표준편차만 남는다.

극단도 확인했다. 시즌 안에서 점수 상위 10%에 든 행들의 길이 백분위 중앙값은 42%다. 기대값 50%보다 오히려 짧은 쪽이고, 하위 10%(48%)와 6%p 차이다. 시즌별 길이 사분위로 점수 평균을 내면 어느 시즌에서도 단조 증가·단조 감소가 나오지 않는다.

마지막으로 짝짓기 검정을 했다. 같은 시즌·같은 모델 안에서 길이가 20자 이상 벌어지는 코멘트 쌍 2,171개를 모아 어느 쪽이 이겼는지 셌다. 긴 쪽 승 1,048회(48.3%), 짧은 쪽 승 859회(39.6%), 동점 264회(12.2%). 평균 길이 차이 29.7자에 대해 점수 차이는 +0.59점이었다(순열 p = 0.087). 방향은 미세하게 긴 쪽으로 기울지만, 관습적 유의 기준을 넘지 못하고 크기도 셀 내부 표준편차의 4분의 1에 못 미친다.

결과 ⑤ — 모델 축에서도 같은 착시가 반복된다

같은 함정이 모델을 놓고도 벌어진다. 모델 다섯의 평균만 찍어 상관을 내면 +0.472로, 긴 문장을 쓰는 모델이 잘하는 것처럼 보인다. 그런데 실제 배치는 이렇다.

모델우승 횟수길이 평균원점수 평균시즌 내 표준화 점수
GPT220건53.7자89.66+0.188
Gemini185건49.8자89.65+0.048
Claude158건66.8자88.76−0.160
Grok61건31.7자87.39−0.183
DeepSeek40건52.9자87.65−0.346

가장 길게 쓰는 Claude(66.8자)는 표준화 점수에서 아래에서 세 번째이고, 가장 짧게 쓰는 Grok(31.7자)도 아래쪽이다. 위쪽 두 자리는 길이가 중간인 GPT(53.7자)와 Gemini(49.8자)가 차지한다. 길이 순서와 점수 순서가 일치하지 않는다. 다섯 점만 찍었을 때 보이던 +0.472는 Claude가 전반기 시즌에, Grok이 후반기 시즌에 몰려 우승한 분포가 만들어 낸 것이다.

왜 이렇게 되는가 — 길이는 채점 축이 아니라 제작 규격이다

결과가 이렇게 나오는 이유는 리그 코드에 그대로 적혀 있다. 심판이 받는 채점 지시(HumorJudge.js의 루브릭)는 세 축으로 되어 있다 — 실제로 웃겼는가(humor), 얼마나 구체적이고 새로운가(creativity), 그리고 사진과 관련은 있는가(relevance, 점수를 주는 축이 아니라 통과 여부만 보는 바닥). 여기에 "사진을 그냥 설명하면 20점 이하", "인사·무난한 긍정이면 15점 이하", "의미가 뒤집히지 않는 말장난이면 40점 이하" 같은 하드 캡이 붙고, 번역투와 존댓말 설명체에 감점이 걸린다. 이 루브릭 어디에도 길이 조항이 없다. 심판은 글자 수를 세라는 말을 들은 적이 없다.

반면 코멘트를 쓰는 쪽(HumorAI.js)에는 길이 조항이 있다. 그것도 아주 구체적이다.

comment_ko는 공백 포함 20~68자 — 68자 초과는 쇼츠 자막 폰트가 강등되고 낭독이 늘어지며, 20자 미만의 파편 한마디는 셋업 없이 끝나 낭독이 빈다(TTS 2초 미만 → 무음 패딩). 셋업-펀치 두 박자를 한 문장(최대 두 절)에 눌러 담아라.

붙어 있는 근거가 전부 제작 사정이라는 점이 핵심이다. 자막 폰트 크기와 낭독 길이, TTS 무음 패딩 — 재미와는 무관한, 쇼츠 영상으로 뽑을 때의 규격이다. 요약하면 이 리그에서 길이는 점수를 다투는 축이 아니라 지켜야 할 상자다. 상자 안에 들어와 있는 한, 몇 자인지는 심판에게 아무 정보도 아니다. 우리 집계가 상자 안에서 아무 기울기도 찾지 못한 것은 그래서 자연스럽다.

표 1의 맨 오른쪽 열이 그 상자가 조여진 과정을 보여 준다. 20~68자 안에 들어온 우승 코멘트의 비율은 시즌 2의 55.4%에서 시즌 15·17·19의 100%로 올라간다. 68자를 넘긴 163건은 전부 시즌 11까지의 구간에서 나왔고(최장 110자, 시즌 2 34라운드 Claude, 83점), 20자 미만 16건은 시즌 1·9·11·13에 흩어져 있다(최단 9자, 시즌 1 7라운드 Gemini의 "네, 다음 집사.", 90점). 최근 세 시즌은 위반이 한 건도 없다.

다만 이 대응을 인과로 못 박을 수는 없다. 저장소에 남은 것은 현재 시점의 코드이고, 이 조항이 언제 들어왔는지는 확인할 수 없기 때문이다(클라우드 세션의 저장소 사본이 최근 52커밋뿐이라 도입 시점을 이력으로 추적할 방법이 없다). 상자가 조여진 시점과 조항이 생긴 시점이 같다는 것은 정황이지 증명이 아니다.

교차 검증 — 영문판에서도 같은 결과

같은 리포트의 영문판 11편으로 한 번 더 확인했다. 영문 라운드 표 672행의 라운드 번호·모델·점수는 국문판과 불일치 0건으로 일치한다. 영문 코멘트는 국문의 번역이 아니라 같은 모델이 같은 사진에 대해 따로 친 별개의 개그이므로(한·영 개그 617쌍 대조 참조), 길이 지표로는 독립적인 재측정에 가깝다.

영문 단어 수는 평균 20.0단어, 중앙값 19단어다. 점수와의 상관은 전체 풀에서 +0.072, 시즌을 통제하면 −0.032, 시즌과 모델을 함께 통제하면 −0.051이다. 국문에서 얻은 결론(통제하면 0)이 그대로 재현되고, 전체 풀 값이 국문(+0.260)보다 훨씬 작다는 점도 앞의 해석과 맞는다 — 영문 쪽에는 20~68자 같은 길이 규격이 걸려 있지 않아 시즌 간 길이 하락 폭이 작기 때문이다(21.3단어 → 15.3단어).

덤으로 하나 더 나왔다. 국문 글자 수와 영문 단어 수의 시즌 내 상관이 +0.707이다. 두 문장이 서로 번역이 아니라 다른 각도의 개그인데도, 같은 라운드에서 길이는 함께 움직인다. 사진이 던지는 상황의 복잡도가 두 언어 모두의 분량을 정하고 있다는 뜻으로 읽힌다.

한계 — 이 분석이 말할 수 없는 것

첫째, 표본이 우승작뿐이다. 공개 리포트의 라운드 표에는 그 라운드에서 이긴 한 줄만 실린다. 같은 라운드에서 진 네댓 줄의 길이는 알 수 없다. 그래서 이 글이 답한 것은 "이긴 코멘트들 사이에서 길이가 점수 차를 만들었는가"이지, "길이가 승패를 갈랐는가"가 아니다. 후자를 보려면 탈락 후보의 길이가 필요하고, 그 데이터는 공개 리포트에 없다.

둘째, 우승작은 이미 걸러진 표본이다. 라운드 1위만 모은 집합에서는 점수 범위가 좁아지고(664행 중 57.1%가 90점 이상, 서로 다른 점수 값은 30종뿐이다) 상관계수가 구조적으로 작아진다. 관측된 시즌 내 +0.047은 이 절단 효과 때문에 실제보다 작게 나왔을 수 있다. 다만 절단은 크기를 줄일 뿐 부호를 뒤집지 않으므로, "부호가 구간마다 반대"라는 결과 ③은 이 한계의 영향을 받지 않는다.

셋째, 시즌 간 점수 비교는 원칙적으로 불가능하다. 시즌 7과 9 사이에 채점 눈금이 바뀐 정황이 있어, 같은 90점도 시즌마다 다른 화폐다. 이 글이 시즌·모델 통제를 계속 고집하고 원점수보다 표준화 점수를 앞세운 이유이며, 동시에 표 1의 '점수 평균' 열을 시즌 간 실력 비교로 읽으면 안 되는 이유다.

넷째, 글자 수는 밀도를 재지 못한다. 같은 40자라도 한 문장으로 밀어붙인 것과 두 절로 나눈 것은 다르고, 쉼표·말줄임의 리듬도 다르다. 작성 지침이 요구하는 "셋업-펀치 두 박자"는 글자 수가 아니라 구조의 문제인데, 이 집계는 구조를 보지 않았다. 길이가 무의미하다는 결론이 곧 형식이 무의미하다는 뜻은 아니다.

다섯째, 시즌 15·17·19는 표본이 작다. 각각 19·30·25행뿐이라 그 시즌의 상관계수(+0.016, +0.032, −0.150)는 개별적으로는 거의 정보가 없다. 이 세 시즌은 '100% 규격 준수'라는 사실을 보여 주는 데만 썼고, 상관의 결론은 표본이 큰 앞쪽 시즌들이 지탱한다.

그래서, 짧을수록 웃긴가

우리 데이터가 허락하는 답은 이렇다. 짧아서 이긴 것도, 길어서 이긴 것도 아니다. 같은 시즌·같은 모델이라는 조건을 맞춰 놓고 보면 30자짜리 우승작과 70자짜리 우승작의 기대 점수 차이는 0.6점이고, 그 정도는 같은 조건 안에서 우승 점수가 흩어지는 폭(표준편차 2.65점)의 4분의 1도 되지 않는다.

그러나 "길이는 상관없다"가 이 글의 교훈은 아니다. 진짜 교훈은 +0.260이라는 숫자가 존재하고, 그것이 완전히 정직한 계산의 결과라는 사실이다. 아무도 수를 조작하지 않았고 표본을 고르지도 않았다. 664행 전부를 넣고 표준적인 방법으로 계산했을 뿐인데, 답은 "긴 쪽이 유리"로 나왔다가, 시즌 하나를 통제하자 사라졌고, 리그를 반으로 자르자 부호가 갈렸다.

그래서 우리 리포트는 점수 옆에 언제나 시즌·라운드·모델을 함께 적는다. 숫자 하나만 떼어 놓으면 그 숫자가 어느 상자에서 나왔는지 알 수 없고, 상자를 모르면 방향조차 믿을 수 없기 때문이다. 이번 집계에 쓴 원자료는 전부 공개 시즌 리포트에 그대로 있다. 세는 방법을 바꿔 다른 답이 나오는지 직접 확인해 보셔도 좋다 — 그것이 이 글의 요지이기도 하다.

집계 기준. 칼라톤 공개 시즌 리포트 유머 리그 국문판 11편(시즌 1·2·3·5·7·9·11·13·15·17·19)의 '전체 라운드 우승 코멘트' 표 672행을 전수 파싱했다. 시즌 1의 점수 0점 8건(Claude 7건·Gemini 1건)을 제외한 664행이 모집단이다. 길이는 코멘트 본문의 공백 포함 글자 수, 영문은 공백 기준 단어 수다. '시즌 내'·'시즌 × 모델 내' 상관은 각 집단의 평균으로 중심화한 잔차로 계산했고, 표준화 점수는 시즌별 평균·표준편차로 z 변환한 값이다. 순열 p값은 집단 안에서 점수를 2만 회(짝짓기 검정은 5천 회) 무작위로 섞어 얻은 양측 확률이다. 영문판 11편으로 672행의 라운드·모델·점수를 교차 검증해 불일치 0건을 확인했다. 인용한 채점 루브릭과 작성 지침은 저장소 코드의 현재 상태이며, 각 조항의 도입 시점과 시즌의 대응은 확인되지 않았다.