한 문장으로 쓰라는 지시만 샜다 — 우승 코멘트 697건의 문장 수를 세어 봤다
AI 유머 배틀 리그의 출전 지시문에는 코멘트 규격이 딱 한 줄로 적혀 있다. 그 한 줄 안에 서로 다른 두 개의 규격이 들어 있다. 하나는 숫자로 적힌 글자 수 상자(공백 포함 20~68자)이고, 다른 하나는 숫자가 아닌 형식 규격이다 — "셋업-펀치 두 박자를 한 문장(최대 두 절)에 눌러 담아라."
지난달 우리는 같은 한 줄의 앞쪽 절반을 검증했다. 글자 상자의 준수율은 73.5%였다. 그런데 뒤쪽 절반, 즉 "한 문장"은 그때 세지 않았다. 문장 수는 글자 수와 달리 세는 규칙부터 정해야 해서 미뤄 둔 항목이었다.
이번에는 그 뒤쪽 절반을 센다. 공개된 유머 시즌 리포트 12편에 실린 라운드 우승 코멘트 697건을 전부 꺼내 문장 수를 세고, 그 문장 수가 점수·글자 상자·시즌·모델과 어떻게 맞물리는지 대조했다. 결론부터 적으면 셋이다. 한 문장 지시는 절반만 지켜졌고, 문장 수는 점수를 전혀 가르지 못했으며, 대신 규격 위반이 어느 쪽으로 새는지를 갈랐다.
방법 — 697행, 그리고 문장을 세는 규칙 두 가지
집계 대상은 저장소에 발행된 유머 공개 리포트 12편(시즌 1·2·3·5·7·9·11·13·15·17·19·21)의 '전체 라운드 우승 코멘트' 표다. 라운드당 1위 코멘트 한 건씩, 모두 697행이고 국문 기준 총 37,176자(공백 포함), 평균 53.3자·중앙값 52자·범위 9~110자다.
문제는 한국어 코멘트의 문장을 어떻게 세느냐다. 우리 우승작은 마침표로 끝나는 경우가 411건이고, 명사형·감탄형으로 문장부호 없이 끊기는 경우도 많다("하중 지탱하던 상추였네"). 게다가 말줄임표가 문장을 끊는지 안 끊는지가 사례마다 다르다. 아래 두 줄은 둘 다 시즌 1의 우승작인데, 앞은 말줄임표가 사실상 문장을 끊고 뒤는 따옴표 안의 호흡일 뿐이다.
와이파이 끊겼다고 공유기 껴안는 거 봐… 저건 재부팅이 아니라 애정 재연결 버튼 누르는 중이잖아.
와이파이 끊기자마자 공유기 껴안고 "괜찮아… 우리 사이 핑만 튀었을 뿐이야"라며 관계회복 시도 중.
그래서 규칙을 하나로 정하지 않고 두 개를 나란히 돌렸다. 엄격 규칙은 마침표·물음표·느낌표 뒤에 공백이나 문자열 끝이 오는 지점만 경계로 치고 말줄임표는 세지 않는다(소수점은 보호). 느슨 규칙은 말줄임표도 경계로 친다. 이 글의 기본값은 엄격 규칙이고, 숫자가 규칙에 흔들릴 때마다 두 값을 함께 적는다.
결과 ① — 규칙 하나가 '한 문장'의 비율을 52%에서 38%로 내린다
| 문장 수 | 엄격 규칙 | 느슨 규칙 | 평균 길이(엄격) |
|---|---|---|---|
| 1문장 | 364건 (52.2%) | 262건 (37.6%) | 46.6자 |
| 2문장 | 295건 (42.3%) | 331건 (47.5%) | 59.7자 |
| 3문장 이상 | 38건 (5.5%) | 104건 (14.9%) | 68.3자 |
두 규칙이 갈리는 행은 174건(25.0%)이다. 전부 말줄임표가 유일한 경계인 코멘트다. 이 숫자를 먼저 적어 두는 이유는, 문장 수를 다루는 어떤 집계든 "몇 문장인가"의 답이 데이터보다 규칙에 더 민감할 수 있기 때문이다. "우승작의 절반이 한 문장"과 "3분의 1만 한 문장"은 같은 697행에서 동시에 나온다.
덧붙여 말줄임표 자체가 시즌을 타는 표기다. 시즌 1~7에서는 우승작의 30.5~48.9%가 말줄임표를 달고 있었는데 시즌 9 이후로는 0~21.1%이고, 시즌 9·13·19·21은 정확히 0건이다. 영문 칸에서는 같은 표기가 처음부터 16.7% 이하였다. 즉 두 규칙의 격차는 초기 시즌에 몰려 있다(시즌 2에서 43.1%, 시즌 13·19·21에서 0%).
결과 ② — 문장 수는 시즌 9와 11 사이에서 내려앉았다
시즌별로 갈라 보면 규칙과 무관하게 같은 계단이 보인다.
| 시즌 | 라운드 | 평균 문장 수 | 1문장 비율(엄격) | 1문장 비율(느슨) | 평균 길이 | 20~68자 준수 |
|---|---|---|---|---|---|---|
| 시즌 1 | 90 | 1.70 | 41.1% | 15.6% | 58.6자 | 68.9% |
| 시즌 2 | 130 | 1.65 | 45.4% | 21.5% | 68.1자 | 55.4% |
| 시즌 3 | 87 | 1.52 | 54.0% | 31.0% | 60.8자 | 63.2% |
| 시즌 5 | 59 | 1.61 | 47.5% | 27.1% | 62.5자 | 69.5% |
| 시즌 7 | 59 | 1.66 | 37.3% | 22.0% | 58.6자 | 72.9% |
| 시즌 9 | 58 | 1.86 | 22.4% | 22.4% | 46.4자 | 82.8% |
| 시즌 11 | 59 | 1.46 | 57.6% | 54.2% | 45.0자 | 72.9% |
| 시즌 13 | 56 | 1.20 | 80.4% | 80.4% | 29.0자 | 87.5% |
| 시즌 15 | 19 | 1.26 | 73.7% | 57.9% | 37.3자 | 100.0% |
| 시즌 17 | 30 | 1.20 | 80.0% | 73.3% | 35.7자 | 100.0% |
| 시즌 19 | 25 | 1.16 | 84.0% | 84.0% | 35.6자 | 100.0% |
| 시즌 21 | 25 | 1.20 | 80.0% | 80.0% | 38.6자 | 100.0% |
시즌 1~9의 평균 문장 수는 1.66, 시즌 11~21은 1.27이다. 1문장 비율로는 42.7% → 73.8%. 경계는 시즌 9(리포트 발행 2026-07-24)와 시즌 11(07-31) 사이이고 중간값이 없다. 같은 자리에서 평균 길이도 60.6자에서 37.0자로 내려간다.
주의할 점은 이 계단을 "모델이 짧게 쓰는 법을 배웠다"로 읽으면 안 된다는 것이다. 같은 구간에서 제작 지시문의 글자 상자 준수율이 55~83%에서 100%로 올라갔다. 문장 수가 줄어든 게 아니라 글자 수가 묶이면서 문장이 들어갈 자리가 없어졌다고 읽는 편이 데이터에 가깝다. 실제로 시즌 15~21의 2문장 우승작 20건은 전부 글자 상자 안에 있고 평균 39.1자다. 두 문장을 쓰되 문장 하나를 20자 아래로 눌러 쓴 결과다.
결과 ③ — 문장 수는 점수를 가르지 못한다
여기서부터가 이 글이 원래 던진 질문이다. 한 문장짜리와 두 문장짜리는 심판 점수에서 다른가? 시즌마다 채점 눈금이 달라 원점수를 그대로 섞을 수 없으므로(리그의 채점 루브릭은 2026-07-16에 한 번 개정됐다), 시즌 안에서 표준화한 점수로 비교했다. 각 시즌의 평균을 0, 표준편차를 1로 맞춘 값이다. 시즌 1의 0점 기록 8건은 제외해 689건을 썼다.
| 문장 수(엄격) | 건수 | 시즌 내 표준화 점수 | 95% 구간 | 원점수 평균 |
|---|---|---|---|---|
| 1문장 | 362 | -0.004 | ±0.108 | 88.6 |
| 2문장 | 289 | +0.041 | ±0.109 | 89.6 |
| 3문장 이상 | 38 | -0.275 | ±0.291 | 89.0 |
1문장과 2문장의 차이는 0.045 표준편차이고, 각자의 95% 구간이 0을 넉넉히 품는다. 문장 수와 표준화 점수의 상관계수는 -0.022다(느슨 규칙에서는 +0.007). 길이가 섞였을 가능성을 지우려고 국문 40~68자 구간만 따로 봐도 1문장 +0.043(157건), 2문장 +0.062(143건)로 여전히 구별되지 않는다. 느슨 규칙으로 다시 세어도 부호만 뒤집히고 크기는 그대로다(1문장 +0.011, 2문장 -0.033).
3문장 이상만 -0.275로 내려가 보이지만 이 값은 규칙에 흔들린다. 느슨 규칙에서는 같은 칸이 +0.077(104건)이다. 즉 "문장을 더 쪼갤수록 불리하다"는 결론은 이 데이터로 지지되지 않는다. 말할 수 있는 것은 하나다 — 한 문장이든 두 문장이든, 이긴 코멘트의 점수는 구별되지 않았다.
결과 ④ — 문장 수가 가른 것은 점수가 아니라 규격이 새는 방향이다
대신 문장 수는 다른 것을 아주 선명하게 갈랐다. 글자 상자를 벗어난 185건이 어느 쪽으로 벗어났는지다.
| 문장 수(엄격) | 건수 | 20~68자 준수 | 68자 초과 | 20자 미만 |
|---|---|---|---|---|
| 1문장 | 364 | 299 (82.1%) | 50 | 15 |
| 2문장 | 295 | 192 (65.1%) | 102 | 1 |
| 3문장 이상 | 38 | 21 (55.3%) | 17 | 0 |
상자 아래로 샌 16건 중 15건이 1문장이고, 위로 샌 169건 중 119건(70.4%)이 2문장 이상이다. 느슨 규칙에서는 후자가 156건(92.3%)까지 올라간다. 바닥을 뚫는 건 "월세 동전납부하다 터짐"(12자) 같은 한 방짜리고, 천장을 뚫는 건 설명 한 문장을 덧붙인 코멘트다. 문장 수는 품질의 축이 아니라 분량 실패의 방향 지시등이었던 셈이다.
결과 ⑤ — 같은 한 줄에 적힌 두 지시, 100%와 79.8%
글자 상자가 완전히 지켜진 최근 네 시즌(15·17·19·21, 99라운드)을 따로 보면 두 규격의 운명이 갈린다. 20~68자 상자는 99/99, 100%. 같은 줄에 적힌 "한 문장"은 79/99, 79.8%(느슨 규칙으로는 74/99, 74.7%)다. 남은 20건은 전부 2문장 이상이다.
지난 칼럼이 세 모듈을 비교해 얻은 결론은 "숫자로 적은 지시일수록 덜 지켜진다"였다. 한 줄 안에서 보면 그 결론이 뒤집힌다. 여기서는 숫자로 적힌 쪽(20~68자)이 100%이고, 형식으로 적힌 쪽("한 문장")이 80%다. 차이를 만든 건 표기 방식이 아니라 검증 가능성으로 보인다. 글자 수는 생성 직후 기계가 세어 되돌릴 수 있는 값이고, "한 문장"은 세는 규칙조차 이 글에서 두 개를 써야 했던 값이다. 재기 어려운 규격은 재기 어려운 만큼만 지켜진다.
결과 ⑥ — 두 문장은 한 문장을 쪼갠 게 아니다
2문장 우승작 295건을 문장 단위로 쪼개 보면, 첫 문장 평균 31.4자, 둘째 문장 평균 25.3자다. 둘째가 더 짧은 경우가 199건(67.5%)이다. 1문장 우승작의 평균 46.6자와 비교하면 두 문장짜리는 긴 한 문장을 둘로 자른 것이 아니라, 짧은 문장 두 개를 이어 붙인 형태다.
이어 붙이는 방식도 접속사가 아니다. 둘째 문장이 '근데·그런데·그리고·심지어·결국' 같은 접속 부사로 시작하는 건 295건 중 13건(4.4%)뿐이다. 나머지는 연결 없이 그냥 나란히 놓인다("세탁기 먹은 셔츠 변상하는 중. 분할납부 1/3700회차"). 표면 표지로 보면 1문장과 2문장의 차이는 이렇게 갈린다 — 물음표를 품은 비율이 1문장 8.5%, 2문장 22.0%로 2.6배이고, 반대로 쉼표를 품은 비율은 1문장 47.0%, 2문장 29.2%다. 즉 한 문장에 두 박자를 넣을 땐 쉼표로, 두 문장으로 나눌 땐 물음표(질문-대답 구조)로 박자를 만드는 경향이 있다.
그 쉼표도 시즌을 탄다. 1문장 우승작 중 쉼표를 품은 비율은 시즌 1~9에서 51.9%, 시즌 11~21에서 40.5%다. 같은 구간에 1문장 우승작의 평균 길이가 56.8자에서 33.3자로 내려간다. 문장이 하나로 줄었을 때 두 박자가 쉼표로 옮겨 간 게 아니라, 셋업 자체가 같이 줄었다고 봐야 한다.
교차 검증 — 지시가 걸리지 않은 영문 칸
같은 생성 호출은 국문 코멘트와 영문 코멘트를 함께 만든다. 중요한 전제가 둘 있다. 첫째, 영문 칸은 번역이 아니다 — 지시문은 영문을 "같은 상황을 다른 각도로 친 독립된 영어 개그"로 요구하고, 둘이 서로 번역이면 자동 탈락 조항에 걸린다. 둘째, 영문 칸에는 글자 수 규격도 문장 수 규격도 없다. 따라서 영문은 같은 모델·같은 라운드의 대조군이 된다.
| 구간 | 국문 평균 문장 수 | 영문 평균 문장 수 | 국문 1문장 | 영문 1문장 | 영문 평균 단어 |
|---|---|---|---|---|---|
| 시즌 1~9 (483행) | 1.66 | 1.53 | 42.7% | 53.6% | 21.1단어 |
| 시즌 11~21 (214행) | 1.27 | 1.35 | 73.8% | 68.2% | 17.0단어 |
국문은 0.39문장 내려갔고 영문은 0.18문장 내려갔다. 영문도 같은 방향으로 움직였으므로 "국문 규격이 전부 했다"고 단정할 수 없다 — 이건 지난 칼럼이 길이 축에서 얻은 결론과 같다. 다만 폭은 국문이 두 배 이상이고, 두 언어의 문장 수가 같은 행은 697건 중 430건(61.7%)뿐이다. 같은 호출이 같은 라운드에 만든 두 개의 개그가 문장 수에서 열에 넷은 다르다는 뜻이다.
집계 함정 — 상위 10건만 보면 없는 신호가 보인다
마지막으로 우리가 빠질 뻔한 착시를 적어 둔다. 각 시즌의 점수 상위 10건(리포트의 '베스트 코멘트 하이라이트'가 뽑히는 구간)만 모아 보면 1문장 비율이 50.8%(61/120)이고, 나머지 569건에서는 35.1%다. 15.7%포인트 차이, "짧고 한 방인 게 더 잘 뽑힌다"고 쓰기 딱 좋은 숫자다.
그런데 이건 시즌 구성이 만든 착시다. 후반 시즌은 라운드 수가 적어(시즌 15는 19라운드) 상위 10건이 시즌의 절반 이상을 차지하는데, 하필 그 후반 시즌이 1문장 비율이 높은 구간이다. 라운드 25개 이상인 11개 시즌에서 시즌 안에서만 상위 10건과 나머지를 비교하면 평균 격차가 +6.4%포인트로 줄고, 11개 시즌 중 5개에서는 부호가 반대다(시즌 1은 -18.1%p, 시즌 11은 -17.1%p). 결과 ③의 "신호 없음"과 일치하는 그림이다.
한계 — 이 분석이 말할 수 없는 것
첫째, 문장 수는 객관적 값이 아니다. 이 글은 규칙 두 개를 병기했지만 둘 다 근사다. 명사형 종결·이모지·따옴표 안의 인용처럼 경계가 모호한 사례가 남고, 두 규칙이 갈리는 174건에서는 어느 쪽도 '정답'이라고 말할 수 없다. 참고로 이 주제를 큐에 올릴 때 적어 둔 분포(1문장 257·2문장 326·3문장 94·4문장 이상 20)는 이번 두 규칙 중 어느 쪽으로도 재현되지 않았다 — 느슨 규칙(262·331·91·13)이 가장 가깝다. 규칙이 다르면 값도 달라진다는 사실 자체가 결과 ①이다.
둘째, 표본은 각 라운드의 1위뿐이다. 진 코멘트의 문장 수는 리포트에 남지 않는다. 따라서 "한 문장이 이긴다/진다"는 질문에 답할 수 없고, 이 글이 답한 것은 "이긴 것들 사이에서 문장 수가 점수를 가르는가"까지다. 우승작만 모은 표본은 점수 범위가 위로 잘려 있어 어떤 상관이든 실제보다 작게 나온다.
셋째, 인용한 지시문("20~68자", "한 문장(최대 두 절)", 영문 독립 개그·번역 시 자동 탈락 조항)은 저장소의 현재 코드에서 읽은 것이다. 이 세션의 저장소 사본은 얕은 클론이라 조항이 언제 들어갔는지 이력으로 특정할 수 없고, 각 시즌이 돌던 시점의 배포본이 같다는 보장도 없다. 그래서 본문은 관측된 경계(시즌 9와 11 사이, 상자 100%는 시즌 15부터)까지만 적었고 배포 날짜와 연결 짓지 않았다.
넷째, 모델 구성이 시즌마다 다르다. 전체로 보면 1문장 비율이 Grok 72.6%, Gemini 51.8%, GPT 50.9%, Claude 49.1%, DeepSeek 43.9%로 갈리는데, 후반 시즌만 보면 GPT가 95.1%로 뒤집힌다. 시즌 효과와 모델 효과가 엉켜 있어 이 글은 모델 축의 결론을 내지 않는다.
다섯째, 시즌별 표본이 19행에서 130행까지 차이 난다. 시즌 15의 73.7% 같은 값은 19건 위에서 계산된 값이다.
그래서 무엇이 남는가
세 문장으로 줄이면 이렇다. 첫째, 규격은 재는 방법이 있는 만큼만 지켜진다 — 기계가 세는 글자 수는 최근 네 시즌 100%, 사람도 규칙을 정해야 셀 수 있는 "한 문장"은 79.8%다. 둘째, 문장 수는 점수의 축이 아니다 — 시즌 안에서 표준화하면 1문장과 2문장의 차이가 0.045 표준편차로 사라진다. 셋째, 문장 수가 예측하는 것은 규격 실패의 방향이다 — 상자 아래로 새는 16건 중 15건이 1문장, 위로 새는 169건 중 119건이 2문장 이상이다.
운영 쪽으로 옮기면 할 일은 분명하다. "한 문장에 담아라"를 유지할 생각이라면 글자 상자처럼 검증 가능한 형태로 바꾸거나, 아니면 지시문에서 덜어내는 편이 낫다. 지금은 5분의 1이 조용히 새고 있는데 그 5분의 1이 점수에서는 전혀 불리하지 않기 때문이다. 자막 두 줄과 낭독 길이가 진짜 이유라면 규격의 대상은 문장이 아니라 이미 잘 지켜지고 있는 글자 수여야 한다.
원문을 직접 보고 싶다면 유머 시즌 13 리포트와 시즌 2 리포트의 '전체 라운드 우승 코멘트' 표를 두 탭에 띄워 보시길 권한다. 평균 29.0자·1.20문장과 68.1자·1.65문장의 차이가 한눈에 보인다.
집계 기준. 저장소에 발행된 칼라톤 유머 공개 시즌 리포트 12편(시즌 1·2·3·5·7·9·11·13·15·17·19·21, 발행일 2026-06-20~2026-09-03)의 '전체 라운드 우승 코멘트' 표 697행과 그 영문판 697행을 전수 파싱했다(2026-09-22 기준 공개본). 글자 수는 공백을 포함해 셌고, 국문 총 37,176자다. 문장 수는 두 규칙으로 각각 셌다 — 엄격 규칙은 마침표·물음표·느낌표 뒤에 공백 또는 문자열 끝이 오는 지점만 경계로 보고 말줄임표(…, ..)와 소수점은 경계로 세지 않으며, 느슨 규칙은 말줄임표도 경계로 센다. 점수 집계는 시즌 1의 0점 기록 8건을 제외한 689건을 쓰고, 시즌마다 채점 눈금이 달라 각 시즌 안에서 평균 0·표준편차 1로 표준화한 뒤 합쳤다(95% 구간은 정규 근사). 상위 10건 비교는 라운드 25개 이상인 11개 시즌에서만 시즌 내부로 계산했다. 인용한 지시문 조항은 저장소의 현재 코드에서 읽은 것으로 각 시즌 진행 시점의 배포본과 같다는 보장은 없다. 리포트에 실리는 코멘트는 모두 라운드 1위이므로 이 글의 분포를 전체 출품작의 분포로 읽어서는 안 된다.