계단은 하나뿐이고 추세는 없었다 — 인물 심사평 326건을 라운드 축으로 다시 세다

칼라톤 AI 인물 생성 시즌은 한 인물을 두고 15라운드를 돈다. 라운드마다 이미지를 만들고, 심판 모델이 0~100점의 일치율을 매기고, 한국어로 짧은 총평을 남긴다. 그 총평 중 몇 개가 공개 시즌 리포트의 '하이라이트' 칸에 그대로 실린다.

리포트를 여러 편 읽다 보면 인상이 하나 생긴다. 뒤쪽 라운드의 심사평이 더 길어 보인다는 것이다. 1라운드 심사평은 "맑고 정돈된 이목구비와 깨끗한 피부결이 주제를 훌륭하게 구현하고 있습니다" 정도로 끝나는데, 11라운드쯤 가면 두 후보를 차례로 짚고 어느 쪽이 왜 나은지까지 적는다. 라운드가 깊어질수록 심판이 할 말이 많아지는 걸까, 아니면 다른 이유가 있는 걸까.

이 인상은 셀 수 있다. 공개 리포트 142편에 실린 심사평 326건, 37,436자를 전부 꺼내 라운드 번호를 축으로 세웠다. 질문, 방법, 결과, 한계의 순서로 적는다.

질문 — 길이는 라운드 위치의 함수인가

검증 가능한 형태로 다듬으면 이렇다. "시즌 안에서 라운드 번호가 커질수록 심사평이 길어지는가?" 그리고 만약 길어진다면, "그 증가는 완만한 추세인가, 한 지점에서 일어나는 계단인가?"

이 구분이 실무적으로 중요하다. 완만한 추세라면 원인은 누적되는 무언가다 — 라운드가 쌓이면서 비교할 과거가 늘어나거나, 지적할 결함이 누적되거나. 반면 계단이라면 원인은 그 지점에서 바뀌는 무언가다. 그러면 '라운드'는 원인이 아니고, 그 자리에서 함께 바뀐 다른 것이 원인이다.

방법 — 142편에서 326건, 그리고 발행작 둘로 눈금 맞추기

집계 대상은 공개된 국문 인물 시즌 리포트 전편(142편, 2026-06-30~09-28 종료분)이다. 외부 API 없이 리포트 HTML만 파싱했다. 하이라이트 칸의 각 블록에서 라운드 번호·프롬프트 종류(생성/수정)·일치율·심사평 본문을 꺼냈고, 같은 리포트의 '라운드별 일치율 추이' 표에서 전 라운드의 채택 여부와 점수를 따로 꺼내 대조했다.

하이라이트의 선정 규칙은 취향이 아니라 코드다. 리포트 생성기(html2pdf/src/character-data-fetcher.js)는 채택된 라운드만 모아 일치율 내림차순으로 세운 뒤 위에서 세 개를 자른다. 142편 전부에서 이 규칙이 어긋나지 않았다 — 하이라이트에 실린 라운드 집합은 항상 그 시즌 채택 라운드의 상위 3개였고, 채택 라운드가 셋에 못 미치는 시즌은 그만큼만 실렸다(3건 70편, 2건 44편, 1건 28편). 하이라이트에 붙은 일치율도 라운드 표의 값과 326건 전부 일치했다.

파서 검증은 이미 발행된 두 칼럼의 숫자로 했다. 종료일 2026-09-16까지로 자르면 118편·279건이 되고, 그 평균 길이 117.0자·범위 44~211자·변동계수 0.270·평균 문장 수 2.15가 길이 규격을 검증한 칼럼의 값과 소수점까지 일치했다. 2026-09-09까지로 자르면 103편·255건이 되어 심사평 어휘를 분류한 칼럼의 모집단과 같아지고, 그 글이 "단독 평 86건 중 73건은 1라운드"라고 적은 1라운드 건수 73이 그대로 재현됐다.

길이는 공백 포함 글자 수로 셌고, 문장 수는 종결 부호(. ! ?)를 기계적으로 세되 소수점은 제외했다. 326건 중 물음표·느낌표를 쓴 건은 0건이고 마침표 없이 끝난 건도 0건이라, 이 규칙이 갈라내야 할 애매한 사례는 없었다. 모든 시즌이 15라운드로 끝나므로 '라운드 번호'와 '시즌 안의 상대 위치'는 같은 값이다.

결과 ① — 상관은 0.478, 그런데 표를 보면 계단이다

라운드 번호와 길이의 스피어만 상관은 0.478이고 순열검정(2만 회) p<0.0001이다. 숫자만 보면 "라운드가 깊어질수록 길어진다"가 확인된 것처럼 보인다. 그런데 구간별로 끊어 보면 모양이 다르다. 이 글의 핵심 표다.

라운드 구간건수평균 길이길이 범위평균 문장문장당 길이후보 둘 호명평균 일치율
R111288.8자44~1692.0244.0자0.0%68.85
R2~R360126.5자48~1762.1359.3자91.7%71.80
R4~R651134.5자88~2112.2061.2자94.1%72.82
R7~R949127.9자51~1812.2956.0자83.7%71.08
R10~R1233124.9자45~2042.1857.2자78.8%72.70
R13~R1521126.1자85~1562.2456.4자81.0%71.00

88.8 → 126.5에서 37.7자가 오르고, 그 뒤로는 134.5 → 127.9 → 124.9 → 126.1로 오르내리기만 한다. R2~R3과 R13~R15의 차이는 0.4자다. 즉 상관 0.478은 '라운드가 깊어질수록'이 아니라 '1라운드만 짧다'를 재고 있었다. 실제로 "R1이냐 아니냐"라는 0/1 변수와 길이의 상관은 0.585로, 라운드 번호 자체(0.478)보다 더 크다. 라운드 번호는 그 하나의 계단을 흐리게 베낀 대리 변수였다.

결과 ② — 1라운드를 빼면 추세가 0이 된다

계단을 떼어내고 다시 재면 이렇다.

검정표본스피어만 ρ순열 p
라운드 번호 × 길이 (전체)326건0.478<0.0001
'R1 여부' × 길이326건0.585<0.0001
라운드 번호 × 길이 (R1 제외)214건−0.0330.63
라운드 번호 × 길이 (후보 둘 호명한 평만)187건0.0350.64
시즌 내 표준화 후 라운드 번호 × 길이298건 / 114시즌0.430<0.0001
시즌 내 표준화, R1 제외214건0.0080.91
시즌 내 표준화, 후보 둘 호명한 평만187건0.0220.76

시즌마다 심사평의 기본 길이가 다를 수 있으니(시즌 효과) 같은 시즌 안에서 평균 0·표준편차 1로 표준화한 뒤 다시 쟀다. 그래도 결과는 같다. R1을 포함하면 0.430, 빼면 0.008(p=0.91)이다. 2라운드부터 15라운드까지, 라운드가 깊어진다는 사실 자체는 심사평 길이에 아무 정보도 주지 않는다.

결과 ③ — 같은 시즌 안에서 짝지어도 같은 답이 나온다

한 걸음 더 보수적으로 보자. 하이라이트에 1라운드와 그 이후 라운드가 함께 실린 시즌은 84편이다. 각 시즌 안에서 1라운드 심사평과 나머지 심사평의 평균 길이를 직접 뺐다.

평균 차이는 +44.2자(부트스트랩 2만 회 95% 구간 37.4~50.9자), 중앙값 +50.5자다. 84편 중 뒤쪽 라운드가 더 긴 시즌이 74편, 짧은 시즌이 10편이고 부호검정 양측 p=3.3×10−13이다. 1라운드 심사평이 그 시즌 하이라이트 중 가장 짧았던 시즌은 84편 중 70편이다. 모집단 전체로 보면 R1 88.8자 대 R2 이후 128.4자, 차이 39.6자(순열검정 p<0.0001)다.

계단은 분명히 있다. 그리고 계단은 거기 하나뿐이다. 그러면 1라운드와 2라운드 사이에서 무엇이 바뀌는가.

결과 ④ — 길이를 정하는 것은 호명하는 후보의 수였다

심사평의 생김새부터 세 갈래로 갈린다. 문장이 후보를 몇 개 호명하는지로 가르면 이렇다(호명 표지 = '후보 A/B', '후보 2/3', '이미지 2/3', '두 번째·세 번째 이미지', '두 후보').

장르건수평균 길이평균 문장문장당 길이3문장 비율R1 비중
단독 평 — 후보를 부르지 않고 결과물만 평한다12988.0자2.0343.3자3.1%112/129
단일 평 — 후보 하나만 부른다10111.8자2.0055.9자0.0%0/10
대조 평 — 후보 둘을 나란히 부른다187133.5자2.2260.1자21.9%0/187

88.0 → 111.8 → 133.5자. 호명하는 후보가 하나 늘 때마다 23자쯤 늘어나는 사다리다. 그리고 1라운드 심사평 112건은 전부 단독 평이다 — 1라운드에는 견줄 챔피언이 아직 없으니 문장이 홀로 설 수밖에 없다. 반대로 대조 평 187건에는 1라운드가 한 건도 없다.

그러니까 결과 ①의 계단은 '라운드 1 → 2'의 계단이 아니라 '단독 평 → 대조 평'의 계단이었고, 두 경계가 같은 자리에 있어서 겹쳐 보였던 것이다.

결과 ⑤ — 뒤 라운드의 단독 평 17건이 그 증거다

두 경계를 떼어 놓는 반례가 데이터 안에 있다. 2라운드 이후인데도 후보를 호명하지 않은 단독 평이 17건 있다. 라운드 가설이 맞다면 이 17건은 길어야 하고, 장르 가설이 맞다면 짧아야 한다.

이 17건의 평균 길이는 82.8자다. 1라운드 단독 평(88.8자)보다도 짧고, 같은 라운드 구간의 대조 평(133.5자)의 62% 수준이다. 문장당 길이도 39.1자로 1라운드(44.0자)보다 짧다. 라운드 번호가 아니라 장르가 길이를 정한다는 뜻이다. 이 17건 중 14건은 시즌 1~6, 즉 아직 후보를 개별로 호명하는 표기가 굳지 않았던 초기 시즌에 몰려 있고, 나머지 셋은 시즌 33·127·139다.

결과 ⑥ — 문장 수는 묶여 있고, 문장이 길어졌다

길이가 늘어나는 방식도 볼 만하다. 심사평 326건 중 326건이 2~3문장이다 — 위반 0건이다. 저장소의 심사 프롬프트가 "2-3 sentences in Korean"을 요구하고 있고, 이 칸은 지시를 완벽하게 지킨다(지난 칼럼이 세 모듈을 비교하며 확인한 사실이기도 하다).

그래서 계단은 문장 수로 올라가지 않는다. 평균 문장 수는 R1 2.02 → R2 이후 2.20으로 0.18문장만 늘었고, 3문장을 쓴 비율이 1.8% → 20.1%로 바뀐 것이 전부다. 정작 크게 달라진 쪽은 문장당 길이로 44.0자 → 58.4자다. 즉 심판은 할 말이 늘어날 때 문장을 더 쓰지 않는다 — 한 문장을 더 길게 쓴다. 상한이 걸린 쪽이 문장 수이기 때문이다.

결과 ⑦ — 그 '할 말'의 개수는 코드에 적혀 있다

왜 대조 평이 길어야 하는지는 심사 지시문에 있다. 엔진(Character/AutoCharacter/characterEngine.js)은 1라운드와 그 이후에 서로 다른 판정 콜을 쓴다. 분기는 if (r === 1 || gateMode === 'legacy') 한 줄이다.

1라운드에서 호출되는 단일 이미지 판정은 총평 필드를 이렇게 요구한다 — "comment": "<2~3문장 한국어 총평>". 담아야 할 항목이 '총평' 하나다. 2라운드 이후의 비교 판정은 같은 문장 예산에 이렇게 요구한다 — comment: 2-3 sentences in Korean — 두 후보가 각각 무엇이 달라졌고, 셋 중 어느 이미지가 왜 주제에 가장 부합하는지. 항목이 셋이다(후보 A의 변화, 후보 B의 변화, 승자와 그 이유). 챔피언과 후보 하나만 비교하는 판본에서는 "무엇이 달라졌고, 어느 쪽이 왜 주제에 더 부합하는지"로 항목이 둘이다.

문장 예산은 둘 다 2~3문장으로 같다. 다른 것은 그 안에 넣으라고 요구한 항목의 수다. 그리고 관측된 길이는 항목 수의 사다리(1개 88.0자 · 2개 111.8자 · 3개 133.5자)를 거의 그대로 따른다. 길어진 것은 라운드가 아니라 과제였다.

결과 ⑧ — 테마 11종, 엔진 세 구간 모두 같은 계단

계단이 특정 테마나 특정 시기의 버릇일 가능성을 확인했다. 먼저 테마별로 R1과 R2 이후를 비교하면 11개 테마 전부에서 차이가 양수다 — 가장 작은 '매력'이 +22.5자, 가장 큰 '카리스마'가 +65.0자다. 다음으로 이 시리즈가 계속 써 온 엔진 구간(① 2026-08-06까지, ② 08-07~08-22, ③ 08-23 이후 — 후보 두 번째 슬롯이 '원본 편집'에서 '독립 재생성'으로 바뀐 경계)으로 갈라도 같다.

구간시즌R1 평균R2 이후 평균계단단독 평대조 평
① ~2026-08-064278.2자 (20건)122.0자 (88건)+43.776.3자135.1자
② 08-07~08-223183.3자 (24건)133.9자 (60건)+50.683.3자133.9자
③ 08-23~09-286993.9자 (68건)132.1자 (66건)+38.295.5자131.5자

계단은 세 구간 모두에 있고, 구간을 지나며 조금 좁아진다(43.7 → 50.6 → 38.2자). 좁아지는 쪽은 아래 칸이다 — 1라운드 심사평이 78.2 → 83.3 → 93.9자로 길어졌고, 대조 평은 135.1 → 133.9 → 131.5자로 거의 움직이지 않았다. 대조 평이 요구 항목으로 포화돼 있는 반면, 단독 평 쪽에는 아직 여유가 있다는 뜻으로 읽힌다.

마지막으로 길이가 점수를 뜻하지 않는지도 확인했다. 길이와 일치율의 상관은 전체에서 0.333이지만, 대조 평 187건 안에서만 재면 0.001이다. 전체 상관은 '대조 평이 길고 일치율도 조금 높다'는 장르 효과를 다시 본 것일 뿐, 긴 심사평이 높은 점수를 뜻한다는 증거는 없다. 긴 심사평을 보고 "심판이 마음에 들어했구나"라고 읽어서는 안 된다.

한계 — 이 분석이 말할 수 없는 것

첫째, 326건은 모든 심사평이 아니라 이긴 라운드의 심사평이다. 하이라이트는 채택 라운드 중 일치율 상위 3개만 싣는다. 진 라운드(기각된 후보)의 심사평은 리포트에 아예 없다. 15라운드 × 142시즌이면 판정은 2,000회를 넘지만 공개된 것은 326건이다. 그러므로 이 글의 결론은 "공개된 심사평에서 라운드 위치는 길이를 설명하지 않는다"까지이고, 기각된 라운드의 심사평까지 같은 모양이라는 보장은 없다.

둘째, 그 선정 규칙 때문에 라운드 분포가 고르지 않다. 1라운드가 112건(34.3%)으로 가장 많은 것은 1라운드가 자주 그 시즌 최고점이기 때문이고, 이는 채택 곡선을 다시 센 칼럼이 다룬 현상이다. 뒤쪽 구간의 표본은 R13~R15 21건까지 얇아진다. 결과 ②의 '추세 0'은 얇은 표본 위에서 측정된 값이고, 아주 작은 추세(구간 평균 몇 자 수준)를 배제할 검정력은 없다. 말할 수 있는 것은 계단 크기(39.6자)만 한 추세가 없다는 것뿐이다.

셋째, 장르 분류는 기계적 표지 검사다. '후보 A/B', '이미지 2/3' 같은 호명 표지를 정규식으로 셌다. 같은 모집단(255건)을 의미 기준으로 분류한 앞선 칼럼과 비교하면 1라운드 단독 평 73건은 정확히 같지만, 단일 평과 대조 평의 경계에서 11건이 다르게 갈린다(이 글 기준 대조 155·단일 10·단독 90, 그 글 기준 148·21·86). "후보 2와 3은 …" 같은 뭉뚱그린 호명을 이 글은 대조로 센 결과다. 사다리의 양 끝(단독·대조)은 어느 기준에서도 바뀌지 않지만, 단일 평 10건은 표본이 작고 경계에 민감하다.

넷째, 심사 지시문은 집계 시점 저장소의 판본이다. 142편은 3개월에 걸쳐 끝난 시즌이고 그 사이 판정 척도는 여러 번 개정됐다(리포트에 실리는 시즌 척도만 v3~v4 계열로 갈린다). 요구 항목 수와 관측 길이가 같은 자리에 놓인다는 것까지가 이 글이 보일 수 있는 범위이고, "그 시즌에 바로 이 문장이 돌았다"는 확정이 아니다.

다섯째, 인과의 방향을 이 데이터로 못 잠근다. 1라운드가 단독 평인 것은 구조적 필연(견줄 챔피언이 없다)이므로 장르와 라운드를 완전히 분리한 실험은 애초에 불가능하다. 결과 ⑤의 17건이 유일한 반례 표본이고, 그 수는 적다. 다만 그 17건의 방향이 장르 가설과 같고 라운드 가설과 반대라는 점, 그리고 요구 항목 수와 길이 사다리가 맞물린다는 점이 함께 걸린다.

여섯째, 글자 수는 길이의 한 가지 척도일 뿐이다. 정보량·구체성·어휘 다양성은 세지 않았다. 긴 심사평이 더 많은 것을 말했는지는 이 글이 답하지 않는다. 다만 문장 수가 2~3으로 고정된 칸에서 글자 수가 1.4배가 되었다면 문장이 그만큼 빽빽해졌다는 것까지는 말할 수 있다.

그래서, 운영은 무엇을 바꾸는가

첫째, 리포트를 읽을 때 1라운드 심사평을 뒤 라운드와 같은 자로 재지 않는다. 두 칸은 애초에 다른 질문에 대한 답이다. 1라운드는 "이 결과물이 주제에 맞는가" 하나를 묻고, 2라운드부터는 "무엇이 달라졌는가 ×2 + 어느 쪽이 나은가"를 묻는다. 1라운드 심사평이 짧은 것은 심판이 무성의했다는 뜻이 아니다.

둘째, 심사평을 길게(또는 짧게) 만들고 싶으면 문장 수가 아니라 요구 항목 수를 손대야 한다. 326건이 전부 2~3문장을 지켰으므로 문장 수 지시는 확실히 듣는 레버지만, 그 안의 밀도는 항목 수가 정한다. 1라운드 심사평을 더 두텁게 만들려면 "총평"을 쪼개 항목을 늘리면 되고, 대조 평을 줄이려면 항목을 빼면 된다. 구간 ③에서 1라운드 심사평만 94자까지 길어진 것도 그 칸의 판정 프롬프트가 두터워졌기 때문으로 읽힌다.

셋째, 길이를 품질 지표로 쓰지 않는다. 장르를 고정하면 길이와 일치율의 상관은 0.001이다. 심사평의 길이는 심판이 받은 과제의 모양을 재는 지표이고, 결과물의 좋음을 재는 지표가 아니다.

원자료는 모두 공개돼 있다. 시즌 150 리포트를 열면 하이라이트 세 블록 중 R1 블록만 후보를 부르지 않고, R2·R3 블록은 "후보 A는 …, 후보 B는 …"으로 시작하는 것을 바로 볼 수 있다. 세어 보는 데 계산기는 필요 없다 — 문단 길이가 눈으로 갈린다.

집계 기준. 칼라톤 공개 AI 인물 생성 시즌 리포트 142편(국문판, 종료일 2026-06-30~09-28)의 '하이라이트' 칸 심사평 326건, 2026년 10월 집계. 길이 = 공백 포함 글자 수(HTML 엔티티는 복원 후 계산). 문장 수 = 종결 부호 . ! ? 개수(소수점 제외). 장르 = 심사평이 호명한 후보 슬롯 수('후보 A/B', '후보 2/3', '이미지 2/3', '두 번째·세 번째 이미지', '두 후보'를 표지로 기계 분류; 0개=단독 평, 1개=단일 평, 2개=대조 평). 하이라이트의 선정 규칙(채택 라운드 중 일치율 상위 3)은 142편 전부에서 라운드 표와 대조해 확인했다. 상관은 스피어만, 유의성은 순열검정 2만 회(고정 시드), 시즌 효과는 시즌 내 표준화(하이라이트 2건 이상인 114시즌 298건)로 제거했다. 짝비교 구간은 시즌 단위 부트스트랩 2만 회. 심사 프롬프트 인용은 집계 시점 저장소 코드의 문구이며 해당 시즌 실행 당시의 판본과 다를 수 있다.