진 후보에게 사유를 적지 않는 판정 — 심사평 276건, 진 후보 절 전수 분류
칼라톤의 AI 인물 생성 시즌은 라운드마다 후보 이미지를 올려 심사 모델에게 채점시킨다. 개막 라운드를 뺀 대부분의 라운드에는 후보가 둘 올라간다(초기에는 챔피언을 각각 다르게 편집한 둘이었고, 8월 7일부터는 편집본 하나와 완전히 새로 생성한 인물 하나다). 심사 모델은 점수와 함께 한국어 총평 두세 문장을 남기고, 그 총평이 공개 시즌 리포트 하단 '하이라이트' 칸에 실린다. 사람이 실제로 읽는 유일한 심사 기록이다.
그 총평을 읽다 보면 이상한 문장이 눈에 띈다. 진 후보를 칭찬만 하고 끝내는 판정이다.
“후보 A(이미지 2)는 턱선이 미세하게 갸름해져 원본보다 정돈된 인상을 줍니다. 후보 B(이미지 3)는 새로운 인물로, 크고 맑은 눈망울과 부드러운 이목구비가 '청순'이라는 주제에 가장 완벽하게 부합합니다.”
— 시즌 142 R8(2026-09-03). 진 쪽은 후보 A인데, A에 대해 적힌 것은 '원본보다 정돈됐다'뿐이다.
이 글은 그런 판정이 얼마나 되는지, 그리고 언제 나오는지를 묻는다. 2026년 9월 15일(KST) 기준 공개된 인물 리포트 116편의 심사평 276건을 전수로 갈랐다.
방법 — 심사평을 호칭으로 가르고, '진 후보 절'만 떼어 낸다
대상은 저장소에 공개된 국문 리포트 116편(영문 116편은 교차 검증용)이다. 116편 모두 정확히 15라운드라 라운드 표는 1,740행, 채택 라운드는 385건이고, 하이라이트에 실린 심사평은 276건이다(총 32,368자, 평균 117.3자, 44~211자).
분류는 두 단계다. 먼저 심사평이 후보를 부르는 방식으로 장르를 가른다 — 두 후보를 각각 부르면 대조 평, 한쪽만 부르면 단일 평, 아무도 부르지 않으면 단독 평이다(같은 기준을 심사평 어휘를 다룬 이전 칼럼에서 썼다). 다음으로 대조 평에서 진 후보의 절만 떼어 낸다. 승자는 하이라이트 이미지 파일 경로의 슬롯 문자(candA=편집, candB=재생성)로 확정하고, 본문에서 그 반대편 호칭이 등장하는 지점부터 다음 호칭 직전까지를 진 후보의 절로 잘랐다(평균 48.5자). 마지막으로 그 절에 '부정 표지'가 있는지를 다섯 갈래 사전(무변화·인위/결함·색과 톤·선명도/디테일·감소/저하)으로 기계 판정하고, 표지가 하나도 없다고 나온 절은 전수를 다시 읽어 확인했다.
승자 판정이 자의적이지 않다는 점은 따로 확인했다. 심사평 안에서 '가장 부합·최고점' 류의 문장이 지목하는 후보를 독립적으로 뽑아 파일 슬롯과 맞대면 추출 가능한 155건 중 154건이 일치한다. 어긋난 한 건은 시즌 33 R5(2026-07-16)로, 심사평이 칭찬한 이미지와 채택된 이미지가 다르다 — 영문판에서도 똑같이 어긋나므로 번역 문제가 아니라 원 심사평 자체의 불일치다.
심사평의 장르는 시간이 지나며 둘로 정리됐다
276건의 장르 분포는 대조 평 158 · 단일 평 14 · 단독 평 104다. 단독 평 104건 중 86건이 R1인데, 개막 라운드에는 후보가 하나뿐이라 비교할 상대가 없다. 나머지를 구간별로 세면 이렇게 움직인다.
| 발행 구간 | 심사평 | 대조 평 | 단일 평 | 단독 평 | 그중 R1 | 비R1 단독 |
|---|---|---|---|---|---|---|
| ① ~2026-08-06 | 108건 | 57건 | 13건 | 38건 | 20건 | 18건 |
| ② 08-07~08-22 | 84건 | 59건 | 1건 | 24건 | 24건 | 0건 |
| ③ 08-23~09-15 | 84건 | 42건 | 0건 | 42건 | 42건 | 0건 |
| 합계 | 276건 | 158건 | 14건 | 104건 | 86건 | 18건 |
비R1 단독 평 18건은 전부 구간 ①이고 마지막 사례가 2026년 7월 20일이다. 그 18건 안에 이 글의 극단값이 들어 있다 — 심사평이 승자를 지목조차 하지 않는 다섯 건이다. 시즌 4의 세 라운드(R5·R9·R13)는 두 후보가 같아 보인다며 판정을 거부하고, 시즌 33 R9와 시즌 41 R3은 후보들을 한 덩어리로 칭찬한 뒤 "후보 이미지들이 주제에 가장 잘 부합한다"로 끝난다.
“두 이미지 간 이목구비, 비율, 피부 질감 등 시각적인 차이가 전혀 관찰되지 않습니다. 완전히 동일한 인상과 매력을 보여주어 우열을 가릴 수 없습니다.”
— 시즌 4 R9(2026-07-02). 그럼에도 이 라운드는 채택돼 챔피언이 교체됐다.
구간 ③에 오면 단독 평 42건이 모두 R1이다. 즉 최근 시즌에서 후보가 둘인 라운드는 예외 없이 두 후보를 각각 부르는 대조 평을 받는다. 형식은 정리됐다. 문제는 형식이 정리된 뒤에도 남는 쪽이다.
결과 ① — 대조 평의 35.4%는 진 후보에게 결함을 적지 않는다
대조 평 158건의 '진 후보 절'을 표지로 갈랐다. 이 표가 이 글의 본문이다.
| 진 후보 절의 모양 | ① ~08-06 (57건) | ② 08-07~08-22 (59건) | ③ 08-23~09-15 (42건) | 합계 158건 |
|---|---|---|---|---|
| 결함 명시(인위·색톤·선명도·저하 등) | 37건 | 35건 | 26건 | 98건 (62.0%) |
| 변화 없음 + 결함 | 1건 | 2건 | 1건 | 4건 (2.5%) |
| 변화 없음만 — “원본과 차이가 없다” | 5건 | 15건 | 12건 | 32건 (20.3%) |
| 개선·중립 서술 — 나아졌는데 졌다 | 3건 | 6건 | 3건 | 12건 (7.6%) |
| 공동 서술 — 두 후보를 한 문장에 묶음 | 11건 | 1건 | 0건 | 12건 (7.6%) |
| 결함을 적지 않은 소계 | 19건 (33.3%) | 22건 (37.3%) | 15건 (35.7%) | 56건 (35.4%) |
| 사유 자체가 없는 소계 | 14건 (24.6%) | 7건 (11.9%) | 3건 (7.1%) | 24건 (15.2%) |
세 줄로 읽힌다. 첫째, 진 후보가 나빠서 졌다고 적히는 경우는 열에 여섯 정도(62.0%)다. 둘째, 결함을 적지 않는 비율은 세 구간에서 33.3 / 37.3 / 35.7%로 거의 움직이지 않는다. 셋째, 움직이는 것은 그 안의 구성이다 — '사유 자체가 없음'이 24.6% → 11.9% → 7.1%로 줄고(순열 검정 p=0.035), 그 자리를 "원본과 차이가 없다"가 10.5% → 28.8% → 31.0%로 채운다(p=0.021).
'변화 없음'은 사유이긴 하지만 품질 평가가 아니다. 엔진 코드에서 이 판정은 점수에 반영되는 감점이 아니라 게이트다 — characterEngine.js의 채택 판정부는 visually_identical이 참이면 점수를 보기도 전에 reason: 'no_op'으로 기각한다(:2635, :2732). 그래서 최근 구간에서 가장 흔한 '기각 사유'는 후보가 못났다는 말이 아니라, 후보가 아무것도 하지 않았다는 말이다.
결과 ② — 사유 없는 판정에는 두 가지 모양이 있고, 둘은 시간축에서 갈린다
사유가 아예 없는 24건은 균질하지 않다. 정확히 12건씩 두 모양으로 갈린다.
공동 서술 12건은 심사평이 두 후보를 한 문장에 묶어 버려서 진 쪽만의 서술이 존재하지 않는 경우다. "후보 2와 3은 원본에 비해 피부의 윤기와 입체감을 더해 '아름다움'이라는 주제를 더욱 부각했습니다"(시즌 25 R4)처럼 시작한 뒤 곧바로 승자를 고른다. 이 12건은 12건 전부가 '수정' 라운드이고 11건이 7월 7일~7월 31일에 몰려 있다. 대조 평에서 수정 라운드는 67/158(42.4%)에 불과하므로, 무작위로 12건을 뽑아 전부 수정일 확률은 1.8×10⁻⁵다. 후보 둘이 모두 같은 원본을 편집한 것일 때에만 "둘 다 이렇게 바뀌었다"가 성립한다는 뜻이다.
개선·중립 서술 12건은 반대다. 진 후보에 대해 적힌 문장이 칭찬이다. "원본보다 정돈된 인상"(시즌 142 R8), "원본 대비 눈이 미세하게 커지고 볼살이 더해져 약간 더 앳된 인상"(시즌 160 R2), "원본보다 피부톤과 눈매가 정돈되어 한결 화사한 인상"(시즌 103 R3). 셋 다 진 쪽에 대한 서술이고, 셋 다 결함이 아니다.
| 사유 없는 판정 24건 | 건수 | 프롬프트 종류 | 발행일 범위 | 몰린 구간 |
|---|---|---|---|---|
| 공동 서술(두 후보를 한 문장에) | 12건 | 수정 12 · 생성 0 | 07-07 ~ 08-17 | 구간 ① 11건 |
| 개선·중립 서술(나아졌는데 졌다) | 12건 | 수정 3 · 생성 9 | 07-13 ~ 09-12 | 구간 ②③ 9건 |
왜 칭찬받은 후보가 지는가. 8월 7일부터 인물 시즌의 후보 B 슬롯은 챔피언의 편집본이 아니라 완전히 새로 생성된 다른 인물이다(챔피언 혈통을 추적한 칼럼에서 다룬 전환이다). 그러면 두 후보 사이에 "무엇이 나빠졌는가"라는 질문이 성립하지 않는다. 편집본은 실제로 조금 나아졌고, 새 인물은 그냥 더 예쁘다. 심사평은 본 대로 적는다.
다만 여기서 한 가지는 분명히 해 둬야 한다. 이 12건 중 8월 7일 이후 9건이 모두 '생성' 라운드라는 사실 자체는 발견이 아니다 — 그 시기 대조 평의 90%(101건 중 91건)가 이미 생성 라운드이기 때문이고, 무작위로 9건을 뽑아도 전부 생성일 확률이 0.38이다. 말할 수 있는 것은 방향이 아니라 내용이다. 진 후보를 칭찬하는 문장은 편집 대 편집의 대결에서는 나올 수 없고, 편집 대 신규의 대결에서만 나온다.
결과 ③ — 양보 연결 35건은 어느 축으로도 갈리지 않는다
결함을 적는 158건 중에도 온도 차가 있다. "미세하게 갸름해졌으나 입술 색상이 다소 탁해졌습니다"처럼 먼저 공을 인정하고 그다음에 깎는 양보 연결(-으나 / -지만 / -는데)이 35건(22.2%) 있다. 구간별로 15.8% → 30.5% → 19.0%로 구간 ②에서 가장 높지만, 순열 검정으로는 p=0.14로 유의하지 않다. 프롬프트 종류(p=0.34)로도, 테마(p=0.35)로도 갈리지 않는다.
주제가 물었던 라운드 축과 테마 축도 같이 정리해 둔다. 아래가 이 글에서 시도한 모든 축의 결과다.
| 축 | 사유 없음(24건) | 변화 없음(36건) | 양보 연결(35건) |
|---|---|---|---|
| 발행 구간(3구간) | p=0.035 | p=0.021 | p=0.14 |
| 프롬프트 종류(생성/수정) | p=0.044 | p=0.0006 | p=0.34 |
| 라운드 구간(R2–5/6–10/11–15) | p=0.50 | p=0.71 | p=0.91 |
| 테마(11종) | p=0.27 | p=0.0012 | p=0.35 |
라운드 번호는 아무것도 예측하지 않는다. 결함 미기재 비율은 R2~R5 38.9% / R6~R10 32.1% / R11~R15 33.3%로 사실상 평평하다(p=0.73). 심판이 시즌 후반에 지쳐 말을 아낀다거나, 초반에 관대하다거나 하는 이야기는 이 데이터에 없다.
테마 축에서 유일하게 튀는 '변화 없음'도 조심해서 읽어야 한다. 남성 테마 5종은 전부 8월 8일 이후에 개통됐으므로 테마와 발행 시점이 엉켜 있다. 레인으로만 보면 남성 36.8%(38건 중 14건) 대 여성 18.3%(120건 중 22건)이지만, 생성 라운드로만 좁히면 p=0.097까지 내려가 유의 수준에 못 미친다. 테마가 아니라 시점일 가능성을 배제할 수 없다.
해석 — 심사평은 애초에 '기각 사유'를 적는 칸이 아니다
여기까지가 관측이고, 다음은 그 관측이 왜 자연스러운지에 대한 이야기다. 리포트에 실리는 총평은 채점 프롬프트의 comment 필드에서 나오는데, 그 필드에 대한 지시문이 요구하는 것은 두 가지뿐이다.
comment: 2-3 sentences in Korean — 두 후보가 각각 무엇이 달라졌고, 셋 중 어느 이미지가 왜 주제에 가장 부합하는지.
—characterEngine.js:2446(후보 둘). 후보가 하나인 페어 판정(:2350)도 "무엇이 달라졌고, 어느 쪽이 왜 주제에 더 부합하는지"로 같다.
변화의 서술과 최상급 하나. "진 쪽은 왜 졌는지 적어라"는 조항은 어디에도 없다. 그렇다면 진 후보를 칭찬만 하고 끝내는 판정은 심판의 태만이 아니라 지시문을 글자 그대로 따른 결과다. 실제로 약점은 총평이 아니라 별도의 weaknesses 필드에 적히도록 설계돼 있고(개막 라운드 판정 :1955는 "반드시 구체적인 약점과 다음 라운드 개선 지시를 남길 것"을 명시한다), 그 필드는 리포트에 실리지 않는다. 독자가 읽는 자리와 사유가 적히는 자리가 처음부터 다른 칸이다.
같은 지시문이 앞의 관측 하나를 더 설명한다. 총평의 최상급과 점수를 일치시키라는 조항("The image you call best in the comment MUST be the image you scored highest in match_rate")은 판정 척도의 특정 버전에서만 프롬프트에 붙는다. 이 글이 찾아낸 유일한 불일치 사례가 그 조항 도입 이전인 7월 16일(시즌 33 R5)이라는 점은, 조항이 실제로 작동하고 있다는 정황이다.
한계 — 이 분석이 말할 수 없는 것
첫째, 이 글의 모집단은 이중으로 잘려 있다. 심사평 276건은 채택된 385개 라운드 중에서도 하이라이트 세 칸 안에 든 것뿐이다. 기각된 라운드의 심사평은 리포트에 아예 없고, 채택됐지만 점수순 절단에서 밀린 라운드의 심사평도 없다(잘린 라운드를 센 칼럼 참조). 따라서 "심판이 전체 판정에서 사유를 얼마나 적는가"는 이 데이터로 답할 수 없다. 여기서 셀 수 있는 것은 공개된 자리에서 사유가 얼마나 보이는가뿐이다.
둘째, 표지 분류는 국문 표면 표현에 붙는다. '미세하게·살짝·소폭·약간'처럼 변화의 크기를 한정하는지 결함의 크기를 한정하는지 구별되지 않는 부사는 부정 표지에서 제외했고, 이 규칙은 이전 칼럼과 동일하다. 다르게 잡으면 경계선의 몇 건은 다른 칸으로 간다. 표지 사전의 다섯 갈래 역시 관측된 문장에서 귀납한 것이어서, 다른 사전으로는 62.0%가 몇 퍼센트 움직일 수 있다.
셋째, 진 후보의 점수는 리포트에 없다. 표에 실리는 것은 그 라운드의 대표 점수 하나뿐이라 "진 후보가 실제로 얼마나 못했는가"를 잴 방법이 없다. 그래서 이 글은 사유가 적혔는지 여부만 셌고, 사유가 정당했는지는 판단하지 않았다.
넷째, 구간을 가른 두 날짜(8월 6일·8월 22일)는 이전 집계에서 확인된 경계를 그대로 가져다 쓴 것이라 이 글이 독립적으로 검증한 값이 아니다. 테마 축의 신호가 시점 교란인지 아닌지도 위에 적은 대로 미결이다.
다섯째, 'p=0.035' 류의 값은 같은 데이터에서 여러 축을 시도한 뒤의 값이다. 다중비교를 보정하지 않았으므로 경계선 근처의 결과(구간 축의 두 값)는 눈금으로만 읽는 편이 안전하다. 반대로 라운드 축과 테마 축의 '없음'은 시도해도 안 나왔다는 사실 그대로다.
교차 검증과 우리가 바꿀 것
영문 리포트 116편으로 같은 파싱을 돌려 라운드 표 1,740행의 다섯 값(라운드 번호·채택 여부·프롬프트 종류·기준 라운드·일치율) 8,700개와 하이라이트 276건의 네 값(라운드·일치율·프롬프트 종류·이미지 URL) 1,104개를 전수 대조했다. 불일치 0건이다. 다만 표지 분류 자체는 국문에서만 돌렸다 — 진 후보를 'Candidate A'로 부를지 'the second image'로 부를지가 시즌마다 다르고, 한국어의 '반면'이 영문에서 'However'와 'On the other hand'로 갈리기 때문이다.
운영으로 옮길 것은 하나다. 리포트의 하이라이트가 심사 기록의 얼굴이라면, 거기 실리는 문장은 '무엇이 달라졌나'가 아니라 '왜 이쪽을 골랐나'여야 한다. 지금 지시문은 전자를 요구하고 후자는 최상급 한 마디로 대신한다. weaknesses 필드가 이미 있으니, 진 후보의 약점 한 줄을 하이라이트에 함께 싣는 편이 읽는 사람에게 정직하다.
그 전까지 이 글이 남기는 메모는 이렇다. 인물 리포트의 심사평을 '기각 사유'로 읽으면 안 된다. 세 건 중 한 건은 진 후보에게 아무 흠도 잡지 않고, 여섯 건 중 한 건은 오히려 진 후보를 칭찬한다. 그것은 심판이 망설였다는 뜻이 아니라, 대부분의 라운드에서 승부를 가른 것이 결함이 아니라 비교였다는 뜻이다. 후보 둘이 다른 인물인 시대에는, 지는 쪽이 나쁠 이유가 없다.
집계 기준. 2026년 9월 15일(KST) 저장소 기준 공개 인물 시즌 리포트 국문 116편·영문 116편을 파싱했다(발행일 2026-06-30~09-15). 116편 모두 15라운드로 라운드 표는 1,740행, '미채택' 배지가 없는 채택 라운드는 385건이며, 하이라이트 블록에 실린 심사평은 276건이다. 장르는 심사평 본문의 후보 호칭(후보 A/B, 이미지 2/3, 두 번째·세 번째 이미지 등)으로 갈랐고, '원본(이미지 1)' 참조는 절 경계로 세지 않았다. 진 후보는 하이라이트 이미지 파일 경로의 슬롯 문자(candA/candB)의 반대편으로 확정했다(대조 평 158건 = 패자 A 131 · 패자 B 27). 부정 표지 사전은 무변화·인위/결함·색과 톤·선명도/디테일·감소/저하 다섯 갈래이며, 표지가 없다고 판정된 절은 전수를 재확인했다. 유의도는 라벨을 20,000회 무작위 재배치한 순열 카이제곱 검정이고 다중비교 보정은 하지 않았다. 요약 배지 값은 라운드 표와 어긋날 수 있어 이 글의 어떤 계산에도 쓰지 않았다. 발행 구간을 가른 2026-08-06·08-22 두 날짜는 이전 집계에서 확인된 경계를 그대로 사용했다.