AI가 쓴 글이 단조롭게 느껴지는 진짜 이유, 문장이 아니라 문단을 재보면 드러난다

AI가 쓴 글이 단조롭게 느껴지는 진짜 이유, 문장이 아니라 문단을 재보면 드러난다

AI가 쓴 글은 문장 하나하나를 보면 별문제가 없는데 전체를 읽으면 단조롭게 느껴집니다. 이 인상의 원인을 대개 어휘에서 찾습니다. 특정 접속 부사나 상투적인 표현을 지우면 나아진다는 것입니다. 그래서 어휘가 아니라 글의 모양을 재봤습니다. AI가 초안을 쓴 글 66편, 약 29만 자를 대상으로 문장과 문단의 길이를 모두 세어 봤더니, 단조로움의 원인은 문장이 아니라 문단에 있었습니다.

무엇을 어떻게 쟀는가

대상은 AI가 초안을 만든 글 66편입니다. 코드 블록은 문장으로 셀 수 없으므로 미리 제외했습니다. 이것을 빼지 않으면 설정 파일 한 덩어리가 ‘400자짜리 문장’으로 잡혀 통계가 통째로 어긋납니다. 처음 세었을 때 가장 긴 문장으로 나온 669자가 실제로는 코드였습니다.

제외한 뒤 남은 것은 문단 1,864개, 문장 4,425개였습니다. 글 한 편에 평균 28개 문단입니다.

문장 길이는 문제가 아니었다

먼저 의심한 것은 문장 길이입니다. AI가 문장을 길게 늘여 쓴다는 지적이 많기 때문입니다. 실제 분포는 이렇습니다.

문장 길이 개수 비중
40자 이하 1,143 25.8%
41~60자 1,487 33.6%
61~80자 1,171 26.5%
81~100자 496 11.2%
101~120자 106 2.4%
121자 이상 22 0.5%

평균 56자, 중앙값 55자입니다. 한글 기준으로 이 정도면 짧은 편입니다. 100자를 넘는 문장은 전체의 3.2%뿐이고, 상위 10%조차 85자에서 끊깁니다. 길이만 보면 지적할 것이 없습니다.

즉 ‘문장을 짧게 끊으라’는 조언은 이 글들에는 해당하지 않았습니다. 이미 짧기 때문입니다. 그런데도 읽는 느낌은 단조로웠으므로, 원인은 다른 곳에 있다는 뜻이 됩니다.

진짜 신호는 문단이 서로 닮았다는 점

문단 단위로 다시 재보니 그림이 달라졌습니다.

문단 길이 개수 비중
60자 이하 329 17.7%
61~110자 260 13.9%
111~160자 558 29.9%
161~210자 551 29.6%
211~260자 148 7.9%
261자 이상 18 1.0%
문단 길이 분포 막대그래프. 111~160자 558개, 161~210자 551개로 가운데 두 구간에 집중
가운데 두 구간에 전체의 59.5%가 몰려 있습니다.

가운데 두 칸에 전체의 59.5%가 몰려 있습니다. 범위를 조금 넓혀 90자에서 200자 사이로 잡으면 61.2%입니다. 문단 열 개 중 여섯 개가 사실상 같은 크기라는 뜻입니다.

문단당 문장 수를 보면 더 분명합니다.

문단 안의 문장 수 비중
1문장 22.1%
2문장 28.7%
3문장 39.6%
4문장 9.0%
5문장 이상 0.6%
문단 안의 문장 수 비중. 3문장이 39.6%로 가장 많고 5문장 이상은 0.6%
세 문장짜리 문단이 가장 흔하고, 다섯 문장을 넘는 문단은 거의 없습니다.

세 문장짜리 문단이 가장 흔하고, 2~3문장이 전체의 68%입니다. 반대로 5문장을 넘는 문단은 0.6%에 불과합니다. 사람이 쓴 글에서는 한 문장으로 끊는 문단과 예닐곱 문장이 이어지는 문단이 뒤섞이는데, 여기서는 그런 폭이 거의 없습니다.

단조로움은 평균이 아니라 편차의 문제다

이 지점이 핵심입니다. 문단 길이의 평균은 135자인데, 중앙값이 146자입니다. 그리고 25%와 75% 지점 사이의 폭이 86자에서 180자로 94자밖에 되지 않습니다. 대부분의 문단이 좁은 구간 안에 들어 있다는 뜻입니다.

글을 읽는 사람은 문단의 절대 길이를 재지 않습니다. 대신 다음 문단이 얼마나 걸릴지를 무의식적으로 예측하면서 읽습니다. 이 예측이 계속 맞으면 리듬이 사라지고, 내용과 무관하게 기계적인 인상이 생깁니다. 문장 길이가 적당하고 어휘가 자연스러워도 단조롭게 느껴지는 이유가 여기에 있습니다.

정리하면 원인은 ‘길다’가 아니라 ‘다 비슷하다’입니다. 그래서 문장을 짧게 고치는 작업은 이 문제를 해결하지 못합니다. 짧게 만들어도 여전히 균일하기 때문입니다.

골격이 다양해도 문단이 균일하면 소용없다

여기서 한 가지 반론이 가능합니다. 소제목과 표, 목록이 충분히 들어 있으면 문단 길이가 비슷해도 읽는 리듬이 생기지 않겠느냐는 것입니다. 그래서 같은 66편의 골격도 세어 봤습니다.

요소 전체 글당 평균
H2 소제목 448개 6.8개
H3 소제목 112개 1.7개
87개 66편 전부에 있음
목록 104개 66편 중 52편에 있음

골격만 보면 부족한 것이 없습니다. 글 한 편에 문단이 28개인데 소제목이 6.8개이므로 평균 네 문단마다 한 번씩 끊깁니다. 표는 모든 글에 들어 있고, 목록도 대부분의 글에 있습니다.

그런데도 단조롭게 읽힙니다. 이 조합이 알려주는 것이 있습니다. 소제목과 표는 글의 큰 단위를 나누고, 문단은 읽는 동안의 호흡을 만듭니다. 둘은 서로를 대신하지 못합니다. 네 문단마다 소제목이 나와도 그 사이의 네 문단이 모두 같은 크기라면, 소제목과 소제목 사이는 여전히 평평합니다.

골격을 다양하게 만드는 작업은 이미 충분히 되어 있었다는 뜻이기도 합니다. 표를 더 넣거나 소제목을 더 쪼개는 것으로는 남은 문제를 풀 수 없습니다.

자기 글을 재보는 가장 간단한 방법

통계를 내지 않아도 확인할 수 있습니다. 글을 열어 연속한 문단 다섯 개만 골라 각각 몇 문장인지 적어 봅니다. 3, 3, 2, 3, 3처럼 나오면 균일한 상태입니다. 1, 4, 2, 6, 3처럼 흩어져 있으면 문제가 없습니다.

글자 수를 재고 싶다면 문단 하나를 복사해 글자 수를 세는 도구에 넣어 보면 됩니다. 다섯 개 중 네 개가 100자에서 200자 사이라면 앞의 측정과 같은 상태입니다. 다섯 문단만 봐도 판단이 서기 때문에 글 전체를 분석할 필요는 없습니다.

왜 3문장 문단으로 수렴하는가

이 모양이 나오는 데는 이유가 있습니다. 설명하는 글의 문단은 대개 주장 → 근거 → 정리라는 세 자리로 구성됩니다. 그리고 각 자리를 한 문장씩 채우면 정확히 세 문장이 됩니다. 이 구성은 그 자체로 잘못된 것이 아니라 오히려 안정적입니다. 문제는 모든 문단이 예외 없이 이 구성을 따를 때 생깁니다.

사람이 쓸 때는 이 틀이 자주 깨집니다. 근거가 필요 없으면 한 문장으로 끝내고, 설명할 것이 많으면 다섯 문장을 이어 붙입니다. 강조하고 싶을 때는 일부러 한 줄만 남깁니다. 내용의 무게에 따라 문단 크기가 달라지는 것이 자연스러운 글의 특징입니다. 균일한 문단은 내용이 아니라 틀이 길이를 정했다는 흔적입니다.

100자를 넘긴 140개 문장의 공통점

길이 자체는 문제가 아니라고 했지만, 상위 3.2%에 해당하는 140개 문장은 따로 볼 가치가 있었습니다. 하나씩 확인해 보니 길어진 방식이 거의 같았습니다.

대부분 두 가지 형태 중 하나였습니다. 첫째는 쉼표로 항목을 계속 잇는 나열형입니다. 조건이나 대상을 A, B, C, D처럼 늘어놓다가 문장이 100자를 넘깁니다. 둘째는 ‘~하고’, ‘~라면’, ‘~지만’ 같은 연결 어미로 절을 이어 붙이는 형태입니다. 앞 절에서 조건을 걸고 뒤 절에서 결론을 내리는데, 그 사이에 단서를 하나 더 끼워 넣으면서 늘어납니다.

두 형태 모두 내용이 어려워서 길어진 것이 아닙니다. 담을 것이 여러 개인데 하나의 문장에 다 넣으려 해서 길어진 것입니다. 그래서 고치는 방법도 간단합니다. 나열은 목록으로 빼고, 이어 붙인 절은 마침표로 끊으면 됩니다.

다만 여기서 주의할 점이 있습니다. 나열을 전부 목록으로 바꾸면 이번에는 목록이 반복되는 다른 종류의 단조로움이 생깁니다. 항목이 셋 이상이고 각 항목이 대등할 때만 목록으로 옮기고, 둘뿐이거나 항목의 무게가 다르면 문장으로 두는 편이 낫습니다.

균일함을 깨려다 하는 실수

문단 길이를 다르게 만들라고 하면 기계적으로 자르는 경우가 있습니다. 세 문장 문단을 한 문장씩 세 개로 쪼개는 식입니다. 이렇게 하면 수치상 편차는 커지지만 읽기는 더 나빠집니다. 근거와 주장이 흩어져서 연결이 끊기기 때문입니다.

기준은 길이가 아니라 한 문단이 하나의 생각을 담고 있는가입니다. 생각이 하나면 짧아도 그대로 두고, 두 개가 섞여 있으면 나눕니다. 이 기준으로 정리하다 보면 길이는 자연스럽게 달라집니다. 반대로 길이를 먼저 맞추면 내용이 뒤틀립니다.

그래서 측정값은 고칠 곳을 찾는 데 쓰고, 고치는 기준으로는 쓰지 않는 편이 맞습니다. 문단의 60%가 비슷하다는 사실은 어디를 들여다볼지 알려줄 뿐, 어떻게 바꿀지까지 알려주지는 않습니다.

고칠 때의 순서

전부 고칠 필요는 없습니다. 문단 열 개 중 여섯 개가 같은 크기라면, 그중 몇 개만 바꿔도 리듬이 생깁니다. 순서는 이렇게 잡는 편이 효율적입니다.

  1. 3문장 문단을 먼저 찾습니다. 가장 많은 유형이므로 손댈 대상이 가장 많습니다.
  2. 그중 세 번째 문장이 앞의 두 문장을 요약만 하고 있는 것을 지웁니다. 지워도 뜻이 그대로면 원래 없어도 되는 문장이었습니다. 문단이 두 문장으로 줄면서 길이도 달라집니다.
  3. 중요한 대목 하나를 골라 한 문장짜리 문단으로 떼어 냅니다. 짧은 문단은 그 자체로 강조가 됩니다.
  4. 설명이 이어지는 대목은 반대로 두 문단을 하나로 붙입니다. 억지로 나눠 둔 곳이 대개 한두 군데는 있습니다.
  5. 100자가 넘는 문장을 확인합니다. 이 글들에서는 140개였고, 대부분 쉼표로 항목을 나열하다 길어진 경우였습니다. 나열은 문장에서 빼서 목록으로 옮기면 문장도 짧아지고 문단 모양도 달라집니다.

마지막 항목이 두 가지를 한 번에 해결하기 때문에 효율이 가장 좋습니다. 나열형 문장은 읽기도 어렵고 문단 길이를 평준화하는 원인이기도 합니다.

정리하면

AI 초안을 다듬을 때 흔히 어휘부터 봅니다. 하지만 재보니 문장 길이는 평균 56자로 이미 짧았고, 문제가 된 것은 문단의 60%가 같은 크기라는 점이었습니다.

이 진단은 직접 확인할 수 있습니다. 자기 글을 열어 문단 몇 개의 글자 수를 세어 보면 됩니다. 대부분이 100자에서 200자 사이에 들어 있고 문장 수가 두세 개로 반복된다면, 어휘를 바꾸는 것보다 문단 몇 개의 크기를 일부러 다르게 만드는 편이 훨씬 빠르게 효과를 냅니다.

Similar Posts

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다