마크다운 문법이 단어수 측정과 텍스트 통계에 미치는 영향
기존 단어수 세기 도구의 마크다운 처리 문제점
마크다운으로 글을 작성할 때 문서에는 최종 게시물에 포함되지 않는 구조적 문법 기호가 다수 포함됩니다. 기존의 단어수 세기 도구는 마크다운 언어를 이해하지 못하고 공백이나 문장 부호 기준으로 텍스트를 단순 분할합니다. 그 결과 제목용 #, 강조용 **, 인용구 >, 코드용 백틱(`), 링크 내부의 URL([앵커 텍스트](https://example.com)) 등이 실제 단어로 계산되어 전체 글자수가 부풀려집니다.
테크니컬 라이터, 블로거, 문서 작성자, 기자에게 이러한 오차는 정교한 원고 분량이나 제한을 맞춰야 할 때 큰 문제를 일으킵니다. 2,000단어 분량의 기술 튜토리얼 마크다운 문서가 일반 온라인 계산기에서는 인라인 코드, 문법 기호, 긴 URL 때문에 2,400단어로 잘못 측정될 수 있습니다.
Utiliome이 정확한 마크다운 메트릭을 계산하는 방법
Utiliome은 텍스트 분석을 실행하기 전 AST(Abstract Syntax Tree) 및 정규식 기반의 다단계 정제 프로세스를 거쳐 이 문제를 해결합니다.
- 링크 및 이미지 필터링: 링크의 앵커 텍스트(
[앵커 텍스트])는 단어 계산을 위해 유지하고, 이동 URL((https://...))과 이미지 마크업()은 제거하여 웹 주소로 인한 단어수 부풀림을 방지합니다. - 서식 토큰 제거: 제목 해시 기호(
#,##), 강조 표시(*,_,**,__), 취소선(~~), 인용구 기호(>)를 토큰화 이전에 자동으로 정제합니다. - 코드 블록 분리 처리: 코드 블록(
js ...)과 인라인 코드를 별도로 분류하여, 코드 구문이 읽기 메트릭을 왜곡하지 않도록 순수 본문 텍스트만 정확히 측정합니다. - 문장 및 단락 토큰화: 언어 인식 정규식 패턴을 사용하여 약어, 소수점, 글머리 기호 경계를 올바르게 처리하면서 문장 경계를 구별합니다.
Utiliome은 마크다운 문법에서 순수 본문만을 분리하여 현대 콘텐츠 제작 워크플로우에 최적화된 신뢰할 수 있는 데이터를 제공합니다.