Jak składnia Markdown wpływa na liczbę słów i dokładność statystyk tekstu
Problem tradycyjnych liczników słów z formatem Markdown
Podczas pisania w Markdownie Twój dokument wypełnia się składnią strukturalną, która nie stanowi części publikowanej prozy. Tradycyjne narzędzia do zliczania słów dzielą tekst bezmyślnie według spacji lub interpunkcji, nie rozumiejąc języków znaczników. W efekcie symbole takie jak # dla nagłówków, ** dla pogrubienia, > dla cytatów, grawisy (`) dla fragmentów kodu oraz ciągi URL w linkach ([tekst kotwicy](https://example.com)) są zaliczane jako słowa lub zawyżają liczbę znaków.
Dla autorów dokumentacji technicznej, blogerów i dziennikarzy to zniekształcenie stwarza poważne problemy przy dopasowywaniu tekstu do limitów wydawców. Samouczek techniczny o długości 2000 słów może zostać oceniony przez zwykły licznik na 2400 słów tylko z powodu wstawionych fragmentów kodu i długich adresów URL.
Jak Utiliome oblicza dokładne metryki Markdown
Utiliome rozwiązuje ten problem poprzez zastosowanie wieloetapowego procesu oczyszczania AST (Abstract Syntax Tree) oraz wyrażeń regularnych przed analizą tekstu:
- Filtrowanie linków i obrazów: Tekst kotwicy (
[tekst kotwicy]) jest zachowywany do zliczania słów, natomiast docelowe adresy URL ((https://...)) i znaczniki obrazów () są usuwane. - Usuwanie znaczników formatowania: Znaki
#w nagłówkach, gwiazdki i podkreślenia (*,_,**,__), tyldy przekreślenia (~~) oraz przedrostki cytatów (>) są usuwane przed tokenizacją tekstu. - Obsługa bloków kodu: Wcięte bloki kodu (
js ...) i elementy kodu wstawiane w tekst są kategoryzowane osobno, co pozwala na dokładny pomiar prozy bez zaburzania metryk czytania przez składnię kodu. - Tokenizacja zdań i akapitów: Tekst jest analizowany przy użyciu wzorców regex rozpoznających granice zdań w danym języku, poprawnie obsługując skróty, liczby dziesiętne i listy wypunktowane.
Dzięki oddzieleniu czystego tekstu od znaczników Markdown, Utiliome dostarcza dokładne i niezawodne dane dostosowane do nowoczesnych procesów tworzenia treści.