ГлавнаяИнструментыТекст и картинкиТекст и редактураАнализ текста: тошнота и водность

Анализ текста: тошнота и водность

Проверка текста на заспамленность и тошноту: классическая и академическая тошнота (она же заспамленность), водность (доля стоп-слов), символы, слова и частотность ключей. Помогает не переспамить и не «лить воду».

Символов (с пробелами)
0
Слов
0
Уникальных слов
0
Водность
0%
Тошнота классич.
0
Тошнота академ. (заспамленность)
0%
Частотность ключевых слов (топ-15, без стоп-слов)

Показатели и нормы

Анализ текста считает показатели, по которым оценивают переспам: классическую тошноту, корень из числа повторов самого частого слова, академическую тошноту, долю самого частого слова в тексте, водность как долю стоп-слов, а также символы, слова, уникальные слова и частотность ключей с процентами. Таблица частот показывает, какое слово тянет показатель вверх.

Нормы, на которые смотрят SEO-специалисты: классическая тошнота до 7, академическая 5–9 %, водность до 60 %. Значения выше не значат «фильтр», но переспамленный текст читается хуже, и поисковые системы с 2017 года ранжируют его ниже.

Джордж Кингсли Ципф
Джордж Ципф: самое частое слово в любом тексте встречается вдвое чаще второго. Фото: Чугайстыр, CC BY-SA 4.0.
ПоказательКак считаетсяНормаО чём говорит
Классическая тошнота√ повторов самого частого словадо 7Переспам одним словом
Академическая тошнотадоля самого частого слова5–9 %Плотность ключа
Водностьдоля стоп-словдо 60 %Предлоги, союзы, вводные
Частотность ключавхождения / слова2–4 %Естественность для темы

История частотного анализа

Джордж Ципф в 1930-е показал, что частоты слов в любом тексте подчиняются одному закону: второе по частоте слово встречается вдвое реже первого, третье втрое, и отклонение от этой кривой выдаёт искусственный текст. Ганс Лун в 1958 году построил на частотах первый автоматический реферат, а Карен Спарк Джонс в 1972-м придумала TF-IDF, взвешивание слов по редкости, которое до сих пор лежит в основе поиска.

«Тошнота» и «водность» пришли из русского SEO конца 2000-х: биржи контента ввели их как нормы для копирайтеров, когда тексты набивали ключами ради позиций. Google Panda 2011 года и «Баден-Баден» Яндекса 2017-го стали понижать переспамленные страницы, и показатели превратились из цели в предохранитель. Инструмент считает их по тем же формулам, чтобы текст оставался естественным.

Фишки с буквами
Частотность слов считается по тем же законам, что и частота букв в языке. Фото: Taro Taylor, CC BY 2.0.
Перфокарта
Первые частотные словари составляли на перфокартах: каждое слово — карта. Фото: Harke, CC BY-SA 3.0.

Как снижать тошноту

Вставьте текст и смотрите показатели с таблицей частот: если классическая тошнота выше 7, самое частое слово повторяется слишком много раз, замените часть вхождений синонимами или местоимениями. Водность выше 60 % означает, что предлогов и вводных слов больше, чем смысла: режьте связки. Ключи проверяйте по проценту: число вхождений без длины текста ничего не говорит.

Показатели зависят от длины: на 200 словах они шумят, считайте от 500. Лишние вводные слова и штампы по списку находит Чистовик, список стоп-слов для чистки семантики даёт инструмент стоп-слов, а словоформы к одной основе приводит лемматизация.

Показателей4 плюс частоты
Классическая тошнотадо 7
Академическая5–9 %
Водностьдо 60 %
Закон Ципфа1930-е
TF-IDF1972
Panda2011
«Баден-Баден»2017
Плитка инструментаЧто попадает в счётНа демо-тексте
Символов (с пробелами)все знаки поля вместе с пробелами и переносами строк270
Словцепочки букв и цифр; знаки препинания и тире словами не считаются37
Водностьдоля стоп-слов от всех слов, список встроенный — 153 служебных слова24 %
Тошнота классическаякорень из числа повторов самого частого слова2
Тошнота академическаядоля самого частого слова от всех слов10,8 %
Частотность, топ-15слова без стоп-слов и без слов короче трёх букв«натяжные» и «потолки» по 4
Правый столбец — демо-текст про натяжные потолки, он подставляется кнопкой «Демо-текст». Текст короткий, 37 слов: классическая тошнота держится низкой, академическая при тех же четырёх повторах выходит высокой. Ровно поэтому показатели считают от 500 слов.

Пример: вход → результат

Вход
Купить пластиковые окна в Москве недорого. Пластиковые окна от производителя. Окна пластиковые с установкой. Заказать окна.
Результат
Классическая тошнота: 3.16
Академическая: 28%
Водность: 21%
Частые слова: окна ×4, пластиковые ×3

Видно переспам по «окна» и «пластиковые» — текст переоптимизирован, риск фильтра. Ориентир: классическая тошнота ≤ 3, вода 15–30%.

Когда пригодится

Что означают показатели и какие значения нормальны

Цифры анализа полезны как сигнал. Оценкой качества они не служат. Текст с идеальными показателями легко может быть бесполезным, и наоборот. Смотреть на них стоит в двух случаях: когда текст писали под ключевые слова и когда его писал кто-то другой, а вам нужно быстро понять качество.

Показатели и ориентиры
Ориентиры собирательные: у юридического текста и у карточки товара нормы разойдутся
ПоказательЧто означаетОриентирО чём говорит отклонение
ОбъёмЗнаки с пробелами и безРешает задача, число вторичноСравнивайте с тем, что уже в топе по запросу
ВодностьДоля слов без смысловой нагрузкидо 15% (Text.ru)Высокая водность — признак разгона вокруг темы
Классическая тошнотаКорень из числа повторов самого частого словаСвоей нормы нетРастёт от повторов одного слова подряд
Академическая тошнотаДоля повторов ко всему объёму5–15% (Advego)Выше — текст перенасыщен ключами
Частотные словаТоп повторяющихся словСмотреть глазамиЕсли в топе служебные слова, текст размыт
Стоп-словаПредлоги, союзы, местоименияНорма 30–50%Полное отсутствие делает текст неестественным
Главное про тошноту. Поисковые системы не считают этот показатель — его придумали сервисы проверки текстов. Пользу он несёт косвенную: высокая тошнота почти всегда означает, что автор вставлял ключ через силу, и это видно читателю. Гнаться за конкретной цифрой смысла нет, достаточно убрать повторы, которые режут глаз.

Как пользоваться цифрами, чтобы стало лучше

1
Прочитайте частотный список первымОн показывает, о чём текст на самом деле. Если в верхних строках служебные слова и вода, тема не раскрыта, сколько бы знаков ни было.
2
Найдите повторы, которые заметны при чтенииОриентируйтесь на слух: одно и то же слово трижды в абзаце читатель замечает, а показатель тошноты при этом может остаться в норме.
3
Сверьте объём с конкурентамиПолезнее абсолютных цифр: если в топе по запросу тексты втрое длиннее, вы, скорее всего, не закрыли часть подтем.
4
Правьте смысл, показатели подтянутсяЗамена слова на синоним ради цифры ничего не улучшает. Работает другое: убрать абзац ни о чём и добавить пример или число.

Откуда взялись нормы тошноты

Числа, которые кочуют по статьям — «классическая до 7», «академическая 4–9%», «минимум 2,64» — на сайте Advego отсутствуют. Ноль вхождений по всем страницам раздела «SEO-анализ текстов» и по лендингу сервиса. Вот что сервисы пишут о своих показателях сами.

Что сервисы называют нормой
Шкалы разных сервисов между собой не переводятся: они считают разное
СервисПоказательНорма по словам сервиса
AdvegoКлассическая тошнотаРекомендуемого значения нет
AdvegoАкадемическая тошнота5–15%
AdvegoВода55–75%
Text.ruВодностьДо 15% — норма, 15–30% — повышенная, от 30% — высокая
Text.ruЗаспамленностьДо 30% — норма, 30–60% — повышенная, от 60% — высокая
MiratextТошнотаДо 3,5
MiratextВодянистостьМеньше 10

Справка Advego про классическую тошноту говорит прямо: «У показателя классической тошноты нет какого-то рекомендуемого значения, поскольку она отражает лишь абсолютное значение частостности слова в тексте без привязки к объему текста». Там же уточнение — показатель годится для сравнения текстов примерно одного объёма.

Причина в природе показателя: он абсолютный и объёма текста не знает. Справка тут же разбирает это на числах — классическая тошнота 3 в тексте на 1000 знаков означает, что 9 слов из 150 — формы одного слова, то есть плотность 6%; та же тройка в тексте на 10 000 знаков даёт плотность 0,6%. Отсюда и практический ориентир на лендинге сервиса: «для 20 000 знаков тошнота, равная 5, будет нормальной, а для 1000 знаков — слишком высокой». Сравнивать по этому показателю имеет смысл тексты примерно одного размера.

У Text.ru показателя «тошнота» нет вовсе: слово не встречается на странице сервиса ни разу. Там водность и заспамленность, каждая со своей шкалой. Перенести цифру из Advego в Text.ru не получится, и наглядно это видно по воде: у Advego нормой считается 55–75%, у Text.ru — до 15%. Показатель называется похоже, формула за ним стоит разная.

Ещё одна ловушка — падежи. Классическая тошнота считает вхождения слова во всех формах, поэтому замена «продвижение» на «продвижения» показатель не двигает: в справке Advego сказано, что понизить его получится только заменой слова другим. В академической тошноте вдобавок не участвуют стоп-слова, так что чистка предлогов и союзов на неё тоже не влияет.

Объём текстаСлов примерноПовторов частого словаКлассическая тошнотаДоля слова в тексте
1 000 знаков150936 %
10 000 знаков1 500930,6 %
1 000 знаков15025516,7 %
20 000 знаков3 0002550,8 %
Первые две строки — пример из справки Advego, две нижние досчитаны по той же формуле: показатель равен корню из числа повторов, длина текста в него не входит. Поэтому пятёрка на 20 000 знаков нормальна; на 1 000 знаков та же пятёрка означает, что каждое шестое слово в тексте одно и то же.

Учитывают ли тошноту Яндекс и Google

Слово «тошнота» не встречается ни в справке Яндекс Вебмастера, ни в правилах Google в отношении спама — ноль вхождений на профильных страницах обоих поисковиков. Показатель придумали сервисы анализа текста, внутри поиска его не существует.

Про переспам поисковики пишут словами. У Яндекса это документ «Использование SEO-текстов» в разделе справки «Безопасность и нарушения на сайтах» и алгоритм «Баден-Баден», анонсированный 23 марта 2017 года; вторым постом, 7 апреля 2017, нарушение распространили на уровень всего сайта. У Google это раздел «Использование избыточного количества ключевых слов» в правилах в отношении спама: там примеры без единого числа.

Практический вывод простой. Тошнота работает как датчик: цифра подскочила — перечитайте абзац, скорее всего, ключ там вставлен через силу. Целью её ставить бессмысленно, потому что снижается она подбором синонимов, а оценивает текст живой читатель.

Что видно в анализеЧто за этим обычно стоитЧто править в тексте
Классическая тошнота подскочилаодно слово повторяется в соседних предложенияхчасть вхождений заменить местоимением или синонимом
Академическая выросла вместе с классическойключ вставлен в каждый абзац по шаблонуоставить его там, где он читается; остальные абзацы переписать
Водность выше 60 %абзацы разогнаны вводными словами и связкамиубрать связки, добавить число, срок или название
В верхних строках частот служебные словатема раскрыта слабо, текст ходит вокруг неёдобавить конкретику: цены, сроки, примеры
Показатели в норме, читать тяжелоправили цифру, смысл при этом не трогаливернуться к структуре и примерам
Тошнота работает как датчик: цифра сдвинулась — перечитайте абзац. Обратный ход, подгонка текста под число, двигает показатель и оставляет текст прежним.

Что дальше

Частотность и тошнота показывают, как текст устроен, а вот опечатки в нём остаются незаметными: их найдёт проверка текста на ошибки — с вариантами замены и правкой типографики одной кнопкой.

Как пользоваться

  1. Скопируйте текст статьи или описания в поле.
  2. Символы, слова, тошнота, водность считаются сразу.
  3. Если слово встречается слишком часто — снизьте плотность, чтобы не было переспама.

Частые вопросы

Что такое тошнота текста?

Показатель плотности повторов. Классическая тошнота ≈ √(число повторов самого частого слова). Академическая — доля самого частого слова от всех слов. Высокая тошнота = риск переспама.

Что такое водность?

Доля «воды» — стоп-слов (предлоги, союзы, местоимения), которые не несут смысла. Норма обычно 30–60%; сильно выше — текст «разбавлен».

Что такое заспамленность текста и как её убрать?

Заспамленность — доля повторов ключевого слова от всего текста, в сервисах вроде text.ru и Advego её считают в процентах. В нашем анализе это «тошнота академическая»: показатель тот же, название разное. Норма — до 8–10%, выше 12% поисковик читает как переспам. Убирается заменой повторов на синонимы и местоимения, переформулировкой предложений и удалением фраз, где ключ вставлен без смысла.

Какая норма академической тошноты?

Advego на своём лендинге называет 5–15%. У классической тошноты справка того же сервиса нормы не даёт вовсе: показатель зависит от объёма и годится для сравнения текстов примерно одного размера. У Miratext своя шкала — тошнота до 3,5, водянистость меньше 10. Числа «2,64» и «максимум 7», которые ходят по статьям, в источниках Advego отсутствуют.

Учитывает ли Яндекс тошноту текста?

Слова «тошнота» в справке Яндекс Вебмастера нет ни разу. Про переспам Яндекс пишет в документе «Использование SEO-текстов» и в постах про алгоритм «Баден-Баден» от 23 марта 2017 года, числовых порогов там не приводится. У Google то же самое: раздел про избыточное количество ключевых слов даёт качественные примеры без цифр.

Почему тошнота не падает, когда меняешь падеж слова?

Классическая тошнота считает вхождения во всех падежах. В справке Advego это сказано прямо: понизить показатель сменой формы слова невозможно, помогает только замена слова другим. В академической тошноте вдобавок не участвуют стоп-слова, поэтому чистка предлогов и союзов её не двигает.

Почему в Text.ru нет тошноты?

Сервис использует другие метрики: водность (до 15% — норма) и заспамленность (до 30% — норма), каждая со своей шкалой. Слово «тошнота» на его странице не встречается. Привычную цифру из Advego перенести не выйдет: показатели считают разное — у Advego нормой воды считается 55–75%, у Text.ru до 15%.

Где этому учат

Что на самом деле показывают эти цифры

Тошнота, водность и заспамленность — метрики сервисов проверки текста. Поисковые системы их не считают. Они считают повторы: сколько раз в тексте встретилось самое частое слово и какую долю занимают слова без смысловой нагрузки. Это полезный сигнал о том, что автор перестарался с ключом, и ничего больше: качество текста цифра не измеряет.

Выше на странице собраны нормы каждого сервиса с их собственных страниц и то, что о переспаме пишут сами поисковики. Разница принципиальная: у сервисов есть числа, у поисковиков — описания и примеры.

График закона Ципфа для тридцати языковых разделов Википедии
Частота слова падает по одному и тому же закону в тридцати языках: несколько слов встречаются постоянно, хвост — почти никогда. Викисклад, SergioJimenez, CC BY-SA 4.0.
Облако слов, где размер зависит от частоты
Облако слов — та же частотность, показанная размером. Разница между верхом и хвостом видна сразу. Викисклад, Ashashyou, CC BY-SA 4.0.

Шесть фактов про тошноту и воду

В справках поисковиков тошноты нет

Слово «тошнота» не встречается ни в справке Яндекс Вебмастера, ни в правилах Google в отношении спама. Показатель придумали сервисы анализа текста, внутри поиска его не существует.

Переспам поисковики описывают словами

У Яндекса это документ «Использование SEO-текстов» и алгоритм «Баден-Баден», анонсированный 23 марта 2017 года; 7 апреля того же года нарушение распространили на уровень всего сайта. У Google — раздел про избыточные ключевые слова, там примеры без единого числа.

Шкалы сервисов между собой не переводятся

Advego считает академическую тошноту и норму называет 5–15 %, Text.ru считает заспамленность и нормой зовёт до 30 %. Это разные формулы: переносить порог из одного сервиса в другой бессмысленно.

Классическая тошнота — это корень

Из числа повторов самого частого слова берут квадратный корень. Поэтому она почти не зависит от объёма: у заметки на тысячу знаков и у лонгрида значения окажутся близкими, а сравнивать их нужно с текстами из топа.

Водность считают по списку стоп-слов

Предлоги, союзы, местоимения и вводные слова у каждого сервиса свои, поэтому один и тот же текст даёт разный процент воды. Полезнее открыть список и посмотреть, какие именно слова туда попали.

Частотность всегда с длинным хвостом

В любом языке несколько слов занимают заметную долю текста, а большинство встречается один-два раза. Поэтому верх списка частотности почти всегда состоит из служебных слов, и смотреть надо на первые знаменательные.

Почему частотность считают по леммам

«Купить», «куплю» и «покупка» для читателя одно слово, а для счётчика три разных. Поэтому серьёзные разборы приводят слова к начальной форме — лемме — и только потом считают. Иначе ключ, склоняемый по падежам, разъезжается по списку и выглядит редким, хотя занимает половину текста.

Обратная сторона тоже есть: после приведения к леммам одинаковыми становятся формы, которые по смыслу разошлись. Поэтому итоговый список частот стоит читать глазами: это подсказка, а приговор выносит редактор.

Размеченный корпус текста с леммами и связями
Размеченный корпус: у каждого слова проставлена лемма. Частотность считают по начальным формам, написание при этом игнорируется. Викисклад, Derise, CC BY-SA 4.0.

Похожие инструменты

Чистовик: вода и штампы

Оценка информационного стиля и читаемости от 0 до 10. Подсвечивает канцелярит, усилители и пассив прямо в тексте и объясняет каждую находку.

Открыть
Чистка по стоп-словам

Удалить или оставить фразы со стоп-словами. Чистка семантического ядра от мусора.

Открыть
Лемматизация и нормализация

Приводит ключи к основе (стемминг) и схлопывает словоформы. Умный дедуп семантики: ловит дубли по падежам, числу и порядку слов.

Открыть
Проверить текст на ошибки

Орфография по словарю с вариантами замены, повторы, пробелы, дефис вместо тире и прямые кавычки. Отдельно ловит латиницу внутри русского слова — ошибку после копипаста.

Открыть
Склонение ФИО по падежам

Фамилия, имя и отчество по шести падежам с автоопределением пола, инициалы и обработка списка ФИО целиком. Правила зашиты в страницу, без обращения к сервисам.

Открыть
Шифр Цезаря

Сдвиг по алфавиту для кириллицы и латиницы, автоподбор ключа по частотности букв, таблица всех сдвигов, ROT13 и ROT47.

Открыть

Как применять это в продвижении — в разборе SEO-копирайтинг и других материалах блога.

Ещё инструменты для текста

Проверка орфографии, анализ на воду и тошноту, счётчик символов, сравнение двух текстов, типографор, регистр и замены — в разделе 46 инструментов.

Сервисы, о которых здесь речь

Что это за инструменты, кому подходят, что доступно без оплаты и чем их заменить.

Весь раздел: Панели вебмастера.