ГлавнаяБлогПроверка текста на нейросеть

Как понять, что текст написан нейросетью: 9 признаков

2 августа 20269 минИИ и контент

Проверка «на ИИ» и проверка на уникальность отвечают на разные вопросы, и путать их дорого. Разбираю девять признаков, по которым машинный текст узнают без всяких сервисов, показываю на цифрах, где проходит граница между живым и сгенерированным, и объясняю, почему ни один детектор не годится в качестве доказательства.

Коротко
  • Уникальность и машинность — разные вещи: сгенерированный текст почти всегда уникален на 95–100%.
  • Признаков девять: шесть видны в тексте (штампы, связки, антитеза «не X, а Y», усилители, обобщения, тройки), три считаются по структуре.
  • Главный структурный признак — ровность длины фраз: у живых текстов разброс выше 0,5, у машинных падает до 0,3.
  • OpenAI закрыла собственный детектор ИИ в июле 2023 года из-за низкой точности. Обвинять автора по проценту нельзя.
  • Поиск наказывает не за способ создания, а за пустоту. Высокий процент — сигнал переписать, а не ждать фильтра.

Чем проверка на нейросеть отличается от проверки на уникальность

Эти две проверки отвечают на разные вопросы, и путаница между ними стоит людям нервов. Уникальность ищет совпадения: брали ли этот кусок с чужой страницы. Проверка на нейросеть смотрит на манеру письма и не сравнивает текст ни с чем внешним.

Отсюда парадокс, с которым сталкивается каждый, кто первый раз прогоняет машинный текст через антиплагиат. Сгенерированная статья почти всегда показывает 95–100% уникальности. Модель не копирует абзацы, она собирает фразу заново из вероятностей — совпадать буквально ей не с чем. Формально придраться не к чему, а читать невозможно.

Обратный случай встречается не реже. Ваш собственный текст про типовую услугу покажет 70% уникальности просто потому, что «замена масла за 40 минут» пишется примерно одинаково у всех автосервисов страны. Живой, полезный, написанный руками — и низкая уникальность.

Поэтому две проверки не заменяют друг друга. Уникальность отвечает «откуда взят текст», проверка на нейросеть — «как он написан».

Девять признаков машинного текста

Нейросеть выдаёт себя не отдельным словом. Любой из признаков ниже встречается и у людей, узнаваемым текст делает их плотность и сочетание. Шесть признаков видны глазом, три считаются по структуре и глазом не ловятся.

Штампы вступления и вывода
«В современном мире продвижение играет ключевую роль… Подводя итог, можно с уверенностью сказать…»
Модель обучена открывать и закрывать абзац красиво. Один и тот же десяток связок кочует из текста в текст независимо от темы.
Связки в начале предложения
«Однако… Более того… Кроме того… Таким образом…»
Одна связка — норма живой речи. Четыре абзаца подряд, открывающиеся связкой, дают механический ритм, который слышно даже при беглом чтении.
Антитеза «не X, а Y»
«Это не просто инструмент, а полноценный помощник»
Самый заметный оборот современных моделей. Человек строит такую конструкцию изредка и ради акцента, нейросеть — через абзац и без повода.
Оценка вместо факта
«значительно повышает эффективность, поистине уникальное решение»
Усилитель стоит ровно там, где у живого автора была бы цифра. Модель не знает, на сколько именно повышает, и заполняет пустоту наречием.
Обобщения без содержания
«различные аспекты, целый ряд преимуществ, те или иные факторы»
Формулировка подходит любой теме и потому не сообщает ничего. Проверяется подстановкой: если фразу можно перенести в статью про другой бизнес без правок, она пустая.
Тройки перечислений
«быстро, качественно и надёжно»
Модель тяготеет к ритму из трёх однородных членов. В живой речи их бывает два, четыре, сколько попалось под руку.

Три структурных признака подсветить нельзя, они считаются по всему тексту:

  • Ровность длины фраз. У человека предложения скачут: три слова, потом двадцать восемь. Нейросеть держит длину около среднего. Формально это коэффициент вариации — разброс, делённый на среднее. У живых текстов он обычно выше 0,5, у машинных падает до 0,3 и ниже.
  • Доля конкретики. Сколько предложений содержат цифру, дату, название или имя. Фактов у модели нет, она пересказывает общее место, поэтому конкретика проваливается до единиц процентов.
  • Плотность длинного тире. Модели ставят «—» заметно чаще пишущих людей, особенно в пояснительных вставках.

Все девять признаков считает проверка текста на нейросеть: первые шесть подсвечивает прямо в тексте, последние три показывает цифрами в правой колонке.

Почему детекторам ИИ нельзя верить на слово

Соблазн получить машинный вердикт «писал робот» велик, но точность у таких инструментов принципиально ограничена, и это признают сами разработчики моделей.

В январе 2023 года OpenAI выпустила собственный классификатор AI Text Classifier — сервис, определяющий, написан ли текст их же моделью. В июле 2023 года компания его закрыла, прямо указав причиной низкую точность. Организация, у которой был полный доступ к обучающим данным GPT, не смогла надёжно отличить его вывод от человеческого письма.

Вторая проблема серьёзнее ложных срабатываний вообще: они распределены неравномерно. Исследование Стэнфордского университета 2023 года (Лян и соавторы, «GPT detectors are biased against non-native English writers») показало, что англоязычные детекторы систематически принимали за машинные тексты людей, для которых английский неродной. Причина ровно та, что описана выше: авторы, пишущие на неродном языке, используют более простой словарь и более ровные конструкции — то есть внешне выглядят как модель.

Для русского языка масштабных публичных исследований такого рода нет, но механизм тот же. Под подозрение попадает любой, кто пишет просто и ровно: технический писатель, юрист, переводчик, школьник.

Практический вывод: процент любого детектора — повод перечитать текст, а не повод обвинить автора. Требовать «понизить процент ИИ» от исполнителя так же осмысленно, как требовать понизить температуру за окном.

Что показал прогон по живым и сгенерированным текстам

Чтобы понимать, что показывает шкала, я прогнал через инструмент собственные материалы этого сайта — они написаны руками — и сгенерированные тексты. Прогон делался на одном и том же алгоритме, никакой подгонки под результат.

Текст Признаков Разброс фраз Конкретика
Сгенерированный текст про кофейни81%0,310%
Сгенерированный текст про SEO84%0,2125%
Как собрать семантическое ядро11%0,7151%
Почему SEO не конвертит8%0,5330%
Накрутка поведенческих факторов4%0,5548%
Политика конфиденциальности сайта2%1,2374%
Прогон 2 августа 2026 года. Разброс фраз — коэффициент вариации длины предложений, конкретика — доля предложений с цифрой или названием.

Две вещи, которые видно из таблицы. Первая: разрыв между машинным и живым текстом идёт не по одному показателю, а по всем сразу — у генерации ровные фразы и пустая конкретика одновременно. Вторая, менее ожидаемая: самый «человеческий» результат показала политика конфиденциальности, документ сухой и формальный. Юридический язык неровный и набит конкретикой — датами, номерами, названиями. Формальность и машинность оказались разными вещами.

Что на самом деле думают Яндекс и Google про тексты нейросетей

Здесь много мифологии, поэтому по фактам.

Google сформулировал позицию в феврале 2023 года в документе о контенте, созданном ИИ: способ производства сам по себе не нарушает правила, значение имеет качество и польза. Нарушением остаётся массовая автогенерация ради манипуляции выдачей — это тот же спам, что и раньше, независимо от того, чем его произвели.

Яндекс отдельного публичного документа именно про нейросети не выпускал, но его правила про автоматически сгенерированные страницы существуют давно и работают ровно так же: под санкции идёт бессодержательный текст, сделанный ради объёма. Подробнее разбирал это в заметке про нейротексты и SEO — там же про то, почему у поисковика с собственной генеративной моделью есть свой интерес в этом вопросе.

Практический смысл такой. Никто не ищет в вашем тексте отпечатки GPT, чтобы наказать за сам факт. Наказывают за пустоту, а пустота у машинного текста просто встречается чаще, потому что генерация дёшева и её делают тоннами. Поэтому высокий процент признаков — сигнал не «сейчас прилетит фильтр», а «этот текст ничего не сообщает читателю».

Как править машинный черновик за пятнадцать минут

Машинный черновик — рабочий материал, если понимать, что именно в нём править. Порядок действий, который у меня занимает минут пятнадцать на статью.

  1. Выкинуть первый и последний абзац целиком. Вступление «в современном мире» и вывод «подводя итог» почти никогда не несут информации. Статья от их удаления только выигрывает.
  2. Заменить усилители цифрами. Каждое «значительно» и «существенно» — место, где нужен факт. Нет факта — предложение удаляется, а не смягчается.
  3. Разбить ритм. Найти три подряд идущих предложения одинаковой длины и переписать среднее — укоротить до реплики или срастить с соседним.
  4. Убрать связки в началах. «Однако», «кроме того», «таким образом» в первом слове абзаца вычёркиваются почти без потерь для смысла.
  5. Добавить то, чего у модели нет. Свой случай, цифру из своего проекта, возражение клиента, ошибку, которую сами допустили. Один абзац личного опыта делает для текста больше, чем вся остальная правка.
Один абзац до и после правки
Было — сгенерировано
«Важно отметить, что скорость загрузки играет ключевую роль в продвижении сайта. Современные исследования показывают, что медленные сайты значительно теряют в конверсии. Таким образом, оптимизация скорости является неотъемлемой частью работы над проектом.»
Стало — переписано
«Порог, за которым Google считает загрузку медленной, — 2,5 секунды до отрисовки главного элемента. Это метрика LCP из Core Web Vitals, её видно в PageSpeed Insights и в Search Console. Если у вас там 4 секунды, заниматься текстами рано.»
Процента здесь нет намеренно: в обоих фрагментах меньше 40 слов, а на таком объёме структурные признаки не считаются — инструмент в этом случае отказывается ставить оценку. Разница видна и без цифры: в первом фрагменте нет ни одного факта, во втором — порог, название метрики и два места, где её посмотреть.

Если после правки хочется свериться, прогоните текст через проверку ещё раз, а следом через «Чистовик» — он ловит другое, воду и канцелярит, и эти два списка правок почти не пересекаются.

Частые вопросы

Как проверить текст на нейросеть онлайн бесплатно?
Вставьте текст в инструмент проверки — он подсветит характерные обороты и посчитает долю признаков. Без регистрации и лимитов, текст обрабатывается в браузере и никуда не отправляется. Проверка занимает секунду и не требует установки.
Можно ли проверить текст на плагиат и нейросеть одновременно?
Одним инструментом — нет, это разные проверки по разным принципам. Плагиат ищет совпадения с чужими страницами и требует обращения к поисковой базе. Проверка на нейросеть анализирует стиль и обходится без интернета. Прогонять стоит обе: текст бывает уникальным и машинным одновременно, и наоборот.
Проверка на оригинальность и на нейросеть — это одно и то же?
Нет. Оригинальность отвечает на вопрос «встречался ли этот текст раньше», проверка на нейросеть — «как он написан». Сгенерированная статья обычно показывает 95–100% оригинальности, потому что модель не копирует, а собирает фразу заново.
Понижает ли Яндекс сайт за тексты от нейросети?
За сам факт генерации — нет. Санкции прилетают за бессодержательные страницы, сделанные ради объёма, и это правило существовало задолго до нейросетей. Google в 2023 году сформулировал то же прямо: значение имеет качество, а не способ производства. Подробнее — в заметке про нейротексты и SEO.
Какой процент считается нормальным?
Ниже 25% — текст читается как живой. От 25 до 50% — обычная картина для человека, пишущего по шаблону, или для машинного черновика после правки. Выше 50% стоит переписать независимо от авторства: такой текст мало что сообщает читателю.
Почему мой собственный текст показал высокий процент?
Скорее всего, он написан ровно и без конкретики — так пишут в официальных документах, описаниях услуг и учебных работах. Детектор реагирует на шаблонность, а не на происхождение. Добавьте цифры и разбейте однообразный ритм предложений: процент упадёт, а текст станет лучше читаться.
Можно ли обмануть проверку?
Легко, и это главный аргумент против использования таких инструментов в качестве доказательства. Достаточно вычистить штампы, добавить фактов и разогнать длину предложений — то есть просто хорошо отредактировать текст. Результат такой правки перестаёт быть машинным по существу, а не только по формальным признакам.

Главное

Если коротко

Машинный текст узнают не по одному слову, а по сочетанию: дежурные обороты, ровные предложения, отсутствие фактов. Ни один детектор не даёт доказательства авторства, и относиться к проценту стоит как к редакторской подсказке. Поиск при этом наказывает не за нейросеть, а за пустоту — поэтому правка машинного черновика сводится к простому: убрать штампы и добавить то, чего у модели нет, — свои цифры и свой опыт.

Прогнать текст можно прямо сейчас — проверка текста на нейросеть работает в браузере, бесплатно и без регистрации. Нужен разбор контента на сайте целиком — напишите мне.

Больше разборов в Telegram — «Digital-трафик»

Читать дальше

Все статьи
Ссылка скопирована