Проверка текста на нейросеть

Вставьте текст — инструмент подсветит обороты, по которым машинный текст обычно и узнают: штампы вступления, связки, антитезу «не X, а Y», оценки вместо фактов. Плюс посчитает три структурных признака, которые глазом не видны: ровность длины предложений, долю конкретики и плотность длинного тире.

Здесь появится разбор: подсветка оборотов, по которым машинный текст обычно и узнают.
Готово ✓
Признаков нейросети
%
Вставьте текст от 40 слов
Слов
0
Предложений
0
Ровность фраз
Конкретика

Это счётчик признаков. Доказательством он не служит. Инструмент не знает, кто писал текст. Он считает обороты и структурные перекосы, которые у нейросетей встречаются чаще, чем у людей. Высокий процент означает «текст выглядит шаблонно» — и живой автор, пишущий штампами, наберёт столько же. Обратное тоже верно: отредактированный машинный текст проходит проверку почти чисто. Использовать результат как основание для обвинения нельзя — ни один детектор ИИ, включая платные, не даёт такой точности.

Признаки машинного текста

Проверка подсвечивает в тексте обороты, по которым обычно узнают машинный текст: штампы вступления, связки «важно отметить», антитезу «не X, а Y», оценки вместо фактов, итоговые формулы. Рядом считаются три структурных признака, невидимых глазу: ровность длины предложений, доля связок и однообразие начал абзацев, и всё сводится в процент похожести на нейросеть с разбором по категориям.

Процент показывает плотность признаков, и только: человек, пишущий канцеляритом, наберёт много, а отредактированный машинный текст мало. Инструмент полезен как список мест, которые стоит переписать. Для выставления оценок он не годится.

Диалог с ChatGPT
Машинный текст узнаётся по ровному ритму и связкам: модель ставит их чаще, чем человек. Фото: Викисклад, общественное достояние.
ПризнакПримерПочему выдаёт
Штамп вступленияВ современном мире…Модель начинает с общего места
СвязкаВажно отметить, что…Заполняет паузу между мыслями
Антитезане просто X, а целый YЛюбимая фигура языковых моделей
Оценка вместо фактаэффективное решениеНет цифры, даты, имени
Ровные предложениявсе по 12–15 словЧеловек пишет рвано
Итоговая формулаВ заключение стоит сказать…Обязательный вывод

История детекторов

Языковые модели GPT-2 2019 года и GPT-3 2020-го уже писали связные тексты, но массовым машинный текст стал после выхода ChatGPT 30 ноября 2022 года. Через месяц студент Эдвард Тянь выпустил GPTZero, считавший «перплексию» и «взрывность», а OpenAI в январе 2023-го показала свой классификатор и в июле закрыла его: он ловил четверть машинных текстов и ошибочно помечал человеческие.

Точных детекторов нет до сих пор: модель, дообученная на живой речи, проходит любую проверку, а водяные знаки в тексте легко смываются перефразированием. Зато у машинного текста есть узнаваемые привычки, за которые его прозвали слопом, и редакторы к 2024 году составили списки оборотов. Инструмент проверяет по такому списку и по структуре, а решение оставляет читателю.

Серверная стойка в дата-центре
Языковая модель живёт в дата-центре; её текст приходит с одинаковым ритмом. Фото: Викисклад, CC0.
Рукопись с правкой
Редактура убирает признаки машинного текста так же, как штампы у человека. Фото: Phoebe, CC BY-SA 3.0.

Как читать процент

Вставьте текст и посмотрите процент с разбором: пройдите по подсвеченным оборотам и перепишите их фактами, разбейте ровные предложения, уберите связки и итоговую формулу. Пересчитайте после правки. На коротких текстах до 100 слов признаки не набираются, берите от трёх абзацев.

Не используйте процент как доказательство: он показывает стиль, а не авторство. Канцелярит и штампы независимо от происхождения текста ловит Чистовик, а два варианта текста до и после правки сравнивает сравнение текстов.

Оборотыпо списку, подсветка
Структурных признаков3
Результатпроцент с разбором
Данные на серверне уходят
ChatGPT30 ноября 2022
GPTZeroянварь 2023
Классификатор OpenAIзакрыт в июле 2023
Точных детекторовнет

По каким признакам инструмент узнаёт машинный текст

Одно слово ничего не доказывает. Узнаваемым текст делает сочетание: ровность плюс предсказуемость. Семь признаков подсвечиваются прямо в тексте, ещё три считаются по структуре.

Штампы вступления и вывода. «В современном мире», «важно отметить», «играет ключевую роль», «подводя итог». Модель обучена начинать и заканчивать абзац красиво, поэтому одни и те же связки кочуют из текста в текст.
Связки в начале предложения. «Однако», «Кроме того», «Более того», «Таким образом». Одна такая связка — норма живого текста. Пять подряд в четырёх абзацах — уже ритм генератора.
Антитеза «не X, а Y». Самый заметный оборот современных моделей: «это не просто инструмент, а полноценный помощник». Человек так пишет изредка, нейросеть — через абзац.
Оценка вместо факта. «Значительно повышает», «поистине уникальный», «максимально эффективный». Усилитель стоит там, где у живого автора была бы цифра.
Обобщения без содержания. «Различные аспекты», «целый ряд преимуществ», «те или иные факторы». Формулировка, которая подходит любой теме и потому не сообщает ничего.
Тройки перечислений. «Быстро, качественно и надёжно». Модель тяготеет к ритму из трёх однородных членов — в живой речи их бывает два, четыре, сколько попалось.
Прямые улики чат-бота. Служебные фразы вроде «надеюсь, это помогло» и «дайте мне знать», оговорки про предел знаний («по состоянию на моё последнее обучение»), остатки разметки Markdown (**жирный**, ## заголовок) и ссылки с меткой utm_source=chatgpt.com. Такое попадает в текст при копировании из чата. Служебные фразы, оговорки про предел знаний и UTM-метка — сигналы почти однозначные, поэтому вес у категории самый большой. С разметкой осторожнее: Markdown пишут и руками — в заметках, на GitHub, в мессенджерах, — так что сама по себе она значит меньше остальных улик.

Три структурных показателя подсветить нельзя, они считаются по всему тексту и влияют на итоговый процент:

  • Ровность фраз. У человека предложения скачут: три слова, потом двадцать восемь. Нейросеть держит длину около среднего. Инструмент считает разброс — чем он меньше, тем ровнее и подозрительнее.
  • Доля конкретики. Сколько предложений содержат цифру, дату, название или имя. Машинный текст абстрактен, потому что фактов у модели нет — она пересказывает общее место.
  • Плотность длинного тире. Модели ставят «—» заметно чаще, чем пишущие люди, особенно в пояснительных вставках.

Откуда взяты признаки

Категории опираются на эссе русской Википедии «Признаки сгенерированности текста» (ВП:ПРГЕН) — самую полную открытую таксономию машинного письма на русском. Её ведут редакторы, вручную отлавливающие сгенерированные статьи, и на неё ссылается правило о быстром удалении таких материалов. К каждому признаку там приложены живые примеры из отклонённых черновиков.

К энциклопедической рамке я добавил коммерческие штампы — «эффективное решение», «широкий спектр услуг», — на которых спотыкаются тексты для сайтов. Оговорка авторов эссе действует и здесь: это наблюдения. Запрещённых слов тут нет. Любой признак встречается у живых людей, и вывод делается по плотности, не по единичной находке.

Как читать процент

0–24% — признаков мало. Текст живой либо хорошо вычитанный. Отдельные штампы есть у всех, это норма.
25–49% — есть отдельные признаки. Обычная картина для текста, который писал человек по шаблону, или для машинного черновика после правки. Смотрите подсветку и решайте по жанру.
50–74% — признаков много. Штампы идут плотно, предложения ровные, фактов мало. Такой текст стоит переписать независимо от того, кто автор: читателю он ничего не сообщает.
75–100% — очень похоже на генерацию без правки. Сочетание всех признаков сразу. Для публикации такой текст брать нельзя: он пустой. Поисковые санкции тут ни при чём.

Польза инструмента — в подсветке. Цифра нужна только как повод присмотреться. Процент говорит «тут что-то не так», а выделенные обороты показывают, что именно править. Убрали штампы, добавили цифры, разогнали длину предложений — и текст стал лучше читаться, независимо от происхождения.

Эта проверка отвечает на вопрос «похоже на машину?». Дальше по кругу: «Чистовик» оценит информационный стиль и подсветит канцелярит, анализ текста покажет тошноту и заспамленность, типографика подготовит к публикации. Что поиск на самом деле думает про машинные тексты, разбираю в статье как проверить текст на нейросеть; про совпадения с чужими страницами — в материале про уникальность текста.

Что дальше

Признаки машинного текста — одно, обычные опечатки — другое: их разбирает проверка текста на ошибки, включая типографику и смешение алфавитов после копипаста.

Как пользоваться

На выходе — процент признаков и список того, что именно сработало. Проверка идёт в браузере, текст никуда не отправляется.

  1. Статью, описание услуги, пост или письмо — от 40 слов. Разбор появится сразу, кнопку жать не нужно.
  2. Он показывает, насколько плотно в тексте сошлись признаки машинного письма. Он оценивает шаблонность. Авторство таким способом не устанавливают.
  3. Наведите курсор на выделенный оборот — увидите, почему он попал под подозрение. Блок «Что сработало» собирает признаки по убыванию веса.
  4. Если тройки перечислений в вашем жанре уместны, нажмите на метку в легенде — подсветка снимется, процент пересчитается.

Частые вопросы

Как проверить текст на нейросеть онлайн бесплатно?

Вставьте текст в форму на этой странице — проверка запустится сама, без регистрации и лимитов. Инструмент подсветит обороты, характерные для машинного письма, и покажет долю признаков в процентах. Текст обрабатывается прямо в браузере и никуда не отправляется.

Насколько точна такая проверка?

Это счётчик признаков. Детектором авторства он не работает. Он измеряет шаблонность как есть: сколько в тексте дежурных оборотов, насколько ровные предложения, много ли конкретики. Живой автор, пишущий штампами, наберёт высокий процент, а отредактированный машинный текст — низкий. Ни один существующий детектор ИИ, включая платные, не даёт достоверного ответа на вопрос «кто это написал».

Можно ли использовать результат как доказательство?

Нет. Обвинять автора на основании процента нельзя — ошибка первого рода тут слишком вероятна. Известны случаи, когда детекторы принимали за машинный текст классическую прозу и работы носителей языка, пишущих просто и ровно. Инструмент полезен как редакторская подсказка: он показывает, какие места стоит переписать.

Чем это отличается от проверки на уникальность?

Уникальность отвечает на вопрос, встречался ли текст в интернете раньше, и ищет совпадения с чужими страницами. Здесь другое: текст может быть стопроцентно уникальным и при этом полностью машинным. Проверка на нейросеть смотрит на стиль. Совпадения с чужими страницами она не ищет.

Понижает ли поиск позиции за текст от нейросети?

Ни Яндекс, ни Google не наказывают за факт машинной генерации как таковой — обе системы прямо заявляли, что оценивают полезность; способ создания их не интересует. Санкции прилетают за другое: за массовый бессодержательный текст, сделанный ради объёма. Именно пустоту инструмент и ловит. Происхождение текста ему недоступно.

Почему подсвечивается слово «однако» — это же обычное слово?

Само по себе оно нормально. Признаком становится частота: когда четыре абзаца подряд открываются связкой, получается механический ритм. Поэтому связки подсвечиваются только в начале предложения, а их вес в общей оценке невелик — не больше двенадцати процентов из ста.

Что означает «ровность длины фраз»?

Это разброс числа слов в предложениях, статистический коэффициент вариации. У живого автора он обычно выше 0,5: короткая реплика соседствует с длинным периодом. Нейросеть держит длину около среднего, и разброс падает до 0,3 и ниже. Показатель виден в правой колонке.

Текст куда-то отправляется?

Нет. Всё работает прямо в браузере на JavaScript — введённые данные не уходят на сервер и нигде не сохраняются.

Где этому учат

Похожие инструменты

Чистовик: вода и штампы

Оценка информационного стиля и читаемости от 0 до 10. Подсвечивает канцелярит, усилители и пассив прямо в тексте и объясняет каждую находку.

Открыть
Сравнить два текста

Подсвечивает, что удалили и что добавили между двумя версиями текста, и считает процент совпадения. Режим по словам и по строкам.

Открыть
Анализ текста: тошнота

Классическая и академическая тошнота, водность, символы, слова и частотность ключей. Проверка SEO-текста перед публикацией.

Открыть
Типографор

Кавычки-ёлочки «», дефис → тире, неразрывные пробелы после предлогов, чистка двойных пробелов. Аккуратная типографика для сайта.

Открыть
Проверить текст на ошибки

Орфография по словарю с вариантами замены, повторы, пробелы, дефис вместо тире и прямые кавычки. Отдельно ловит латиницу внутри русского слова — ошибку после копипаста.

Открыть
Разбить текст на части

Делит длинный текст на куски нужной длины: Telegram 4096, подпись 1024, ВК 4000, description 160, SMS 70. Не рвёт слова и предложения.

Открыть

Ещё инструменты для текста

Проверка орфографии, анализ на воду и тошноту, счётчик символов, сравнение двух текстов, типографор, регистр и замены — в разделе 46 инструментов.