Проверка «на ИИ» и проверка на уникальность отвечают на разные вопросы, и путать их дорого. Разбираю девять признаков, по которым машинный текст узнают без всяких сервисов, показываю на цифрах, где проходит граница между живым и сгенерированным, и объясняю, почему ни один детектор не годится в качестве доказательства.
- Уникальность и машинность — разные вещи: сгенерированный текст почти всегда уникален на 95–100%.
- Признаков девять: шесть видны в тексте (штампы, связки, антитеза «не X, а Y», усилители, обобщения, тройки), три считаются по структуре.
- Главный структурный признак — ровность длины фраз: у живых текстов разброс выше 0,5, у машинных падает до 0,3.
- OpenAI закрыла собственный детектор ИИ в июле 2023 года из-за низкой точности. Обвинять автора по проценту нельзя.
- Поиск наказывает не за способ создания, а за пустоту. Высокий процент — сигнал переписать, а не ждать фильтра.
Чем проверка на нейросеть отличается от проверки на уникальность
Эти две проверки отвечают на разные вопросы, и путаница между ними стоит людям нервов. Уникальность ищет совпадения: брали ли этот кусок с чужой страницы. Проверка на нейросеть смотрит на манеру письма и не сравнивает текст ни с чем внешним.
Отсюда парадокс, с которым сталкивается каждый, кто первый раз прогоняет машинный текст через антиплагиат. Сгенерированная статья почти всегда показывает 95–100% уникальности. Модель не копирует абзацы, она собирает фразу заново из вероятностей — совпадать буквально ей не с чем. Формально придраться не к чему, а читать невозможно.
Обратный случай встречается не реже. Ваш собственный текст про типовую услугу покажет 70% уникальности просто потому, что «замена масла за 40 минут» пишется примерно одинаково у всех автосервисов страны. Живой, полезный, написанный руками — и низкая уникальность.
Поэтому две проверки не заменяют друг друга. Уникальность отвечает «откуда взят текст», проверка на нейросеть — «как он написан».
Девять признаков машинного текста
Нейросеть выдаёт себя не отдельным словом. Любой из признаков ниже встречается и у людей, узнаваемым текст делает их плотность и сочетание. Шесть признаков видны глазом, три считаются по структуре и глазом не ловятся.
Три структурных признака подсветить нельзя, они считаются по всему тексту:
- Ровность длины фраз. У человека предложения скачут: три слова, потом двадцать восемь. Нейросеть держит длину около среднего. Формально это коэффициент вариации — разброс, делённый на среднее. У живых текстов он обычно выше 0,5, у машинных падает до 0,3 и ниже.
- Доля конкретики. Сколько предложений содержат цифру, дату, название или имя. Фактов у модели нет, она пересказывает общее место, поэтому конкретика проваливается до единиц процентов.
- Плотность длинного тире. Модели ставят «—» заметно чаще пишущих людей, особенно в пояснительных вставках.
Все девять признаков считает проверка текста на нейросеть: первые шесть подсвечивает прямо в тексте, последние три показывает цифрами в правой колонке.
Почему детекторам ИИ нельзя верить на слово
Соблазн получить машинный вердикт «писал робот» велик, но точность у таких инструментов принципиально ограничена, и это признают сами разработчики моделей.
В январе 2023 года OpenAI выпустила собственный классификатор AI Text Classifier — сервис, определяющий, написан ли текст их же моделью. В июле 2023 года компания его закрыла, прямо указав причиной низкую точность. Организация, у которой был полный доступ к обучающим данным GPT, не смогла надёжно отличить его вывод от человеческого письма.
Вторая проблема серьёзнее ложных срабатываний вообще: они распределены неравномерно. Исследование Стэнфордского университета 2023 года (Лян и соавторы, «GPT detectors are biased against non-native English writers») показало, что англоязычные детекторы систематически принимали за машинные тексты людей, для которых английский неродной. Причина ровно та, что описана выше: авторы, пишущие на неродном языке, используют более простой словарь и более ровные конструкции — то есть внешне выглядят как модель.
Для русского языка масштабных публичных исследований такого рода нет, но механизм тот же. Под подозрение попадает любой, кто пишет просто и ровно: технический писатель, юрист, переводчик, школьник.
Практический вывод: процент любого детектора — повод перечитать текст, а не повод обвинить автора. Требовать «понизить процент ИИ» от исполнителя так же осмысленно, как требовать понизить температуру за окном.
Что показал прогон по живым и сгенерированным текстам
Чтобы понимать, что показывает шкала, я прогнал через инструмент собственные материалы этого сайта — они написаны руками — и сгенерированные тексты. Прогон делался на одном и том же алгоритме, никакой подгонки под результат.
| Текст | Признаков | Разброс фраз | Конкретика |
|---|---|---|---|
| Сгенерированный текст про кофейни | 81% | 0,31 | 0% |
| Сгенерированный текст про SEO | 84% | 0,21 | 25% |
| Как собрать семантическое ядро | 11% | 0,71 | 51% |
| Почему SEO не конвертит | 8% | 0,53 | 30% |
| Накрутка поведенческих факторов | 4% | 0,55 | 48% |
| Политика конфиденциальности сайта | 2% | 1,23 | 74% |
Две вещи, которые видно из таблицы. Первая: разрыв между машинным и живым текстом идёт не по одному показателю, а по всем сразу — у генерации ровные фразы и пустая конкретика одновременно. Вторая, менее ожидаемая: самый «человеческий» результат показала политика конфиденциальности, документ сухой и формальный. Юридический язык неровный и набит конкретикой — датами, номерами, названиями. Формальность и машинность оказались разными вещами.
Что на самом деле думают Яндекс и Google про тексты нейросетей
Здесь много мифологии, поэтому по фактам.
Google сформулировал позицию в феврале 2023 года в документе о контенте, созданном ИИ: способ производства сам по себе не нарушает правила, значение имеет качество и польза. Нарушением остаётся массовая автогенерация ради манипуляции выдачей — это тот же спам, что и раньше, независимо от того, чем его произвели.
Яндекс отдельного публичного документа именно про нейросети не выпускал, но его правила про автоматически сгенерированные страницы существуют давно и работают ровно так же: под санкции идёт бессодержательный текст, сделанный ради объёма. Подробнее разбирал это в заметке про нейротексты и SEO — там же про то, почему у поисковика с собственной генеративной моделью есть свой интерес в этом вопросе.
Практический смысл такой. Никто не ищет в вашем тексте отпечатки GPT, чтобы наказать за сам факт. Наказывают за пустоту, а пустота у машинного текста просто встречается чаще, потому что генерация дёшева и её делают тоннами. Поэтому высокий процент признаков — сигнал не «сейчас прилетит фильтр», а «этот текст ничего не сообщает читателю».
Как править машинный черновик за пятнадцать минут
Машинный черновик — рабочий материал, если понимать, что именно в нём править. Порядок действий, который у меня занимает минут пятнадцать на статью.
- Выкинуть первый и последний абзац целиком. Вступление «в современном мире» и вывод «подводя итог» почти никогда не несут информации. Статья от их удаления только выигрывает.
- Заменить усилители цифрами. Каждое «значительно» и «существенно» — место, где нужен факт. Нет факта — предложение удаляется, а не смягчается.
- Разбить ритм. Найти три подряд идущих предложения одинаковой длины и переписать среднее — укоротить до реплики или срастить с соседним.
- Убрать связки в началах. «Однако», «кроме того», «таким образом» в первом слове абзаца вычёркиваются почти без потерь для смысла.
- Добавить то, чего у модели нет. Свой случай, цифру из своего проекта, возражение клиента, ошибку, которую сами допустили. Один абзац личного опыта делает для текста больше, чем вся остальная правка.
Если после правки хочется свериться, прогоните текст через проверку ещё раз, а следом через «Чистовик» — он ловит другое, воду и канцелярит, и эти два списка правок почти не пересекаются.
Частые вопросы
Как проверить текст на нейросеть онлайн бесплатно?
Можно ли проверить текст на плагиат и нейросеть одновременно?
Проверка на оригинальность и на нейросеть — это одно и то же?
Понижает ли Яндекс сайт за тексты от нейросети?
Какой процент считается нормальным?
Почему мой собственный текст показал высокий процент?
Можно ли обмануть проверку?
Главное
Машинный текст узнают не по одному слову, а по сочетанию: дежурные обороты, ровные предложения, отсутствие фактов. Ни один детектор не даёт доказательства авторства, и относиться к проценту стоит как к редакторской подсказке. Поиск при этом наказывает не за нейросеть, а за пустоту — поэтому правка машинного черновика сводится к простому: убрать штампы и добавить то, чего у модели нет, — свои цифры и свой опыт.
Прогнать текст можно прямо сейчас — проверка текста на нейросеть работает в браузере, бесплатно и без регистрации. Нужен разбор контента на сайте целиком — напишите мне.