Главная / Статьи

23 признака, по которым вычисляют нейротекст

РазборКоманда КотПишетСам·6 мин чтения·сентябрь 2026

Детекторы и преподаватели ищут в тексте не «след ChatGPT», а измеримые статистические привычки языковых моделей. Таких признаков в нашем разборе ИИ-детекции собрано 23 — от предсказуемости слов до больших букв после двоеточия. Ниже — самые показательные, с цифрами из исследований 2024–2026 годов. Полезно прочитать перед сдачей любой работы: часть этих привычек люди перенимают у нейросетей, сами того не замечая.

Статистика, которую не видно глазом

Главный признак — низкая перплексия: текст, в котором каждое следующее слово легко предсказывается языковой моделью. Команда разработчиков Антиплагиата опубликовала метод, где перплексия считается быстрыми статистическими моделями в паре с лог-вероятностью — в тысячи раз быстрее, чем полноценной нейросетью. Простыми словами: чем «глаже» и обобщённее текст, тем он подозрительнее.

Рядом — burstiness, неровность письма. Человек пишет рвано: длинный период на сорок слов с двумя придаточными, потом вывод в пять слов. Модель выдаёт предложения ровные, как штакетник, и абзацы одинакового объёма.

Третий маркер оказался неожиданно простым — плотность цифр. Анализ 52 305 русскоязычных научных абстрактов (AINL-Eval 2025) показал: люди вставляют в текст примерно в десять раз больше чисел, чем модели. Живой автор пишет «рост с 12,4 до 19,8 млрд за 2019–2024 годы», модель — «значительный рост в последние годы».

Четвёртый — словарный. У моделей бедная локальная вариативность: метрика дисперсии лексики у GPT-4.5 — 5,8 против 16,4 у людей, а классификатор на одних лексических метриках разделяет тексты с точностью выше 97%. При этом удаление признаков лексического богатства роняет качество детектора сильнее любой другой группы — на 13,1% F1.

Привычки, которые видно без всякой программы

Есть признаки, которые преподаватель замечает быстрее алгоритма.

«Правило трёх». Модели обожают тройки однородных членов: в среднем 7,13 тройки на документ против 3,73 у экспертов-людей — сильнейший из известных различающих маркеров. Если третий пункт перечисления можно выбросить без потери смысла, он стоит там «для ритма» — и это машинная привычка. Обратный маркер человечности — риторический вопрос: у людей он встречается вдвое чаще.

Конструкция «не X, а Y». ChatGPT использует противопоставления вида «это не просто инструмент, а философия» в три-четыре раза чаще других авторов.

Словарь LLM-эпохи. Метод «избыточной лексики» на 15 миллионах медицинских абстрактов выявил слова, частота которых аномально взлетела с приходом нейросетей: в английском это delves, underscores, showcasing. В русских работах та же роль у оборотов «играет ключевую роль», «в современном динамично развивающемся мире», «подчёркивает необходимость», «открывает новые горизонты». Две трети избыточных слов — глаголы.

Номинализация. По данным PNAS (2025), отглагольные существительные («осуществление внедрения методики») у инструкт-моделей встречаются в полтора-два раза чаще, причастные и деепричастные обороты — в 1,4–5,3 раза чаще, чем у людей.

Форматирование. Эксперимент Sun с коллегами (ICML 2025): удаление markdown-разметки роняет точность определения модели-автора с 97,1% до 73,1% — то есть примерно четверть «подписи» нейросети сидит в буллитах, жирных ярлыках и заголовках. Сюда же официальная памятка Антиплагиата относит большие буквы после двоеточия и фразы, характерные для диалога с ботом, вроде «на момент моего последнего обновления знаний».

Тональность. По iScience (февраль 2026), маркеры уверенности у ИИ выше на 111–152%, позитивные эмоции — на 69–132%. Ровный восторг ко всему подряд и отсутствие честных оговорок «данные не позволяют утверждать» — машинная черта. Человек ругает свои источники, сомневается и признаёт слабые места.

И закольцованность. Чехович называет это «эффектом рыбки Дори»: модель повторяет тему абзаца, не добавляя нового содержания. Если выписать по тезису из каждого абзаца и соседние можно поменять местами — текст крутится на месте.

Что с этим знанием делать

Важная оговорка: почти каждый признак по отдельности встречается и у живых авторов. Научный стиль сам по себе формален и предсказуем — поэтому детекторы регулярно помечают честные работы, что мы разбираем в материале о ложных срабатываниях. Опасна не запятая после двоеточия, а совпадение десятка привычек сразу.

Использовать список стоит как чеклист самопроверки: конкретные цифры вместо оценочных слов, разная длина предложений и абзацев, дословное повторение терминов вместо синонимической карусели, честные ограничения выводов, минимум списков и ни одной тройки «для красоты». Это не маскировка — это и есть требования нормального научного письма. Прогнать готовый текст через такую переработку можно хьюманайзером — он работает именно с этими признаками, а не с трюками подмены символов.

Вопрос — ответ

Какой признак ИИ-текста самый сильный?

По опубликованным данным — «правило трёх»: 7,13 тройки однородных членов на документ у моделей против 3,73 у людей. Из невидимых глазу — низкая перплексия (предсказуемость слов) и бедная локальная вариативность лексики: дисперсия 4,8–5,8 у моделей против 16,4 у людей.

Если я сам пишу «в современном мире» и люблю списки — меня пометят?

Один-два признака ничего не решают: детектор оценивает совокупность, а преподаватель — общее впечатление. Но привычки из соцсетей и переписки с ботами (ровные абзацы, буллиты, штампы) статистически сближают ваш стиль с машинным и повышают риск ложной пометки. Чеклист из этой статьи работает и как профилактика.

Помогает ли замена слов синонимами?

Нет. Синонимический парафраз не снижает детектируемость, а на детекторах RADAR и Fast-DetectGPT даже повышает её на 8,6–15%. Работает противоположное: добавление конкретики, реальных цифр с источниками и переработка структуры аргумента — то есть содержательная, а не косметическая правка.

Как это решает кот

КотПишетСам решает эту задачу не промптом, а конвейером: тысячи операций на каждую работу, не считая самой генерации, — от проверки каждого источника до контроля оформления по ГОСТ. Финальный из этих этапов — встроенный хьюманайзер, он же существует как отдельный инструмент для готовых текстов. Итог в наших замерах — стабильные 0% ИИ-контента в Антиплагиат.ВУЗ; курсовая покупателя с 0% ИИ и 87% оригинальности выложена в примерах готовых работ. Первый шаг бесплатный: план работы за минуту.

Источники — 3
  1. Официальные разъяснения компании «Антиплагиат» о подозрительных документах и признаках ИИ-текста открыть
  2. PNAS. 2025. Vol. 122, № 8 — лингвистические маркеры текстов больших языковых моделей.
  3. iScience, февраль 2026 — эмоциональность и избыточная уверенность ИИ-текстов.
Нужен план по своей теме? Кот соберёт цель, задачи и оглавление за минуту — бесплатно и без регистрации. Готовые работы с проверками — в примерах.

Читать дальше