Детекторы и преподаватели ищут в тексте не «след ChatGPT», а измеримые статистические привычки языковых моделей. Таких признаков в нашем разборе ИИ-детекции собрано 23 — от предсказуемости слов до больших букв после двоеточия. Ниже — самые показательные, с цифрами из исследований 2024–2026 годов. Полезно прочитать перед сдачей любой работы: часть этих привычек люди перенимают у нейросетей, сами того не замечая.
Статистика, которую не видно глазом
Главный признак — низкая перплексия: текст, в котором каждое следующее слово легко предсказывается языковой моделью. Команда разработчиков Антиплагиата опубликовала метод, где перплексия считается быстрыми статистическими моделями в паре с лог-вероятностью — в тысячи раз быстрее, чем полноценной нейросетью. Простыми словами: чем «глаже» и обобщённее текст, тем он подозрительнее.
Рядом — burstiness, неровность письма. Человек пишет рвано: длинный период на сорок слов с двумя придаточными, потом вывод в пять слов. Модель выдаёт предложения ровные, как штакетник, и абзацы одинакового объёма.
Третий маркер оказался неожиданно простым — плотность цифр. Анализ 52 305 русскоязычных научных абстрактов (AINL-Eval 2025) показал: люди вставляют в текст примерно в десять раз больше чисел, чем модели. Живой автор пишет «рост с 12,4 до 19,8 млрд за 2019–2024 годы», модель — «значительный рост в последние годы».
Четвёртый — словарный. У моделей бедная локальная вариативность: метрика дисперсии лексики у GPT-4.5 — 5,8 против 16,4 у людей, а классификатор на одних лексических метриках разделяет тексты с точностью выше 97%. При этом удаление признаков лексического богатства роняет качество детектора сильнее любой другой группы — на 13,1% F1.
Привычки, которые видно без всякой программы
Есть признаки, которые преподаватель замечает быстрее алгоритма.
«Правило трёх». Модели обожают тройки однородных членов: в среднем 7,13 тройки на документ против 3,73 у экспертов-людей — сильнейший из известных различающих маркеров. Если третий пункт перечисления можно выбросить без потери смысла, он стоит там «для ритма» — и это машинная привычка. Обратный маркер человечности — риторический вопрос: у людей он встречается вдвое чаще.
Конструкция «не X, а Y». ChatGPT использует противопоставления вида «это не просто инструмент, а философия» в три-четыре раза чаще других авторов.
Словарь LLM-эпохи. Метод «избыточной лексики» на 15 миллионах медицинских абстрактов выявил слова, частота которых аномально взлетела с приходом нейросетей: в английском это delves, underscores, showcasing. В русских работах та же роль у оборотов «играет ключевую роль», «в современном динамично развивающемся мире», «подчёркивает необходимость», «открывает новые горизонты». Две трети избыточных слов — глаголы.
Номинализация. По данным PNAS (2025), отглагольные существительные («осуществление внедрения методики») у инструкт-моделей встречаются в полтора-два раза чаще, причастные и деепричастные обороты — в 1,4–5,3 раза чаще, чем у людей.
Форматирование. Эксперимент Sun с коллегами (ICML 2025): удаление markdown-разметки роняет точность определения модели-автора с 97,1% до 73,1% — то есть примерно четверть «подписи» нейросети сидит в буллитах, жирных ярлыках и заголовках. Сюда же официальная памятка Антиплагиата относит большие буквы после двоеточия и фразы, характерные для диалога с ботом, вроде «на момент моего последнего обновления знаний».
Тональность. По iScience (февраль 2026), маркеры уверенности у ИИ выше на 111–152%, позитивные эмоции — на 69–132%. Ровный восторг ко всему подряд и отсутствие честных оговорок «данные не позволяют утверждать» — машинная черта. Человек ругает свои источники, сомневается и признаёт слабые места.
И закольцованность. Чехович называет это «эффектом рыбки Дори»: модель повторяет тему абзаца, не добавляя нового содержания. Если выписать по тезису из каждого абзаца и соседние можно поменять местами — текст крутится на месте.
Что с этим знанием делать
Важная оговорка: почти каждый признак по отдельности встречается и у живых авторов. Научный стиль сам по себе формален и предсказуем — поэтому детекторы регулярно помечают честные работы, что мы разбираем в материале о ложных срабатываниях. Опасна не запятая после двоеточия, а совпадение десятка привычек сразу.
Использовать список стоит как чеклист самопроверки: конкретные цифры вместо оценочных слов, разная длина предложений и абзацев, дословное повторение терминов вместо синонимической карусели, честные ограничения выводов, минимум списков и ни одной тройки «для красоты». Это не маскировка — это и есть требования нормального научного письма. Прогнать готовый текст через такую переработку можно хьюманайзером — он работает именно с этими признаками, а не с трюками подмены символов.
Вопрос — ответ
Какой признак ИИ-текста самый сильный?
По опубликованным данным — «правило трёх»: 7,13 тройки однородных членов на документ у моделей против 3,73 у людей. Из невидимых глазу — низкая перплексия (предсказуемость слов) и бедная локальная вариативность лексики: дисперсия 4,8–5,8 у моделей против 16,4 у людей.
Если я сам пишу «в современном мире» и люблю списки — меня пометят?
Один-два признака ничего не решают: детектор оценивает совокупность, а преподаватель — общее впечатление. Но привычки из соцсетей и переписки с ботами (ровные абзацы, буллиты, штампы) статистически сближают ваш стиль с машинным и повышают риск ложной пометки. Чеклист из этой статьи работает и как профилактика.
Помогает ли замена слов синонимами?
Нет. Синонимический парафраз не снижает детектируемость, а на детекторах RADAR и Fast-DetectGPT даже повышает её на 8,6–15%. Работает противоположное: добавление конкретики, реальных цифр с источниками и переработка структуры аргумента — то есть содержательная, а не косметическая правка.
Как это решает кот
КотПишетСам решает эту задачу не промптом, а конвейером: тысячи операций на каждую работу, не считая самой генерации, — от проверки каждого источника до контроля оформления по ГОСТ. Финальный из этих этапов — встроенный хьюманайзер, он же существует как отдельный инструмент для готовых текстов. Итог в наших замерах — стабильные 0% ИИ-контента в Антиплагиат.ВУЗ; курсовая покупателя с 0% ИИ и 87% оригинальности выложена в примерах готовых работ. Первый шаг бесплатный: план работы за минуту.
Источники — 3
- Официальные разъяснения компании «Антиплагиат» о подозрительных документах и признаках ИИ-текста открыть
- PNAS. 2025. Vol. 122, № 8 — лингвистические маркеры текстов больших языковых моделей.
- iScience, февраль 2026 — эмоциональность и избыточная уверенность ИИ-текстов.