Главная / Статьи

Как Антиплагиат.ВУЗ находит ИИ-текст: что известно точно, а что — догадки

РазборКоманда КотПишетСам·9 мин чтения·сентябрь 2026

Точно известно немногое. С 16 июля 2025 года в результатах проверки Антиплагиат.ВУЗ есть числовой показатель «ИИ-контент» — по определению из памятки компании, «доля сгенерированного текста в общем объеме текста»; подозрительный документ помечается в личном кабинете, а отдельный отчёт называет конкретные страницы с предполагаемой генерацией. Как именно «детектор сгенерированных текстов» принимает решение, компания не раскрывает. Зато у её исследовательской команды есть рецензируемые статьи, по которым архитектуру можно восстановить — с оговоркой, что боевая версия может отличаться.

Что подтверждено документами компании

Памятка сентября 2025 года фиксирует рамки детектора: языки — русский, английский, испанский и казахский; форматы — только PDF и DOCX, загруженные без OCR; документ — от двух листов. Для .txt значок подозрительности ставится, но отчёт «Подозрительный документ» не формируется.

В личном кабинете подозрительная работа выделяется значком и розовой подсветкой строки. По ссылке «Подробнее» открывается отчёт со страницами, где предположительно использован сгенерированный текст. Деталь, о которой студенты обычно не знают: отметку можно снять. Эксперт нажимает кнопку в правой части отчёта и оставляет поясняющий комментарий, который сохраняется в печатных формах. Решение о допуске принимает вуз по своему локальному регламенту — не система.

Официальный список «Признаки ИИ-текста» из той же памятки — чеклист для живого преподавателя, а не перечень признаков алгоритма. Эти вещи постоянно смешивают. Про сам алгоритм Ю. В. Чехович сказал в интервью Skillbox 28 февраля 2024 года одно: модель анализирует «большой набор признаков» — и раскрывать перечень отказался.

Две цитаты из памяток пригодятся в споре с кафедрой. Сентябрь 2025 года: ИИ-детекторы «следует рассматривать не как доказательство нечестной работы, а, скорее, как маркер». Сентябрь 2024-го: «Процентный подход изжил себя, требуется экспертный анализ содержания каждой работы».

Что реконструируется по статьям разработчиков

Дальше — не документация, а картина, восстановленная по публикациям команды (бренд Advacheck).

Это классификатор, а не поиск совпадений. Грицай, Грабовой, Кильдяков и Чехович (Доклады РАН, 2023, т. 514, № 2; DOI 10.1134/S1064562423701211) описывают трансформер XLM-RoBERTa, к которому конкатенируются 26 ручных числовых признаков. Публично подтверждены пять: части речи, пунктуация, индекс удобочитаемости Флеша, средняя длина предложения, количество стоп-слов. Заявленный F1 — 0.968 для русского языка.

Центральный статистический признак — перплексия, то есть предсказуемость текста для языковой модели. В Doklady Mathematics (2024, т. 110) та же команда показала, что перплексию не считают тяжёлой нейросетью, а аппроксимируют предсобранными статистическими моделями в паре с лог-вероятностью — выигрыш в скорости «в тысячи раз».

Отчёт по страницам тоже объясняется публикацией. Span-детектор из arXiv:2411.07343 (SDP 2024) классифицирует каждый токен двумя головами поверх SciBERT в окне 350 токенов-слов, порог инференса — 0.55, F1 — 0.95–0.96. Помечается фрагмент, а не работа целиком.

И доменная калибровка. В arXiv:2411.11736 (первое место на соревновании COLING 2025, macro-F1 83.07%) энкодер DeBERTa-v3-base дополнен головами, предсказывающими домен: arXiv, Wikipedia, Reddit, медицина, финансы. Следствие для студента неприятное: научный текст судят по своей, более строгой шкале, чем эссе или блог.

Насколько этому можно верить

Самая жёсткая критика — от самих разработчиков. В статье «Are AI Detectors Good Enough?» (arXiv:2410.14677) Грицай, Вознюк, Грабовой и Чехович пишут, что бенчмарк-метрики до 99.9% часто отражают низкое качество оценочных датасетов, а качество «резко падает в реальных применениях». Хуже всего детекторы работают на отредактированных текстах и на генераторах, которых не было в обучении.

Чувствительность при этом растёт. 8 апреля 2026 года алгоритмы адаптировали под актуальные версии GPT, а 9 июля компания сообщила через CNews о снижении ложноположительных срабатываний по документам с 1,55% до 0,15% — тест на 1500 документах. Проверить это со стороны нельзя: независимых рецензируемых проверок детектора не существует, все цифры — самоотчёт. Масштаб виден из данных РИА: за II квартал 2026 года признаки ИИ найдены в 983,7 тыс. из 2,73 млн работ — в каждой третьей против каждой пятой годом ранее.

Цена ошибки выросла быстрее точности. «Коммерсантъ» описывал 28 апреля 2026 года студентку с 96% «использования нейросетей» в самостоятельной работе и вузы, где 1% ведёт к недопуску, — притом что порог всегда задаёт локальный акт вуза. Ложные срабатывания на честных текстах — отдельная тема, мы разбираем её в разборе ИИ-детекции. Короткая версия: Савельев (VERBA, 2024) показал, что удаление внутритекстовых ссылок поднимает оценку «человечности» текста с 16% до 42% — ссылочный аппарат научного жанра сам работает против автора.

Про трюки скажем прямо. Синонимический парафраз детектируемость не снижает, а на детекторах RADAR и Fast-DetectGPT даже повышает (+8,57% и +15,03%); невидимые символы и гомоглифы ловятся отдельными проверками и выглядят как умысел. Риск снижает другое — текст по нормам научного письма: конкретные цифры вместо «ряда исследований» и честные ограничения выводов. Наш хьюманайзер работает именно на этом принципе — перерабатывает текст под эти нормы.

Куда всё движется, Чехович сказал на science.mail.ru 5 мая 2026 года: перспектива — «объяснимая детекция» и фиксация процесса создания текста. Пилот «Антиплагиат 2.0» (28 университетов, 10 тыс. проверок, февраль–июль 2026-го) уже отслеживает, как текст появлялся, а не только каким получился. Веб-версию обещают осенью 2026 года.

Вопрос — ответ

Можно ли снять отметку «Подозрительный документ»?

Да, это штатная функция. Эксперт вуза нажимает кнопку в правой части отчёта и оставляет поясняющий комментарий — тот сохраняется в печатных формах. Решение о допуске принимает организация по своему регламенту, а не система. Лучший аргумент при снятии — доказательства процесса: черновики с историей версий, собственные данные и расчёты, переписка с научным руководителем.

Почему детектор помечает работы, написанные без нейросетей?

Потому что он оценивает статистику стиля, а не факт генерации. Научный регистр предсказуем: формальный, безличный, терминологически однородный — то есть статистически похож на машинный. По эксперименту Савельева (VERBA, 2024), сам ссылочный аппарат снижает «человечность»: без внутритекстовых ссылок оценка выросла с 16% до 42%. Доцент ГАУГН Д. Фомин-Нилов сформулировал итог: «Хорошо написанная работа часто воспринимается как созданная искусственным интеллектом».

Какой процент «ИИ-контента» считается допустимым?

Единого порога нет. Показатель «ИИ-контент» — доля предположительно сгенерированного текста, а что с ней делать, каждый вуз решает своим локальным актом: по данным «Коммерсанта» от 28 апреля 2026 года, где-то не допускают к защите даже при 1%. Сама компания в памятке 2025 года называет детектор маркером, а не доказательством, и требует экспертного анализа каждой работы.

Как это решает кот

За «котом» стоит программный комплекс, в котором генерация текста — лишь одна из тысяч операций: поиск и проверка источников, расчёты, выстраивание логики глав, терминологический контроль, ГОСТ-оформление. Встроенный хьюманайзер — обязательный этап каждого продукта; тем, у кого текст уже написан, он доступен отдельной услугой. Результат измерим: в наших замерах — стабильные 0% ИИ-контента в Антиплагиат.ВУЗ, свежий пример с 0% ИИ и 87% оригинальности лежит в примерах готовых работ. Начните с бесплатного плана работы — минута, и каркас у вас.

Источники — 14
  1. РИА Новости, 16.07.2026 — «Антиплагиат» обнаружил признаки ИИ в каждой третьей студенческой работе открыть
  2. «Коммерсантъ», апрель 2026 — Студентов не допускают до защиты дипломов из-за ложных срабатываний детектора ИИ открыть
  3. CNews, 09.07.2026 — «Антиплагиат» стал умнее: детектор чувствительнее к ИИ-фрагментам, ложные срабатывания снижены открыть
  4. Skillbox Media — «Стало известно, как „Антиплагиат“ определяет сгенерированный нейросетью текст» (с комментариями Ю. В. Чеховича) открыть
  5. Наука Mail, 05.05.2026 — интервью Ю. В. Чеховича о перспективах «объяснимой детекции».
  6. Официальные разъяснения компании «Антиплагиат» о подозрительных документах и признаках ИИ-текста открыть
  7. Сообщение компании «Антиплагиат» об обновлении алгоритмов детектора, 08.04.2026.
  8. Итоги пилотного проекта «Антиплагиат 2.0» (февраль–июль 2026, 28 университетов).
  9. Грицай Г., Грабовой А., Кильдяков А., Чехович Ю. Поиск искусственно сгенерированных текстовых фрагментов в научных документах // Доклады РАН. Математика, информатика, процессы управления. 2023. Т. 514, № 2 открыть
  10. Савельев. Эксперимент с оценкой «человечности» академических текстов // VERBA. 2024.
  11. arXiv:2411.07343 открыть
  12. arXiv:2411.11736 открыть
  13. arXiv:2410.14677 открыть
  14. DOI 10.1134/S1064562423701211 открыть
Нужен план по своей теме? Кот соберёт цель, задачи и оглавление за минуту — бесплатно и без регистрации. Готовые работы с проверками — в примерах.

Читать дальше