Что детектор ИИ-текста на самом деле измеряет
Это страница-разбор, а не обещание. Здесь про то, как устроены автоматические проверки на сгенерированность, что в тексте осмысленно менять, и почему ни один сервис не может гарантировать их результат.
Начнём с механики. Детектор не «понимает», кто писал текст. Он оценивает, насколько текст статистически предсказуем для языковой модели. Две величины делают почти всю работу.
Предсказуемость слова в контексте. Модель для каждой позиции в тексте оценивает, насколько ожидаемым было это слово. У сгенерированного текста слова в среднем ожидаемее: модель выбирает вероятные продолжения. Живой автор чаще берёт неожиданное — не из-за оригинальности, а потому что у него есть конкретная мысль, а не распределение вероятностей.
Разброс этой предсказуемости. Ещё важнее, насколько предсказуемость колеблется от предложения к предложению. У человека она скачет: плотный абзац, потом лёгкий, потом внезапно короткая фраза. У модели держится ровно. Именно эта ровность — самый устойчивый сигнал.
Дальше идут вспомогательные признаки: доля шаблонных связок, разброс длины предложений, симметричность списков, повторяемость синтаксических конструкций.
Отсюда сразу следует важный вывод: замена слов синонимами почти ничего не меняет. Предсказуемость слова определяется контекстом, а не редкостью самого слова, и разброс от синонимов не появляется.
Почему детекторы ошибаются в обе стороны
У любой такой проверки два типа ошибок, и оба реальны.
Ложное срабатывание. Текст написан человеком, но помечен как сгенерированный. Особенно уязвимы: авторы, для которых язык текста неродной; научная и юридическая проза, где ровность и формульность — норма жанра; отредактированные тексты, из которых убрали всю неровность; короткие фрагменты, где статистике просто не на чем работать.
Ложный пропуск. Сгенерированный текст не помечен. Достаточно, чтобы автор переписал часть абзацев вручную.
Обе ошибки — следствие природы метода. Детектор выдаёт вероятностную оценку, а не факт. Поэтому серьёзные площадки формулируют результат как «сигнал к проверке», а не как приговор, и решение принимает человек.
И поэтому же ни один сервис не может обещать конкретный вердикт. Систем много, они разные, их модели обновляются, их пороги настраиваются площадкой. Мы не эмулируем чужие сервисы и не предсказываем их вывод — и не считаем, что кто-то другой на это способен.
Что в тексте можно изменить осознанно
Из трёх измеряемых величин две — служебные, а одна поддаётся осмысленной работе: разброс. И работать с ней полезно само по себе, независимо от любых проверок, потому что ровный текст просто хуже читается.
Разброс длины предложений. Самое заметное. Абзац, где все фразы по двадцать пять слов, читается как отчёт. Живой абзац идёт рывками: длинный период, короткая фраза, средний.
Разнообразие связок. Не «более того — кроме того — таким образом» подряд, а иногда вопрос, иногда прямое продолжение, иногда вообще без связки.
Асимметрия перечислений. Реальный список неровный: где-то пункт в три слова, где-то в две строки.
Плотность конкретики. Имена, числа, даты, ваши примеры. Их вообще нет в сгенерированном тексте, если вы их не вписали, — и именно они делают текст непохожим на среднее по корпусу.
Позиция вместо страховки. «Данный вопрос требует комплексного подхода» — это отказ от утверждения. Скажите то, что думаете.
С первыми тремя пунктами работает автоматическая правка. Четвёртый и пятый — только вы: инструмент не добавляет содержания, которого не было в исходнике.
Разбор: три признака и что с ними делает правка
Возьмём абзац с одинаковым ритмом:
Внедрение цифровых технологий в образовательный процесс существенно меняет характер взаимодействия преподавателя и студента. Более того, применение интерактивных платформ позволяет повысить уровень вовлечённости обучающихся в учебный процесс. Кроме того, использование данных инструментов способствует индивидуализации образовательных траекторий.
Три предложения по двадцать с небольшим слов, две связки-паразита подряд, одинаковая конструкция «применение/использование чего-то позволяет/способствует чему-то».
После правки:
Цифровые технологии меняют сам характер отношений преподавателя и студента. Интерактивные платформы втягивают студентов в работу активнее — а заодно позволяют выстроить каждому свою траекторию.
Что изменилось: два предложения вместо трёх, разной длины; ушли «более того» и «кроме того»; отглагольные конструкции «применение позволяет» стали глаголами. Что не изменилось: все три утверждения на месте, ни одно не усилено и не ослаблено.
Заметьте, чего здесь нет: подстановки синонимов. «Взаимодействие» не превратилось во «взаимоотношение», а «вовлечённость» — в «заинтересованность». Менялась конструкция, а не словарь.
Чего делать не стоит
Не подставляйте невидимые символы и не портите текст намеренно. Латинская «a» вместо кириллической, нулевой ширины пробелы, лишние переносы — это не работа со стилем, а порча файла. Такие приёмы легко обнаруживаются, ломают поиск по документу и выглядят как попытка обмана.
Не гоняйте текст через несколько инструментов подряд. С каждым проходом растёт риск сдвига смысла и потери фактов, а выигрыш быстро уходит в ноль.
Не пытайтесь «чинить» правкой неоформленное заимствование. Если фрагмент взят из источника, его нужно оформить цитатой со ссылкой. Перефразирование чужого текста без ссылки остаётся заимствованием — независимо от того, что покажет любая проверка.
Не считайте вердикт детектора целью работы. Он вероятностный, у него две стороны ошибки, и он меняется с каждым обновлением. Читаемость — цель, которая никуда не денется.
Если работу пометили, а вы её писали сами
Ситуация не редкая, особенно если вы пишете плотно и формульно или язык текста для вас неродной.
Полезные шаги:
- Сохраняйте историю работы. Черновики с датами, история изменений в документе, заметки, промежуточные версии. Это самое сильное доказательство авторства — гораздо сильнее любых аргументов о методе.
- Просите показать основание. Оценка вероятности — не доказательство. Спросите, какой инструмент использовался, каков порог и как площадка трактует результат.
- Указывайте на природу метода. Ложные срабатывания задокументированы и особенно вероятны для неносителей языка и для формульных жанров.
- Предлагайте проверяемое. Устно пересказать логику работы, объяснить выбор источников, показать черновики.
И заранее: если правила вашей площадки допускают использование ИИ с указанием — указывайте. Прозрачность снимает большую часть подобных разговоров ещё до того, как они начнутся.
Что делает наш инструмент — и чего не делает
Делает: переписывает наблюдаемые свойства текста — ритм предложений, связки, синтаксические конструкции, канцелярские обороты. Сохраняет факты, числа, имена, цитаты, термины, структуру и язык исходника.
Не делает: не предсказывает и не эмулирует вердикт стороннего сервиса; не заявляет о совместимости с какой-либо системой проверки; не добавляет содержания; не проверяет заимствования; не оценивает аргументацию.
Если вам нужно не разобраться в механике, а просто привести текст в порядок — начните с общей страницы хуманайзера: инструмент там прямо на странице, бесплатно и без регистрации.
Где продолжить
Длинные тексты и история запросов — в @vustHumanBot. Первые два запроса бесплатны, дальше цена видна до подтверждения: 9 ₽ за текст до 1000 символов и 29 ₽ от 1001. Если результат не пришёл, списания не происходит.