Управление cookie
🍪 Наш сайт использует cookie — это файлы, которые сохраняют данные о ваших прошлых посещениях, так мы сделать работу с сайтом удобнее. При желании вы можете отключить сохранение cookie в настройках браузера.
Управление cookie
Настройки cookie
Выберите, какие cookie вы разрешаете. Обязательные cookie всегда включены — без них сайт не сможет работать корректно. Остальные категории можно включать и отключать в любой момент.
Всегда включено
Эти cookie необходимы для работы сайта и его функций. Их нельзя отключить. Они устанавливаются в ответ на ваши действия, например, при выборе настроек конфиденциальности, входе в аккаунт или заполнении форм.
Аналитические cookie
Disabled
Эти cookie собирают информацию, чтобы мы понимали, как используется сайт, насколько эффективны наши маркетинговые кампании, и могли сделать сайт удобнее для вас.
Рекламные cookie
Disabled
Эти cookie помогают рекламным компаниям понимать вашу онлайн-активность, чтобы показывать более релевантную рекламу или ограничивать количество показов одного и того же объявления.
Другие cookie
Disabled
Эти cookie не относятся к обязательным, аналитическим или рекламным. Они помогают включать дополнительные функции сайта (например, настройки языка и интерфейса) и могут устанавливаться сторонними сервисами.
ДЛЯ СТУДЕНТОВ
ДЛЯ СТУДЕНТОВ ПО ПРОМОКОДУ
ДЛЯ СТУДЕНТОВ НА КУРСЫ ПО ПРОМОКОДУ
СКИДКА -30%
Блог новостей о биотехе — Бластим

🚩 О КРАСНЫХ ФЛАГАХ

Если парень в личных сообщениях не допускает грамматических ошибок, педантично ставит длинные тире и сорит вычурными глаголами типа delve into, то, вероятно, с вами общается никакой не парень, а ИИ-агент...

Сегодня многие подозревают, что вокруг них сплошь и рядом тексты, написанные искусственным интеллектом. И небезосновательно подозревают. Но какие именно признаки могут свидетельствовать о том, что перед вами синтетический текст? Давайте разбираться, что гласит наука.

🚩 В языкознанье знает толк

В прошлом году в Science Advances вышла публикация Дмитрия Кобака с соавторами. Датасайентисты с помощью анализа избыточного использования слов (по аналогии с избыточной смертностью) изучили более 15 млн абстрактов биомедицинских статей из PubMed c 2010 по 2024 годы. Оказалось, что в дочатджипитишные времена основное влияние на лексику оказывали исторические события. Например, вместе с COVID-19 скакнула частота встречаемости специализированных существительных: локдаун, пандемия, ремдесивир.

А вот с конца 2022 года наблюдаются совсем другие изменения. Они касаются стилистики. Возросло употребление почти 400 уникальных лемм, которые делают речь прилизанной и витиеватой. Это преимущественно прилагательные (например, pivotal, intricate или meticulous) и глаголы (showcase, underscore и особенно delve, который вообще попал в разряд мемов). Причем темп, с которым чат-боты подхватывают новые словечки и начинают злоупотреблять ими, значительно превышает естественные лингвистические процессы.
Из областей, где заметны следы ИИ, в передовиках компьютерные науки и биоинформатика, из государств — Китай и Тайвань, из журналов — MDPI, Frontiers. Свежие данные подтверждают эту информацию. Ричард Ше из Наньянского технологического университета проштудировал литературу за последние пять лет. В 2025 году наблюдался взрывной рост машинной прозы. По-видимому, использовать LLM-ки начали еще раньше, потому что между сабмитом рукописи и выходом в свет проходит время. Больше всего применяют ИИ в Поднебесной и Корее. Самые подозрительные статьи из США связаны с авторами, ФИО которых указывают на то, что английский для них неродной.

🚩 Никому не скажу, но будут знаки

А что за пределами науки? Википедисты уже организовали и постоянно апдейтят страницу «Signs of AI writing», где собраны типичные паттерны, характерные для нейрослопа в любых сферах, не только академии. Вот несколько. Языковые модели с трудом проявляют сдержанность, склонны к пафосу («Непоколебимо преданный своему делу»). Они легко скатываются на поучительный тон («Стоит учесть»). LLM-ки обожают риторический прием «не X, а Y» («Фотосинтез — это не просто биологический процесс, это основополагающий двигатель жизни на Земле»). Еще к ред флагам относят парцелляцию, правило трех, оборот «от и до». Алгоритмы выучили всё это из рекламных сообщений, коими наполнен интернет, и добавляют фразы для придания глубокомыслия.

Отдельная песня — типографика. Живые люди не заморачиваются, а вот нейронки различают все эти кавычки «елочки» и „лапки“. Еще ИИ-шные тексты как на русском, так и на английском грешат обилием так называемых длинных тире (—; по англ. «em dash»). Видя их, энтузиасты сразу спешат повесить на новостную заметку или пост в соцсетях ярлык генеренки. Но те, кто мало-мальски знаком с редакторским делом, знают, что это стандарты оформления. Не верите? Откройте русскую литературу или параграф книги Артемия Лебедева. Для отечественной традиции длинное тире, окруженное пробелами, — здоровый вариант. ИИ только перебарщивает с количеством.

🚩 Поймай меня, если сможешь

Мы перечислили самые выпуклые признаки машинного текста, но их наличие всё-таки не может служить железобетонным доказательством. Кроме того, люди могут применять флагманские модели, которые умны и пишут очень связно. А наиболее ушлые пользователи перефразируют отдельные предложения или даже прибегают к специальным тулам-гуманизаторам, что сильно затрудняет распознавание нейрописанины. Как же быть? Вопрос наболевший, учитывая, что для представителей таких профессий, как преподаватели, медики или эйчары, подлинность и достоверность текстов критически важна.

Прямо сейчас разворачивается настоящая гонка между трансформерами-писателями и трансформерами-детекторами. Постоянно выходят научные исследования на тему идентификации ИИ-контента. Есть и коммерческие сервисы, такие как Originality.ai, GPTZero, ZeroGPT. Лидером среди них считается Pangram. Эта нейросеть сканирует перекрывающиеся окна текста и по каждому фрагменту выносит вердикт — «человек или робот». Детектор уже внедряется компаниями, университетами и даже успел подмочить репутацию некоторых личностей. Так, недавно с его помощью немецкие журналисты обнаружили, что в Бундестаге каждая 11 речь создана моделями. А еще Pangram назвал генеренкой энциклику Папы Римского Лео XIV, где понтифик как раз и предупреждает о рисках ИИ...
Если вам хочется не просто пользоваться LLM, но и глубоко delve в сферу обработки естественного языка, то важно рассмотреть pivotal курс по машинному обучению — от Бластим.
P.S. Мы загнали этот материал в Pangram, он был классифицирован как «человеческий» 😅
Полезные советы Машинное обучение