Работа группы из исследовательского центра Pew Research показывает, как за период после выпуска OpenAI ChatGPT в ноябре 2022 года и появления других чат‑ботов резко возросло использование определённых слов и фраз в интернете.

Исследователи, возглавляемые специалистом по обработке данных Самуэлем Бестватером, изучили почти полмиллиона текстов англоязычных веб‑страниц за последние пять лет.
Бестватер и его команда обнаружили двойной рост использования тире, а также отдельных слов — таких как “delve”, “testament” и “interplay” — и почти утроенное использование фраз, известных как отрицательные параллелизмы («это не X, это Y»). Кроме того, на 63% выросло количество оксфордских запятых.
«Возможно, и сами писатели меняют свой стиль в ответ на ИИ. Я видел несколько примеров, когда люди говорили: „Теперь я избегаю тире“. Если писатели‑люди корректируют выбор слов, фраз и знаков препинания, чтобы отличить свой текст от текста, сгенерированного ИИ, то вы увидите закономерность, которая выглядит примерно так, как на графике», — сказал Бестватер.
Исследователи собирали ежемесячные данные от некоммерческой организации Common Crawl за период с января 2021 года по июль 2026 года. Бестватер описал этот веб‑архив как «настолько полный сбор данных из наблюдаемого интернета, насколько это возможно».
Среди других слов, часто встречающихся в текстах, созданных ИИ, можно назвать “align”, “showcase”, “valuable”, “crucial”, “underscore”, “intricate”, “meticulous”, “tapestry”, “landscape” и “pivotal”.
Детекторы ИИ не просто ищут список признаков; вместо этого, по словам Бестватера, они оценивают статистические данные, касающиеся выбора слов, ритма предложений, распределения пунктуации и тому подобного, а затем выдают вероятность того, что текст создан ИИ. Однако он подчеркнул, что для одной веб‑страницы или текста бывает сложно определить, был ли он написан с помощью ИИ, и существует риск ложных срабатываний, когда кто‑то ошибочно помечает текст, написанный человеком, как созданный ИИ.
Исследователи использовали версию детектора ИИ от Pangram Labs с открытым исходным кодом, проверив часть своего анализа с помощью коммерческого детектора Pangram 3.3 и получив аналогичные результаты. Pangram обнаруживает тонкие различия между моделями, такими как ChatGPT, Claude и Gemini, заявил основатель и инженер компании Элиас Масрур. Например, хотя ChatGPT использует тире чаще, чем люди, Gemini применяет этот символ реже.
По мере распространения в интернете и за его пределами текстов, созданных с помощью ИИ, 76% американцев считают важным уметь различать такой контент, сказал Бестватер, ссылаясь на опрос Pew, проведенный в сентябре 2025 года. Однако, согласно опросу, только 12% пользователей уверены в своих способностях на этот счёт.
Около 10% веб‑страниц теперь демонстрируют признаки авторства ИИ, обнаружили Бестватер и его коллеги. Они наиболее распространены на сайтах с доменом .com и наименее — на сайтах с доменами .gov и .edu. Собственное исследование Pangram также показало в июле, что 41% длинного контента (более 250 слов) в LinkedIn написан ИИ. Pangram обычно требуется 50 слов или больше, чтобы провести анализ.
Некоторые исследователи пытались понять не только то, как чат‑боты пишут текст, но и почему они выбирают те или иные обороты. Том Юзек, исследователь в области вычислительной лингвистики из Университета штата Флорида, опубликовал в 2025 году исследование, посвящённое тому, почему такие слова, как “delve” (погружаться), становятся более распространёнными.
Юзек сказал, что по мере обучения и совершенствования ChatGPT и другие большие языковые модели цепляются за определённые слова, которые люди одобряют, предоставляя обратную связь о способности модели выполнять сложные задачи. То есть, некоторым людям‑оценщикам, вероятно, нравится слово “delve”.
Помимо выбора слов, LLM склонны использовать определённые типы фраз и конструкций предложений чаще, чем люди, сказал Юзек. Например, недавние исследования показали, что чат‑боты применяют следующие обороты примерно в два раза чаще, чем люди: «Но это наблюдение ему подходит», придаточные предложения с маркерами, например, «…, и это хорошо», и существительные с указанием количества, например, «многие в Европе». Согласно другому анализу, чат‑боты иногда также склонны к использованию списков, выделенного текста и эмодзи.
Некоторые исследователи считают, что влияние может быть двусторонним: люди меняют свой стиль письма, а чат‑боты корректируют результаты. В любом случае, Юзек подчеркнул, что модные слова приходят и уходят. Масрур заметил, что в новых версиях чат‑ботов слово “delve” постепенно выходит из употребления. Аналогично, по словам Юзека, OpenAI, возможно, «берёт под контроль» проблему с длинными тире.
Источник: habr.com