Каждая третья новая страница в интернете уже написана с помощью ИИ

Аналитики Pew Research Center опубликовали данные масштабного анализа веб-контента, которые фиксируют заметный сдвиг в том, кем создаются тексты в глобальной сети. Согласно подсчетам, среди публикаций, появившихся после массового запуска ChatGPT, доля материалов с явными признаками машинной генерации достигла 35%. Иными словами, более трети новых страниц в интернете написаны не людьми, а алгоритмами.

Для оценки ситуации специалисты использовали инструмент Open Pangram. Алгоритм проверил выборку из почти полумиллиона англоязычных веб-страниц, а временной охват включил период начиная с ноября 2022 года (с момента релиза ChatGPT) и заканчивая серединой 2026 года.

статистика с ростом ИИ-материалов

статистика с ростом ИИ-материалов

Если рассматривать весь массив опубликованных за последние годы страниц (включая старые материалы, созданные задолго до бума нейросетей), то доля ИИ-текстов составляет около 10%. Однако этот показатель сильно размывается архивными данными. Как только исследователи отфильтровали выборку и оставили только страницы, опубликованные после ноября 2022 года, картина резко изменилась. Здесь участие искусственного интеллекта выявляется в 35% случаев. Ситуация имеет четкую восходящую динамику и чем ближе к сегодняшнему дню дата публикации, тем выше вероятность обнаружить в тексте следы алгоритмической генерации.

Распределение синтетического контента по доменным зонам оказалось неравномерным. Наибольшая концентрация наблюдается в коммерческом сегменте. На сайтах в зоне .com признаки использования ИИ фиксируются примерно в два раза чаще, чем на ресурсах .org (4.6%). Наименьшее проникновение нейросетей зафиксировано в образовательном и государственном секторах. На доменах .edu и .gov доля текстов, написанных или значительно отредактированных машиной, колеблется в районе 1%. Это может объясняться более строгими стандартами публикаций и меньшей коммерческой мотивацией к автоматической генерации контента ради трафика.

Материалов от реальных авторов не становится меньше, просто нейросети делают в разы больше

Материалов от реальных авторов не становится меньше, просто нейросети делают в разы больше

Аналитики подчеркивают, что детекторы ИИ не дают стопроцентной гарантии и могут ошибаться в частных случаях. Однако при анализе больших массивов данных статистические закономерности видны достаточно четко. Выяснилось, что модели чаще человека используют определенные лингвистические конструкции. В частности, за последние годы в вебе значительно выросла частота употребления слов delve (копаться, углубляться) и interplay (взаимодействие). Кроме того, алгоритмы грешат избыточным использованием длинных тире и оксфордских запятых. Ещё один маркер — конструкция «отрицательного параллелизма», когда мысль строится по принципу «это не просто X, это Y». Частота её использования в сети выросла почти втрое.

Исследователи отмечают, что наличие одного такого признака не является доказательством. Но совокупность стилистических особенностей и статистических паттернов позволяет модели классифицировать текст как машинный с высокой долей уверенности.

Каждая третья новая страница в интернете уже написана с помощью ИИ

Рост доли автоматически сгенерированного текста ставит вопрос о качестве данных, на которых будут обучаться следующие поколения моделей. Если интернет все больше наполняется синтетикой, существует риск попадания такого контента в обучающие выборки, что может привести к деградации качества выдачи и распространению однотипных формулировок.

Станет ли текст, написанный человеком, дефицитом, или пользователи перестанут обращать внимание на происхождение контента, если он решает их задачу? Делитесь мнением в комментариях.

НовостиЖелезо и технологииАналитика и статистикаискусственный интеллект

Источник: vgtimes.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев