Компании, занимающиеся ИИ, такие как Anthropic и OpenAI, регулярно публикуют отчёты о том, как используются их продукты, в том числе Claude и ChatGPT. Однако исследователи выяснили, что реальные цифры отличаются от декларируемых.

Анка Реуэль, аспирантка в области компьютерных наук в лаборатории Stanford Trustworthy AI Research (STAIR), курирует исследовательский проект под названием AI Observatory, цель которого — отразить реальные данные. Это общедоступная платформа, которая агрегирует и анализирует диалоги с популярными моделями, такими как Claude и Gemini, собранные с согласия пользователей из семи существующих наборов данных. AI Observatory обнаружила, что использование ИИ значительно различается в зависимости от модели и меняется со временем.
Исследования показывают гораздо больше личных, чем рабочих сценариев поведения, чем отражено в отчётах крупных компаний. Так, Anthropic Economic Index — один из самых известных и цитируемых источников данных об использовании ИИ, но у него есть «слепые зоны». Как следует из названия, он фокусируется на использовании ИИ, связанном с работой и производительностью, отфильтровывая разговоры, не имеющие отношения к этим целям.
Когда исследователи из AI Observatory применили методы Anthropic Economic Index к своему набору данных, они обнаружили, что почти половина разговоров — 48% — были бы отфильтрованы. Эти разговоры, не связанные с работой, чаще касались здоровья и отношений (44,2% против 31,2% в обычном анализе), тем для взрослых или незаконных (7,9% против 2,1%), домогательств и ненависти (27,5% против 5,66%) и сексуального контента (16,7% против 2,4%).
Наборы данных, которые изучали в AI Observatory, включают разговоры, состоявшиеся в период с 2023 по 2025 год. Так, диалоги в WildChat, одном из крупнейших и наиболее подробных наборов, со временем становились длиннее и сложнее, о чем свидетельствует рост количества токенов подсказок, токенов ответов и реплик в разговоре. Также со временем в наборе значительно увеличилось количество личных разговоров. Это говорит о том, что взаимодействие с ИИ усиливалось.
Кроме того, обмены сообщениями, которые исследователи пометили как конфиденциальные — то есть содержащие потенциально вредный или запрещённый контент, стали реже. Это может свидетельствовать о том, что платформы в целом внедряли более эффективные меры защиты.
В AI Observatory также обнаружили, что темы, стили взаимодействия, структуры разговоров, а также вероятность и тип конфиденциальных сценариев использования различались от одной модели к другой. Например, люди чаще использовали Grok и Gemini для поиска информации, а Grok пользовался особой популярностью как платформа для получения информации о новостях и политике, но именно там, как правило, концентрировалась дезинформация. К моделям Anthropic чаще обращались для программирования, к Gemini — для общения и ролевых игр, а к ChatGPT — для помощи с домашними заданиями. Были даже различия между разными версиями одной и той же модели. Исследователи обнаружили, что люди вели более короткие беседы с ChatGPT, когда он работал на базе GPT-3.5, и более длинные и итеративные — с GPT-4. Однако отчёты компаний, как правило, не отражали этих нюансов.
Для создания платформы исследователи из Массачусетского технологического института, Стэнфордского университета, Инициативы по происхождению данных и других учреждений объединили 85 633 диалоговых реплики (то есть, запрос пользователя и соответствующий ответ ИИ) из 24 521 разговора из семи реальных рабочих мест. Эти данные были получены от 5000 пользователей, взаимодействовавших с 52 различными моделями, включая ChatGPT, Gemini, Claude и Grok, в период с 2023 по 2025 год.
Однако эти беседы — капля в море по сравнению с данными, к которым имеют доступ сами крупные лаборатории. Например, последний индекс Anthropic Economic AI Index основан на анализе 1 млн бесед с использованием Claude; в отчёте OpenAI о том, как люди используют ChatGPT, был проанализирован 1,5 млн бесед.
Представитель Anthropic заявил, что опубликованные исследования отражают конкретные вопросы и интересы её исследовательских групп. OpenAI не ответила на запросы о комментариях.
Данные AI Observatory будут доступны исследователям для анализа, и команда надеется со временем расширить свои наборы.
Ранее OpenAI впервые опубликовала подробную статистику использования ChatGPT по странам. Данные разместили на платформе Signals, которую развивает экономическая исследовательская группа компании. В набор вошла статистика за второй квартал 2026 года и только аккаунты с подписками Free, Go, Plus и Pro. Корпоративные аккаунты в исследовании не учитывали.
Источник: habr.com