Недавно широкий резонанс вызвал анализ стиля письма 22 ведущих языковых моделей искусственного интеллекта. Исследователи с помощью статистического инструмента Fable провели сравнение исходных текстовых ответов моделей на одну и ту же серию тестовых заданий с использованием показателя перекрестной энтропии. Результаты показали, что не только модели, разработанные в одной лаборатории, имеют очень схожий стиль письма, но и некоторые модели из разных лабораторий демонстрируют необычайно схожие языковые особенности.
Исследователи объединили ответы каждой модели на все тестовые задания в единый текстовый корпус и рассчитали вероятностное распределение на основе триадов символов (то есть скользящих окон, состоящих из каждых трех последовательных символов), что позволило создать уникальную «модель языкового стиля» для каждой модели.
Хотя этот метод относится к базовым технологиям языкового моделирования, он основан на тысячах образцов и гораздо лучше отражает внутренние языковые привычки модели, чем простое оценивание.
В исследовании подчеркивается, что данный анализ сравнивает исключительно языковые стили, включая лексические привычки, предпочтения в форматировании, стилистические регистры и т. д., и не затрагивает содержание позиций или точек зрения моделей.
Исследователи ожидают, что модели одного производителя будут иметь схожий стиль из-за общих корней в обучающих данных, но при этом признают потенциальное влияние переменных, связанных с избыточностью данных
Критерием определения сходства между лабораториями служит следующее: если разброс стилей пары моделей из разных лабораторий меньше медианы разброса пар моделей из одной лаборатории в наборе данных, то срабатывает предупреждение. Этот порог определяется исключительно самими данными, без какого-либо искусственного вмешательства.
Выводы о направлении зависимости основываются исключительно на дате публикации. Статистические методы могут лишь показать, что стили двух моделей схожи, но не позволяют определить, какая из них копировала другую. Факт более позднего выпуска по сравнению с какой-либо моделью служит лишь прокси-показателем даты окончания сбора обучающих данных и даёт ориентир для определения направления причинно-следственной связи.
Все данные для анализа получены в ходе одного и того же тестирования, названного «You’re absolutely right!», проведённого 18 июля 2026 года. 22 модели отвечали на одни и те же тестовые вопросы в абсолютно одинаковых условиях; в общей сложности было собрано 584 655 символов исходного текста моделей. Данные были встроены в аналитический файл с точностью до символа, и любой желающий может полностью воспроизвести все выводы на основе этого единственного файла. Данные об оценках самого теста сохранены вместе со снимком, однако в данном анализе оценки не используются, а используется исключительно текст.
Исследователи пока не сделали окончательных качественных выводов, но заявили, что результаты вызывают значительные сомнения, и призвали сообщество провести независимую проверку данных и кода.


https://typebulb.com/u/lab/you-re-relatively-right/full
Источник: habr.com