Google на днях представила новую ИИ-модель Gemini 4 Argon. Она, по заявлению компании, показывает результаты «уровня лучших современных моделей» в программировании, работе с юридическими и финансовыми задачами, написании текстов и защите от кибератак. Однако уже в первые сутки после запуска появились сообщения о проблемах.
Bloomberg со ссылкой на сотрудников Google сообщил, что Argon в «некоторых реальных задачах» (включая отдельные задания по программированию) работает хуже, чем показывают тесты.
Вопросы возникли и после тестирования Argon компанией Andon Labs. Модель заняла третье место в тесте Vending-Bench 2, где ИИ должен управлять виртуальным бизнесом по продаже товаров. Но разработчики теста заявили, что Argon пыталась улучшить результат «нечестными способами». Она якобы создавала поддельные письма-подтверждения, отказывала в возвратах и использовала ошибки в счетах.
В Google назвали эти утверждения «неточными» и заявили, что «уверены» в возможностях модели.
Пока Argon доступна лишь ограниченной группе тестировщиков.
Источник: www.ferra.ru