Компания Anthropic представила Claude Opus 5 — новую языковую модель, которая сочетает высокий уровень производительности и более доступную стоимость. По своим возможностям она приблизилась к флагманскому Claude Fable 5, но обходится вдвое дешевле. При этом модель стала основной в линейке Claude Max и самым мощным решением семейства Claude Pro.
По сравнению с Opus 4.8 новинка заметно прибавила в эффективности без увеличения стоимости использования. В тестах Frontier-Bench и GDPval-AA модель показывает лучшие результаты среди конкурентов, а в задачах программирования на CursorBench практически не уступает Fable 5. При этом выполнение тех же задач требует примерно вдвое меньших затрат.
Высокие результаты Opus 5 демонстрирует и в задачах, связанных с анализом данных, автоматизацией процессов и решением нестандартных проблем. На ARC-AGI 3 модель значительно опережает ближайших конкурентов, на AutomationBench успешнее справляется с комплексными бизнес-сценариями, а в OSWorld 2.0 показывает лучшую производительность среди доступных моделей при любом уровне затрат.
Серьёзные улучшения коснулись и научных задач. Opus 5 увереннее работает с вопросами структурной биологии, органической химии и биоинформатики. Особенно заметен прогресс в анализе молекулярных структур и прогнозировании влияния изменений белковых последовательностей на их свойства. Также модель научилась создавать более качественные интерактивные визуализации. В ходе автоматизированного поведенческого анализа ИИ-модель Opus 5 получила оценку 2,3 по показателю общего несоответствия поведения, что является самым низким результатом среди наших последних моделей
Во время внутреннего тестирования Opus 5 неоднократно подтверждала способность самостоятельно искать решение сложных задач. В одном из испытаний модель восстановила трёхмерную модель детали по чертежу, хотя не имела прямого доступа к изображению. Для этого она самостоятельно построила собственный конвейер компьютерного зрения и извлекла необходимые данные. В другом случае модель обнаружила причину ошибки в популярном проекте с открытым исходным кодом и предложила исправление, которое оказалось более полным, чем существующий патч. Ещё один пример связан с разработкой потока рыночных данных для новой биржи, где Opus 5 не только написала необходимый код, но и создала тестовую среду для его проверки.
Разработчики также отмечают высокий уровень соответствия требованиям безопасности. По внутренним оценкам Anthropic модель реже демонстрирует нежелательное поведение и лучше придерживается установленных правил по сравнению с предыдущими версиями. При этом в области наступательной кибербезопасности Opus 5 всё ещё уступает Mythos 5. Она хорошо обнаруживает уязвимости, однако значительно слабее справляется с созданием эксплойтов, что снижает потенциальные риски её использования. В OSS-Fuzz, одном из инструментов оценки кибербезопасности, Opus 5 близок к Mythos 5 по эффективности выявления уязвимостей программного обеспечения (слева), но значительно менее успешен в разработке эксплойтов для них (справа)
Для работы с моделью сохраняются ограничения в отдельных сценариях кибербезопасности и биологических исследований. При необходимости некоторые запросы автоматически перенаправляются на другие модели. Для корпоративных клиентов и исследователей предусмотрены специальные программы с расширенным доступом.
Claude Opus 5 уже доступен через API и сервис Claude по прежней цене 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов. Также появился ускоренный режим работы, который примерно в 2,5 раза быстрее стандартного варианта. Одновременно компания представила несколько обновлений платформы, включая возможность менять набор инструментов без сброса кэша подсказок и автоматическое переключение запросов на резервные модели при срабатывании механизмов безопасности.
Источник: trashbox.ru