Anthropic представила Claude Opus 5 — новую версию старшей модели семейства Claude. Модель уже доступна пользователям и через API, а по качеству в ряде задач приблизилась к Claude Fable 5, оставаясь при этом вдвое дешевле. Для Opus 5 сохранился прежний прайсинг: $5 за миллион входных токенов и $25 за миллион выходных.

По словам Anthropic, Opus 5 стала новым state-of-the-art в задачах кодинга и knowledge work: компания ссылается на Frontier-Bench и GDPval-AA. Пишут, что модель также стала сильнее в агентных сценариях и эффективнее в повседневном использовании. Opus 5 назначена дефолтной моделью для Claude Max и позиционируется как самая сильная опция для Claude Pro.
Главный практический акцент релиза — разработка ПО. Anthropic сообщает, что на Frontier-Bench v0.1 Opus 5 опережает все остальные модели, а на CursorBench 3.2 в режиме max effort она показывает результат в пределах 0,5% от пика Fable 5, но при этом обходится вдвое дешевле на задачу. Компания также заявляет о более высокой эффективности в agentic workflow: меньше лишних шагов, лучшее планирование и более стабильное поведение на длинных цепочках действий.
При этом в Anthropic не пытаются представить Opus 5 как универсального чемпиона во всех областях. В официальном посте прямо сказано, что модель не обгоняет Mythos 5 в кибербезопасности. Более того, компания отдельно отмечает, что Opus 5 не выводит вперед рискованные dual-use-возможности: на оценках по биологии и offensive cybersecurity она все еще уступает Mythos 5, хотя в обнаружении уязвимостей заметно приблизилась к нему.
Внимания заслуживает и безопасность самой модели. Anthropic пишет, что Opus 5 показала лучшее поведение по внутреннему behavioral audit среди своих недавних моделей и лучше следует «Constitution» компании, чем Opus 4.8, Sonnet 5 и Fable 5. В то же время в разделе про safeguards компания указывает, что для Opus 5 сохранены ограничения на часть cyber-задач: модель может находить уязвимости в исходном коде, но блокируется для binary-based scanning, penetration testing и генерации эксплойтов.
В сумме релиз выглядит как очень прагматичный шаг Anthropic: не очередная демонстрация «чудо-модели», а попытка улучшить именно те сценарии, за которые компании реально платят деньги — кодинг, агенты, анализ данных и профессиональную работу с документами. На фоне того, что публичный разговор об ИИ все чаще сводится к «достигли ли мы AGI», Anthropic снова делает ставку на более приземленную метрику: насколько модель помогает быстрее и надежнее выполнять прикладные задачи.
Кто затестил, как вам?
Источник: habr.com