Anthropic представила Claude Opus 5.5, первую модель семейства Claude 5.5. Компания позиционирует её как более доступную альтернативу Fable 5.1 для программирования и сложной интеллектуальной работы. По оценке Anthropic, типичная задача обходится на 40% дешевле, чем при использовании Opus 5, а генерация ответа стала быстрее более чем на 30%.
Снижение стоимости складывается из двух факторов. Opus 5.5 расходует меньше токенов на задачу, а сами токены подешевели на 20%. Миллион входных токенов стоит $4 вместо $5, выходных $20 вместо $25. Чтение кеша подешевело сразу на 60%, с $0,50 до $0,20 за миллион токенов. Это особенно заметно в агентных сценариях и работе с кодом, где модель постоянно обращается к уже обработанному контексту.
Ускоренный режим для Claude Code и API выдаёт токены до 2,5 раза быстрее. Его цена составляет $8 за миллион входных и $40 за миллион выходных токенов.
Что показали тесты
В опубликованных Anthropic результатах Opus 5.5 обходит не только предшественника, но и Fable 5.1 в большинстве приведённых тестов:
-
Terminal-Bench 4.0 для работы в терминале 66,4% против 55,8% у Fable 5.1 и 52,3% у Opus 5;
-
CursorBench 4.0 для агентного программирования 57,8% против 51,8% и 46,6%;
-
GDPval-AA v2.1 для профессиональных задач 1846 пунктов Elo против 1735 и 1708;
-
OSWorld 2.0 для управления компьютером 81,8% против 80,7% и 74%.
В тесте AutomationBench модель набрала 40%, немного уступив GPT-6 Astra с результатом 41,4%.

К цифрам стоит относиться с обычной осторожностью. Большинство результатов опубликовала сама Anthropic, а Opus 5.5 во многих тестах работала с максимальным уровнем рассуждений. Компания также признаёт, что небольшая разница в бенчмарках всё хуже отражает различия при реальной работе. По внутренней оценке Anthropic, на практике Opus 5.5 скорее соответствует уровню Fable 5.1, чем заметно превосходит её.

В одном из внутренних экспериментов обе модели переписывали HAProxy с C на Rust. Получившиеся версии прошли почти все штатные регрессионные тесты, но Opus 5.5 закончила работу за 9,5 часа вместо 12 и обошлась на 51% дешевле. Другой ранний пользователь сообщил о миграции проекта из 680 тысяч строк менее чем за сутки. Это примеры от Anthropic и участников предварительного тестирования, а не независимые сравнительные исследования.
Claude обещает меньше «клаудить»
Отдельным пунктом Anthropic занялась стилем ответов. Пользователи критиковали Opus 5 за многословие, необычные обороты и привычку прятать главный вывод внутри длинного текста. За этой манерой даже закрепилось неофициальное название Claudish.
Opus 5.5, по словам разработчиков, чаще начинает с главной информации, реже использует жаргон и лучше соблюдает заданные правила письма. Ранние тестировщики называют её ответы более понятными при продолжительных рабочих сессиях. Насколько заметна разница вне подготовленных примеров, покажут пользовательские тесты.
Ограничения стали строже
Opus 5.5 стала первой моделью линейки Opus, которая получила защитные механизмы уровня Fable 5.1 для биологии, кибербезопасности и предотвращения дистилляции.
Обычный поиск и исправление ошибок в коде останутся доступны. Однако большинство специализированных задач по кибербезопасности при срабатывании классификатора будут перенаправляться на Opus 4.8. Часть запросов по биологии и разработке передовых языковых моделей получит Opus 5. Для исследовательских организаций Anthropic предлагает отдельные программы проверенного доступа.

Кроме того, в Opus 5.5 нельзя полностью отключить режим рассуждений. Модель поддерживает Preserved Thinking, механизм, который не позволяет клиенту API редактировать предыдущий контекст рассуждений Claude. Anthropic рассматривает это как защиту от массового извлечения возможностей модели через тысячи подставных аккаунтов.
В тестах безопасности Opus 5.5 реже пыталась выходить за заданные ограничения и лучше сопротивлялась prompt injection, то есть внедрению вредоносных инструкций через обрабатываемые моделью данные. При этом сама Anthropic предупреждает, что модель иногда распознаёт проверочные сценарии. Из-за этого лабораторные оценки поведения могут не полностью описывать её действия в реальных системах.
Где доступна модель
Claude Opus 5.5 уже появилась в продуктах Anthropic и в API под идентификатором claude-opus-5-5. Модель также доступна через Amazon Web Services, Google Cloud и Microsoft Azure.
Компания увеличивает пятчасовые лимиты для тарифов Pro, Max и Team и разрешает сохранить одно сбрасывание лимита, чтобы использовать его позже. Claude Sonnet 5.5 и Haiku 5.5 должны выйти в ближайшие недели.
Запуск состоялся примерно через два месяца после появления Opus 5. Получилась редкая для флагманских моделей комбинация, когда новое поколение одновременно быстрее, дешевле и, судя по опубликованным тестам, сильнее. Теперь проверяе: действительно ли 40-процентная экономия воспроизводится в реальных проектах и научился ли Claude наконец отвечать без перевода с Claudish.
Больше важных AI‑новостей в канале AI Native. Разбираем все, что связано с ИИ.
Источник: habr.com