Основной апгрейд пришёлся на агентное программирование, длинные задачи и повседневную работу с документами, таблицами и презентациями.
По данным Anthropic, Sonnet 5.5 генерирует ответы 30 с лишним процентов быстрее Sonnet 5. При этом цена токенов осталась прежней, но сама задача обычно обходится дешевле: модель тратит меньше токенов и делает меньше шагов. В тестах Anthropic экономия достигала 30% на задачу.
Самый заметный прирост — в программировании:
Бенчмарк
Sonnet 5.5
Sonnet 5
Terminal-Bench 4.0
70,6%
10,3%
CursorBench 4.0
55,5%
34,1%
FrontierCode 1.1
46,2%
42,4%
GDPval-AA v2.1
1844
1449
OSWorld 2.1
80,1%
57,0%
Humanity’s Last Exam, с инструментами
64,5%
54,9%
В агентном кодинге модель стала экономнее. По словам Anthropic и ранних тестеров, Sonnet 5.5 быстрее разбирается в больших кодовых базах, умеет объединять вызовы инструментов и завершает задачи за меньшее число шагов. Например, Lovable зафиксировала примерно на треть меньше tool calls и почти вдвое меньше shell-вызовов.
Сильнее стала и работа с компьютером и визуальными данными. На OSWorld 2.1 модель набрала 80,1%, на Chartography — 61,6% против 15,6% у Sonnet 5. Anthropic также заявляет заметный прогресс на длинных knowledge-work задачах и в создании документов, презентаций и таблиц.
При этом API-тариф не изменился:
$2 / 1 млн входных токенов
$10 / 1 млн выходных токенов
$0,20 / 1 млн cache reads
Есть и отдельное изменение по безопасности: из-за роста возможностей в кибербезопасности Sonnet 5.5 впервые для линейки Sonnet получила защитные механизмы, близкие к тем, что используются в старших моделях. Для части высокорисковых киберзадач модель может откатываться на Sonnet 5.
Claude Sonnet 5.5 уже доступна в Claude и API, а также через AWS, Google Cloud и Microsoft Azure. API ID — claude-sonnet-5-5. Anthropic также готовит Claude Haiku 5.5, который должен выйти в ближайшие недели.
Источник: habr.com