Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

Anthropic выпустила обновление своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в общем доступе, а Mythos 5.1 – только проверенным организациям через программы доверенного доступа.

Что изменилось в бенчмарках

Компания заявляет о заметном росте показателей по сравнению с Fable 5. На Terminal-Bench-Science 0.1, который оценивает агентные способности к научным исследованиям, Fable 5.1 набирает 52,6% против 24,7% у Fable 5 – более чем двукратный прирост. На Terminal-Bench 4.0 (агентное программирование в терминале) результат – 55,8% против 42% у предшественника, а Mythos 5.1 с более мягкими киберограничениями показывает 60,9%.

Рост фиксируется и в других категориях: GDPval-AA v2 (интеллектуальная работа) – 1853 балла против 1723 у Fable 5; AutomationBench (бизнес-процессы) – 31,4% против 17,1%; CursorBench 3.2.0 – 73,4% против 70,5%.

При выставлении низкого или среднего уровня эффорта Fable 5.1 достигает результатов, сопоставимых или превосходящих Fable 5, но при меньшей стоимости. В Claude Code по умолчанию используется высокий уровень усилий, в Claude Cowork и на claude.ai – средний.

Отзывы ранних тестировщиков

Среди компаний, получивших ранний доступ: Jane Street Capital, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, Browserbase, Shopify, Datadog, SpaceXAI и другие.

  • Компания Millennium сообщила, что Fable 5.1 нашла причину крайне редкого сбоя (примерно один случай на миллион запусков) во внутренних системах, которую инженеры компании не могли объяснить четыре-пять лет: модель дизассемблировала стороннюю библиотеку и сопоставила её с дампом памяти.

  • В Ramp описали беспрерывный 38-часовой прогон модели над задачей машинного обучения, в ходе которого она переоценила предыдущий результат, диагностировала артефакт разметки данных, запустила шесть параллельных экспериментов и вернулась с результатами и предложениями по дальнейшим шагам.

  • В Browserbase заявили о 82% выполненных задач на самом сложном бенчмарке браузерных агентов против 74% у Opus 5 и 57% у Fable 5.

Доступность

Claude Fable 5.1 появилась уже сегодня на всех основных платформах. Модель можно потестить:

  • На сайте claude.ai.

  • В GPTunneL новая версия тоже уже доступна.

Anthropic заявляет о планах расширить доступ к Mythos 5.1 на более широкий круг партнёров, в том числе международных.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев