Google представили Gemini 4 Argon, новую флагманскую модель для программирования, профессиональных задач и кибербезопасности. В опубликованной компанией таблице она показывает лучший результат в 13 из 19 строк, а ещё в одной делит первое место с GPT-6 Astra.
На DeepSWE v1.1, который оценивает выполнение длительных задач по разработке, Argon набрала 77,9%. Для сравнения: у GPT-6 Astra результат составляет 74,1%, у Claude Opus 5.5 составляет 74,2%, у Fable 5.1 составляет 67,4%. Модель также опережает конкурентов в тестах автоматизации бизнес-процессов, финансовых и юридических задач, работы с длинным контекстом и понимания видео.

Однако пользователи ранее уже критиковали Gemini за бенчмаксинг и жаловались на разрыв между результатами тестов и качеством в работе. У Argon тоже есть повод присмотреться к цифрам: на Terminal-Bench 4.0 она набрала 57,4% против 66,4% у Opus 5.5, а на FrontierSWE v2 получила 55% против 65,5% у Astra. Эти результаты сами по себе не доказывают подгонку под бенчмарки, но очень подозрительно, что именно в свежих бенчмарках Argon не оказался сильнее всех.
К сожалению, проверить, насколько заявленные возможности соответствуют реальной работе, пока сможет лишь ограниченный круг пользователей. Общего доступа нет.
Следующими доступ получат платные пользователи API и подписчики Google AI Ultra, но дату компания пока не назвала.
Стартовая цена API составит $2 за миллион входных и $10 за миллион выходных токенов. После вводного периода тариф увеличится до $4/$20. Кэшированные входные токены будут стоить на 95% дешевле обычных.
Если новость понравилась, приглашаю в канал AI for Devs. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
Источник: habr.com