Google обновила свою модель для генерации и редактирования изображений. Nano Banana 2.1 построена на Gemini 3.6 Flash и сохраняет Flash-подход: быстрый инференс при заметно более низкой стоимости по сравнению с Pro-линейкой. Модель уже появилась в Gemini, AI Studio и Gemini API.
Основной апгрейд — работа с редактированием. В анонсе пишут об улучшении консистентности персонажей и объектов, multi-image editing, масок и эскизов, а также генерации инфографики. Для последней задачи модель может использовать знания Gemini и данные веб-поиска, что помогает не только рисовать изображение, но и точнее работать с фактическим содержанием.
Самая приятная плюшка, как по мне — большое контекстное окно. Модель принимает текст и изображения с контекстом до 1 млн токенов. На выходе поддерживается до 4K токенов для изображения и до 64K для текста. При этом в Gemini API опубликованы отдельные лимиты: 131 072 входных и 32 768 выходных токенов.
Для multi-reference сценариев можно передать до 14 изображений. Google заявляет сохранение консистентности до четырёх персонажей и точности до десяти объектов. Есть генерация в 1K, 2K и 4K, включая широкие и панорамные соотношения сторон.
Отдельно появилась настраиваемая глубина Thinking: minimal, medium и high, причём medium используется по умолчанию.
Что изменилось в цифрах
В собственных preference-тестах Google Nano Banana 2.1 с Thinking получила 1050 Elo против 990 у Nano Banana 2 и 935 у Nano Banana Pro.
Для задач с несколькими персонажами модель получила 1106 Elo, против 978 у Nano Banana 2 и 1011 у Pro. В mask/ink-based editing — 1049 Elo против 965 и 927 соответственно.
Отдельно Google проверила фактологическую точность инфографики. Здесь Nano Banana 2.1 показала 0,521 против 0,179 у Nano Banana 2 и 0,265 у Nano Banana Pro.
Источник: habr.com