Google выпустила Nano Banana 2.1

Google обновила свою модель для генерации и редактирования изображений. Nano Banana 2.1 построена на Gemini 3.6 Flash и сохраняет Flash‑подход: быстрый инференс при заметно более низкой стоимости по сравнению с Pro‑линейкой. Модель уже появилась в Gemini, AI Studio и Gemini API.

Основной апгрейд — работа с редактированием. В анонсе пишут об улучшении консистентности персонажей и объектов, multi‑image editing, масок и эскизов, а также генерации инфографики. Для последней задачи модель может использовать знания Gemini и данные веб‑поиска, что помогает не только рисовать изображение, но и точнее работать с фактическим содержанием.

Самая приятная плюшка, как по мне — большое контекстное окно. Модель принимает текст и изображения с контекстом до 1 млн токенов. На выходе поддерживается до 4K токенов для изображения и до 64K для текста. При этом в Gemini API опубликованы отдельные лимиты: 131 072 входных и 32 768 выходных токенов.

Для multi‑reference сценариев можно передать до 14 изображений. Google заявляет сохранение консистентности до четырёх персонажей и точности до десяти объектов. Есть генерация в 1K, 2K и 4K, включая широкие и панорамные соотношения сторон.

Отдельно появилась настраиваемая глубина Thinking: minimal, medium и high, причём medium используется по умолчанию.

Что изменилось в цифрах

В собственных preference‑тестах Google Nano Banana 2.1 с Thinking получила 1050 Elo против 990 у Nano Banana 2 и 935 у Nano Banana Pro.

Для задач с несколькими персонажами модель получила 1106 Elo, против 978 у Nano Banana 2 и 1011 у Pro. В mask/ink‑based editing — 1049 Elo против 965 и 927 соответственно.

Отдельно Google проверила фактологическую точность инфографики. Здесь Nano Banana 2.1 показала 0,521 против 0,179 у Nano Banana 2 и 0,265 у Nano Banana Pro.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев