Новые ИИ-модели и LLM недели: Qwen3.8-Flash-Next, GLM-5.3, Granite 4.2, Hy4 и новые модели для видео, речи и изображений

С 24 по 31 августа разработчики выпустили сразу несколько заметных ИИ-моделей и LLM. В числе главных релизов недели — новая архитектура Qwen3.8-Flash-Next, мультимодальная GLM-5.3-Flash и публикация весов основной GLM-5.3, Granite 4.2 от IBM, Hy4 preview от Tencent и первая собственная LLM Thomson Reuters.

Параллельно обновились модели для генерации видео, изображений и речи. Alibaba выпустила Wan 3.0, Bria AI — Fibo 1.5, а в speech-направлении появились Gemini 3.5 Transcribe, FireRedTTS3, Breeze TTS 2 и Sopro V2 Turbo. Ниже — главные релизы новых нейросетей и обновления AI-моделей за последнюю неделю августа.

Новые LLM и мультимодальные языковые модели

Thomson — собственная LLM от Thomson Reuters

Thomson Reuters представила Thomson — первую собственную большую языковую модель компании.

Вместо попытки конкурировать с крупнейшими универсальными моделями по числу параметров компания сделала ставку на специализированную LLM, обученную с использованием собственных профессиональных данных и экспертизы. На разработку Thomson Reuters направила $40 млн.

Модель предназначена для юридических, налоговых, аудиторских и других профессиональных сценариев. Компания подчёркивает, что полностью контролирует Thomson и её эксплуатацию, а сама модель рассчитана на существенно меньшую стоимость работы по сравнению с сопоставимыми frontier-моделями.

Thomson

Apodex 1.1 — LLM для многошаговых агентских задач

В конце августа обновилось семейство Apodex 1.1, ориентированное на сложные автономные задачи.

Основной акцент разработчики делают не на обычном диалоге, а на сценариях, где модели нужно последовательно анализировать информацию, работать с файлами, кодом и внешними инструментами и доводить задачу до результата.

В линейке есть и open-weight версия Apodex 1.1 mini на 35 млрд параметров. Семейство позиционируется как agentic-модель для длинных рабочих цепочек, а не как обычный чат-бот.

Granite 4.2 — IBM добавила нативный reasoning

IBM представила Granite 4.2 — новое семейство открытых reasoning-моделей в трёх размерах: 3B, 8B и 30B параметров.

Главное изменение по сравнению с предыдущим поколением — встроенный режим reasoning. Модели умеют выполнять многошаговые рассуждения, работать с инструментами, решать задачи по программированию и использовать reasoning в агентских сценариях.

При этом IBM сознательно оставила семейство относительно компактным: версии Granite 4.2 рассчитаны не только на облачные сервисы, но и на локальный запуск и корпоративную инфраструктуру.

Granite 4.2

Qwen3.8-Flash-Next — preview архитектуры следующего поколения Qwen

Alibaba открыла веса Qwen3.8-Flash-Next.

Это мультимодальная MoE-модель и одновременно ранний preview архитектуры, которую разработчики планируют использовать в следующем поколении Qwen. Команда специально открыла модель до появления полноценной новой линейки, чтобы показать архитектурные изменения и дать сообществу возможность их исследовать.

Qwen3.8-Flash-Next получила изменения сразу в нескольких компонентах архитектуры — attention, residual, embedding и оптимизации. Задача релиза — сохранить большую ёмкость модели, одновременно снижая вычислительные затраты.

Это один из наиболее интересных open-weight релизов недели именно с исследовательской точки зрения.

Qwen3.8-Flash-Next

Ссылки

github
huggingface + quantized
Демо
API

GLM-5.3 и GLM-5.3-Flash

На этой же неделе Z.ai представила GLM-5.3-Flash. Модель стала мультимодальной: она работает с текстом, изображениями и видео. Архитектура использует sparse-механизмы, благодаря чему при общем размере около 320 млрд параметров на каждый токен активируется только около 18 млрд. Она ориентирована прежде всего на агентские и coding-сценарии, а также на работу с длинным контекстом.

GLM-5.3-Flash

Следом Z.ai опубликовала веса GLM-5.3. Таким образом, за одну неделю обновилась сразу основная модель семейства и её более экономичная Flash-версия.

GLM-5.3

Hy4 preview — 770 млрд параметров от Tencent

Tencent выпустила и открыла веса Hy4 preview. Это MoE-модель с 770 млрд параметров, из которых 49 млрд активны на токен. Контекстное окно превышает 1 млн токенов.

Tencent позиционирует Hy4 как модель для программирования, офисной работы и научных задач. В отличие от многих экспериментальных open-weight моделей, разработчики изначально делают упор на длительные agentic-сценарии и реальную работу с большими объёмами контекста.

Hy4 preview

Новые модели для генерации видео

Wan 3.0 — новая видеомодель Alibaba

Это мультимодальная видеомодель, которая объединяет генерацию видео, работу с изображениями и референсами, редактирование и продолжение сцен в рамках одной модели. Wan 3.0 поддерживает генерацию видео до 30 секунд и варианты вывода от 480p до 1080p.

Заявленная стоимость стандартной версии начинается от $0,05 за секунду для 480p, $0,10 для 720p и $0,20 для 1080p.

Wan 3.0

MiniMax H3 Max — ускоренная версия видеомодели

В конце недели появилась MiniMax H3 Max — пост-трейн версия MiniMax H3, ориентированная на более быструю генерацию видео.

Для модели заявлены генерация пятisekундного 768p-ролика примерно за три секунды и сниженная стоимость инференса. В отличие от исходной H3, H3 Max делает ставку прежде всего на скорость и быстрые итерации.

MiniMax H3 Max

MiniMax-H3 × Z-Image — улучшенная детализация видео

Появилась производная версия MiniMax-H3 × Z-Image, в которой разработчики попытались перенести сильные стороны Z-Image в работе с текстурами в видеогенерацию H3.

Главное изменение заметно на мелких деталях: поверхности, лица, растительность и другие текстурные элементы должны выглядеть более детализированными, при этом базовые свойства MiniMax H3 сохраняются.

MiniMax-H3 × Z-Image

InfinityEdit — модель для последовательного редактирования видео

InfinityEdit от Zhejiang University и Alibaba Group решает другую задачу — последовательное редактирование видео текстовыми командами.

После каждой команды модель продолжает работать с уже изменённой сценой, а не начинает генерацию заново. Это позволяет выстраивать длинную цепочку правок, не разрывая исходное видео.

InfinityEdit

VideoNeuMat — нейронные материалы из генеративных моделей

VideoNeuMat от NVIDIA и University of Manchester превращает знания видеогенеративных моделей о внешнем виде объектов в отдельное представление материала.

На вход можно подать текст или изображение, а на выходе получить нейронный материал, который отделён от конкретной геометрии и освещения. Такой подход рассчитан уже не столько на генерацию видео, сколько на дальнейшее использование материалов в 3D.

VideoNeuMat

Новые модели для генерации изображений

Fibo 1.5 — генерация изображений за 4–6 шагов

Bria AI обновила модель Fibo 1.5. Вместо десятков шагов новая версия использует дистилляцию и генерирует изображение за 4–6 шагов без classifier-free guidance. При этом сохраняется главное преимущество семейства FIBO — структурированное JSON-native управление сценой.

Разработчики заявляют улучшение реализма и качества текстур при существенном сокращении количества шагов инференса. Релиз датирован 24 августа.

Fibo 1.5

SenseNova U1.5 Lite

SenseNova обновила мультимодальную модель U1.5 Lite. В новой версии улучшены генерация изображений, следование сложным инструкциям и работа с текстом. Также заявлена поддержка нативного 4K и более точного редактирования с сохранением исходного изображения.

SenseNova U1.5 Lite

Модели для речи и голоса

Gemini 3.5 Transcribe — интеллектуальная транскрипция

Google представила Gemini 3.5 Transcribe — новую speech-to-text модель. В отличие от классических систем распознавания речи она сразу превращает сырой аудиопоток в очищенный и структурированный текст: модель умеет убирать слова-паразиты и самоперебивы, учитывать контекст и автоматически форматировать результат.

Google заявляет поддержку более 85 языков, включая региональные варианты произношения, и работу в реальном времени.

Gemini 3.5 Transcribe

FireRedTTS3 — клонирование и редактирование голоса

FireRedTTS3 — третье поколение TTS-модели FireRed Team. Она объединяет несколько задач в одной системе: zero-shot клонирование голоса, управление характеристиками голоса по текстовой инструкции и редактирование уже сгенерированной речи.

Модель поддерживает 24 языка, включая русский. Для клонирования достаточно короткого аудиореференса.

FireRedTTS3

Breeze TTS 2 — realtime TTS

Breeze TTS 2 — новая модель синтеза речи, ориентированная на работу в реальном времени. Она поддерживает клонирование голоса, управление манерой речи по инструкции и специальные голосовые события. Разработчики заявляют задержку до первого аудио менее 40 мс и скорость генерации до трёх раз выше реального времени.

Breeze TTS 2

Sopro V2 Turbo — 120 млн параметров и работа на CPU

Sopro V2 Turbo выделяется минимальным размером — всего около 120 млн параметров. Модель умеет клонировать голос по короткому образцу и работает непосредственно на устройстве. Разработчики заявляют первый звук примерно через 300 мс на обычном ноутбучном CPU и генерацию до пяти раз быстрее реального времени.

Sopro V2 Turbo

Embeddings и специализированные AI-модели

GigaEmbeddings — новое поколение embeddings от Сбера

Сбер представил три модели семейства GigaEmbeddings: на 480 млн, 3 млрд и 10 млрд параметров с 1,8 млрд активных параметров. Это не генеративные LLM, а модели представления текста для семантического поиска, RAG, классификации и кластеризации.

Особенно интересна крупная версия 10B-A1.8B: она заняла первое место в ruMTEB. Более компактные модели также получили заметные улучшения по скорости и качеству русского языка.

GigaEmbeddings

Какие модели стали доступны на BotHub

В конце лета на платформе BotHub появились и стали доступны для работы ещё несколько актуальных моделей для текста, изображений и видео.

Среди них:

  • Seedance 2.0 и Seedance 2.5 — модели для генерации видео;

  • Seedream 4.5 — модель для генерации изображений;

  • Kimi K2.6 и Kimi K3 — большие языковые модели;

  • GLM-5.3 — языковая модель семейства GLM;

  • MiniMax-M3 — большая языковая модель MiniMax;

  • Mistral Medium 3.5 — новая версия LLM от Mistral;

  • GPT-OSS-120B — открытая большая языковая модель;

  • Wan 2.7 — видеомодель семейства Wan;

  • Gemini 3.7 Flash — быстрая версия мультимодальной модели Google.

Что успели протестировать? Как вам релизы конца августа?

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев