С 24 по 31 августа разработчики выпустили сразу несколько заметных ИИ-моделей и LLM. В числе главных релизов недели — новая архитектура Qwen3.8-Flash-Next, мультимодальная GLM-5.3-Flash и публикация весов основной GLM-5.3, Granite 4.2 от IBM, Hy4 preview от Tencent и первая собственная LLM Thomson Reuters.
Параллельно обновились модели для генерации видео, изображений и речи. Alibaba выпустила Wan 3.0, Bria AI — Fibo 1.5, а в speech-направлении появились Gemini 3.5 Transcribe, FireRedTTS3, Breeze TTS 2 и Sopro V2 Turbo. Ниже — главные релизы новых нейросетей и обновления AI-моделей за последнюю неделю августа.
Новые LLM и мультимодальные языковые модели
Thomson — собственная LLM от Thomson Reuters
Thomson Reuters представила Thomson — первую собственную большую языковую модель компании.
Вместо попытки конкурировать с крупнейшими универсальными моделями по числу параметров компания сделала ставку на специализированную LLM, обученную с использованием собственных профессиональных данных и экспертизы. На разработку Thomson Reuters направила $40 млн.
Модель предназначена для юридических, налоговых, аудиторских и других профессиональных сценариев. Компания подчёркивает, что полностью контролирует Thomson и её эксплуатацию, а сама модель рассчитана на существенно меньшую стоимость работы по сравнению с сопоставимыми frontier-моделями.
Thomson
Apodex 1.1 — LLM для многошаговых агентских задач
В конце августа обновилось семейство Apodex 1.1, ориентированное на сложные автономные задачи.
Основной акцент разработчики делают не на обычном диалоге, а на сценариях, где модели нужно последовательно анализировать информацию, работать с файлами, кодом и внешними инструментами и доводить задачу до результата.
В линейке есть и open-weight версия Apodex 1.1 mini на 35 млрд параметров. Семейство позиционируется как agentic-модель для длинных рабочих цепочек, а не как обычный чат-бот.
Granite 4.2 — IBM добавила нативный reasoning
IBM представила Granite 4.2 — новое семейство открытых reasoning-моделей в трёх размерах: 3B, 8B и 30B параметров.
Главное изменение по сравнению с предыдущим поколением — встроенный режим reasoning. Модели умеют выполнять многошаговые рассуждения, работать с инструментами, решать задачи по программированию и использовать reasoning в агентских сценариях.
При этом IBM сознательно оставила семейство относительно компактным: версии Granite 4.2 рассчитаны не только на облачные сервисы, но и на локальный запуск и корпоративную инфраструктуру.
Granite 4.2
Qwen3.8-Flash-Next — preview архитектуры следующего поколения Qwen
Alibaba открыла веса Qwen3.8-Flash-Next.
Это мультимодальная MoE-модель и одновременно ранний preview архитектуры, которую разработчики планируют использовать в следующем поколении Qwen. Команда специально открыла модель до появления полноценной новой линейки, чтобы показать архитектурные изменения и дать сообществу возможность их исследовать.
Qwen3.8-Flash-Next получила изменения сразу в нескольких компонентах архитектуры — attention, residual, embedding и оптимизации. Задача релиза — сохранить большую ёмкость модели, одновременно снижая вычислительные затраты.
Это один из наиболее интересных open-weight релизов недели именно с исследовательской точки зрения.
Qwen3.8-Flash-Next
Ссылки
github
huggingface + quantized
Демо
API
GLM-5.3 и GLM-5.3-Flash
На этой же неделе Z.ai представила GLM-5.3-Flash. Модель стала мультимодальной: она работает с текстом, изображениями и видео. Архитектура использует sparse-механизмы, благодаря чему при общем размере около 320 млрд параметров на каждый токен активируется только около 18 млрд. Она ориентирована прежде всего на агентские и coding-сценарии, а также на работу с длинным контекстом.
GLM-5.3-Flash
Следом Z.ai опубликовала веса GLM-5.3. Таким образом, за одну неделю обновилась сразу основная модель семейства и её более экономичная Flash-версия.
GLM-5.3
Hy4 preview — 770 млрд параметров от Tencent
Tencent выпустила и открыла веса Hy4 preview. Это MoE-модель с 770 млрд параметров, из которых 49 млрд активны на токен. Контекстное окно превышает 1 млн токенов.
Tencent позиционирует Hy4 как модель для программирования, офисной работы и научных задач. В отличие от многих экспериментальных open-weight моделей, разработчики изначально делают упор на длительные agentic-сценарии и реальную работу с большими объёмами контекста.
Hy4 preview
Новые модели для генерации видео
Wan 3.0 — новая видеомодель Alibaba
Это мультимодальная видеомодель, которая объединяет генерацию видео, работу с изображениями и референсами, редактирование и продолжение сцен в рамках одной модели. Wan 3.0 поддерживает генерацию видео до 30 секунд и варианты вывода от 480p до 1080p.
Заявленная стоимость стандартной версии начинается от $0,05 за секунду для 480p, $0,10 для 720p и $0,20 для 1080p.
Wan 3.0
MiniMax H3 Max — ускоренная версия видеомодели
В конце недели появилась MiniMax H3 Max — пост-трейн версия MiniMax H3, ориентированная на более быструю генерацию видео.
Для модели заявлены генерация пятisekундного 768p-ролика примерно за три секунды и сниженная стоимость инференса. В отличие от исходной H3, H3 Max делает ставку прежде всего на скорость и быстрые итерации.
MiniMax H3 Max
MiniMax-H3 × Z-Image — улучшенная детализация видео
Появилась производная версия MiniMax-H3 × Z-Image, в которой разработчики попытались перенести сильные стороны Z-Image в работе с текстурами в видеогенерацию H3.
Главное изменение заметно на мелких деталях: поверхности, лица, растительность и другие текстурные элементы должны выглядеть более детализированными, при этом базовые свойства MiniMax H3 сохраняются.
MiniMax-H3 × Z-Image
InfinityEdit — модель для последовательного редактирования видео
InfinityEdit от Zhejiang University и Alibaba Group решает другую задачу — последовательное редактирование видео текстовыми командами.
После каждой команды модель продолжает работать с уже изменённой сценой, а не начинает генерацию заново. Это позволяет выстраивать длинную цепочку правок, не разрывая исходное видео.
InfinityEdit
VideoNeuMat — нейронные материалы из генеративных моделей
VideoNeuMat от NVIDIA и University of Manchester превращает знания видеогенеративных моделей о внешнем виде объектов в отдельное представление материала.
На вход можно подать текст или изображение, а на выходе получить нейронный материал, который отделён от конкретной геометрии и освещения. Такой подход рассчитан уже не столько на генерацию видео, сколько на дальнейшее использование материалов в 3D.
VideoNeuMat
Новые модели для генерации изображений
Fibo 1.5 — генерация изображений за 4–6 шагов
Bria AI обновила модель Fibo 1.5. Вместо десятков шагов новая версия использует дистилляцию и генерирует изображение за 4–6 шагов без classifier-free guidance. При этом сохраняется главное преимущество семейства FIBO — структурированное JSON-native управление сценой.
Разработчики заявляют улучшение реализма и качества текстур при существенном сокращении количества шагов инференса. Релиз датирован 24 августа.
Fibo 1.5
SenseNova U1.5 Lite
SenseNova обновила мультимодальную модель U1.5 Lite. В новой версии улучшены генерация изображений, следование сложным инструкциям и работа с текстом. Также заявлена поддержка нативного 4K и более точного редактирования с сохранением исходного изображения.
SenseNova U1.5 Lite
Модели для речи и голоса
Gemini 3.5 Transcribe — интеллектуальная транскрипция
Google представила Gemini 3.5 Transcribe — новую speech-to-text модель. В отличие от классических систем распознавания речи она сразу превращает сырой аудиопоток в очищенный и структурированный текст: модель умеет убирать слова-паразиты и самоперебивы, учитывать контекст и автоматически форматировать результат.
Google заявляет поддержку более 85 языков, включая региональные варианты произношения, и работу в реальном времени.
Gemini 3.5 Transcribe
FireRedTTS3 — клонирование и редактирование голоса
FireRedTTS3 — третье поколение TTS-модели FireRed Team. Она объединяет несколько задач в одной системе: zero-shot клонирование голоса, управление характеристиками голоса по текстовой инструкции и редактирование уже сгенерированной речи.
Модель поддерживает 24 языка, включая русский. Для клонирования достаточно короткого аудиореференса.
FireRedTTS3
Breeze TTS 2 — realtime TTS
Breeze TTS 2 — новая модель синтеза речи, ориентированная на работу в реальном времени. Она поддерживает клонирование голоса, управление манерой речи по инструкции и специальные голосовые события. Разработчики заявляют задержку до первого аудио менее 40 мс и скорость генерации до трёх раз выше реального времени.
Breeze TTS 2
Sopro V2 Turbo — 120 млн параметров и работа на CPU
Sopro V2 Turbo выделяется минимальным размером — всего около 120 млн параметров. Модель умеет клонировать голос по короткому образцу и работает непосредственно на устройстве. Разработчики заявляют первый звук примерно через 300 мс на обычном ноутбучном CPU и генерацию до пяти раз быстрее реального времени.
Sopro V2 Turbo
Embeddings и специализированные AI-модели
GigaEmbeddings — новое поколение embeddings от Сбера
Сбер представил три модели семейства GigaEmbeddings: на 480 млн, 3 млрд и 10 млрд параметров с 1,8 млрд активных параметров. Это не генеративные LLM, а модели представления текста для семантического поиска, RAG, классификации и кластеризации.
Особенно интересна крупная версия 10B-A1.8B: она заняла первое место в ruMTEB. Более компактные модели также получили заметные улучшения по скорости и качеству русского языка.
GigaEmbeddings
Какие модели стали доступны на BotHub
В конце лета на платформе BotHub появились и стали доступны для работы ещё несколько актуальных моделей для текста, изображений и видео.
Среди них:
-
Seedance 2.0 и Seedance 2.5 — модели для генерации видео;
-
Seedream 4.5 — модель для генерации изображений;
-
Kimi K2.6 и Kimi K3 — большие языковые модели;
-
GLM-5.3 — языковая модель семейства GLM;
-
MiniMax-M3 — большая языковая модель MiniMax;
-
Mistral Medium 3.5 — новая версия LLM от Mistral;
-
GPT-OSS-120B — открытая большая языковая модель;
-
Wan 2.7 — видеомодель семейства Wan;
-
Gemini 3.7 Flash — быстрая версия мультимодальной модели Google.
Что успели протестировать? Как вам релизы конца августа?
Источник: habr.com