В Рег.облаке запустили инференс ИИ-моделей на NVIDIA B300

В Рег.облаке расширили GPU-инфраструктуру ускорителями NVIDIA B200 и B300. Новые мощности уже доступны клиентам, а часть B300 мы задействовали внутри собственной ИИ-платформы — на них идет инференс моделей, развернутых непосредственно в инфраструктуре Рег.облака.

Что изменилось: раньше часть моделей на платформе была доступна через внешних поставщиков, теперь отдельные модели работают полностью внутри нашего контура. Запросы к ним не передаются внешним AI-провайдерам, не уходят за пределы инфраструктуры Рег.облака и не логируются.

С такими моделями можно работать без виртуальной частной сети компании и трансграничной передачи данных, а оплачивать использование — в рублях по фактически потребленным токенам.

Что по железу: NVIDIA B300 относится к поколению Blackwell Ultra и рассчитана в том числе на инференс reasoning- и agentic-моделей. В конфигурации HGX B300 восемь ускорителей объединяют более 2 ТБ HBM3E-памяти, поэтому на такой системе можно размещать крупные модели и обслуживать более тяжелые inference-нагрузки.

Что с самой ИИ-платформой: сейчас через единый интерфейс и API в Рег.облаке доступны почти 40 моделей. Платформой уже воспользовались более тысячи клиентов. Каталог моделей, которые работают непосредственно на нашей инфраструктуре, будем расширять по мере ввода новых GPU-мощностей.

При этом новые мощности на B200 и B300 доступны клиентам для собственных AI/ML-нагрузок — от инференса и тестирования моделей до ресурсоемких вычислений. Полный список доступных моделей собрали на сайте Рег.облака.

Читать далее

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев