Привет! Первый месяц осени мы посвятили ИИ: расширили выбор GPU‑конфигураций, обновили сервис резервного копирования и подготовили материалы для работы с ИИ — от выбора видеопамяти до запуска помощника по документам компании.
Запустили новый тариф: две NVIDIA L4 в одной машине
Если одной L4 уже мало, а NVIDIA L40S — это «слишком сложно и дорого», у нас появилось то, что нужно. Конфигурация с двумя NVIDIA L4 в одной виртуальной машине дает 48 ГБ видеопамяти для ваших проектов по доступной стоимости.
В составе:
-
2 × NVIDIA L4 по 24 ГБ
-
16 vCPU на высокочастотных процессорах AMD EPYC 9555
-
64 ГБ DDR5
-
300 ГБ NVMe
Конфигурация подойдет для запуска LLM, ИИ‑помощников, экспериментов с дообучением моделей, генерации картинок и обработки видео.
Заходите на наш сайт, чтобы посмотреть тарифы на GPU‑серверы.
Обновили BaaS до 13-й версии Veeam
Самое главное, что изменилось — безопасность. В последней версии также обновлены критичные уязвимости. Также добавились ИИ‑анализ подозрительной активности, двойное подтверждение критичных действий и поддержка единого входа.
Ускорилось восстановление, расширилась поддержка CDP для физических и виртуальных Linux‑ и Windows‑нагрузок, что позволяет защищать данные с минимальной точкой восстановления.
Написали новые посты в Телеграм
В сентябре добавили несколько полезных материалов, которые помогут настроить CrowdSec, использовать ИИ для работы с корпоративной базой знаний. А еще разобрались, какие форматы используют компании и дата‑центры, чтобы расширить память.
Безопасность. Показали, как настроить CrowdSec для защиты сервера, чтобы вовремя обнаруживать подозрительную активность, блокировать перебор паролей SSH и проверять веб‑запросы.
Читать: про настройку CrowdSec на Linux
ИИ. Объяснили, как подключить документы компании к ИИ‑помощнику. Разобрались, сколько видеопамяти понадобится языковой модели с учетом контекста и одновременных запросов.
Читать: про RAG, про видеопамять
Технологии. Обсудили NVIDIA RTX PRO 5500 Blackwell, расширение серверной памяти через CXL и применение LPDDR5X в дата‑центрах.
Читать: про GPU, про CXL, про LPDDR5X
Новости и свежие материалы mClouds быстрее всего появляются в Телеграме. Подписывайтесь на наш канал.
И тут, на Хабре, тоже писали немного )
В сентябре добавили две статьи: рассказали о технологии CXL для расширения памяти сервера и разобрались, зачем дата‑центры устанавливают «ноутбучную» память.
Больше RAM через PCIe: как работает CXL
Бывает, процессор еще справляется, а оперативной памяти уже не хватает. Разобрали, как технология CXL расширяет серверную память, можно ли повторно использовать старые модули DDR4 и какие ограничения есть по скорости и совместимости.
«Ноутбучная» память приходит в серверы
Рассказали, зачем дата‑центрам LPDDR5X и съемные модули SOCAMM2. Дело в том, что такая память потребляет меньше энергии, и для CPU и GPU остается больше свободной мощности. В статье обсудили устройство нового формата и результаты испытаний в задачах ИИ, веб‑сервисах и аналитике.
Как оценить VRAM для LLM и немного про RAG — рассказали у себя на сайте
Заходите в наш блог — в сентябре там появилось несколько полезных материалов, которые помогут вам в реализации проектов с ИИ.
Как правильно оценить объем VRAM для запуска LLM
Чтобы правильно выбрать GPU для запуска LLM, мало учитывать размер модели. Даже если LLM занимает 14 ГБ, видеокарты на 16 ГБ может не хватить: длинные диалоги и одновременные запросы требуют дополнительной памяти. Объясняем, как оценить реальную нагрузку и не промахнуться с выбором GPU.
Как запустить локальную LLM с RAG‑системой на своем сервере
Подготовили пошаговое руководство по запуску LLM с RAG — с поиском ответов на основе вашей базы знаний. Показываем, как развернуть систему на GPU‑сервере mClouds, подключить документы и настроить веб‑интерфейс. Такой помощник пригодится для поиска по инструкциям, регламентам и внутреннему FAQ.
В этой же статье ↓
Qwen или Gemma: сравнили модели на практике
Протестировали Qwen3.5–9B и Gemma 4 E4B на NVIDIA L4 24 ГБ: задали обеим моделям один и тот же вопрос и сравнили ответы на русском языке с подключенной базой знаний и без нее. При анализе результатов учитывали также скорость генерации и расход видеопамяти. Gemma показала около 45 токенов в секунду, Qwen — около 28. Gemma отвечала более кратко и по существу, а Qwen добавляла подробности. Разбираем результаты в статье о запуске LLM и объясняем, на что смотреть при выборе модели под свои документы и задачи.
Сохраняйте сайт mClouds в закладки, подписывайтесь на наш блог на Хабре и телеграм‑канал — мы регулярно делимся полезными материалами и инструкциями, которые помогут вам быстрее реализовывать проекты, усиливать безопасность и экономить ресурсы. Работаем для вас!
Источник: habr.com