AMD покупает стартап Taalas для создания чипов под конкретные нейросети

Компания AMD официально объявила о намерении приобрести стартап Taalas, разрабатывающий принципиально иной класс ускорителей для выполнения инференса нейросетей. Подавляющее большинство современных решений — от GPU NVIDIA® H200 и ускорителей AMD Instinct™ до специализированных тензорных процессоров — проектируются как программируемые вычислители. Они загружают веса модели из стеков HBM в регистры и вычисляют тензорные операции на универсальных исполнительных блоках. Подход Taalas несколько иной: архитектура чипа и веса конкретной модели «запекаются» непосредственно в структуру КМОП-кристалла.

Архитектура без HBM и первые показатели Taalas HC1

Чип Taalas HC1. Источник.Чип Taalas HC1. Источник.

Снижение энергопотребления достигается за счет отказа от выборки из памяти. В традиционных системах на прокачку гигабайтов весов через шину HBM тратится больше энергии, чем на сами математические операции. Чипы Taalas реализуют архитектуру прямого потока данных: связи и веса зафиксированы на уровне межсоединений между транзисторами. Сигнал идет последовательно через логические блоки, а шина памяти и циклы чтения HBM отсутствуют.

Чип Taalas HC1 изготовлен по техпроцессу TSMC 6 нм. Кристалл площадью 815 мм² содержит 53 миллиарда транзисторов и сконфигурирован под работу с моделью Llama® 3.1 8B. По заявлениям разработчиков, HC1 способен выдавать до 17 000 токенов в секунду на пользователя, опережая по показателям производительности и плотности вычислений такие системы, как NVIDIA® H200, NVIDIA® B200, а также ускорители от Groq, SambaNova и Cerebras.

Проблема гибкости

Сравнение производительности чипа Taalas HC1 с ускорителями NVIDIA® H200, B200, Groq, SambaNova и Cerebras на модели Llama® 3.1 8B . Источник.Сравнение производительности чипа Taalas HC1 с ускорителями NVIDIA® H200, B200, Groq, SambaNova и Cerebras на модели Llama® 3.1 8B . Источник.

Главный инженерный и экономический компромисс такой архитектуры — полная потеря гибкости. Если вам требуется запустить в серверной стойке другую модель или кардинально обновить текущую, придется буквально менять физические ускорители. Более того, для размещения крупных современных LLM потребуется не один, а сразу несколько кристаллов предельного размера сетки фотошаблона, соединенных в единый модуль.

На первый взгляд, необходимость проектировать и производить отдельные серии микросхем под каждую модель выглядит экономически нецелесообразной. Однако инженеры Taalas нашли компромисс в производстве. Для обновления весов и значений параметров в рамках зафиксированной архитектуры модели не требуется делать полный перезапуск производства. Достаточно перепроектировать лишь два верхних слоя фотошаблонов. Это сильно дешевле и быстрее, чем проектирование нового GPU с нуля, где счет масок идет на десятки слоев.

Арендуйте GPU за 1 рубль!

Выберите нужную конфигурацию в панели управления Selectel. *

Подробнее →

Зачем это AMD

Сделка с Taalas отлично вписывается в долгосрочную стратегию AMD. Компания не отказывается от универсальных графических ускорителей AMD Instinct™. Для гибких задач, экспериментов и обучения продолжит использоваться линейка AMD Instinct™ с программной платформой AMD ROCm™ и процессорами AMD EPYC™. В свою очередь, технологические наработки Taalas будут интегрированы в архитектуру серверных стоек Helios для обслуживания базовых, статичных нагрузок (base-load inference).

Когда модель доказывает свою эффективность, обрастает инфраструктурой и внедряется в миллионы продакшен-сервисов, экономика масштаба начинает требовать максимальной оптимизации стоимости владения. В таких сценариях узкоспециализированный кремний от Taalas позволит AMD предложить облачным провайдерам наименьшую стоимость токена на рынке.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев