
На Hot Chips 2026 Samsung представила LPDDR5X-PIM — внешне обычную LPDDR5X, внутри которой в каждом банке стоят MAC-деревья. На инференсе Llama 3.1 8B это дало х3,01 по токенам в секунду (81,3 против 27,0) и х2,28 по времени выполнения (5,4 секунды против 12,3), а эффективная полоса выросла с 76,8 ГБ/с до 614 ГБ/с.
Как это устроено
Логика встроена в каждый банк памяти: регистровые файлы VRF и SRF плюс деревья умножителей-накопителей. Чип умеет работать в двух режимах, как обычная DRAM и как многобанковый PIM.
Главная инженерная проблема в адресации. Строки DRAM физически не разложены так, как их хочет видеть матричное умножение, и переупорядочивание данных съедает весь выигрыш. Samsung решает это через Address Align Mode. Это такой режим, который отображает адреса DRAM прямо на MAC-инструкции.
А вот форм-фактор не поменялся. Стандартный 561-шариковый корпус, модули на 16 ГБ. То есть в теории это бесшовная замена, а не новый класс устройств со своей обвязкой.
8× полосы — но это не та полоса
Схема извлечения вычисленных ИИ-данных хостом (xPU) из чипа LPDDR5X-PIM. Источник.
Цифру 614 ГБ/с легко прочитать (или понять) неправильно. Это не пропускная способность шины до процессора, тут шина осталась прежней. Это эффективная полоса внутри памяти, доступная тем операциям, которые выполняются на месте и не требуют вывода данных наружу. Выигрыш возникает ровно там, где нагрузка упирается в перекачку весов, — то есть на memory-bound инференсе с батчем, близким к единице.
Почему выигрыш вообще возможен, видно из арифметики декодирования. При генерации каждого следующего токена с батчем, равным единице, модель обязана прочитать все свои веса целиком, а полезных вычислений на прочитанный байт приходится ничтожно мало. Скорость упирается в то, как быстро веса доедут до него по шине, — ускоритель большую часть времени просто ждет. Отсюда и разрыв в измерениях Samsung, 27,0 токена в секунду на обычной LPDDR5X против 81,3 на PIM при одном и том же вычислителе.
Пиковая мощность при работе PIM подскакивает, но суммарное потребление, по словам компании, «без существенного роста» и в итоге ниже, чем у обычной DRAM за счет сокращения трафика. Логика та же — перемещение байта по шине стоит дороже, чем умножение.
Зачем это Samsung именно сейчас
Контекст читается легко, HBM дорожает и остается дефицитным. Если часть нагрузки удается снять на дешевую LPDDR с логикой внутри, у вендора появляется вторая линейка продаж вместо конкуренции по одному фронту. Стандартизацию Samsung двигает уже через следующее поколение: спецификацию LPDDR6X-PIM компания рассчитывает провести через JEDEC в этом году, по срокам самой LPDDR5X-PIM ясности нет.
Стоит помнить, что это не первый заход. HBM-PIM и Aquabolt-XL Samsung показывала еще в 2021, и до массового продукта та история не дошла. Разница в том, что тогда PIM искал задачу, а сейчас рынок сам требует — инференс на устройстве.
Оговорки
Одна из серьезных оговорок — точность вывода на PIM отличается от базовой версии. Samsung над этим еще работает. Для рекомендательных систем и голосовых ассистентов расхождение может быть терпимым, для чего-то, где считают деньги или диагноз, — нет.
Вторая: измерения сделаны на edge-ускорителе с моделью на восемь млрд параметров. Это честный сценарий для смартфона, но переносить множители на серверный инференс не стоит — там батч большой, веса читаются один раз на много запросов, и узкое место переезжает с весов на KV-кэш. PIM в текущем виде эту часть задачи не решает.
Третья — MAC-деревья внутри памяти умеют не все. Attention, нормализации, нелинейности по-прежнему считает хост, а значит компилятор должен уметь резать граф и раскладывать его между двумя исполнителями с разными правилами адресации. Это ровно та работа, на которой спотыкались все предыдущие поколения PIM.
Почему на это стоит смотреть и в серверном контексте
Прямого переноса в стойку нет, но направление считывается. Индустрия последние два года двигает вычисления ближе к данным на всех уровнях сразу: HBM с логикой в базовом кристалле, near-memory processing в ускорителях, вынос части операций в сеть. LPDDR5X-PIM — самая дешевая точка этого спектра, и именно поэтому у нее есть шанс на объем. LPDDR производится десятками миллионов модулей, а HBM остается дефицитным и дорогим.
Если стандартизация состоится и PIM доедет хотя бы до сегмента инференс-серверов на ARM, у части нагрузок появится альтернатива схеме «докупить еще карту, чтобы модель влезла в память». Пока это гипотеза, но гипотеза с опубликованными измерениями.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Источник: habr.com