НVIDIA випустила чіп Groq 3 LPU, який прискорює інференс ІІ‑моделей до рівня токенів.

НVIDIA випустила чіп Groq 3 LPU, який прискорює інференс ІІ‑моделей до рівня токенів.

24 software

Нvidia розкриває нові можливості платформи Vera Rubin

На конференції GTC цього року генеральний директор Nvidia Дженсен Хуанг оголосив про розширення платформи Vera Rubin. У основу нових можливостей положено інтелектуальну власність, придбану у компанії Groq, і до Rubin увійшов чип *Groq 3 LPU* – прискорювач інференсу, призначений для видачі токенів з високою швидкістю та низькою затримкою.

Що вже є в Vera Rubin
Платформа складається з шести ключових компонентів, які Nvidia збирає у стоячі системи і масштабує до великих AI‑фабрик:

КомпонентОписGPU RubinВідеокарта з 288 ГБ HBM4CPU VeraЦентральний процесорNVLink 6Система внутрисистемного масштабуванняConnectX‑9Інтелектуальний мережевий адаптерBlueField‑4Процесор обробки данихSpectrum‑XКомутатор міжсистемного масштабування з інтегрованою оптикою
Groq 3 LPU тепер доданий як новий будівельний блок, який буде використовуватися при розгортанні великих систем.

Чому Groq 3 LPU виділяється
Головна відмінність – архітектура пам’яті. У той час як більшість прискорювачів використовують HBM як робочу пам’ять, кожен Groq 3 LPU містить 500 МБ SRAM. Порівняння:

ПараметрGPU Rubin (HBM4)Groq 3 LPU (SRAM)Ємність288 ГБ0,5 ГБПропускна здатність~22 ТБ/сдо 150 ТБ/с
Для задач інференсу, чутливих до пропускної здатності, перевага SRAM очевидна. Саме тому Nvidia включила Groq 3 у Rubin – щоб підвищити швидкість видачі токенів.

Стойка Groq 3 LPX
У складі стойки знаходиться 256 чипів Groq 3 LPU, що дає:

- 128 ГБ SRAM

- 40 ПБ/с сумарної пропускної здатності

- 640 ТБ/с внутрисистемного інтерфейсу

Віце‑президент по гіпермасштабованим рішенням Іен Бак назвав цю стойку сопроцесором для Rubin, підкреслюючи її роль у підвищенні продуктивності декодування на кожному шарі моделі та токені.

Вплив на мультиагентні системи
Бак зазначив, що Groq 3 LPX буде ключовим елементом для майбутнього AI‑ринку – мультиагентних систем. Коли агенти обмінюються даними безпосередньо, а не через чат‑боти, вимоги до реакції змінюються: від 100 токенів/с до 1 500+ токенів/с і вище.

Конкуренти та перспективи
У тексті згадано конкурент – Cerebras, що використовує Wafer‑Scale Engine (WSE) з величезним SRAM для низьколатентного інференсу. OpenAI вже задіяла Cerebras у своїх передових моделях завдяки вигідній затримці.

Бак також зазначив, що поява Groq 3 LPU може знизити залежність від прискорювача Rubin CPX. Поки Nvidia фокусується на інтеграції стойки Groq 3 LPX з платформою, обидва чипи призначені посилити інференс без необхідності великих обсягів GDDR7 пам’яті.

Висновок:

Новий чип Groq 3 LPU та його стойка LPX зміцнюють Vera Rubin у сегменті низьколатентного інференсу, відкриваючи шлях до швидших мультиагентних AI‑систем і конкуруючи з такими гравцями, як Cerebras.

Коментарі (0)

Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.

Поки немає коментарів. Залиште коментар — поділіться своєю думкою!

Щоб залишити коментар, увійдіть в акаунт.

Увійдіть, щоб коментувати