НVIDIA випустила чіп Groq 3 LPU, який прискорює інференс ІІ‑моделей до рівня токенів.
Нvidia розкриває нові можливості платформи Vera Rubin
На конференції GTC цього року генеральний директор Nvidia Дженсен Хуанг оголосив про розширення платформи Vera Rubin. У основу нових можливостей положено інтелектуальну власність, придбану у компанії Groq, і до Rubin увійшов чип *Groq 3 LPU* – прискорювач інференсу, призначений для видачі токенів з високою швидкістю та низькою затримкою.
Що вже є в Vera Rubin
Платформа складається з шести ключових компонентів, які Nvidia збирає у стоячі системи і масштабує до великих AI‑фабрик:
КомпонентОписGPU RubinВідеокарта з 288 ГБ HBM4CPU VeraЦентральний процесорNVLink 6Система внутрисистемного масштабуванняConnectX‑9Інтелектуальний мережевий адаптерBlueField‑4Процесор обробки данихSpectrum‑XКомутатор міжсистемного масштабування з інтегрованою оптикою
Groq 3 LPU тепер доданий як новий будівельний блок, який буде використовуватися при розгортанні великих систем.
Чому Groq 3 LPU виділяється
Головна відмінність – архітектура пам’яті. У той час як більшість прискорювачів використовують HBM як робочу пам’ять, кожен Groq 3 LPU містить 500 МБ SRAM. Порівняння:
ПараметрGPU Rubin (HBM4)Groq 3 LPU (SRAM)Ємність288 ГБ0,5 ГБПропускна здатність~22 ТБ/сдо 150 ТБ/с
Для задач інференсу, чутливих до пропускної здатності, перевага SRAM очевидна. Саме тому Nvidia включила Groq 3 у Rubin – щоб підвищити швидкість видачі токенів.
Стойка Groq 3 LPX
У складі стойки знаходиться 256 чипів Groq 3 LPU, що дає:
- 128 ГБ SRAM
- 40 ПБ/с сумарної пропускної здатності
- 640 ТБ/с внутрисистемного інтерфейсу
Віце‑президент по гіпермасштабованим рішенням Іен Бак назвав цю стойку сопроцесором для Rubin, підкреслюючи її роль у підвищенні продуктивності декодування на кожному шарі моделі та токені.
Вплив на мультиагентні системи
Бак зазначив, що Groq 3 LPX буде ключовим елементом для майбутнього AI‑ринку – мультиагентних систем. Коли агенти обмінюються даними безпосередньо, а не через чат‑боти, вимоги до реакції змінюються: від 100 токенів/с до 1 500+ токенів/с і вище.
Конкуренти та перспективи
У тексті згадано конкурент – Cerebras, що використовує Wafer‑Scale Engine (WSE) з величезним SRAM для низьколатентного інференсу. OpenAI вже задіяла Cerebras у своїх передових моделях завдяки вигідній затримці.
Бак також зазначив, що поява Groq 3 LPU може знизити залежність від прискорювача Rubin CPX. Поки Nvidia фокусується на інтеграції стойки Groq 3 LPX з платформою, обидва чипи призначені посилити інференс без необхідності великих обсягів GDDR7 пам’яті.
Висновок:
Новий чип Groq 3 LPU та його стойка LPX зміцнюють Vera Rubin у сегменті низьколатентного інференсу, відкриваючи шлях до швидших мультиагентних AI‑систем і конкуруючи з такими гравцями, як Cerebras.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати