Google зменшила споживання пам’яті ІІ‑моделей вісім разів, зберігши точність, завдяки алгоритму TurboQuant
Коротка зміст
Google Research представив новий спосіб стискання KV‑кешу великих мовних моделей – TurboQuant. Алгоритм зменшує розрядність кешу до 3 бітів (4 біти, якщо додати корекцію помилок), не погіршуючи точність відповідей і без додаткового навчання. На прискорювачах Nvidia H100 TurboQuant підвищив продуктивність обчислення логітів уваги в 8‑рази та скоротив розмір KV‑кешу шість раз.
Що таке KV‑кеш і чому він важливий
* KV‑кеш зберігає ключі (K) і значення (V), отримані під час обчислення механізму уваги.
Це дозволяє моделі не перераховувати їх на кожному кроці генерації токенів.
* При збільшенні контекстного вікна кеш росте експоненційно, що призводить до високих витрат пам’яті.
* Традиційні методи квантування зменшують розмір кешу, але потребують зберігання констант квантування (словників), аналогічних ZIP/RAR.
Ці словники створюють значні накладні витрати.
Як працює TurboQuant
TurboQuant складається з двох етапів і повністю позбавляєсь від словників.
| Етап | Що робиться | Чому це важливо |
|---|---|---|
| 1. PolarQuant | Перетворення векторів із декартових координат у полярні (радіус + кут). Кутові розподіли передбачувані й концентровані, тому не потрібен дорогий етап нормалізації кожного блоку. Отримується високоякісний стиск без словників. | |
| 2. 1‑бітовий шар корекції помилок | Застосовується квантований алгоритм Джонсона‑Лінденштрауса; залишкова помилка зводиться до одного біта. Усуває систематичну похибку у розрахунках уваги при мінімальних додаткових витратах. |
Практичні результати
| Тест | Алгоритми | Результати |
|------|-----------|------------|
| LongBench, Needle In A Haystack, ZeroSCROLLS, RULER, L‑Eval (Gemma & Mistral) | TurboQuant vs KIVI | TurboQuant: мінімум 6‑кратний стиск KV‑кешу; у задачах пошуку «иголки в стоге сена» – без втрат точності. У LongBench – не гірше, а іноді краще за KIVI. |
| Векторний пошук (GloVe) | TurboQuant vs Product Quantization, RabbiQ | Навіть без навчання TurboQuant перевершив навчених конкурентів у якості результатів і споживанні пам’яті. |
Висновки
* TurboQuant забезпечує сильний стиск KV‑кешу до 3–4 бітів без втрати точності й без додаткового навчання.
* Продуктивність на Nvidia H100 зросла в 8 раз, а розмір кешу скоротився шість раз.
* Алгоритм працює як для великих мовних моделей, так і для задач векторного пошуку, не вимагаючи тонкої настройки.
Таким чином, TurboQuant готовий до практичного використання навіть при високій навантаженості й відкриває нові можливості для ефективної роботи з великими моделями.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати