Google зменшила споживання пам’яті ІІ‑моделей вісім разів, зберігши точність, завдяки алгоритму TurboQuant

Google зменшила споживання пам’яті ІІ‑моделей вісім разів, зберігши точність, завдяки алгоритму TurboQuant

23 hardware

Коротка зміст

Google Research представив новий спосіб стискання KV‑кешу великих мовних моделей – TurboQuant. Алгоритм зменшує розрядність кешу до 3 бітів (4 біти, якщо додати корекцію помилок), не погіршуючи точність відповідей і без додаткового навчання. На прискорювачах Nvidia H100 TurboQuant підвищив продуктивність обчислення логітів уваги в 8‑рази та скоротив розмір KV‑кешу шість раз.

Що таке KV‑кеш і чому він важливий
* KV‑кеш зберігає ключі (K) і значення (V), отримані під час обчислення механізму уваги.

Це дозволяє моделі не перераховувати їх на кожному кроці генерації токенів.

* При збільшенні контекстного вікна кеш росте експоненційно, що призводить до високих витрат пам’яті.

* Традиційні методи квантування зменшують розмір кешу, але потребують зберігання констант квантування (словників), аналогічних ZIP/RAR.

Ці словники створюють значні накладні витрати.

Як працює TurboQuant
TurboQuant складається з двох етапів і повністю позбавляєсь від словників.

ЕтапЩо робитьсяЧому це важливо
1. PolarQuantПеретворення векторів із декартових координат у полярні (радіус + кут). Кутові розподіли передбачувані й концентровані, тому не потрібен дорогий етап нормалізації кожного блоку. Отримується високоякісний стиск без словників.
2. 1‑бітовий шар корекції помилокЗастосовується квантований алгоритм Джонсона‑Лінденштрауса; залишкова помилка зводиться до одного біта. Усуває систематичну похибку у розрахунках уваги при мінімальних додаткових витратах.

Практичні результати
| Тест | Алгоритми | Результати |
|------|-----------|------------|
| LongBench, Needle In A Haystack, ZeroSCROLLS, RULER, L‑Eval (Gemma & Mistral) | TurboQuant vs KIVI | TurboQuant: мінімум 6‑кратний стиск KV‑кешу; у задачах пошуку «иголки в стоге сена» – без втрат точності. У LongBench – не гірше, а іноді краще за KIVI. |
| Векторний пошук (GloVe) | TurboQuant vs Product Quantization, RabbiQ | Навіть без навчання TurboQuant перевершив навчених конкурентів у якості результатів і споживанні пам’яті. |

Висновки
* TurboQuant забезпечує сильний стиск KV‑кешу до 3–4 бітів без втрати точності й без додаткового навчання.

* Продуктивність на Nvidia H100 зросла в 8 раз, а розмір кешу скоротився шість раз.

* Алгоритм працює як для великих мовних моделей, так і для задач векторного пошуку, не вимагаючи тонкої настройки.

Таким чином, TurboQuant готовий до практичного використання навіть при високій навантаженості й відкриває нові можливості для ефективної роботи з великими моделями.

Коментарі (0)

Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.

Поки немає коментарів. Залиште коментар — поділіться своєю думкою!

Щоб залишити коментар, увійдіть в акаунт.

Увійдіть, щоб коментувати