Сегодня 06 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google сократила потребление памяти ИИ-моделями в шесть раз без потери точности — с алгоритмом TurboQuant

Исследовательский отдел Google Research опубликовал работу о технологии TurboQuant — алгоритме квантизации, который сокращает разрядность KV-кеша больших языковых моделей до 3 битов без потери точности в ответах и без потребности в дополнительном обучении. В тестах на ускорителях искусственного интеллекта Nvidia H100 4-битный алгоритм TurboQuant (с четвёртым битом на коррекцию ошибок) помог восьмикратно повысить производительность при вычислении логитов внимания в сравнении с неквантованными 32-битными ключами; при этом объём KV-кеша сократился в шесть раз.

 Источник изображения: and machines / unsplash.com

Источник изображения: and machines / unsplash.com

В KV-кеше хранятся ранее вычисленные данные механизма внимания, чтобы модели не приходилось пересчитывать их на каждом шаге генерации токенов. По мере роста контекстного окна этот кеш существенно разрастается; традиционные методы квантования помогают уменьшить размер кеша, но за это приходится «расплачиваться» несколькими дополнительными битами на значение из-за констант квантования, которые хранятся вместе со сжатыми данными — это своего рода аналог словаря из традиционных алгоритмов архивирования данных ZIP и RAR. При большом размере контекстного окна эти накладные расходы всё равно оказываются значительными.

TurboQuant помогает устранить эти накладные расходы в двухэтапном процессе, то есть обходится вообще без словаря. На первом этапе срабатывает метод PolarQuant — преобразование векторов данных из декартовых в полярные координаты. Каждому вектору присваивается значение радиуса (длины) и угла (направления). Угловые распределения предсказуемы и сконцентрированы, поэтому PolarQuant обходится без ресурсоёмкого этапа нормализации каждого блока, который неизбежен с традиционными квантизаторами. На выходе получается сжатие высокого качества без накладных расходов на хранение констант внимания — словарей.

 Источник изображения: Conny Schneider / unsplash.com

Источник изображения: Conny Schneider / unsplash.com

На втором этапе применяется 1-битный слой коррекции ошибок с использованием квантованного алгоритма Джонсона-Линденштрауса. Остаточная ошибка квантования проецируется в пространство меньшей размерности, каждое значение сводится к одному знаковому биту, устраняя тем самым систематическую погрешность в вычислениях оценки внимания с незначительными дополнительными издержками.

Google протестировала две составляющих алгоритма TurboQuant в отдельности и их совместную работу в бенчмарках с длинным контекстом LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval на открытых моделях Gemma и Mistral. TurboQuant показал идеальные результаты в задачах класса поиска «иголки в стоге сена» добившись сжатия KV-кеша минимум в шесть раз. В группе тестов LongBench, включающей ответы на вопросы, генерацию кода и создание сводок, TurboQuant оказался не хуже, а то и лучше базового алгоритма сжатия KIVI по всем задачам.

TurboQuant показал эффективность не только в работе с большими языковыми моделями, но и в векторном поиске — его протестировали в сравнении с известными алгоритмами сжатия Product Quantization и RabbiQ на наборе данных GloVe. Даже без обучения и оптимизации разработанный в Google алгоритм показал более качественные результаты, чем его соперники, настроенные специально для работы с этим набором данных. TurboQuant вообще не требует ни обучения, ни тонкой настройки, а его выполнение сопровождается незначительными накладными расходами — он готов для развёртывания даже в условиях повышенной нагрузки.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ-агенты потребляют в 15 раз больше токенов, чем люди, и это даёт преимущество дешёвым китайским моделям 26 мин.
Новая статья: WheelMates — без ветерка. Рецензия 10 ч.
Суд разрешил конкуренту X использовать слово твит и логотип птицы, но запретил имя Twitter 20 ч.
Windows 11 будет сообщать приложениям возраст пользователя 20 ч.
В поглощении Hugging Face компанией Nvidia оказалось много символизма — возможно, неслучайного 20 ч.
Спамеры стали использовать ASCII-подмену символов — раньше так взламывали ИИ 21 ч.
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 05-09 00:07
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 04-09 23:30
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 04-09 23:16
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 04-09 22:41
В Китае разработан четвероногий робот-поводырь для незрячих людей 52 мин.
Xiaomi настолько уверена в своей тяговой батарее, что готова менять сгоревший из-за неё автомобиль на новый 2 ч.
Выручка Foxconn на крыльях ИИ-бума в августе выросла на 52 %, и это только начало, как считают в компании 3 ч.
AMD анонсировала рабочую станцию Threadripper Halo Station с Instinct MI350P для ИИ-задач 17 ч.
ASUS анонсировала ИИ-серверы на чипах Intel Xeon 6 и AMD EPYC 9006 17 ч.
В 2027 году Apple выпустит умную камеру, которая записывает только нужные события 21 ч.
Бюджетные Galaxy A помогут Samsung нарастить поставки, пока конкуренты сокращают производство на фоне роста цен на память 21 ч.
Google, Oppo и Vivo вслед за Apple добавят два слоя стекла в складные дисплеи смартфонов 23 ч.
Apple усилила наём сотрудников в Китае — потребовались специалисты в области ИИ и не только 23 ч.
Samsung и Arm собираются разработать для OpenAI чип, который будет выпускаться по 2-нм технологии 24 ч.