RAP: новый метод сжатия KV-кэша для LLM с сохранением точности
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
RAP: новый метод сжатия KV-кэша для LLM с сохранением точности
Кратко: Исследователи представили RoPE-Aligned Pruning (RAP) — метод сжатия ключ-значение (KV) кэша в больших языковых моделях (LLM), который сохраняет точность даже при 30% сжатии. RAP удаляет не отдельные каналы, а целые пары размерностей, что учитывает особенности позиционного кодирования RoPE.
Что произошло
Опубликован препринт arXiv:2602.02599v4, в котором авторы описывают RAP. Основная проблема: существующие методы структурного сжатия KV-кэша (обрезка проекций W_k, W_v) удаляют отдельные каналы, что разрушает пары размерностей, используемые в Rotary Position Embedding (RoPE). Это нарушает позиционную семантику и делает модель неработоспособной. RAP решает эту проблему, обрезая целые пары (RoPE-aligned pairs), а не отдельные каналы, сохраняя вращение пар и семантику позиций.
Что изменилось по сравнению с предыдущей версией
Ранее применялась «слепая» обрезка каналов (RoPE-blind channel pruning), которая не учитывала структуру RoPE и приводила к значительному падению качества. RAP — первый метод, который явно учитывает парную структуру RoPE при обрезке. Эксперименты на моделях Llama, Mistral и Qwen от 3B до 14B показали, что RAP сохраняет точность при 30% сжатии (retain ratio ρ = 0.7) и значительно превосходит RoPE-blind подход.
Цены и доступность
Статья опубликована на arXiv в виде препринта, не прошла рецензирование. Код и данные не указаны, но метод доступен для изучения и воспроизведения по описанию. Дата публикации — 2025 год (версия 4).
Почему это важно
KV-кэш — узкое место при инференсе длинных контекстов в LLM. Сжатие кэша без потери точности позволяет снизить требования к памяти и ускорить вывод. RAP демонстрирует, что можно сократить объём кэша на 30% без существенного ухудшения качества, что открывает путь к более эффективным развёртываниям LLM. Метод универсален для архитектур с RoPE (Llama, Mistral, Qwen).
Для пользователей AI-Sphere
Если вы используете LLM с длинными контекстами (например, анализ документов, чат-боты с историей), RAP обещает снизить затраты на память и ускорить инференс. Техника может быть внедрена в open-source модели и фреймворки. Следите за обновлениями: исследование может повлиять на карточки моделей в каталоге AI-Sphere.
Источники