Новый метод квантования Tied Trit-Planes сжимает DeepSeek-V4 до 4.0625 бит на вес
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Опубликована работа, в которой предложен метод квантования Tied Trit-Planes, обобщающий PTQTP до единого девятиуровневого квантователя. Метод применён к модели DeepSeek-V4-Flash-0731 (284B параметров, 13B активных) и обеспечивает компактное представление 4.0625 бит на вес с возможностью потоковой загрузки экспертов с диска.
Что произошло Исследователи модифицировали алгоритм PTQTP (Post-Training Quantization of Ternary Planes), который раскладывает весовые матрицы LLM на две тернарные плоскости с двумя свободными масштабами на группу. В новой работе масштабы жёстко связываются коэффициентом 3, что превращает разложение в единый однородный девятиуровневый квантователь — известную сбалансированную тернарную структуру. Авторы утверждают, что впервые наложили это тождество как ограничение внутри решателя PTQTP.
Две тернарные плоскости без потерь сворачиваются в одну 4-битную кодовую плоскость, которая становится постоянным представлением для инференса: байты на диске, байты в кэше экспертов и входные данные ядра идентичны — это блоки по 4.0625 бита на вес, обрабатываемые за один проход целочисленного скалярного произведения.
Что изменилось по сравнению с предыдущей версией Ранее PTQTP использовал свободные масштабы для каждой тернарной плоскости. Новая работа вводит ограничение на их соотношение, что приводит к более простому и компактному квантователю без потери точности. Также впервые предложено сохранять свёрнутое 4-битное представление на всех этапах — от хранения на диске до вычислений на CPU с SIMD-инструкциями.
Цены и доступность Работа опубликована как препринт arXiv (2608.08910v1) и не является коммерческим продуктом. Дата публикации — не указана, но номер arXiv указывает на 2026 год? (Обычно arXiv:YYMM.xxxxx, здесь 2608 — август 2026). Код и реализации не представлены. Применение выполнено к модели DeepSeek-V4-Flash-0731, которая уже выпущена с весами в формате MXFP4.
Почему это важно Метод решает задачу эффективного инференса больших Mixture-of-Experts моделей. Сжатие до 4.0625 бит на вес при сохранении качества, а также возможность потоковой загрузки экспертов с SSD (даже для моделей с 284B параметров) существенно снижают требования к памяти и ускоряют работу. Для сообщества AI это шаг к практическому развёртыванию гигантских MoE-моделей на обычном оборудовании.
Для пользователей AI-Sphere Исследование демонстрирует, как можно сократить потребление памяти и пропускной способности при работе с современными MoE-моделями. Если вы интересуетесь квантованием или развёртыванием DeepSeek-V4, эта техника может в будущем лечь в основу инструментов для оптимизации моделей. Подписывайтесь на обновления карточки модели DeepSeek-V4 на ai-sphere.ru, чтобы следить за появлением практических реализаций.
Источники