CoCommit: Совместное принятие токенов улучшает диффузионные языковые модели
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
CoCommit: Совместное принятие токенов улучшает диффузионные языковые модели
Кратко: Диффузионные языковые модели (dLLM) обычно декодируют несколько токенов за шаг независимо, что вносит ошибку из-за зависимостей между позициями. Предложенный метод CoCommit откладывает фиксацию, повторно применяя последние слои модели для координации выбранных позиций, что улучшает качество на пяти из семи тестов без дополнительных моделей.
Что произошло
Исследователи представили CoCommit — метод для диффузионных языковых моделей, который решает проблему независимого декодирования токенов. В стандартных dLLM на каждом шаге денойзинга выбирается набор позиций, и для каждой из них токен предсказывается независимо от контекста. Однако когда токены зависимы, такое разложение вносит ошибку, описываемую условной полной корреляцией. CoCommit добавляет проход координации: после выбора пакета позиций специальный обученный маркер определяет набор токенов для фиксации, после чего последние n слоев модели повторно применяются для координации этих позиций, и только затем выполняется жадный argmax.
Что изменилось по сравнению с предыдущей версией
Метод CoCommit не требует вспомогательной модели — он использует существующие веса, выполняя лишь один дополнительный частичный прямой проход. В тестах на модели LLaDA 2.1 с адаптерами LoRA и жадным выводом CoCommit превзошёл стандартный факторизованный декодер на пяти из семи тестов. Наибольший прирост качества наблюдался на задачах, связанных с кодом.
Цены и доступность
Исследование опубликовано в виде препринта arXiv (не рецензировано). Код и веса модели не указаны как доступные. Метод реализован поверх LLaDA 2.1 с LoRA, что позволяет применять его к существующим диффузионным языковым моделям с минимальными доработками.
Почему это важно
Диффузионные языковые модели — альтернатива авторегрессионным моделям, позволяющая генерировать текст параллельно. Однако независимое декодирование токенов снижало качество на зависимых последовательностях. CoCommit предлагает эффективное решение, которое улучшает результаты без увеличения числа параметров или сложности обучения, что может ускорить внедрение dLLM в продуктивные системы.
Для пользователей AI-Sphere
Если вы работаете с диффузионными языковыми моделями (например, LLaDA), метод CoCommit может повысить качество генерации кода и других структурированных текстов. Это особенно актуально для задач, где важна согласованность между токенами. Следите за обновлениями: возможно, реализация появится в открытом доступе.