Tokka-Bench: новый бенчмарк оценивает токенизаторы для 100 языков и 20 языков программирования
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа исследователей опубликовала на arXiv препринт, в котором описала Tokka-Bench — открытый фреймворк для оценки токенизаторов. В отличие от существующих подходов, которые часто фокусируются на одном-двух языках или одной метрике, Tokka-Bench предлагает комплексное сравнение по пяти метрикам:
- байтов на токен;
- покрытие уникальных токенов;
- плодовитость токенов (fertility);
- частота разбиения слов;
- состав словаря.
Бенчмарк охватывает 100 естественных языков (более 30 систем письменности) и 20 языков программирования. Для каждого языка используется сегментация, адаптированная к его системе письма.
Исследователи сравнили семь BPE-токенизаторов: GPT-2, GPT-4, gpt-oss (открытая версия GPT), Llama 3.1, Gemma 3, Qwen3 и Kimi K2.
Ключевые выводы исследования
Основной вывод работы: стратегия распределения словарного запаса (vocabulary allocation) влияет на эффективность токенизатора сильнее, чем его общий размер. Это означает, что простое увеличение словаря не гарантирует улучшения — важнее то, как токены распределены между разными языками и типами контента.
Ещё один важный результат: для языков программирования современные токенизаторы показывают схожую эффективность, несмотря на то, что их профили для естественных языков могут сильно различаться. Это говорит о том, что конкуренция в области кода уже привела к некой конвергенции решений, тогда как для естественных языков ещё есть пространство для улучшений.
Фреймворк, данные и интерактивная панель визуализации опубликованы в открытом доступе.
Почему это важно
Редакционный анализ: Токенизаторы часто остаются «за кадром» при обсуждении LLM, хотя именно они определяют, сколько вычислительных ресурсов потребуется для обработки текста на том или ином языке. Например, если токенизатор плохо справляется с русским, украинским или арабским, модель тратит больше токенов на одно и то же сообщение — это увеличивает стоимость и время ответа.
Tokka-Bench даёт разработчикам и исследователям инструмент для осознанного выбора токенизатора под конкретные задачи. Если ваша модель должна работать с десятками языков, теперь можно заранее оценить, какой токенизатор будет наиболее эффективным.
Кроме того, открытость фреймворка позволяет воспроизводить результаты и добавлять новые токенизаторы, что должно ускорить развитие этой области.
Что это даёт пользователю
На практике Tokka-Bench может быть полезен:
- Разработчикам мультиязычных чат-ботов и ассистентов — для выбора токенизатора, который экономит токены на целевых языках.
- Исследователям LLM — для сравнения новых токенизаторов с существующими без необходимости собирать собственную тестовую выборку.
- Инженерам, оптимизирующим стоимость инференса: более эффективный токенизатор снижает количество токенов на запрос, а значит, и затраты на вычислительные ресурсы.
Поскольку фреймворк открыт, любой желающий может протестировать свой токенизатор и сравнить его с семью уже включёнными в бенчмарк.
Что пока неизвестно
Tokka-Bench — это препринт, ещё не прошедший рецензирование. Методология и результаты могут быть уточнены после peer-review. Также пока неясно, насколько быстро сообщество примет этот бенчмарк в качестве стандарта для сравнения токенизаторов. Кроме того, в исследовании сравниваются только BPE-токенизаторы — другие подходы (например, Unigram или WordPiece) в текущую версию не включены.