Открытый синтетический бенгальский речевой датасет для телеком-поддержки
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Открытый синтетический бенгальский речевой датасет для телеком-поддержки
Кратко: Опубликован синтетический бенгальский речевой датасет для сценариев телеком-поддержки. Набор содержит 10 000 аудио-текстовых пар общей длительностью 26.82 часа и доступен на Hugging Face под лицензией CC-BY-4.0.
Что произошло Исследователи создали и выложили в открытый доступ синтетический датасет бенгальской речи, ориентированный на домен телекоммуникационной поддержки клиентов. Все аудио сгенерированы с помощью системы OmniVoice в режиме клонирования голоса на основе реальной женской эталонной записи. Использовались параметры: bfloat16, 16 шагов диффузионной выборки, коэффициент скорости речи 1.0. Частота дискретизации — 24 кГц. Датасет разбит на обучающую (9 000 примеров), валидационную (500) и тестовую (500) выборки. Вместе с оригинальным бенгальским текстом предоставляется нормализованное поле транскрипта, предназначенное для обучения и оценки ASR/STT-моделей. Авторы провели автоматическую проверку разборчивости всех 10 000 образцов с помощью доменно-адаптированной модели Whisper ASR, дообученной с контрольной точки bengaliAI/tugstugi_bengaliai-regional-asr_whisper-.
Что изменилось по сравнению с предыдущей версией Сведения о предыдущих версиях отсутствуют.
Цены и доступность Датасет опубликован на Hugging Face под лицензией CC-BY-4.0, что допускает свободное использование с указанием авторства. Доступен для скачивания и использования без ограничений.
Почему это важно Синтетические речевые датасеты позволяют быстро создавать доменно-специфичные ресурсы для языков с ограниченным количеством реальных записей. Бенгальский язык — один из самых распространённых в мире, но слабо обеспечен качественными речевыми корпусами для узких задач, таких как телеком-поддержка. Данный набор может ускорить разработку голосовых помощников и систем распознавания речи в этом сегменте.
Для пользователей AI-Sphere Разработчикам ASR-систем на бенгальском языке стоит обратить внимание на этот датасет: он содержит нормализованные транскрипты, готовые для обучения, и уже прошёл автоматическую проверку разборчивости. Открытая лицензия позволяет интегрировать данные в коммерческие и исследовательские проекты.
Источники