Data Turnstile: открытый фреймворк для генерации синтетических данных обучения вызовам функций в малых языковых моделях
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Data Turnstile: открытый фреймворк для генерации синтетических данных обучения вызовам функций в малых языковых моделях
Кратко: Исследователи представили Data Turnstile — открытый фреймворк, который по заданным API-спецификациям генерирует качественные синтетические данные для обучения малых языковых моделей вызовам функций. В отличие от больших моделей, малые не могут компенсировать шумные данные своей ёмкостью, поэтому качество данных становится критическим фактором.
Что произошло
Data Turnstile — это фреймворк с открытым исходным кодом, который принимает на вход API-спецификации пользователя и генерирует высококачественные синтетические данные для обучения вызовам функций. Он разбивает многошаговые взаимодействия с инструментами на контролируемые шаги с валидацией и циклами обратной связи по ошибкам. Это позволяет точно контролировать разнообразие API, сложность разговоров и корректность выходных данных.
Эффективность фреймворка продемонстрирована на двух сложных бенчмарках вызова функций. В частности, на однократном бенчмарке BFCL малая модель Qwen3-0.6B, дообученная на данных Data Turnstile, показала улучшение результатов (детали в полном тексте препринта arXiv:2607.29250v1).
Что изменилось по сравнению с предыдущей версией
Предыдущая версия не указана; это новая публикация. Отличие от традиционных подходов — акцент на малые модели и декомпозиция генерации данных на шаги с валидацией, что решает проблему шума в данных для SLM.
Цены и доступность
Data Turnstile — это открытый фреймворк. Исходный код и данные доступны для загрузки и использования. Дата публикации препринта — 2025 год (arXiv:2607.29250v1).
Почему это важно
Малые языковые модели (SLM) становятся всё более привлекательными для агентного развёртывания благодаря низкой задержке, сниженным затратам и конфиденциальности на устройстве. Однако они слабо справляются с задачами использования инструментов, где данные для обучения редки и зашумлены. Data Turnstile предлагает масштабируемый и контролируемый способ генерации качественных данных, что может значительно ускорить внедрение SLM в агентные сценарии.
Для пользователей AI-Sphere
Если вы работаете с малыми моделями (например, Qwen3-0.6B) и хотите научить их вызывать внешние функции, Data Turnstile может стать полезным инструментом. Фреймворк позволяет адаптировать модель под свои API без необходимости ручного сбора данных. На карточке модели на ai-sphere.ru можно будет отслеживать обновления и примеры использования.
Источники