SkillGym: новый фреймворк для обучения LLM-агентов решению реальных задач
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В препринте на arXiv описана система SkillGym, которая превращает навыки человека, описанные в виде инструкций, в тренировочные среды с проверкой результатов. Фреймворк включает:
- конвейер преобразования навыков в конкретные задачи;
- проверочные механизмы на основе кода, которые подтверждают корректность выполнения;
- метод оценки зависимости выполнения от отдельных навыков.
Детали фреймворка
Авторы создали 2 756 тренировочных сред, разделённых на 12 категорий. Для их заполнения было собрано 8 364 успешных траекторий от различных моделей и инструментов. Каждая траектория в среднем включает 49 вызовов инструментов и более 60 тысяч токенов текста. Эти данные используются для дообучения моделей с учителем (supervised fine-tuning) на проверенных сценариях и обучения с подкреплением на основе результата (outcome-based rewards).
Почему это важно
Современные LLM-агенты могут следовать инструкциям, но редко усваивают навыки как собственное умение. SkillGym предлагает подход, при котором навыки интегрируются в модель. Редакционный анализ: использование верифицированных сред с автоматической проверкой — шаг к более надёжным агентам. Однако на данном этапе фреймворк представлен как исследование, и его практическое применение может потребовать дополнительных испытаний.
Что это даёт пользователю
Для разработчиков это означает возможность создавать агентов, которые не просто читают инструкции, а могут решать задачи в незнакомых ситуациях, опираясь на усвоенные навыки. Например, агент, обученный на навыках работы с базами данных, сможет самостоятельно составлять запросы, не требуя пошаговых указаний. Пользователи сервисов, включающих таких агентов, могут получить более гибкие и надёжные инструменты.
Что пока неизвестно
Данные о точной производительности на других бенчмарках, кроме GDPval-AA v2, не приведены. Нет информации о необходимых вычислительных ресурсах для обучения и запуска. Неясно, насколько масштабируем подход для новых доменов.