Исследования

SkillGym: новый фреймворк для обучения LLM-агентов решению реальных задач

Автор: AI-Sphere· обновлено 24 сентября 2026 г. в 06:57· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В препринте на arXiv описана система SkillGym, которая превращает навыки человека, описанные в виде инструкций, в тренировочные среды с проверкой результатов. Фреймворк включает:

  • конвейер преобразования навыков в конкретные задачи;
  • проверочные механизмы на основе кода, которые подтверждают корректность выполнения;
  • метод оценки зависимости выполнения от отдельных навыков.

Детали фреймворка

Авторы создали 2 756 тренировочных сред, разделённых на 12 категорий. Для их заполнения было собрано 8 364 успешных траекторий от различных моделей и инструментов. Каждая траектория в среднем включает 49 вызовов инструментов и более 60 тысяч токенов текста. Эти данные используются для дообучения моделей с учителем (supervised fine-tuning) на проверенных сценариях и обучения с подкреплением на основе результата (outcome-based rewards).

Почему это важно

Современные LLM-агенты могут следовать инструкциям, но редко усваивают навыки как собственное умение. SkillGym предлагает подход, при котором навыки интегрируются в модель. Редакционный анализ: использование верифицированных сред с автоматической проверкой — шаг к более надёжным агентам. Однако на данном этапе фреймворк представлен как исследование, и его практическое применение может потребовать дополнительных испытаний.

Что это даёт пользователю

Для разработчиков это означает возможность создавать агентов, которые не просто читают инструкции, а могут решать задачи в незнакомых ситуациях, опираясь на усвоенные навыки. Например, агент, обученный на навыках работы с базами данных, сможет самостоятельно составлять запросы, не требуя пошаговых указаний. Пользователи сервисов, включающих таких агентов, могут получить более гибкие и надёжные инструменты.

Что пока неизвестно

Данные о точной производительности на других бенчмарках, кроме GDPval-AA v2, не приведены. Нет информации о необходимых вычислительных ресурсах для обучения и запуска. Неясно, насколько масштабируем подход для новых доменов.

Источники

#SkillGym#LLM-агенты#обучение агентов#человеческие навыки

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат