Новое исследование: AI-агенты фиксируют стратегию обучения на старте, игнорируя эксперименты
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: В новой работе на arXiv исследователи показали, что при post-training больших языковых моделей AI-агенты принимают ключевые стратегические решения в самом начале процесса, а затем тратят весь оставшийся бюджет на локальные корректировки в рамках выбранной стратегии. Работа разграничивает два уровня способностей агентов: исполнительский (execution-level) и стратегический (strategy-level).
Что произошло Авторы препринта «What is Missing from AI Post-Training AI: An Empirical Analysis» проанализировали большой корпус публично доступных траекторий post-training, выполняемых LLM-агентами. Оказалось, что во всех рассмотренных задачах агент фиксирует свою тренировочную стратегию в самом начале, а весь оставшийся бюджет расходуется на локальные настройки внутри выбранной стратегии. Ученые выделили два различных типа способностей:
- исполнительский уровень — способность итеративно работать в рамках выбранной стратегии;
- стратегический уровень — способность пересматривать высокоуровневые решения по мере накопления экспериментальных данных.
Что изменилось по сравнению с предыдущей версией Работа представляет собой новый эмпирический анализ, а не обновление предыдущей версии. До этого феномен фиксации стратегии на старте не был детально изучен на таком масштабе.
Цены и доступность Исследование опубликовано на arXiv как препринт (идентификатор arXiv:2608.19072v1, тип анонса cross) и ещё не прошло рецензирование. Доступно для свободного чтения.
Почему это важно Результаты показывают ограничение современных AI-агентов, самостоятельно занимающихся post-training: они не способны менять стратегию по ходу работы, даже если экспериментальные данные указывают на необходимость такого изменения. Это ставит вопрос о том, как перейти от «железобетонного» следования плану к настоящему адаптивному обучению. Без решения этой проблемы AI-агенты рискуют оставаться лишь инструментами для локальной оптимизации, а не полноценными исследователями.
Для пользователей AI-Sphere Если вы используете или разрабатываете AI-агентов для автоматизации обучения моделей, знайте: текущие системы плохо умеют пересматривать собственную стратегию. При настройке пайплайнов стоит закладывать механизмы, которые позволяют агенту «отступать» от первоначального плана на основе промежуточных результатов. Само исследование — хорошая отправная точка для понимания, какие именно «рычаги» не хватают современные AI-системы для полной автономии.
Источники