Исследования

Новое исследование: AI-агенты фиксируют стратегию обучения на старте, игнорируя эксперименты

Автор: AI-Sphere· обновлено 20 августа 2026 г. в 06:09· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Кратко: В новой работе на arXiv исследователи показали, что при post-training больших языковых моделей AI-агенты принимают ключевые стратегические решения в самом начале процесса, а затем тратят весь оставшийся бюджет на локальные корректировки в рамках выбранной стратегии. Работа разграничивает два уровня способностей агентов: исполнительский (execution-level) и стратегический (strategy-level).

Что произошло Авторы препринта «What is Missing from AI Post-Training AI: An Empirical Analysis» проанализировали большой корпус публично доступных траекторий post-training, выполняемых LLM-агентами. Оказалось, что во всех рассмотренных задачах агент фиксирует свою тренировочную стратегию в самом начале, а весь оставшийся бюджет расходуется на локальные настройки внутри выбранной стратегии. Ученые выделили два различных типа способностей:

  • исполнительский уровень — способность итеративно работать в рамках выбранной стратегии;
  • стратегический уровень — способность пересматривать высокоуровневые решения по мере накопления экспериментальных данных.

Что изменилось по сравнению с предыдущей версией Работа представляет собой новый эмпирический анализ, а не обновление предыдущей версии. До этого феномен фиксации стратегии на старте не был детально изучен на таком масштабе.

Цены и доступность Исследование опубликовано на arXiv как препринт (идентификатор arXiv:2608.19072v1, тип анонса cross) и ещё не прошло рецензирование. Доступно для свободного чтения.

Почему это важно Результаты показывают ограничение современных AI-агентов, самостоятельно занимающихся post-training: они не способны менять стратегию по ходу работы, даже если экспериментальные данные указывают на необходимость такого изменения. Это ставит вопрос о том, как перейти от «железобетонного» следования плану к настоящему адаптивному обучению. Без решения этой проблемы AI-агенты рискуют оставаться лишь инструментами для локальной оптимизации, а не полноценными исследователями.

Для пользователей AI-Sphere Если вы используете или разрабатываете AI-агентов для автоматизации обучения моделей, знайте: текущие системы плохо умеют пересматривать собственную стратегию. При настройке пайплайнов стоит закладывать механизмы, которые позволяют агенту «отступать» от первоначального плана на основе промежуточных результатов. Само исследование — хорошая отправная точка для понимания, какие именно «рычаги» не хватают современные AI-системы для полной автономии.

Источники

#AI-агенты#пост-тренинг#arXiv#анализ возможностей

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат