DeReAct: новая архитектура для надёжных AI-агентов с разделением рассуждения и действий
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В типичных ReAct-агентах одна и та же языковая модель отвечает и за выбор действия, и за взаимодействие со средой, и за решение, когда задача выполнена. Такое совмещение приводит к ошибкам: модель может выполнить непроверенное действие или объявить задачу завершённой, хотя на самом деле это не так. DeReAct вводит два внешних модуля:
- Critic — проверяет предложенное действие перед его выполнением;
- Context Manager — восстанавливает актуальное состояние среды и подтверждает, что задача действительно выполнена.
Таким образом, решение о том, можно ли выполнить действие и завершена ли задача, принимается не одной моделью, а специализированными компонентами.
Результаты экспериментов
Архитектуру протестировали на бенчмарках GAIA и SWE-bench Verified. Наибольший прирост показателя Pass@1 (доля успешно решённых задач с первой попытки) наблюдался для более слабых «мозговых» моделей:
- Qwen3-Coder-480B: улучшение на 6,5–7,0 пунктов;
- Claude Sonnet 4.5: улучшение на 4,2–5,2 пункта.
По мере увеличения мощности базовой модели выигрыш снижается. Это говорит о том, что DeReAct особенно эффективен, когда исходная модель склонна к типичным ошибкам — необоснованным действиям или ложному завершению.
Почему это важно
Проблема «галлюцинаций» и преждевременного завершения задач остаётся одной из главных в области AI-агентов. DeReAct предлагает не улучшать саму модель, а добавить внешние механизмы контроля. Редакционный вывод: такой модульный подход может стать стандартом для промышленных агентов, где цена ошибки высока — например, в автоматизации бизнес-процессов или генерации кода. То, что метод сильнее помогает слабым моделям, открывает путь к использованию менее дорогих LLM с сохранением приемлемой надёжности.
Что это даёт пользователю
Разработчики AI-агентов смогут:
- снизить количество неверных действий в автоматизированных сценариях (обработка документов, взаимодействие с API);
- получать более предсказуемое поведение агентов за счёт явной проверки каждого шага;
- использовать более лёгкие и дешёвые языковые модели, компенсируя их недостатки внешними модулями.
Что пока неизвестно
В публикации не указаны авторы работы, а сам препринт ещё не прошёл рецензирование. Нет информации о том, планируется ли открытая реализация DeReAct или API. Также неясно, как метод поведёт себя на других бенчмарках и в реальных приложениях с длинными цепочками действий.