Исследования

Новый метод выявляет источник ошибок в системах Deep Research

Автор: AI-Sphere· обновлено 26 августа 2026 г. в 09:09· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Новый метод выявляет источник ошибок в системах Deep Research

Кратко: Исследователи представили метод, позволяющий локализовать ошибки в мультиагентных системах Deep Research. Метод тестирует каждого агента на точность и проверяемость относительно его собственных входных данных, а также классифицирует ошибки по четырём типам.

Что произошло

В новой научной работе, опубликованной на arXiv, авторы предложили метод оценки для систем Deep Research (DR). Такие системы создают длинные отчёты с цитатами, координируя работу нескольких агентов, которые ищут и синтезируют информацию из интернета. Текущие DR-системы демонстрируют низкую полноту цитирования, а улучшение этого показателя затруднено из-за сложной мультиагентной архитектуры, где информация проходит через агентов, подобно «испорченному телефону», и как содержание, так и цитаты могут искажаться. Предложенный метод позволяет определить, какой именно агент внёс ошибку, путём локального тестирования каждого вызова агента на точность и проверяемость относительно его собственных входных данных. Для категоризации обнаруженных ошибок введена таксономия из четырёх типов: галлюцинация, опора на нецитируемые входные данные, нецитируемый вывод или недостаточное количество цитат. Метод был применён к трём ведущим открытым DR-системам.

Что изменилось по сравнению с предыдущей версией

Ранее не существовало метода, который бы точно определял, какой именно агент в мультиагентной системе Deep Research допустил ошибку. Предыдущие подходы фокусировались на оценке финального отчёта, не позволяя локализовать источник проблемы. Новый метод предлагает пошаговую диагностику каждого агента.

Цены и доступность

Исследование опубликовано в виде препринта на arXiv и не является коммерческим продуктом. Метод и таксономия доступны для изучения и использования научным сообществом.

Почему это важно

Системы Deep Research становятся всё более популярными, но их надёжность остаётся под вопросом из-за низкого качества цитирования. Новый метод предоставляет инструмент для систематического выявления и исправления ошибок, что критически важно для повышения доверия к таким системам и их внедрения в практику.

Для пользователей AI-Sphere

Если вы используете или разрабатываете системы Deep Research, этот метод поможет вам понять, где именно возникают ошибки в цепочке агентов, и целенаправленно их исправлять. Это шаг к более прозрачным и надёжным AI-системам для работы с информацией.

Источники

https://arxiv.org/abs/2608.24306

#Deep Research#агентные системы#цитирование#faithfulness

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат