Исследования

AstraZeneca и исследователи представили систему оценки AI-агентов для открытия лекарств с выверкой по экспертам

Автор: AI-Sphere· обновлено 11 сентября 2026 г. в 19:10· 6 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В препринте на arXiv (идентификатор 2608.21057) описана методология LLM-as-a-Judge для агентного AI-ассистента ChatInvent, развёрнутого в AstraZeneca. Авторы определили четыре измерения качества выходных данных: Полнота (Completeness), Релевантность (Relevancy), Структурная чёткость (Structural Clarity) и Соответствие рамкам задачи (Scope Adherence). Дополнительно введена детерминированная проверка правильности вызовов инструментов (Tool Call Correctness).

Для валидации судьи-LLM проведено исследование с участием пяти экспертов-аннотаторов. Они сравнили четыре модели в роли судей: Gemini 3.1 Pro, Claude Opus 4.7, GPT-5 и Llama 3.1 70B. Цель — определить, насколько оценки LLM совпадают с человеческими.

Как устроена система оценки

Традиционные бенчмарки для AI в drug discovery часто используют LLM в качестве судьи без предварительной проверки согласованности с экспертами. Новая работа предлагает сначала калибровать судью по человеческим оценкам. Четыре критерия покрывают разные аспекты качества: от полноты информации до соблюдения заданных инструкций. Проверка Tool Call Correctness является детерминированной — она не зависит от LLM-судьи, а анализирует фактические вызовы инструментов (например, обращение к базам данных или молекулярным симуляторам).

На практике это означает, что система может не только оценить итоговый ответ, но и проверить, правильно ли AI-агент использовал доступные инструменты в процессе решения задачи.

Почему это важно

Редакционный анализ. Агентные LLM-системы становятся ключевым инструментом в научных рабочих процессах, но их открытые ответы сложно оценивать автоматически. Подход LLM-as-a-Judge масштабируем, но без выверки с человеком он может давать смещённые или нерелевантные оценки. Предложенная методология — шаг к созданию надёжных систем оценки, которые можно доверять в чувствительных областях вроде фармацевтики. Если судья-LLM подтверждает свою согласованность с экспертами, это снижает риск пропуска ошибок или неверной интерпретации результатов.

Кроме того, комбинация субъективных критериев (полнота, релевантность) и объективной проверки вызовов инструментов создаёт более полную картину качества работы AI-агента.

Что это даёт пользователю

Для исследователей и разработчиков AI в науке этот подход означает:

  • возможность автоматизировать оценку агентных систем, не теряя в качестве, сопоставимом с человеческой экспертизой;
  • прозрачность: можно понять, по каким критериям и насколько хорошо работает AI-агент;
  • повторяемость: методология описана и может быть адаптирована для других агентов и доменов.

Для фармацевтических компаний и лабораторий, внедряющих AI-ассистентов, это способ быстрее выявлять слабые места агентов и улучшать их без необходимости каждый раз привлекать группу экспертов.

Что пока неизвестно

Препринт не прошёл рецензирование, поэтому выводы следует рассматривать как предварительные. Не раскрыты детали того, какая из моделей-судей показала наилучшее согласование с экспертами — авторы лишь упоминают, что проводили сравнение. Также не указаны конкретные метрики согласованности (например, коэффициент каппа Коэна). Остаётся неясным, насколько универсальна предложенная система для других агентов, отличных от ChatInvent.

Источники

#LLM-as-a-Judge#drug discovery#evaluation framework

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат