AstraZeneca и исследователи представили систему оценки AI-агентов для открытия лекарств с выверкой по экспертам
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В препринте на arXiv (идентификатор 2608.21057) описана методология LLM-as-a-Judge для агентного AI-ассистента ChatInvent, развёрнутого в AstraZeneca. Авторы определили четыре измерения качества выходных данных: Полнота (Completeness), Релевантность (Relevancy), Структурная чёткость (Structural Clarity) и Соответствие рамкам задачи (Scope Adherence). Дополнительно введена детерминированная проверка правильности вызовов инструментов (Tool Call Correctness).
Для валидации судьи-LLM проведено исследование с участием пяти экспертов-аннотаторов. Они сравнили четыре модели в роли судей: Gemini 3.1 Pro, Claude Opus 4.7, GPT-5 и Llama 3.1 70B. Цель — определить, насколько оценки LLM совпадают с человеческими.
Как устроена система оценки
Традиционные бенчмарки для AI в drug discovery часто используют LLM в качестве судьи без предварительной проверки согласованности с экспертами. Новая работа предлагает сначала калибровать судью по человеческим оценкам. Четыре критерия покрывают разные аспекты качества: от полноты информации до соблюдения заданных инструкций. Проверка Tool Call Correctness является детерминированной — она не зависит от LLM-судьи, а анализирует фактические вызовы инструментов (например, обращение к базам данных или молекулярным симуляторам).
На практике это означает, что система может не только оценить итоговый ответ, но и проверить, правильно ли AI-агент использовал доступные инструменты в процессе решения задачи.
Почему это важно
Редакционный анализ. Агентные LLM-системы становятся ключевым инструментом в научных рабочих процессах, но их открытые ответы сложно оценивать автоматически. Подход LLM-as-a-Judge масштабируем, но без выверки с человеком он может давать смещённые или нерелевантные оценки. Предложенная методология — шаг к созданию надёжных систем оценки, которые можно доверять в чувствительных областях вроде фармацевтики. Если судья-LLM подтверждает свою согласованность с экспертами, это снижает риск пропуска ошибок или неверной интерпретации результатов.
Кроме того, комбинация субъективных критериев (полнота, релевантность) и объективной проверки вызовов инструментов создаёт более полную картину качества работы AI-агента.
Что это даёт пользователю
Для исследователей и разработчиков AI в науке этот подход означает:
- возможность автоматизировать оценку агентных систем, не теряя в качестве, сопоставимом с человеческой экспертизой;
- прозрачность: можно понять, по каким критериям и насколько хорошо работает AI-агент;
- повторяемость: методология описана и может быть адаптирована для других агентов и доменов.
Для фармацевтических компаний и лабораторий, внедряющих AI-ассистентов, это способ быстрее выявлять слабые места агентов и улучшать их без необходимости каждый раз привлекать группу экспертов.
Что пока неизвестно
Препринт не прошёл рецензирование, поэтому выводы следует рассматривать как предварительные. Не раскрыты детали того, какая из моделей-судей показала наилучшее согласование с экспертами — авторы лишь упоминают, что проводили сравнение. Также не указаны конкретные метрики согласованности (например, коэффициент каппа Коэна). Остаётся неясным, насколько универсальна предложенная система для других агентов, отличных от ChatInvent.