Оценка LLM для открытия лекарств от малярии: открытые модели с тонкой настройкой превосходят проприетарные
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Оценка LLM для открытия лекарств от малярии: открытые модели с тонкой настройкой превосходят проприетарные
Кратко: Исследователи представили Malaria-Instruct — набор данных для оценки LLM в виртуальном скрининге на малярию. Систематическое тестирование пяти открытых моделей показало, что тонко настроенные на доменной задаче Llama и Gemma значительно превосходят как классические ML-модели, так и проприетарные Gemini 2.5 и OpenAI o3. Без тонкой настройки даже лучшие проприетарные модели не дают надёжного предсказания.
Что произошло
В новой работе на arXiv (arXiv:2608.20418v1) исследователи создали курируемый набор данных Malaria-Instruct, основанный на корпусе ChEMBL Legacy Malaria, и провели оценку пяти открытых LLM: Gemma-2 2B/9B, TxGemma-2B/9B и LlaSMol-Mistral-7B. Тестирование проводилось на строгом out-of-distribution сплите данных. В качестве базовых моделей выступили классические ML (Random Forest, XGBoost) и проприетарные frontier-модели (Gemini 2.5, OpenAI o3) при few-shot условиях.
Результаты показали, что тонко настроенные LLM значительно превзошли все базовые модели. Лучший результат по ROC-AUC показал TxGemma-9B — 0,731 ± 0,005, а лучший фактор обогащения (EF@1%) — LlaSMol-Mistral-7B, около 4,99. Ключевой вывод: доменная тонкая настройка оказалась категорически необходимой. TxGemma-9B без тонкой настройки в лучших few-shot условиях упал до ROC-AUC 0,499, а Gemini 2.5 и OpenAI o3 без тонкой настройки показали лишь 0,53 и 0,59 соответственно, что не позволяет считать их надёжными инструментами для этой задачи.
Что изменилось по сравнению с предыдущей версией
Это новое исследование, а не обновление существующей работы. Ранее прямого сравнения такого набора открытых и проприетарных LLM на задаче виртуального скрининга на малярию не проводилось. В работе впервые представлен Malaria-Instruct и систематически продемонстрирована критическая важность доменной тонкой настройки для этой задачи.
Цены и доступность
Исследование опубликовано в виде препринта на arXiv и не является коммерческим продуктом. Malaria-Instruct доступен как открытый набор данных. Все протестированные модели (Gemma, TxGemma, LlaSMol) являются открытыми, что позволяет воспроизвести результаты и использовать их для дальнейших исследований.
Почему это важно
Результаты показывают, что открытые LLM с узкой доменной настройкой могут превосходить значительно более крупные проприетарные модели в специализированных научных задачах. Это подчёркивает эффективность стратегии тонкой настройки вместо использования универсальных моделей в условиях ограниченного бюджета. Для фармацевтики и открытия лекарств такой подход может существенно снизить стоимость скрининга и ускорить поиск кандидатов.
Для пользователей AI-Sphere
Это исследование — практический пример того, как доменная настройка даже небольших открытых моделей (TxGemma-9B, LlaSMol-Mistral-7B) позволяет достичь результатов, недоступных проприетарным гигантам. Если вы работаете в области биоинформатики, химии или материаловедения, стоит обратить внимание на подобные модели: они могут быть эффективнее и дешевле, чем ChatGPT или Claude, для ваших специфических задач. Планируется добавить результаты этого исследования в карточку модели для сравнения на ai-sphere.ru.
Источники