DiG-bench: новый бенчмарк для оценки способности ИИ к научным открытиям
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Исследователи представили DiG-bench — набор из 70 независимых игр, в которых ИИ-агенты должны самостоятельно открывать скрытые правила трансформации через взаимодействие и эксперименты. Бенчмарк включает семь уровней сложности, от решаемых множеством моделей до бросающих вызов лучшим современным агентам.
Что произошло
DiG-bench (Discovery in Games) — это новый бенчмарк, призванный заполнить пробел в оценке способности искусственного интеллекта к формулированию новых обобщений, то есть к научному открытию. Каждая из 70 игр закодирована короткой строкой и имеет уникальные правила трансформации. Агент должен узнать эти правила, взаимодействуя со средой, причём цели каждого уровня также неизвестны. Уровни в игре проверяют, действительно ли правила были открыты.
Бенчмарк разбит на семь уровней сложности (tiers). Самый низкий уровень регулярно решается несколькими моделями, в то время как самый высокий представляет серьёзный вызов для лучших моделей в агентных средах.
Что изменилось по сравнению с предыдущей версией
Бенчмарк является новым, предыдущие версии отсутствуют.
Цены и доступность
DiG-bench опубликован в виде препринта на arXiv (ID: 2608.12593v1) и доступен для свободного скачивания. Открытый код и данные, вероятно, будут размещены по ссылкам из статьи. Бенчмарк не требует лицензионных отчислений.
Почему это важно
Современные AI-бенчмарки в основном проверяют способность к запоминанию и применению известных правил, а не к открытию нового. DiG-bench напрямую оценивает, насколько ИИ способен к экспериментальному поиску и обобщению — ключевым компонентам научного метода. Успешное прохождение самых сложных уровней может стать важным шагом к созданию моделей, способных к самостоятельным открытиям. По сравнению с существующими тестами на абстрактное мышление (например, ARC), DiG-bench фокусируется на интерактивном исследовании среды с неизвестными целями.
Для пользователей AI-Sphere
DiG-bench интересен разработчикам агентных систем и исследователям, работающим над активным обучением и планированием. Если вы тестируете свою модель на способность к самостоятельному исследованию, попробуйте запустить её на DiG-bench. Результаты помогут понять, насколько ваш ИИ близок к научному мышлению.
Источники