Исследования

DiG-bench: новый бенчмарк для оценки способности ИИ к научным открытиям

Автор: AI-Sphere· обновлено 14 августа 2026 г. в 02:30· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Кратко: Исследователи представили DiG-bench — набор из 70 независимых игр, в которых ИИ-агенты должны самостоятельно открывать скрытые правила трансформации через взаимодействие и эксперименты. Бенчмарк включает семь уровней сложности, от решаемых множеством моделей до бросающих вызов лучшим современным агентам.

Что произошло

DiG-bench (Discovery in Games) — это новый бенчмарк, призванный заполнить пробел в оценке способности искусственного интеллекта к формулированию новых обобщений, то есть к научному открытию. Каждая из 70 игр закодирована короткой строкой и имеет уникальные правила трансформации. Агент должен узнать эти правила, взаимодействуя со средой, причём цели каждого уровня также неизвестны. Уровни в игре проверяют, действительно ли правила были открыты.

Бенчмарк разбит на семь уровней сложности (tiers). Самый низкий уровень регулярно решается несколькими моделями, в то время как самый высокий представляет серьёзный вызов для лучших моделей в агентных средах.

Что изменилось по сравнению с предыдущей версией

Бенчмарк является новым, предыдущие версии отсутствуют.

Цены и доступность

DiG-bench опубликован в виде препринта на arXiv (ID: 2608.12593v1) и доступен для свободного скачивания. Открытый код и данные, вероятно, будут размещены по ссылкам из статьи. Бенчмарк не требует лицензионных отчислений.

Почему это важно

Современные AI-бенчмарки в основном проверяют способность к запоминанию и применению известных правил, а не к открытию нового. DiG-bench напрямую оценивает, насколько ИИ способен к экспериментальному поиску и обобщению — ключевым компонентам научного метода. Успешное прохождение самых сложных уровней может стать важным шагом к созданию моделей, способных к самостоятельным открытиям. По сравнению с существующими тестами на абстрактное мышление (например, ARC), DiG-bench фокусируется на интерактивном исследовании среды с неизвестными целями.

Для пользователей AI-Sphere

DiG-bench интересен разработчикам агентных систем и исследователям, работающим над активным обучением и планированием. Если вы тестируете свою модель на способность к самостоятельному исследованию, попробуйте запустить её на DiG-bench. Результаты помогут понять, насколько ваш ИИ близок к научному мышлению.

Источники

#DiG-bench#научные открытия#бенчмарк#AI

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат