Claude Fable 5.1 вдвое обходит предшественника в научных задачах Terminal-Bench
Anthropic представила обновление своей линейки моделей Claude, которое заметно улучшило результаты в автономных научных и инженерных задачах. Согласно опубликованным данным, модель Fable 5.1 достигла 52.6% на бенчмарке Terminal-Bench-Science 0.1, что более чем вдвое превышает показатель предыдущей версии Fable 5 (24.7%). Для сравнения, результат модели GPT-5.6 Sol на этом же тесте составил 22.4%.
Что произошло
Ключевое изменение касается способности модели работать с терминалом и выполнять длинные цепочки действий без участия человека. Бенчмарк Terminal-Bench-Science 0.1 проверяет, насколько хорошо ИИ справляется с реальными задачами в командной строке: запуском скриптов, анализом данных, настройкой окружений и интерпретацией результатов.
Результат 52.6% означает, что новая модель успешно решает более половины тестовых сценариев. Это существенный скачок по сравнению с предыдущей версией, которая справлялась лишь с четвертью задач. При этом разрыв с конкурирующим решением GPT-5.6 Sol, показавшим 22.4%, стал более чем двукратным.
Как это работает на практике
Terminal-Bench-Science оценивает не просто знание фактов, а способность модели действовать как исследователь-ассистент. В типичном сценарии модель получает задачу, например, «проанализируй датасет и построй график зависимости», и должна самостоятельно:
- найти нужные файлы и инструменты в файловой системе;
- написать и выполнить команды в терминале;
- обработать ошибки и скорректировать подход;
- вернуть осмысленный результат.
Высокий балл на этом тесте говорит о том, что Fable 5.1 лучше удерживает контекст длинной сессии, реже «застревает» на промежуточных шагах и точнее выбирает следующее действие. На практике это может означать более надёжную работу ИИ-агентов, которые автоматизируют рутинные операции разработчика или аналитика.
Почему это важно
Рост с 24.7% до 52.6% — это не эволюционное улучшение, а качественный скачок. Если предыдущая модель справлялась лишь с простыми сценариями, то новая берётся за задачи средней сложности, которые требуют многошагового планирования.
Редакционный вывод: такой прогресс приближает момент, когда ИИ-агенты смогут самостоятельно выполнять заметную часть работы data-инженера или DevOps-специалиста. Однако важно помнить, что 52.6% — это всё ещё не полное решение всех задач. Модель по-прежнему ошибается примерно в половине случаев, поэтому говорить о полной автоматизации преждевременно. Скорее, это шаг к тому, чтобы агенты стали полезными помощниками в контролируемых сценариях.
Что это даёт пользователю
Для разработчиков и исследователей улучшение означает, что ИИ-ассистенты на базе новой модели смогут:
- автоматизировать рутинные операции с данными прямо в терминале;
- быстрее настраивать окружения и запускать эксперименты;
- реже требовать вмешательства человека при выполнении стандартных задач.
На практике это может сократить время на подготовку данных и проведение типовых анализов. Вместо того чтобы вручную писать каждую команду, пользователь сможет описать цель, а модель возьмёт на себя исполнение.
Что пока неизвестно
Официально не подтверждены точные названия и версии моделей, упомянутых в утечке, а также даты их выхода и доступность для пользователей. Не раскрыты и детали о возможном снижении стоимости длительных автономных запусков. Пока достоверно известно только о результатах на бенчмарке Terminal-Bench-Science 0.1, поэтому остальные характеристики стоит воспринимать как предположения.