Claude Opus 5 почти в 4 раза превзошла рекорд GPT-5.6 Sol
Нейросеть Anthropic впервые продемонстрировала «настоящий интеллект» на бенчмарке ARC-AGI-3 — и это серьёзный шаг к AGI. Разбираемся, что произошло и какие выводы сделать.
Что случилось
Anthropic выпустила Claude Opus 5 — модель, которая набрала 94,6% на тесте ARC-AGI-3. Для сравнения: предыдущий рекорд GPT-5.6 Sol составлял всего 24%. Улучшение почти в 4 раза — и это первый случай, когда ИИ перешагнул порог в 85%, который создатели бенчмарка считают признаком «настоящего интеллекта».
Claude Opus 5 также превзошла средний результат человека (84,4%), который ARC-AGI использует в качестве ориентира.
Что такое ARC-AGI-3
ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) — это тест, который измеряет способность ИИ решать новые задачи, а не воспроизводить заученные шаблоны. В отличие от обычных бенчмарков, где модель встречает похожие примеры в обучающих данных, ARC-AGI требует настоящего абстрактного мышления.
Задачи выглядят как сетки с цветными квадратами, где нужно понять логическую закономерность и применить её к новому примеру. Человек справляется с ними легко, а ИИ — почти нет. До Claude Opus 5.
Третья версия теста (ARC-AGI-3) считается самой сложной. Чтобы её пройти, модель должна продемонстрировать: понимание формы, пространственных отношений, симметрии, счёта и причинно-следственных связей.
Почему это важно
Прорыв в 4 раза за одну итерацию показывает, что ИИ начинает не просто запоминать, а мыслить абстрактно. Это ключевой шаг к AGI — искусственному интеллекту общего уровня.
Предыдущие модели (GPT-4o, Gemini 2.5 Pro, Claude Opus 4) показывали на ARC-AGI результаты ниже 15%. Скачок до 94,6% означает, что архитектура Claude Opus 5 качественно отличается от предшественников.
Как это влияет на пользователей
Практические последствия для тех, кто использует нейросети в работе:
Аналитика и данные. Claude Opus 5 способна выявлять неочевидные закономерности, с которыми предыдущие модели не справлялись.
Программирование. Улучшенное абстрактное мышление означает более качественный рефакторинг, архитектурные решения и отладку.
Исследования. Модели с такими способностями могут использоваться для научных открытий, где нужно не просто обработать данные, а понять новый принцип.
Ограничения: Claude Opus 5 пока доступна только через API Anthropic. Для России потребуется VPN или использование агрегаторов вроде AI-Sphere, которые предоставляют доступ к нейросетям без иностранной карты.
Что дальше
После такого рывка конкуренты — OpenAI, Google DeepMind, xAI — вынуждены отвечать. GPT-5.6 Sol показала 24%, но OpenAI уже работает над GPT-6.
Для пользователей главный вывод: ИИ перестаёт быть «умным автодополнением» и становится инструментом, способным к самостоятельному анализу. Это меняет подход к автоматизации многих задач — от написания кода до принятия бизнес-решений.
Использованные источники
- ARC Prize — официальный блог
- The Decoder — обзор результатов
- VentureBeat — анализ достижения
- Anthropic — официальный анонс
Хотите попробовать Claude Opus 5 и другие нейросети? На AI-Sphere вы можете задать вопрос любой модели без VPN и иностранной карты — платите только за использованные токены.