Claude Opus 5 почти в 4 раза превзошла рекорд GPT-5.6 Sol
Claude Opus 5 от Anthropic установила рекорд на бенчмарке ARC-AGI-3, набрав 94.6% — почти в 4 раза выше предыдущего достижения GPT-5.6 Sol (24%). Это первый случай, когда нейросеть продемонстрировала способность к адаптивному мышлению на уровне, сопоставимом с человеческим.
Что такое ARC-AGI-3
ARC-AGI (Abstraction and Reasoning Corpus) — бенчмарк, созданный Франсуа Шолье (создатель Keras) для измерения способности ИИ к абстрактному мышлению. В отличие от стандартных тестов, ARC проверяет не знание фактов, а умение выявлять закономерности и применять их в новых ситуациях.
Версия ARC-AGI-3 считается наиболее сложной: задачи требуют не просто распознавания паттернов, а построения внутренних моделей мира.
Как Claude Opus 5 достигла такого результата
Anthropic использовала комбинацию техник:
- Улучшенное архитектурное решение — новая версия механизма внимания, позволяющая модели строить более абстрактные представления
- Обучение на синтетических задачах — генерация десятков тысяч уникальных задач ARC-стиля для тренировки
- Тестирование на приватных данных — модель ни разу не видела задачи ARC-AGI-3 до теста
- Многошаговое рассуждение — улучшенная цепочка мышления, позволяющая модели «размышлять» над задачей
Результат: 94.6% против 24% у GPT-5.6 Sol и 67.8% у предыдущей версии Claude.
Что это значит для пользователей
Для пользователей AI-Sphere этот прорыв означает:
- Более точные ответы — модель лучше понимает контекст и нюансы задач
- Меньше галлюцинаций — абстрактное мышление снижает вероятность выдуманных фактов
- Решение нестандартных задач — Claude Opus 5 справляется с задачами, которые раньше требовали человека
- Доступность через API — модель уже доступна через провайдеров, включая OpenRouter
Контекст рынка
Прорыв Anthropic меняет расстановку сил на рынке AI:
- OpenAI с GPT-5.6 Sol (24% ARC-AGI-3) — уступает почти в 4 раза
- Google Gemini 3 Pro — результаты не раскрыты публично
- DeepSeek V4 Flash — ориентирована на скорость, не на сложное рассуждение
- Open source модели (Llama 4, Mistral Large) — пока далеки от таких результатов
ARC-AGI-3 становится ключевым бенчмарком для сравнения моделей, и Anthropic вырвалась вперёд.