Anthropic

Claude Opus 5 почти в 4 раза превзошла рекорд GPT-5.6 Sol

Автор: AI-Sphere· 4 мин чтения
Источники: arcprize.org, the-decoder.com, venturebeat.com, anthropic.com
Claude Opus 5 от Anthropic установила рекорд на бенчмарке ARC-AGI-3, набрав 94.6% — почти в 4 раза выше предыдущего достижения GPT-5.6 Sol (24%). Это первый случай, когда нейросеть продемонстрировала способность к адаптивному мышлению на уровне, сопоставимом с человеческим.

Claude Opus 5 от Anthropic установила рекорд на бенчмарке ARC-AGI-3, набрав 94.6% — почти в 4 раза выше предыдущего достижения GPT-5.6 Sol (24%). Это первый случай, когда нейросеть продемонстрировала способность к адаптивному мышлению на уровне, сопоставимом с человеческим.

Что такое ARC-AGI-3

ARC-AGI (Abstraction and Reasoning Corpus) — бенчмарк, созданный Франсуа Шолье (создатель Keras) для измерения способности ИИ к абстрактному мышлению. В отличие от стандартных тестов, ARC проверяет не знание фактов, а умение выявлять закономерности и применять их в новых ситуациях.

Версия ARC-AGI-3 считается наиболее сложной: задачи требуют не просто распознавания паттернов, а построения внутренних моделей мира.

Как Claude Opus 5 достигла такого результата

Anthropic использовала комбинацию техник:

  • Улучшенное архитектурное решение — новая версия механизма внимания, позволяющая модели строить более абстрактные представления
  • Обучение на синтетических задачах — генерация десятков тысяч уникальных задач ARC-стиля для тренировки
  • Тестирование на приватных данных — модель ни разу не видела задачи ARC-AGI-3 до теста
  • Многошаговое рассуждение — улучшенная цепочка мышления, позволяющая модели «размышлять» над задачей

Результат: 94.6% против 24% у GPT-5.6 Sol и 67.8% у предыдущей версии Claude.

Что это значит для пользователей

Для пользователей AI-Sphere этот прорыв означает:

  1. Более точные ответы — модель лучше понимает контекст и нюансы задач
  2. Меньше галлюцинаций — абстрактное мышление снижает вероятность выдуманных фактов
  3. Решение нестандартных задач — Claude Opus 5 справляется с задачами, которые раньше требовали человека
  4. Доступность через API — модель уже доступна через провайдеров, включая OpenRouter

Контекст рынка

Прорыв Anthropic меняет расстановку сил на рынке AI:

  • OpenAI с GPT-5.6 Sol (24% ARC-AGI-3) — уступает почти в 4 раза
  • Google Gemini 3 Pro — результаты не раскрыты публично
  • DeepSeek V4 Flash — ориентирована на скорость, не на сложное рассуждение
  • Open source модели (Llama 4, Mistral Large) — пока далеки от таких результатов

ARC-AGI-3 становится ключевым бенчмарком для сравнения моделей, и Anthropic вырвалась вперёд.

#claude-opus-5#anthropic#arc-agi

Читайте также

Claude Opus 5Цены на Claude Opus 5AnthropicAnthropic (Claude) — модели, продукты и новостиСравнения нейросетейСравнение AI-моделей

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат