От BERT до агентов: восемь лет прогресса языковых моделей
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Согласно исследованию arXiv, с октября 2018 по июль 2026 года языковые модели прошли путь от простых систем вроде BERT до мощных агентов, способных решать сложные математические задачи и писать код. Затраты резко снизились: модель GPT 5.6 Luna сопоставима по возможностям с флагманами при цене 1–6 долларов за миллион токенов. Производительность распределилась между специализированными моделями: Claude Opus 5 лидирует во фронтенд-кодинге, Claude Fable 5 — в репозиториях, а GPT 5.6 Sol — в терминальных задачах.
Что произошло Исследователи проанализировали прогресс языковых моделей за восемь лет — с октября 2018 года (выход BERT) по июль 2026 года. За это время модели превратились из простых систем в массивные агенты, которые решают сложные математические задачи и пишут программный код. Способность решать реальные проблемы кодирования улучшалась почти в шесть раз в год с конца 2024 года. В тесте по математике для начальной школы на базе модели Qwen 2.5 базовый метод решил 58 из 100 задач, а продвинутый семплинг — до 79. Инструмент ранжирования уверенности правильно определил 47 правильных ответов в своих топ-50 выборах, что оказалось полезным для сортировки задач.
Что изменилось по сравнению с предыдущей версией В 2018 году BERT был передовым решением, но не умел генерировать код или решать сложные задачи. Современные модели (2026 год) не только пишут код, но и специализируются: Claude Opus 5 — фронтенд, Claude Fable 5 — репозиторий, GPT 5.6 Sol — терминал. Стоимость использования упала: бюджетная модель GPT 5.6 Luna за 1–6 долларов за миллион токенов превосходит старые версии по возможностям при гораздо меньшей цене.
Цены и доступность Модель GPT 5.6 Luna доступна через OpenAI по цене от 1 до 6 долларов за миллион токенов. Другие модели (Claude Opus 5, Claude Fable 5, GPT 5.6 Sol) также доступны через соответствующих провайдеров. Все исследовательские материалы опубликованы в открытом доступе.
Почему это важно Исследование демонстрирует колоссальный прогресс: за восемь лет модели прошли путь от простого понимания текста до решения сложных задач, а стоимость упала настолько, что флагманские возможности стали доступны по цене бюджетных решений. Специализация моделей указывает на новую тенденцию — выбор модели под конкретную задачу становится критичным для максимальной эффективности.
Для пользователей AI-Sphere При выборе модели для кодинга стоит учитывать специализацию: для фронтенда — Claude Opus 5, для работы с репозиториями — Claude Fable 5, для терминальных задач — GPT 5.6 Sol. Если бюджет ограничен, GPT 5.6 Luna предлагает почти флагманскую производительность по минимальной цене. В карточке модели на ai-sphere.ru можно уточнить актуальные цены и доступность для российских пользователей.
Источники