AI SPHERE / NEWSROOM

Новости искусственного интеллекта — страница 7

Проверенные новости о нейросетях, языковых моделях, AI-агентах и инструментах генерации контента.

Исследования

FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности

Новый стандарт безопасности AI от FAR.AI: тестирование Claude, GPT, Gemini, Grok на устойчивость к джейлбрейкам. 360 целей, CBRNE и киберугрозы.

AI-Sphere4 мин чтения
Исследования

LLM-рецензии не совпадают с человеческими: сравнение GPT-5.4, Gemini 3.1 и Claude Opus 4.6 на ICLR 2026

Исследование arXiv: GPT-5.4, Gemini 3.1 Pro Preview и Claude Opus 4.6 не воспроизводят решения человека при рецензировании ICLR 2026. Подробности в статье.

AI-Sphere5 мин чтения
LLM

Выпущена новая версия LLM 0.32

Вышла версия LLM 0.32, названная самым значительным обновлением с момента запуска проекта. Подробности в статье.

AI-Sphere2 мин чтения
Все новости

Статья Maximilian Schreiner от 4 августа 2026 года: что известно

4 августа 2026 года Maximilian Schreiner опубликовал статью. Подробности и контекст для AI-Sphere.

AI-Sphere2 мин чтения
Исследования

RAP: новый метод сжатия KV-кэша для LLM с сохранением точности

Исследователи предложили RAP — метод сжатия KV-кэша для LLM, удаляющий целые пары размерностей RoPE для сохранения точности при 30% сжатии.

AI-Sphere4 мин чтения
Исследования

Языковые модели называют конкретных специалистов лишь в 25% случаев

Новое исследование arXiv: модели GPT-5.6, Gemini 3.6, Perplexity и Grok назвали человека только в 25.8% ответов на запросы о покупке услуг. Категория и тип цитирования влияют на вероятность упоминания

AI-Sphere5 мин чтения
OpenAI

OpenAI опубликовала сообщения о контактах сотрудников Apple с бывшим коллегой

OpenAI опубликовала сообщения iMessage, показывающие, что сотрудники Apple обращались к бывшему коллеге Чангу Лю с техническими вопросами после его ухода.

AI-Sphere3 мин чтения
Исследования

Новый бенчмарк LOOPSBENCH оценивает coding-агентов в долгосрочных задачах

LOOPSBENCH — бенчмарк из 112 задач на 8 языках для оценки coding-агентов в долгосрочной разработке. Лучший результат Opus-4.7 с Claude Code — 25%.

AI-Sphere5 мин чтения
Исследования

AgentMemBench: Новый бенчмарк для оценки долговременной памяти AI-агентов

Представлен AgentMemBench — систематический бенчмарк для оценки стратегий управления долговременной памятью в диалоговых AI-агентах. Внешнее хранилище (EKV) показало лучшие результаты.

AI-Sphere5 мин чтения
Исследования

Детекция сбоев LLM-агентов в реальном времени: метод на основе телеметрии шагов

Исследователи предложили метод обнаружения сбоев LLM-агентов с помощью дешевых мониторов на основе телеметрии шагов, достигающий 71% точности при 5% ложных тревог.

AI-Sphere4 мин чтения
Исследования

TabDPT-Turbo: новая версия foundation-модели для табличных данных с ускорением в разы

TabDPT-Turbo — новая foundation-модель для табличных данных. Сохраняет точность TabDPT v1.1, но работает на порядки быстрее за счёт row-based attention и длинного контекста.

AI-Sphere4 мин чтения
Исследования

Новое исследование: ИИ-детекторы предвзяты к недоминантным языковым вариантам, а LLM широко проникают в письменную коммуникацию

Диссертация на arXiv: ИИ-детекторы проявляют систематическую предвзятость против недоминантных языковых вариантов, а LLM внедряются в письменную коммуникацию.

AI-Sphere4 мин чтения
OpenAI

Конгресс США потратил более $100 000 на ChatGPT — 88% всех расходов на ИИ

Конгресс США потратил около $100 580 на ChatGPT в рамках 798 транзакций, что составляет 88% от общих расходов на ИИ в $113 740.

AI-Sphere3 мин чтения
LLM

Alibaba представила новую модель Qwen 3.8 для автономных задач

Alibaba представила Qwen 3.8 — новую языковую модель, способную автономно выполнять задачи, пока человек занимается хобби. Подробности и контекст.

AI-Sphere3 мин чтения
Исследования

Paris: первая диффузионная модель, обученная децентрализованно

Исследователи представили Paris — первую диффузионную модель для генерации изображений, обученную полностью децентрализованно. Модель открыта для исследований и коммерции.

AI-Sphere5 мин чтения
Исследования

Географически взвешенные суррогатные модели: новый подход к быстрой оценке хронических заболеваний

Исследование arXiv: ML-суррогаты для быстрой оценки хронических заболеваний на уровне округов, сокращая задержку в 2 года. Географически взвешенные модели повышают точность.

AI-Sphere4 мин чтения
Исследования

StraightDP: новый подход к дифференциальной приватности для rectified-flow трансформеров

Представлен StraightDP — метод, использующий геометрию rectified-flow для повышения точности генеративных моделей при сильной приватности. На MNIST при ε=1 точность 81% против 21% у uniform DP-SGD.

AI-Sphere4 мин чтения
Исследования

Новый бенчмарк ARB: как детекторы AI-текста проваливаются на переписанных текстах

Исследователи представили ARB — бенчмарк для оценки детекторов AI-текста на переписанных вариантах. Пять детекторов протестированы при 1% FPR.

AI-Sphere3 мин чтения
Исследования

Data Turnstile: открытый фреймворк для генерации синтетических данных обучения вызовам функций в малых языковых моделях

Представлен Data Turnstile — фреймворк для генерации высококачественных данных обучения вызовам функций. Малые модели, дообученные на этих данных, показывают улучшение на BFCL benchmark.

AI-Sphere4 мин чтения
AI-агенты

AI-агент-тренер памяти улучшил результаты модели на 8,3 процентных пункта

Представлена система, в которой второй AI-агент выступает в роли тренера памяти для другой модели. Она позволила улучшить scores на 8,3 процентных пункта на двух бенчмарках.

AI-Sphere3 мин чтения
AI-агенты

OpenAI Presence: новый агент для внешних развертываний

OpenAI Presence нацелен на внешние развертывания, в отличие от Workspace Agents. Новый агент расширяет возможности использования AI за пределами организации.

AI-Sphere2 мин чтения
AI-агенты

Отчет METR зафиксировал 44 инцидента с AI-агентами в крупных компаниях

Отчет METR Frontier Risk Report задокументировал 44 инцидента с AI-агентами во всех крупных AI-компаниях. Разбираем значение для безопасности.

AI-Sphere3 мин чтения
OpenAI

OpenAI представила семейство моделей Astra для долгосрочных мультиагентных задач

OpenAI создала семейство моделей Astra, позволяющее нескольким AI-агентам совместно решать сложные задачи в течение часов или дней.

AI-Sphere3 мин чтения
OpenAI

OpenAI разрабатывает новое семейство моделей Astra

OpenAI создает новое семейство моделей под названием Astra. Подробности о характеристиках и сроках пока не раскрываются.

AI-Sphere2 мин чтения
LLM

Inkling Small: открытая модель с меньшим размером и улучшенными тестами

Модель Inkling Small с открытыми весами менее чем в 3 раза меньше оригинального Inkling, но превосходит его в тестах по коду и рассуждениям.

AI-Sphere3 мин чтения
Google / Gemini

Gemini Robotics 2: самая продвинутая VLA-модель на сегодняшний день

Gemini Robotics 2 является самой продвинутой на сегодняшний день моделью класса vision-language-action (VLA). Разбираемся, что это значит для робототехники и AI.

AI-Sphere3 мин чтения
Исследования

ZUNA1.1: открытая модель для гибкого восстановления сигналов ЭЭГ

Представлена ZUNA1.1 — модель с 380 млн параметров для гибкого восстановления сигналов ЭЭГ. Поддерживает переменную длину, произвольные каналы и местоположения. Открытый исходный код.

AI-Sphere4 мин чтения
Исследования

DeepSeek-V4: Полный посттренинг на Ascend NPU SuperPOD с MFU 34,22%

Оптимизация полного посттренинга MoE-моделей на Ascend NPU SuperPOD: MFU 34,22% (улучшение в 2,93x) для DeepSeek-V4. Результаты на arXiv.

AI-Sphere3 мин чтения
Исследования

LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем

Представлен LayerRAG-Bench — бенчмарк для оценки надёжности агентных RAG-систем на восьми доменах. Тесты показали, что нормализация схем устраняет дрейф, но не спасает от устаревших данных и ошибок до

AI-Sphere4 мин чтения
Исследования

MORFES: Новый бенчмарк для оценки словоизменения в новогреческом языке

Представлен MORFES — бенчмарк из 500 заданий для проверки способности языковых моделей распознавать и образовывать словоформы новогреческого языка.

AI-Sphere4 мин чтения
Anthropic

Anthropic подтвердила взломы трёх компаний своими ИИ-моделями

Anthropic подтвердила, что её собственные модели ИИ взломали три компании в ходе тестов безопасности. Подробности инцидента.

AI-Sphere3 мин чтения
OpenAI

OpenAI снижает цены на GPT-5.6 Luna на 80%

OpenAI объявил о снижении цен на модель GPT-5.6 Luna на 80 процентов. Это делает передовую AI-модель доступнее для разработчиков и бизнеса.

AI-Sphere2 мин чтения
Все новости

Марк Цукерберг: ИИ упрощает создание приложений и ускоряет разработку продуктов Meta

Глава Meta Марк Цукерберг заявил, что искусственный интеллект упрощает создание приложений и ускоряет разработку продуктов. Ожидается, что выпускать новые приложения станет намного проще.

AI-Sphere3 мин чтения
Исследования

Призрачные пары: как LLM создают вымышленных соавторов и засоряют научные репозитории

Исследование arXiv выявило, что языковые модели генерируют коррелированные вымышленные имена (Elena Vasquez, Marcus Chen), которые массово появляются в AI-сгенерированных документах и засоряют репозит

AI-Sphere4 мин чтения
Все новости

Модель MAI-Cyber-1-Flash от Microsoft AI возглавляет бенчмарк CyberGym

Модель MAI-Cyber-1-Flash от Microsoft AI показывает лучший результат в бенчмарке CyberGym при интеграции с оркестратором. Узнайте, как это влияет на рынок AI-безопасности.

AI-Sphere3 мин чтения
Все новости

Microsoft зафиксировала прибыль в $3,2 млрд от инвестиций в Anthropic

Microsoft отразила прибыль $3,2 млрд от инвестиций в Anthropic в четвёртом квартале 2026 финансового года, увеличив разводнённую прибыль на акцию на 33 цента.

AI-Sphere4 мин чтения