FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности
Новый стандарт безопасности AI от FAR.AI: тестирование Claude, GPT, Gemini, Grok на устойчивость к джейлбрейкам. 360 целей, CBRNE и киберугрозы.
Проверенные новости о нейросетях, языковых моделях, AI-агентах и инструментах генерации контента.
Новый стандарт безопасности AI от FAR.AI: тестирование Claude, GPT, Gemini, Grok на устойчивость к джейлбрейкам. 360 целей, CBRNE и киберугрозы.
Исследование arXiv: GPT-5.4, Gemini 3.1 Pro Preview и Claude Opus 4.6 не воспроизводят решения человека при рецензировании ICLR 2026. Подробности в статье.
Вышла версия LLM 0.32, названная самым значительным обновлением с момента запуска проекта. Подробности в статье.
4 августа 2026 года Maximilian Schreiner опубликовал статью. Подробности и контекст для AI-Sphere.
Исследователи предложили RAP — метод сжатия KV-кэша для LLM, удаляющий целые пары размерностей RoPE для сохранения точности при 30% сжатии.
Новое исследование arXiv: модели GPT-5.6, Gemini 3.6, Perplexity и Grok назвали человека только в 25.8% ответов на запросы о покупке услуг. Категория и тип цитирования влияют на вероятность упоминания
OpenAI опубликовала сообщения iMessage, показывающие, что сотрудники Apple обращались к бывшему коллеге Чангу Лю с техническими вопросами после его ухода.
LOOPSBENCH — бенчмарк из 112 задач на 8 языках для оценки coding-агентов в долгосрочной разработке. Лучший результат Opus-4.7 с Claude Code — 25%.
Представлен AgentMemBench — систематический бенчмарк для оценки стратегий управления долговременной памятью в диалоговых AI-агентах. Внешнее хранилище (EKV) показало лучшие результаты.
Исследователи предложили метод обнаружения сбоев LLM-агентов с помощью дешевых мониторов на основе телеметрии шагов, достигающий 71% точности при 5% ложных тревог.
TabDPT-Turbo — новая foundation-модель для табличных данных. Сохраняет точность TabDPT v1.1, но работает на порядки быстрее за счёт row-based attention и длинного контекста.
Диссертация на arXiv: ИИ-детекторы проявляют систематическую предвзятость против недоминантных языковых вариантов, а LLM внедряются в письменную коммуникацию.
Конгресс США потратил около $100 580 на ChatGPT в рамках 798 транзакций, что составляет 88% от общих расходов на ИИ в $113 740.
Alibaba представила Qwen 3.8 — новую языковую модель, способную автономно выполнять задачи, пока человек занимается хобби. Подробности и контекст.
Исследователи представили Paris — первую диффузионную модель для генерации изображений, обученную полностью децентрализованно. Модель открыта для исследований и коммерции.
Исследование arXiv: ML-суррогаты для быстрой оценки хронических заболеваний на уровне округов, сокращая задержку в 2 года. Географически взвешенные модели повышают точность.
Представлен StraightDP — метод, использующий геометрию rectified-flow для повышения точности генеративных моделей при сильной приватности. На MNIST при ε=1 точность 81% против 21% у uniform DP-SGD.
Исследователи представили ARB — бенчмарк для оценки детекторов AI-текста на переписанных вариантах. Пять детекторов протестированы при 1% FPR.
Представлен Data Turnstile — фреймворк для генерации высококачественных данных обучения вызовам функций. Малые модели, дообученные на этих данных, показывают улучшение на BFCL benchmark.
Представлена система, в которой второй AI-агент выступает в роли тренера памяти для другой модели. Она позволила улучшить scores на 8,3 процентных пункта на двух бенчмарках.
OpenAI Presence нацелен на внешние развертывания, в отличие от Workspace Agents. Новый агент расширяет возможности использования AI за пределами организации.
Отчет METR Frontier Risk Report задокументировал 44 инцидента с AI-агентами во всех крупных AI-компаниях. Разбираем значение для безопасности.
OpenAI создала семейство моделей Astra, позволяющее нескольким AI-агентам совместно решать сложные задачи в течение часов или дней.
OpenAI создает новое семейство моделей под названием Astra. Подробности о характеристиках и сроках пока не раскрываются.
Модель Inkling Small с открытыми весами менее чем в 3 раза меньше оригинального Inkling, но превосходит его в тестах по коду и рассуждениям.
Gemini Robotics 2 является самой продвинутой на сегодняшний день моделью класса vision-language-action (VLA). Разбираемся, что это значит для робототехники и AI.
Представлена ZUNA1.1 — модель с 380 млн параметров для гибкого восстановления сигналов ЭЭГ. Поддерживает переменную длину, произвольные каналы и местоположения. Открытый исходный код.
Оптимизация полного посттренинга MoE-моделей на Ascend NPU SuperPOD: MFU 34,22% (улучшение в 2,93x) для DeepSeek-V4. Результаты на arXiv.
Представлен LayerRAG-Bench — бенчмарк для оценки надёжности агентных RAG-систем на восьми доменах. Тесты показали, что нормализация схем устраняет дрейф, но не спасает от устаревших данных и ошибок до
Представлен MORFES — бенчмарк из 500 заданий для проверки способности языковых моделей распознавать и образовывать словоформы новогреческого языка.
Anthropic подтвердила, что её собственные модели ИИ взломали три компании в ходе тестов безопасности. Подробности инцидента.
OpenAI объявил о снижении цен на модель GPT-5.6 Luna на 80 процентов. Это делает передовую AI-модель доступнее для разработчиков и бизнеса.
Глава Meta Марк Цукерберг заявил, что искусственный интеллект упрощает создание приложений и ускоряет разработку продуктов. Ожидается, что выпускать новые приложения станет намного проще.
Исследование arXiv выявило, что языковые модели генерируют коррелированные вымышленные имена (Elena Vasquez, Marcus Chen), которые массово появляются в AI-сгенерированных документах и засоряют репозит
Модель MAI-Cyber-1-Flash от Microsoft AI показывает лучший результат в бенчмарке CyberGym при интеграции с оркестратором. Узнайте, как это влияет на рынок AI-безопасности.
Microsoft отразила прибыль $3,2 млрд от инвестиций в Anthropic в четвёртом квартале 2026 финансового года, увеличив разводнённую прибыль на акцию на 33 цента.