Исследование arXiv:2608.05353v2 показало, что принудительное сохранение промежуточных доказательств снижает согласие LLM-судей с человеческими оценками на 4–6 процентных пунктов.
Новое исследование показывает, что способность LLM к контекстной правдивости наследуется внутри модельных семейств. Предложен метод TruthProbe для усиления правдивых голов.
Исследование arXiv:2608.10008v1 показывает, что LLM-рекомендатели (Mistral Large, Llama-3.3-70B, GPT-OSS-120B, Claude Sonnet 4.6) систематически недооценивают уверенность, даже при нулевых галлюцинаци
Исследователи представили TRIBE — метод, предсказывающий эффективность команды по паттернам общения уже на 10% выполнения задачи. Подход не требует знаний о задаче и позволяет своевременно вмешиваться
OpenAI ввела Premium Seats для ChatGPT Team по цене $125 за пользователя в месяц. Новая опция дороже стандартной и предназначена для расширенных возможностей.
Исследователи представили Tied Trit-Planes — метод квантования для MoE-моделей, достигающий 4.0625 бит/вес. Применён к DeepSeek-V4-Flash-0731, обеспечивая однородное девятиуровневое квантование.
Anthropic расширяет требование маркировки на все продукты Claude по всему миру. Нововведение действует для всех регионов, включая страны за пределами ЕС.
Аудит четырёх открытых линий LLM показал, что показатели доверия между чекпоинтами одной линейки могут существенно отличаться, что ставит под сомнение использование единого значения для всей линейки.
OpenAI представила новую модель GPT-5.6-Cyber, доступную только на уровне Red программы Daybreak. Модель построена на базе GPT-5.6 и ориентирована на специализированные сценарии.
Meta выпустила Muse Glimmer — 30-миллиардную модель с открытой лицензией Apache 2.0, предназначенную для работы локальных AI-агентов. Модель доступна на Hugging Face.
Исследователи представили Deep Generalised Mixed Models — нейросеть для анализа иерархических данных, решающую проблему пропусков в лонгитюдных исследованиях.
Представлена Kimi K2.5 — открытая мультимодальная модель с совместным обучением текста и зрения. Включает фреймворк Agent Swarm, ускоряющий выполнение задач до 4.5 раз.
Количество судебных исков выросло на 39% за год, закончившийся в марте 2026 года. Анализ влияния на рынок AI и рекомендации для пользователей AI-Sphere.
OpenAI заявила о потенциально критическом уровне риска кибербезопасности в новой модели Astra. Внутренние тесты показали значительные улучшения в агентном кодировании.
Исследование arXiv оценило шесть open-weight LLM на CoqStoq: Gemma 4 верифицировала 12 из 100 теорем, Llama 3.3 — 8, остальные — менее 1. Результаты показывают ограничения LLM в формальной верификации