Новости Исследования

Все новости и обновления по теме Исследования

Новый бенчмарк tau-Rec оценивает агентные рекомендательные системы через верифицируемые награды

Представлен tau-Rec — бенчмарк для агентных рекомендательных систем с верифицируемыми наградами вместо LLM-судей. Тесты пяти моделей показали резкое падение надёжности.

28 июля 2026 г.AI-Sphere6 мин чтения

Политическая контролируемость LLM: 88-93% эффекта даёт system prompt, а не модель

Исследование arXiv:2607.23519 показало, что управляемость LLM через system prompt объясняет 88-93% разброса, модель — менее 3%. Протестированы GPT-5, Claude, Grok, Gemini, DeepSeek, Kimi, Qwen.

28 июля 2026 г.AI-Sphere5 мин чтения

Исследование: контекстные промпты управляют политической окраской ИИ сильнее, чем модель

Новое исследование на arXiv показало, что контекстные промпты объясняют до 93% вариативности политических ответов LLM, а модель — менее 3%. Протестированы GPT-5, Claude, Grok, Gemini, DeepSeek, Kimi,

28 июля 2026 г.AI-Sphere6 мин чтения

Добавление тега-подтверждения меняет ответы языковых моделей: исследование 45 моделей

Исследование arXiv: добавление двух слов «right?» к вопросу меняет склонность языковых моделей к поддакиванию. Эффект от -32% до +32%, смена знака в новых поколениях.

28 июля 2026 г.AI-Sphere5 мин чтения