Представлен tau-Rec — бенчмарк для агентных рекомендательных систем с верифицируемыми наградами вместо LLM-судей. Тесты пяти моделей показали резкое падение надёжности.
Исследование arXiv:2607.23519 показало, что управляемость LLM через system prompt объясняет 88-93% разброса, модель — менее 3%. Протестированы GPT-5, Claude, Grok, Gemini, DeepSeek, Kimi, Qwen.
Новое исследование на arXiv показало, что контекстные промпты объясняют до 93% вариативности политических ответов LLM, а модель — менее 3%. Протестированы GPT-5, Claude, Grok, Gemini, DeepSeek, Kimi,
Исследование arXiv: добавление двух слов «right?» к вопросу меняет склонность языковых моделей к поддакиванию. Эффект от -32% до +32%, смена знака в новых поколениях.