Как ложные и неоднозначные вопросы ломают работу vision-language моделей
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Исследователи построили эксперимент, в котором вопросы к изображениям модифицировались так, чтобы нарушать принципы Грайса. Вопросы дополнялись необязательными деталями, двусмысленными формулировками или откровенно ложными утверждениями, после чего подавались сразу нескольким популярным vision-language моделям.
Результаты показали, что в присутствии таких нарушений все проверенные модели демонстрируют снижение качества ответов. При этом авторы не просто зафиксировали падение метрик, но и сравнили поведение моделей с человеческим. Люди, как выяснилось, гораздо лучше игнорируют постороннюю информацию и восстанавливают истинный смысл вопроса.
Что такое принципы Грайса и почему они важны для VQA
Принципы Грайса — это набор правил эффективной коммуникации, сформулированный философом Полом Грайсом. Он выделил четыре максимы: количества (информации должно быть ровно столько, сколько нужно), качества (говори правду), отношения (говори по существу) и способа (избегай двусмысленности).
В контексте VQA модель должна понять не только содержание изображения, но и релевантность каждого слова в вопросе. Если вопрос содержит лишнее прилагательное, которое ни на что не влияет, модель всё равно может попытаться использовать его при формировании ответа. Исследование показало, что такие, казалось бы, незначительные помехи способны существенно ухудшить результат.
Человеческие и ИИ-нарушения: разница в восприятии
Особый интерес представляет часть работы, где авторы сравнили два типа нарушений: созданные людьми и сгенерированные самими моделями. Оказалось, что люди тратят меньше когнитивных усилий (измеряемых временем на задачу) при разрешении нарушений, созданных ИИ, однако сами vision-language модели в таких случаях отвечают хуже.
Это может означать, что ИИ-нарушения устроены иначе, чем человеческие — возможно, они более тонкие или нелогичные с точки зрения прагматики. Модели, обученные в основном на естественных человеческих текстах, оказались менее устойчивы к искусственно созданным аномалиям.
Почему это важно
Результаты исследования указывают на фундаментальное ограничение современных vision-language систем: они плохо понимают контекст и не умеют отделять существенное от несущественного. В реальных сценариях пользователи редко задают идеально сформулированные вопросы — они могут использовать сленг, добавлять лишние детали, формулировать неточности. Пока модели чувствительны к таким помехам, их применение в диалоговых системах, автоматическом анализе изображений или ассистентах остаётся ограниченным.
Редакционный вывод: это исследование — ещё один аргумент в пользу того, что текущие архитектуры полагаются на поверхностные языковые паттерны, а не на глубокое понимание смысла. Дальнейшее развитие, вероятно, потребует обучать модели прагматическому анализу или комбинировать их с дополнительными механизмами фильтрации информации.
Что это даёт пользователю
Практический вывод для разработчиков и пользователей: даже продвинутые мультимодальные модели могут ошибаться на простых вопросах, если те содержат вводящие в заблуждение фрагменты. При проектировании VQA-приложений стоит предусматривать предобработку вопросов или использовать стратегии few-shot промптов, которые помогают модели игнорировать нерелевантные детали.
Для конечных пользователей это означает, что формулировать запросы к моделям стоит максимально точно, избегая лишних слов. Возможно, со временем модели будут лучше справляться с такой вариативностью, но пока эта задача остаётся открытой.
Что пока неизвестно
В препринте не раскрыты детали экспериментальной методологии — какие именно типы нарушений использовались, на каком наборе изображений проводилось тестирование, и были ли модели дообучены. Также не ясно, насколько результаты устойчивы для других vision-language моделей, не попавших в выборку (например, открытых моделей вроде LLaVA в других конфигурациях). Авторы не предоставили код или датасет для воспроизведения. Исследование опубликовано на arXiv и пока не прошло рецензирование.
Источники
- Препринт arXiv: arXiv:2610.02878