ИИ-агенты не чувствуют времени: тесты Codex показали ошибку в 6–10 раз
Искусственный интеллект умеет писать код, отвечать на вопросы и даже шутить, но совершенно не ориентируется во времени. Эксперименты с моделью Codex от OpenAI показали: при оценке длительности задач агенты ошибаются в 6–10 раз. Такая погрешность делает их непригодными для самостоятельного планирования без контроля человека.
Что произошло
В ходе тестов ИИ-агент на базе Codex должен был предсказать, сколько времени займёт выполнение типовых программных задач. Результат оказался далёк от реальности: модель ошиблась в 6–10 раз. Это означает, что если агент обещает закончить работу за час, на деле может потребоваться 6–10 часов — или наоборот, агент может сильно недооценить время.
Важно, что ошибка не случайна: она систематическая. ИИ не просто ошибается, а демонстрирует полное отсутствие «чувства времени». При этом сам агент не осознаёт своей ошибки — он уверен в своей оценке.
Почему ИИ не умеет оценивать время
Современные языковые модели обучаются на текстах, где временные рамки часто опущены или указаны приблизительно. Например, в документации к коду редко пишут «эта функция выполняется за 2 миллисекунды». Модель видит только логику и синтаксис, но не имеет доступа к реальным метрикам производительности.
Кроме того, ИИ не обладает внутренними часами. Он не может «почувствовать», сколько времени прошло, и не способен сопоставить абстрактную задачу с реальной длительностью. Это фундаментальное ограничение архитектуры.
Почему это важно
Редакционный анализ: проблема оценки времени — один из главных барьеров на пути к полностью автономным ИИ-агентам. Если мы хотим, чтобы ИИ самостоятельно планировал свою работу, распределял ресурсы и укладывался в дедлайны, ему нужно либо встроенное «чувство времени», либо внешние инструменты учёта.
Пока же любое применение ИИ-агентов в проектах с жёсткими сроками требует ручной проверки их временных прогнозов. Компании, внедряющие ИИ в DevOps или управление задачами, должны закладывать поправку на эту погрешность.
Что это даёт пользователю
На практике разработчикам и менеджерам стоит:
- Всегда перепроверять временные оценки, которые выдаёт ИИ-агент, особенно если они кажутся слишком оптимистичными.
- Использовать ИИ для генерации кода или идей, но не доверять ему планирование спринтов и дедлайнов.
- Учитывать, что агент может в 6–10 раз ошибаться как в меньшую, так и в большую сторону — это не просто завышение, а систематическая ошибка.
Если вы применяете Codex или аналогичные модели для автоматизации, закладывайте буфер времени в 10x от оценки ИИ.
Что пока неизвестно
Исследователи не раскрывают, на каких именно задачах проводилось тестирование и какие факторы влияют на величину ошибки. Непонятно, одинаково ли плохо оценивают время разные модели (GPT-4, Claude, Gemini) или это особенность именно Codex. Также нет данных о том, можно ли улучшить оценку времени через специальную дообучение или добавление таймеров в промпт.
Пока это лишь единичное наблюдение, но оно указывает на системную проблему, которую предстоит решить разработчикам ИИ.