OpenAI привлекает сотни подрядчиков для ручного чтения диалогов ChatGPT
OpenAI привлекает сотни внештатных сотрудников для чтения реальных диалогов пользователей ChatGPT. Это следует из расследования издания 404 Media, на которое ссылается The Decoder. Практика ручного анализа переписок не нова для индустрии, но в случае с самым популярным чат-ботом в мире она поднимает вопросы о конфиденциальности и прозрачности.
Что произошло
По данным расследования, OpenAI на постоянной основе сотрудничает с сотнями контрактных работников, в чьи обязанности входит чтение переписок пользователей с ChatGPT. Речь идет не о выборочных случаях, а о систематическом процессе, встроенном в цикл разработки модели.
Такая работа обычно связана с разметкой данных: подрядчики оценивают ответы модели, отмечают неудачные формулировки, токсичные или опасные высказывания, а также фиксируют случаи, когда ChatGPT ведет себя некорректно. Собранные разметки затем используются для дообучения нейросети.
Важно подчеркнуть: сам факт наличия подрядчиков OpenAI не опровергает. Однако компания традиционно не раскрывает деталей о масштабах такой работы и о том, какие именно категории диалогов попадают на ручную проверку.
Как устроен процесс ручной разметки
Ручное чтение диалогов — стандартная практика для компаний, разрабатывающих большие языковые модели. Автоматические метрики не всегда способны оценить качество ответа: модель может быть грамматически безупречной, но при этом давать вредный, предвзятый или просто бесполезный совет.
Человек-разметчик видит реальный диалог пользователя и ответ ChatGPT, после чего выносит суждение: помог ли ответ, был ли он безопасным, соответствовал ли ожиданиям. Эти оценки превращаются в обучающие сигналы — так называемую обратную связь от человека (RLHF). Именно этот механизм лежит в основе того, почему ChatGPT стал заметно «вежливее» и полезнее ранних версий.
Подрядчики работают через специализированные платформы, часто удаленно. Их труд оплачивается поштучно или по часам, а доступ к диалогам предоставляется через внутренние интерфейсы, где переписка может быть частично анонимизирована.
Почему это важно
Новость важна по двум причинам. Первая — прозрачность. Пользователи ChatGPT, как правило, не знают, что их переписка может читаться посторонними людьми. Даже если компания заявляет об анонимизации, сам факт привлечения сотен внешних сотрудников создает дополнительные риски утечек — как случайных, так и намеренных.
Вторая причина связана с качеством модели. Ручная разметка — это то, что отличает действительно полезного ассистента от «болтушки». Без участия людей ChatGPT не смог бы научиться отклонять опасные запросы или давать точные ответы в сложных сценариях.
Редакционный вывод: ситуация иллюстрирует фундаментальное противоречие современного ИИ. Чем качественнее и безопаснее модель, тем больше человеческого труда и доступа к приватным данным она требует. Это означает, что в обозримом будущем полностью автоматизированное обучение без участия человека вряд ли станет реальностью.
Что это даёт пользователю
Для рядового пользователя эта новость — повод внимательнее относиться к тому, что он пишет в чат-боте. Если вы используете ChatGPT для рабочих задач и вставляете в диалог конфиденциальные документы, исходный код или личные данные клиентов, стоит учитывать, что эти материалы потенциально могут попасть к разметчикам.
На практике это означает: не стоит доверять ChatGPT информацию, которую вы не хотели бы раскрывать постороннему человеку. Для чувствительных данных лучше использовать локальные модели или корпоративные решения с изолированным контуром обработки.
Одновременно можно рассматривать ручную разметку как косвенную гарантию того, что модель продолжает улучшаться. Каждая ваша жалоба на некорректный ответ, скорее всего, попадает в выборку для дообучения — и в перспективе делает ChatGPT точнее.
Что пока неизвестно
Расследование не раскрывает, какой именно процент всех диалогов проходит ручную проверку, и существуют ли автоматические фильтры, отсеивающие наиболее чувствительные темы до попадания к разметчикам. Также нет данных о том, как долго OpenAI хранит переписки после разметки и могут ли подрядчики сохранять копии диалогов. Неизвестно, применяется ли аналогичная практика к другим продуктам компании, таким как API или корпоративные версии.