Новый бенчмарк ARB: как детекторы AI-текста проваливаются на переписанных текстах
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Исследователи представили набор данных ARB, построенный из 1800 человеческих текстов (по 600 из XSum, WritingPrompts и OpenWebText). Для каждого текста с помощью четырёх открытых генераторов (Llama-3.2-3B, Qwen2.5-7B, Mistral-7B, Gemma-2-9B) созданы четыре варианта:
- HUMAN — оригинальный человеческий текст.
- Free-LLM — прямая генерация LLM без человеческого оригинала.
- H2L — человеческий текст, переписанный LLM.
- LLM2L — LLM-сгенерированный текст, переписанный той же моделью.
На этом наборе протестированы пять детекторов: FastDetectGPT, Binoculars-falcon-7b, RADAR, BERT-Dense, RoBERTa-Dense, при строгом пороге ложноположительных срабатываний в 1%.
Что изменилось по сравнению с предыдущей версией
Предыдущие бенчмарки не учитывали сценарий, когда человеческий текст переписан LLM. ARB специально создан для оценки детекторов в таких условиях — это первый бенчмарк с четырьмя вариантами одного исходного текста.
Цены и доступность
Бенчмарк опубликован в виде препринта на arXiv (идентификатор arXiv:2607.29539). Данные и код не указаны в публикации, но, вероятно, будут доступны для исследователей.
Почему это важно
Стандартные детекторы AI-текста могут быть эффективны против прямых генераций, но переписанные тексты (например, студенты, использующие ChatGPT для перефразирования) способны обходить защиту. ARB делает оценку детекторов более реалистичной и показывает, что даже лучшие модели не справляются с переписанными вариантами при низком уровне ложных срабатываний.
Для пользователей AI-Sphere
Если вы используете детекторы AI-текста (например, в образовании или контент-верификации), этот бенчмарк напоминает: доверять результатам на прямых генерациях рискованно. Переписанные тексты остаются серьёзной проблемой, и для практического применения нужны более устойчивые методы.