Как DeepSeek помог сэкономить 70% на AI-запросах — кейс
date: 2026-07-26
Когда объём AI-запросов переваливает за миллион токенов в месяц, каждый цент на стоимости токена начинает иметь значение. В этом кейсе рассказываем, как компания — один из клиентов AI Sphere — перевела часть нагрузки на DeepSeek и сократила расходы на 70 % без потери качества.
Исходная ситуация
Компания занимается автоматической обработкой обращений клиентов. Каждое обращение проходит через нейросеть: модель классифицирует тему, определяет тональность и формирует черновик ответа. До внедрения DeepSeek все запросы шли через OpenAI GPT-4 Turbo.
Объёмы: 500 000 обращений в месяц. Средняя длина запроса: 800 токенов на вход, 200 токенов на выход. Ежемесячный расход на OpenAI API: $4 200.
Компания поставила задачу: снизить затраты на AI, не снижая точности классификации и качества ответов. Требование к точности — не ниже 92 %.
Поиск альтернативы
Мы рассмотрели три варианта. Первый — Claude 3 Haiku от Anthropic. Цена ниже GPT-4 Turbo, но точность на русском языке оказалась ниже порога. Второй — YandexGPT. Хорошее качество на русском, но API не подходил по формату интеграции. Третий — DeepSeek v4.
DeepSeek в 2026 году предлагал цену в 10 раз ниже GPT-4 Turbo. При этом бенчмарки показывали качество на уровне 90-95 % от эталона. Единственный риск — модель могла хуже справляться с тональностью запросов на русском языке, где требовалось различать тонкие эмоциональные оттенки.
Тестирование
Мы запустили A/B-тест на выборке из 20 000 обращений. GPT-4 Turbo обрабатывал контрольную группу, DeepSeek v4 — тестовую. Метрики:
| Параметр | GPT-4 Turbo | DeepSeek v4 |
|---|---|---|
| Точность классификации | 96,1 % | 95,3 % |
| Корректность тональности | 93,8 % | 92,9 % |
| Доля ответов, требующих доработки | 4,2 % | 5,1 % |
| Среднее время ответа | 1,8 сек | 1,4 сек |
DeepSeek нейросеть незначительно уступила GPT-4 Turbo по всем метрикам, но разница оказалась в пределах 1–2 процентных пунктов. При этом DeepSeek был быстрее на 22 %, что критически важно для онлайн-обработки.
Результаты внедрения
После тестирования компания перевела на DeepSeek 80 % всех запросов. GPT-4 Turbo остался только для самых сложных случаев — юридических обращений и жалоб с высокой эмоциональной окраской.
Итоговые цифры за месяц:
- Расходы на AI снизились с $4 200 до $1 260 (включая резерв GPT-4 Turbo на 20 % запросов).
- Экономия: 70 %, или $2 940 в месяц.
- Качество обработки: точность упала на 0,8 % (с 96,1 % до 95,3 %), что было признано приемлемым.
- Скорость обработки: выросла на 20 % за счёт меньшей latency DeepSeek.
Годовая экономия составила $35 280.
Выводы
Замена ChatGPT на DeepSeek оказалась оправданной для задач, где не требуется абсолютный максимум качества. Ключевыми факторами успеха стали:
- Предварительное A/B-тестирование на репрезентативной выборке.
- Гибридная схема: дешёвая нейросеть для 80 % запросов и дорогая — для критичных.
- Использование DeepSeek чат-интерфейса для быстрой валидации качества перед интеграцией.
Этот подход подходит большинству компаний, которые работают с большими объёмами однотипных запросов. Подробнее о запуске AI Sphere и нашем опыте агрегации моделей — в соответствующем кейсе.