Консалтинговая компания The Call Center Doctors, которая строит и обслуживает колл-центры для других бизнесов, 27 сентября арендовала сервер с четырьмя ускорителями Nvidia H200, чтобы развернуть на нём DeepSeek V4.1 Flash и подставить эту модель своим агентам Claude Code вместо Opus 5.5. Эксперимент адресован всем, кто слышал, будто DeepSeek «в 80 раз дешевле» Claude. На реальном рабочем наборе задач по программированию весь сервер выдавал в пике около 213 токенов в секунду при стоимости аренды $440,88 в сутки по тарифу on-demand — против $184–223 в сутки за ту же работу через API самого DeepSeek. В итоге компания вернулась к Opus 5.5, который обошёлся дешевле, чем посуточная аренда железа.
Источник изображения — tomshardware.com
Прайс DeepSeek API выглядит так: $0,15 за 1 млн новых входных токенов вне часов пик, $0,003 за кэшированные входные и $0,60 за 1 млн выходных токенов. В пиковые часы расценки удваиваются. Для сравнения, Anthropic оценивает Claude Opus 5.5 в $4 за вход и $20 за выход на 1 млн токенов, а чтение из кэша — в $0,20. При этом компания пользовалась Claude не через API, а по подписке.
Производительности сервера хватало лишь на один вид нагрузки за раз — да и то только в тестовых прогонах под полной нагрузкой длиной в минуту. Беда в том, что кодинг-агенты работают, раз за разом пересылая модели всю историю диалога: по логам компании 96% того, что агенты отправляли модели, оказывалось уже знакомым, «устаревшим» текстом. На каждый новый записанный токен приходится около 1000 перечитанных старых. Перечитывание дешёвое, но его так много, что сервер был постоянно занят именно им, а на генерацию нового кода времени почти не оставалось.
Чтобы модель заработала стабильно, понадобилось пять попыток по 10–15 минут загрузки каждая. Арендованный сервер тарифицируется независимо от того, занят он или простаивает, что само по себе невыгодно. По подсчётам издания, полный месяц по ставке on-demand $18,37 в час выливается примерно в $13 200 — это более чем вдвое дороже сентябрьского счёта компании за Claude. К тому же один сервер способен прожевать около 20 млрд токенов в сутки, большая часть которых уходит на перечитывание, тогда как в самый нагруженный день агентам требовался 51 млрд.
Статистика одного сервера за период с 1 по 27 сентября: 2,03 млн обращений к модели, 388,5 млрд прочитанных токенов (из них 374,2 млрд из кэша) и 393 млн записанных, а также 5610 принятых изменений в коде. Сентябрьские подписки на Claude Code обошлись примерно в $5500. Те же 27 дней на API DeepSeek стоили бы от $3500 до $7000 в зависимости от пиковых тарифов, со средней оценкой около $4200, если распределить нагрузку равномерно по неделе.
Если же пересчитать тот же объём токенов по прайс-листу Claude Opus 5.5, выходит около $140 000 — более чем в 25 раз дороже подписки. Именно в этой разнице между подпиской и поштучной оплатой и «спрятались» те самые 80 раз. Стоимость одного принятого изменения кода компания оценила так: около $1 на Claude и около $0,63 на API DeepSeek — при условии, что модель сделает ту же работу тем же числом токенов. Более осторожная вилка $1,15–4,90 для DeepSeek учитывает, что модели понадобится больше токенов, она будет реже справляться с задачей и потребует проверки результатов силами Claude.
Написать настоящий код DeepSeek в тесте так и не дали. Проверяющие раз за разом находили способы, которыми код агента мог бы вырваться из песочницы, — например, через файл настроек в общей временной папке, позволявший запустить код агента с правами администратора. Поэтому агентам, пишущим код, пришлось остаться в офлайне, а DeepSeek работал лишь как 48–64 агента-ревьюера в режиме «только чтение»: они просмотрели 2377 папок и завели 32 отчёта об ошибках. Сервер, взятый по спотовой ставке $9,19 в час, провайдер забрал обратно через считаные минуты после окончания последнего теста.
Опираясь на поколение V4, где версия Pro обходила Flash, можно ожидать более высоких результатов от DeepSeek V4.1-Pro, у которой пока нет точной даты выхода. В будущем это способно изменить расклад, но на сегодня есть куда более разумные способы потратить деньги на токены, чем арендовать GPU ради запуска открытой модели.














