Рост стоимости использования ИИ связан не с улучшением моделей, а с эффектом «усиления токенов»
Один запрос к ИИ-агенту для многоэтапной задачи способен израсходовать миллионы токенов, превращая $1 в $10 и более за один отчёт
При ежечасном запуске такой отчёт обходится компании в $28 800 в месяц — дороже, чем труд штатного сотрудника
Крупные компании, включая Uber и Microsoft, вынуждены ограничивать расходы на ИИ из-за запретительно высоких затрат на токены
Об экономике сферы ИИ написано уже немало, но большинство дискуссий крутится вокруг макроуровня: доли рынка, инвестиций в дата-центры, счетов за электроэнергию. От технологий обычно ждут, что со временем они дешевеют по мере совершенствования. С ИИ всё наоборот: стоимость его использования на самом деле растёт, даже когда модели становятся умнее. Причина кроется не в самих нейросетях, а в том, как именно их сегодня используют.
Источник изображения — tomshardware.com
Со всеми достижениями в моделях за последние пару лет чат-бот, отвечающий на вопросы простой и средней сложности, уже давно никого не удивляет — с этим справляется практически любая современная система. Настоящий потенциал скрывается в агентных сценариях: ботов запускают на многоэтапные повторяющиеся задачи, на которые у человека ушли бы дни, а то и недели. Дайте боту доступ к системе выставления счетов, нескольким таблицам Excel и вашей CRM, задайте вопрос вроде «какие клиенты приносят наибольшую прибыль по категориям и какая у них динамика» — и для ИИ это окажется рутинной задачей.
Пользователю кажется, что всё просто: задал вопрос — через пару минут получил точный ответ. Но за кулисами происходит куда более масштабная обработка, чем можно предположить. Вычислительное время ИИ измеряется токенами: короткий вопрос-ответ может занять от 200 до 2000 токенов, а запрос, требующий от модели поиска в интернете, — от 1000 до 4000. А вот агентная задача способна незаметно израсходовать миллионы токенов на, казалось бы, безобидный запрос. Этот эффект получил название «усиление токенов» (token amplification).
Дело в том, что у модели нет памяти или собственного «понимания контекста» в человеческом смысле — при каждом новом сообщении в диалоге она заново загружает и обрабатывает всю переписку целиком: все прежние реплики, ответы бота и прикреплённые файлы. Из-за этого каждый следующий вопрос в длинном разговоре обходится дороже предыдущего. Первое сообщение может «весить» всего 500 токенов, второе — уже 600, поскольку системе приходится заново «переваривать» всю историю переписки. К тому же с ростом диалога заметно падает и скорость ответа.
Возьмём пример с отчётом, о котором шла речь выше. Такая задача выполняется поэтапно: скажем, три шага на анализ таблиц Excel, четыре — на работу с CRM, полдюжины поисковых запросов для уточнения информации о продуктах и ещё около десятка промежуточных шагов на обработку и расчёты. Каждый такой шаг добавляет потенциально несколько тысяч токенов — и в сумме набегают миллионы токенов, потраченные на выполнение всей задачи целиком.
Расходы могут выйти из-под контроля очень быстро — и это ещё в лучшем сценарии, когда все данные легко интерпретируются, модели не приходится делать повторные попытки, а используется не самая мощная (и не самая дорогая) модель.
В деньгах это выглядит так: один относительно простой запрос может обойтись в 280 000 токенов и стоить около $1 по текущим расценкам. Само по себе немного — но это была всего одна задача. Если запускать её каждые 15 минут, например для обновления дашборда, сумма быстро превращается в $96 в день, или $2 880 в месяц. А ведь это был простой пример: сложный многоэтапный отчёт способен «съесть» миллионы токенов, превратив $1 в $10, а итоговую сумму — в $28 800 в месяц. И это за один-единственный отчёт, для ограниченного круга пользователей, в рамках одного отдела компании.
Именно поэтому Anthropic, Microsoft, OpenAI и почти все остальные крупные игроки ещё в апреле перевели свои основные тарифы на модель оплаты по факту использования и заметно урезали лимиты токенов в фиксированных тарифных планах. Для многих разработчиков по всему миру это обернулось настоящим «ценовым шоком» — они узнали, во сколько на самом деле обходится их привычный стиль работы с ИИ-ассистентами, и были неприятно удивлены.
В крупной компании, где задействовано множество ИИ-агентов, такие расходы способны стать непомерными — и нередко превышают стоимость труда обычных сотрудников. Такие компании, как Uber, Microsoft, Amazon и Walmart, уже отреагировали сокращением бюджетов на ИИ. Контроль над расходом токенов внезапно стал головной болью и для финансистов, и для инженеров: сдерживание затрат вышло на первый план. По меткому наблюдению издания VentureBeat, для компаний, активно применяющих агентов, изменение промпта способно напрямую повлиять на маржинальность бизнеса, а неудачно выстроенный цикл работы агента фактически равносилен утечке средств с корпоративной карты.
Большинство ИИ-компаний по-прежнему предлагают тарифы с фиксированной ежемесячной оплатой, но почти все они теперь идут с жёсткими лимитами на токены. И, как это обычно бывает с любыми услугами по фиксированной цене, самые умелые и продвинутые пользователи ботов неизбежно окажутся именно теми, кто расходует больше всего токенов — не только из-за интенсивности использования как таковой, но и потому, что решаемые ими задачи как раз сильнее всего страдают от эффекта усиления токенов.
Это ломает привычную финансовую модель, при которой обычные пользователи с лихвой компенсируют затраты на небольшую долю «тяжёлых» клиентов: активное использование продвинутыми пользователями способно серьёзно подорвать месячную прибыль сервиса или свести её на нет полностью.
ИИ-компании не сидят сложа руки — снижение стоимости токена, судя по всему, сейчас один из приоритетов для большинства инженерных команд отрасли. Кэширование промптов, маршрутизация между моделями, пакетная обработка запросов, семантическое кэширование и более грамотное управление контекстным окном — вот лишь часть технических мер, каждая из которых способна ощутимо, на десятки процентов, сократить расход токенов.
И всё же расходы продолжают расти — по простой причине: чем умнее становятся модели и чем изощрённее люди учатся их применять, тем сложнее и продолжительнее становятся агентные задачи, добавляя новые порядки к общему числу потраченных токенов.
Пока эта гонка выглядит проигрышной, несмотря на такие прорывы, как китайские модели Deepseek V4 Pro и V4 Flash, которые заметно дешевле сопоставимых западных аналогов — по некоторым оценкам, до 17 раз дешевле для первой модели и до 25 раз для второй. Из крупных западных игроков только Anthropic прогнозирует первый прибыльный квартал в своей истории — хотя, как и все остальные, компания пока остаётся глубоко убыточной по совокупным расходам, исчисляемым миллиардами долларов.












