Бум искусственного интеллекта строился на одном базовом допущении: чем крупнее модель, тем она мощнее, а самые мощные модели забирают рынок. Сейчас отрасль впервые проверяет, что произойдёт, если это допущение перестанет работать.
Источник изображения — techcrunch.com
Бум ИИ столкнулся с возможным разрушением ключевого допущения, что большие модели всегда лучше
80% вычислительных задач в ближайшие 12-18 месяцев могут перейти на модели, в 100 раз более дешевые, предсказал сооснователь Coinbase
Тестирование юридического ИИ Harvey показало возможность сокращения затрат на вывод в 3 раза без потери качества основного результата
Переход с доминирования самых мощных моделей на экономически оптимальные угрожает доходам OpenAI и Anthropic перед их выходом на IPO
Растущие расходы уже заставили пользователей внимательнее присмотреться к небольшим и дешёвым моделям. Такой осознанный выбор модели с оглядкой на стоимость — явление новое, и последствия его для рынка пока не просчитаны, но они почти наверняка окажутся заметными.
Прогноз Армстронга: 80% нагрузок уедут вниз
Один из самых резких прогнозов сформулировал сооснователь Coinbase Брайан Армстронг: подавляющее большинство задач перейдёт на дешёвые модели, и произойдёт это быстро.
«[С]прос на интеллект почти бесконечен, но 80% рабочих нагрузок будут выполняться на моделях, которые на 99% дешевле в течение 12-18 месяцев», — написал он в соцсети X. Оставшиеся 20% задач, по его оценке, останутся за новейшими моделями — там, где важно выжать максимум качества рассуждений.
Масштаб такого сдвига трудно переоценить. До сих пор компании конкурировали качеством, а это означало выбор по умолчанию в пользу самой передовой доступной модели. Если те же задачи решаются дешёвыми моделями без просадки результата, отрасль ждёт перестройка всей экономики ИИ. И значительная часть сэкономленных денег будет вычтена из выручки крупных лабораторий — удар придётся по OpenAI и Anthropic прямо перед их выходом на первичное размещение акций (IPO).
Тест Harvey: те же результаты втрое дешевле
Первые проверки показывают, что при грамотно собранной системе дешёвые модели действительно заменяют дорогие. В недавнем тесте юридического ИИ-инструмента Harvey удалось снизить затраты на обработку запросов (инференс) в 3 раза без потери качества. Испытание проводилось вместе с платформой Fireworks AI: связка объединила Claude Opus и Fireworks GLM 5.1, причём на Opus система переключалась только для самых тяжёлых операций. Итог — существенно меньшая нагрузка и по времени работы серверов, и по итоговому счёту.
По словам сооснователя Harvey Гейба Перейры, качество в юриспруденции остаётся на первом месте и таковым останется всегда, но само понимание качества меняется: вместо привычки применять самую мощную модель ко всему подряд приходит выбор той модели, которая даёт верный ответ наиболее эффективно.
Механика здесь несложная и уже хорошо знакома разработчикам: запросы сортируются по сложности, простые уходят на компактную модель, а тяжёлые поднимаются на уровень выше. Такой подход обычно называют каскадной маршрутизацией, и он даёт основную экономию именно потому, что доля по-настоящему сложных запросов в реальных продуктах невелика.
Настоящий разрыв — не между открытыми и закрытыми моделями
Эту тенденцию часто описывают как противостояние крупных западных лабораторий с китайскими моделями или моделями с открытыми весами, но такая рамка уводит в сторону. Реальный водораздел проходит не между проприетарными и открытыми решениями, а между большими и маленькими. Сэкономить можно, перейдя с GPT-5.5 на DeepSeek V4 Flash, но переход на GPT-5.4-mini сработает ничуть не хуже.
Между собственной инфраструктурой крупных лабораторий и сторонними площадками, обслуживающими модели с открытыми весами, идёт активная ценовая война. Но для более общего вопроса «малое против большого» не так уж важно, какая именно компактная модель победит в этой схватке.
Подтягиванию малых моделей помогли сразу несколько технических факторов: дистилляция знаний из крупных моделей в компактные, разрежённые архитектуры со смесью экспертов, где на каждый запрос активируется лишь часть параметров, и заметно выросшее качество обучающих выборок. В результате разрыв в практических задачах — извлечение данных, классификация, черновая генерация текста, работа с шаблонами — сузился до величин, которые бизнес перестал замечать.
Почему это противоречит подходу «сначала масштаб»
Всё это может показаться очевидным: разумеется, не стоит тратить больше вычислений, чем требуется. Но такой взгляд прямо противоречит логике «сначала масштабирование», которая доминировала в отрасли последние годы. Вдохновившись горьким уроком — тезисом о том, что в долгую выигрывают методы, опирающиеся на рост вычислительных мощностей, — лаборатории целенаправленно обучали максимально ресурсоёмкие модели, раздвигая границы возможного. Пока цены щедро субсидировались инвесторами, у клиентов просто не было причин брать что-то, кроме флагмана.
Теперь стоимость токенов растёт, субсидии сокращаются, и пользователи впервые ощущают ценовое давление. Способов ответить на него несколько, и переход на модель поменьше — лишь один из них:
- маршрутизация запросов: простые задачи — компактной модели, сложные — флагману;
- сокращение объёма передаваемого контекста и отказ от избыточных подсказок;
- кеширование повторяющихся частей запроса и готовых ответов;
- уменьшение числа обращений к модели за счёт группировки задач;
- дообучение небольшой модели под узкий сценарий вместо универсального флагмана;
- сворачивание наименее перспективных внедрений, которые так и не окупились.
Пока неизвестно, какой из этих путей окажется массовым. Корпоративные заказчики с равным успехом могут экономить, просто реже обращаясь к моделям или урезая контекст, — и тогда прогноз о переезде 80% нагрузок вниз не сбудется в заявленном виде.
Чем это грозит рынку
Если же выяснится, что большинство внедрений одинаково хорошо работает на компактной модели, это способно всерьёз притормозить растущий спрос на вычисления для обработки запросов. А следом встанет куда более неудобный вопрос: чем оправдывать колоссальные затраты на обучение передовых моделей, если основную работу в экономике выполняют их дешёвые младшие версии.
Для разработчиков и компаний из СНГ, где бюджеты на ИИ-инструменты обычно жёстче, а доступ к флагманским моделям осложнён оплатой и ограничениями по регионам, этот разворот скорее хорошая новость: он делает конкурентоспособные решения дешевле и снижает зависимость от одного поставщика. Для крупнейших лабораторий — прямая угроза той модели доходов, на которой строятся их оценки перед выходом на биржу.












