Китайская компания Moonshot AI открыла веса модели Kimi K3 — теперь запустить её на своём оборудовании может кто угодно
По замерам Moonshot, Kimi K3 почти не уступает GPT-5.6 Sol и Claude Fable, но обходится в 2–3 раза дешевле в работе
Стоимость обработки запросов стартует от $0,30 за миллион токенов при кешировании — до 10 раз выгоднее конкурентов
Модель работает в смешанной точности MXFP4 и MXFP8 и активирует лишь 104 миллиарда параметров из 2,8 триллиона
Джинн выбрался из бутылки. Вслед за блогом и документацией к программному интерфейсу свежей модели Kimi K3 китайская компания Moonshot AI сдержала обещание и 27 июля 2026 года бесплатно выложила её веса на Hugging Face. Это значит, что практически любой владелец современной стойки ИИ-ускорителей может запустить модель у себя и брать плату за её использование — почти без ограничений. По размеру это крупнейшая открытая модель из когда-либо опубликованных: 2,8 триллиона параметров.
Источник изображения — tomshardware.com
Прямой вызов OpenAI и Anthropic
Это серьёзный вызов крупным игрокам рынка ИИ — в первую очередь Anthropic и OpenAI. Их актуальные модели, Claude Fable и GPT-5.6 Sol, теперь сталкиваются с конкурентом, который по замерам Moonshot уверенно обходит прошлые поколения Claude и GPT и лишь немного отстаёт от Fable и Sol. При этом запуск модели обходится примерно в 2–3 раза дешевле, а при попадании запроса в кеш — до 10 раз.
Независимые площадки во многом подтверждают эти оценки, хотя и осторожнее в формулировках. В индексе интеллекта Artificial Analysis Kimi K3 набирает 57 баллов против 60 у Claude Fable 5 и занимает третье место, в рейтинге Vals AI — второе, а в отдельном испытании по разработке веб-интерфейсов Frontend Code Arena выходит на первое место с результатом 1679 очков Elo. Тем не менее по совокупности задач модель находится у самой границы возможностей, но не выше неё — и сама Moonshot признаёт, что сильнейшим закрытым моделям K3 всё ещё уступает.
При этом до публикации весов почти все цифры оставались заявлениями самой Moonshot. Технический отчёт компании подтверждает опубликованные ранее замеры и раскрывает, какое именно ПО применялось при тестировании, — но часть задач прогонялась в нестандартных условиях и на разном сопутствующем инструментарии, поэтому сравнивать результаты стоит с оглядкой на сноски.
Сколько стоит запуск
При сравнении затрат Moonshot опирается на собственные внутренние замеры и публичные цены конкурентов — и разрыв получается заметным. Входные токены Kimi K3 стоят $3 за миллион. Для сравнения: у Fable — $10, у Sol — $5 за миллион. Это цена без кеширования, и она уже выглядит привлекательно. Но структура кеша Kimi K3 при задачах по программированию, по данным компании, даёт около 90% попаданий — и тогда $3 превращаются в $0,30 за миллион токенов.
Важная оговорка: кеширование удешевляет именно входные токены. С выходными всё интереснее — они стоят $15 за миллион, и кеш здесь не спасает. Более того, Kimi K3 всегда рассуждает на максимальном усилии, другого режима на старте попросту нет. На длинных цепочках рассуждений, повторных вызовах инструментов и многоходовых диалогах счёт за вывод может быстро вырасти, так что реальная экономия сильно зависит от того, как именно вы гоняете модель.
За счёт чего такая эффективность
Одна из причин высокой эффективности Kimi K3 — смешанные типы данных: MXFP4 для весов и MXFP8 для входных активаций. Оба формата имеют невысокую точность, зато позволяют запускать модель на заметно меньшем объёме видеопамяти. К этому добавляется разреженная архитектура: из 2,8 триллиона параметров единовременно работают лишь 104,2 миллиарда.
Вместо классического, постоянно растущего хранилища «ключ-значение» (KV) модель использует обработчик состояния фиксированного размера — Kimi Delta Attention. Теоретически это экономит и видеопамять, и время выполнения: по оценке Moonshot, длинный контекст обрабатывается до шести раз дешевле, чем при прежних подходах. Смесь экспертов у K3 тоже необычайно разреженная — из 896 экспертов одновременно включаются только 16. В сумме компания оптимизировала каждый слой обработки, чтобы убрать лишние накладные расходы и снизить стоимость вычислений.
Что нужно, чтобы запустить у себя
Здесь важна отрезвляющая оговорка: «бесплатно скачать» и «реально запустить» — совсем не одно и то же. Полная модель в формате MXFP4 занимает около 1,4 ТБ — против примерно 5,6 ТБ, которые потребовались бы для весов в FP16. Но даже так для самостоятельного запуска рекомендуется не меньше 64 ускорителей уровня Nvidia H100 или B200, то есть порядка восьми серверов. Иными словами, реальные потребители этих весов — поставщики вычислений, крупные компании и хорошо профинансированные молодые команды, а не энтузиасты с одной видеокартой.
Любопытно, что в техническом отчёте для части тестов по программированию Moonshot упоминает лишь Nvidia H20 — по современным меркам довольно слабый процессор. У него, в отличие от подпадающих под экспортные ограничения микросхем Blackwell серии B, нет нативной поддержки чисел с плавающей запятой формата MX.
Это можно трактовать двояко. С одной стороны, оптимизации Kimi K3 явно делают её удобной для запуска на менее мощном железе. С другой — на Blackwell или иных микросхемах с нативной поддержкой MXFP модель, вероятно, оказалась бы ещё выгоднее, чем показывают опубликованные замеры. Точные цифры покажут только независимые проверки.
Открытые веса — не открытый исходный код
Тот факт, что у Kimi K3 открытые веса, усиливает ощущение, что «свободное» ПО почти не уступает проприетарным аналогам, но обходится куда дешевле в эксплуатации. Практически любой владелец приличных ИИ-ускорителей теперь может стать прямым конкурентом OpenAI и Anthropic — и это плохая новость для обеих компаний.
Но открытые веса — это не открытый исходный код. Модель распространяется по видоизменённой лицензии MIT: она разрешает коммерческое использование, однако процесс обучения и обучающие данные Moonshot оставила при себе — это её секретный рецепт. Отдельная оговорка в лицензии требует согласовывать использование с компанией, если продукт превышает 100 миллионов активных пользователей в месяц или $20 миллионов годовой выручки.
Геополитический фон
Вокруг выхода модели хватает и политики. В феврале Anthropic обвинила Moonshot в том, что та обучала свои модели на 3,4 миллиона диалогов с Claude через дистилляцию, — а K3 теперь отстаёт от упомянутых в той жалобе моделей всего на несколько очков. В июле директор управления по научно-технической политике Белого дома Майкл Кратсиос повторил претензии, добавив, что модель якобы обучали на запрещённых к поставкам ускорителях Nvidia. Moonshot эти обвинения публично не комментировала.
Занятно, что ограничения работают в обе стороны. По данным Financial Times, министерство коммерции КНР обсуждает с местными компаниями более жёсткий контроль за вывозом самих ИИ-моделей, обучающих данных и смежных технологий. Обе стороны, по сути, пришли к одному выводу: веса моделей — это стратегический актив, а не просто файл для скачивания.
Что это значит для рынка
Открытые модели из Китая давно стали несущей инфраструктурой даже внутри западных молодых компаний: Cursor задействовал модели Kimi при создании своего кодового помощника, DoorDash отдаёт часть рутинных задач Kimi K2.6, а Thinking Machines использовала K2.5 для подготовки данных под собственную модель. Kimi K3 переносит эту логику на уровень выше — к задачам, где раньше безраздельно правили закрытые флагманы.
Напоследок — практическая деталь для тех, кто соберётся внедрять модель: K3 обучали с сохранением всей истории рассуждений. Если приложение выбрасывает служебное состояние, оставляет только финальный текст или переключает модель посреди диалога, качество может «поплыть». Так что аккуратная работа с состоянием диалога здесь не мелочь, а обязательное условие стабильной работы.















