Разработка AI-решений и внедрение искусственного интеллекта | Ай Пай
г. Москва, Малый дровяной 3, с2
page-banner-shape-1
page-banner-shape-2

Kimi K3: зачем Moonshot AI сделала ставку на память, а не на мощность

Kimi K3 от Moonshot AI

Kimi K3: зачем Moonshot AI сделала ставку на память, а не на мощность

Kimi K3 от Moonshot AI: китайская модель весом 2,8 трлн параметров сделала ставку на память, а не на вычисления.

Когда 16 июля Moonshot AI выпустила открытую модель Kimi K3, всё внимание СМИ ушло на одну цифру — 2,8 триллиона параметров. Это крупнейшая открытая (open-weight) модель из когда-либо опубликованных, и она с большим отрывом заходит в весовую категорию «3T», куда прежде не попадала ни одна общедоступная модель. Для сравнения: предыдущий флагман Moonshot весил чуть больше 1 трлн параметров, а Kimi K3 почти втрое превзошла её и ощутимо обошла DeepSeek V4 Pro с его 1,6 трлн параметров.

Но именно параметры — та часть истории, которая меньше всего объясняет, как модель на самом деле работает.

Напрашивается очевидный вывод: Moonshot нашла способ обойти американские экспортные ограничения на чипы. Но собственный технический блог компании описывает более точную картину. K3 не столько обходит эти ограничения, сколько переносит нагрузку — почти на каждом уровне архитектуры вычисления заменяются работой с памятью.

Разница принципиальна, потому что вычислительная мощность и память — это не взаимозаменяемые ресурсы, и китайским лабораториям они доступны далеко не в равной степени.

Почему Kimi K3 — это в первую очередь вопрос памяти

Стоимость запуска большой модели определяют два разных фактора. Первый — сколько вычислений нужно машине, чтобы сгенерировать очередное слово. Второй — какой объём модели должен постоянно находиться «под рукой», в памяти, готовый к использованию. Первое — это вычислительная мощность (compute). Второе — память. Экспортные ограничения на чипы в первую очередь ударили по Китаю именно по линии мощности, и архитектура K3 читается как последовательная попытка экономить именно на ней.

Главный приём — архитектура mixture-of-experts (MoE, «смесь экспертов»). Вместо того чтобы задействовать всю модель для генерации каждого слова, K3 делится на 896 специализированных «экспертных» блоков и на каждом шаге активирует лишь 16 из них — около 1,8% от общего числа. Объём вычислений на одно слово резко падает. А вот расход памяти не меняется вовсе: все 2,8 трлн параметров всё равно должны быть загружены и готовы к работе — на случай, если именно они понадобятся на следующем шаге.

Поэтому Moonshot взялась именно за память. Модель обучили работать с точностью 4 бита на параметр вместо привычных 16 — это метод так называемого quantisation-aware training (обучения с учётом последующего квантования), который компания применяла начиная с этапа тонкой настройки. В Moonshot объясняют такой выбор «широкой совместимостью с оборудованием» — формулировка, которая читается как подстраховка на случай запуска не на чипах Nvidia, а на другом «железе». Экономия получилась внушительной: по независимым оценкам, модель в этом формате занимает около 1,4 ТБ против 5,6 ТБ при полной точности.

Второе архитектурное решение, Kimi Delta Attention, нацелено на другую статью расходов памяти. Пока модель обрабатывает длинный документ, она накапливает «рабочую» память — всё, что уже успела прочитать. При заявленном лимите K3 в миллион токенов (это несколько тысяч страниц) именно этот накопленный объём, а не сама модель, становится главным потребителем памяти.

Moonshot открыто говорит о коммерческой важности этого решения: компания передала код кеширования в open-source проект vLLM и утверждает, что именно эта комбинация технологий позволяет держать конкурентную цену на K3, несмотря на масштаб модели. Для запуска Moonshot рекомендует использовать связку из 64 и более ускорителей, объединённых в единый пул с достаточно быстрым соединением.

Это тот же принцип, что лежит в основе систем CloudMatrix от Huawei, и он указывает на реальный способ обхода ограничений: память можно объединять из большого числа отдельных, ничем не примечательных чипов. А вот вычислительную мощность для обучения моделей таким образом собрать нельзя.

Проходит ли это объединение памяти на китайских чипах — вопрос, на который блог компании ответа не даёт. Тесты на уровне отдельных чипов Moonshot проводила на Nvidia H200 и на неком «GPGPU от альтернативного поставщика», название которого компания не раскрывает. Другие результаты приведены в сравнении с Nvidia L20 — урезанной версией карты, которую разрешено продавать в Китай по экспортным правилам.

Блог не уточняет, где физически расположено оборудование на базе H200, а в январе Палата представителей США приняла законопроект, закрывающий лазейку с удалённой арендой облачных мощностей — именно так китайские компании получали доступ к чипам с ограничениями на экспорт. Это важно, потому что именно по памяти, а не по вычислительной мощности, китайская чиповая индустрия отстаёт сильнее всего.

На торговых переговорах в августе 2025 года Пекин просил снять ограничения именно на память высокой пропускной способности (HBM), а не на литографическое оборудование или доступ к TSMC — красноречивый сигнал о том, что чиновники считают действительно узким местом. По прогнозам, внутреннее производство такой памяти в этом году составит около двух миллионов стеков — этого хватит примерно на 250–300 тысяч чипов уровня Huawei Ascend 910C, тогда как мощности SMIC по производству пластин превышают миллион.

Что реально смогут развернуть у себя компании

Kimi K3 от Moonshot AI

Для бизнеса практический вопрос не в том, лидирует ли K3 в рейтингах. Вопрос в том, можно ли вообще развернуть открытую модель такого масштаба у себя. Азиатские компании выбирают открытые модели по трём причинам — цена, суверенитет данных и поддержка региональных языков, — и банки со страховыми компаниями в Юго-Восточной Азии уже тестируют локально развёрнутые открытые модели именно для того, чтобы данные не покидали их собственную инфраструктуру.

Веса модели станут доступны 27 июля, и любая организация, у которой хватит вычислительных мощностей, сможет скачать K3, изменить и запустить его в собственном контуре. Вопрос — многие ли на это способны. Moonshot рекомендует разворачивать модель на 64 и более ускорителях, объединённых в единый пул, а сами веса, по независимым оценкам, занимают около 1,4 ТБ в поставляемом формате — и это без учёта памяти, необходимой для обработки длинных документов.

Это уровень требований целого дата-центра, а не серверной комнаты. Для большинства компаний практичным решением станет аренда выделенных мощностей, а не владение ими. Это по-прежнему позволяет держать данные внутри страны и в рамках контракта — именно этого требует большинство региональных регуляторов. Но это не даёт независимости от поставщиков инфраструктуры — а ведь именно за этим многие покупатели изначально обращались к открытым моделям.

Программное обеспечение тоже пока не готово. Два ключевых архитектурных нововведения K3 настолько новы, что стандартные open-source инструменты для запуска моделей ещё не поддерживают их в полной мере. Moonshot заявляет, что сейчас работает с партнёрами по инференсу и разработчиками open-source решений, чтобы согласовать технические детали до релиза. Командам, которые планируют локальное развёртывание, стоит различать дату выхода модели и дату, когда её реально можно будет использовать.

Изменилась и цена. K3 стоит 3 доллара за миллион входных токенов (с падением до 0,30 доллара, если модель недавно уже обрабатывала этот текст) и 15 долларов за миллион выходных токенов. Это заметно ниже 50 долларов за вывод у Fable 5, но заметно выше, чем у GLM-5.2 от z.ai (4,40 доллара) и DeepSeek V4 (0,87 доллара). K3 больше не относится к бюджетному сегменту, где находились предыдущие модели компании.

Кроме того, на старте доступен только режим максимальных вычислительных усилий при рассуждении — облегчённые режимы появятся позже. Это значит, что длинные цепочки рассуждений и повторные попытки быстро увеличивают итоговый счёт. Компаниям стоит планировать бюджет исходя из стоимости выполнения конкретной задачи целиком, а не из цены за токен.

Что доказано, а что пока остаётся заявлением

В тесте Arena по разработке фронтенда K3 заняла первое место с результатом 1679 баллов, опередив Fable 5 в слепом тестировании среди разработчиков — об этом сообщает Tom’s Hardware. Этот результат реален. Но это лишь один бенчмарк в одной узкой области.

Сама Moonshot формулирует свои достижения куда сдержаннее, чем заголовки СМИ. Компания прямо признаёт, что по общей производительности K3 всё ещё уступает Claude Fable 5 и GPT 5.6 Sol, и указывает три ограничения: качество генерации может резко упасть, если система-«обвязка» не передаёт модели историю предыдущих рассуждений; модель иногда принимает неожиданные решения от имени пользователя, если его намерение сформулировано нечётко; и есть заметный разрыв в удобстве использования по сравнению с Fable 5 и GPT 5.6 Sol.

В примечаниях к собственным тестам Moonshot также указывает, что в 35% задач теста SWE Marathon модель Fable 5 переходила в аварийный («fallback») режим — это могло исказить итоговую оценку конкурента. Все остальные цифры пока остаются заявлениями самой компании: ни одна из опубликованных характеристик K3 не может быть независимо проверена до тех пор, пока веса модели не станут публичными.

Аналитики Bank of America под руководством Алекса Лю отмечают в своей записке, что масштабное предобучение в сочетании с архитектурными решениями по-прежнему способно давать китайским флагманским моделям качественный скачок вперёд, несмотря на ограничения на вычислительные мощности. Это более трезвая версия того же тезиса — и она куда точнее соответствует тому, что фактически описано в блоге компании.

Общий тренд, впрочем, сомнений не вызывает. В июне открытые модели обработали 29% всех токенов, прошедших через производственный шлюз Vercel, — против примерно девятой части в апреле, — при этом на них пришлось менее 4% расходов. 27 июля станет понятно, какую долю этого тренда займёт именно Kimi K3.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *