Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Moonshot AI опубликовала веса нашумевшей Kimi-K3 — она почти не уступает лидерам рынка, но намного проще в работе

Китайская Moonshot выполнила своё обещание и бесплатно опубликовала веса революционной модели искусственного интеллекта Kimi-K3. Теперь любой обладатель достаточно мощных вычислительных ресурсов может запустить её на своём оборудовании.

 Источник изображений: kimi.com

Источник изображений: kimi.com

На практике подтвердилось, что Kimi-K3 значительно превосходит модели OpenAI GPT и Anthropic Claude предыдущих поколений и лишь немного уступает передовым Sol и Fable. При этом эксплуатация китайской модели обходится в 2–3 раза дешевле американских аналогов, а если запрос попадает в кеш, то и в 10 раз. За ввод данных на своих ресурсах Moonshot AI взимает $3 за 1 млн токенов; для сравнения, Anthropic Fable обходится в $10, а OpenAI GPT-5.6 Sol — $5. И это для некешированных входных данных; а механизмы кеширования Kimi-K3 обеспечивают попадание на 90 % для задач на написание кода, и $3 превращаются в $0,30 за тот же 1 млн токенов. Аналогичная ситуация и с выходными токенами.

Вероятнее всего, такой эффективности разработчики добились за счёт комбинации формата чисел MXFP4 для хранения весов и MXFP8 для активации входных данных — в обоих случаях точность относительно низкая, что помогает экономить память. Из 2,8 трлн параметров Kimi-K3 одновременно активны только 104,2 млрд. Интересно, что в описании упоминается работа модели только на относительно скромных ускорителях Nvidia H20, которые не имеют встроенной поддержки MX с плавающей запятой в отличие от чипов семейства Blackwell, которые не поставляются в Китай. Это значит, что Kimi-K3 оптимизирована для работы на менее мощном оборудовании, а запуск на передовых Nvidia Blackwell или других ускорителях с поддержкой MXFP может сделать её более экономичной, но официальными данными это пока не подтверждено.

Кроме того, Kimi-K3 не пользуется хранилищем key-value (KV), вместо которого предлагается обработчик состояний фиксированного размера Kimi Delta Attention, в теории обещающий экономить видеопамять и сокращать время выполнения. Алгоритм MoE (Mixture-of-Experts) предполагает запуск всего 16 из 896 «экспертов», что дополнительно способствует снижению затрат на вывод. Стоит, однако отметить, что открытые веса не означают открытого исходного кода: процесс обучения и набор данных Moonshot держит в секрете.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 10 мин.
Nvidia DLSS 5 заработает 3 сентября на видеокартах GeForce RTX 50 и в GeForce NOW — первой игрой станет NBA 2K27 16 мин.
Double Fine пообещала сделать Brutal Legend 2, но при одном условии 33 мин.
Группа фанатов возродит амбициозный сетевой экшен APB: All Points Bulletin от создателя GTA — подробности и геймплей 2 ч.
Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне 2 ч.
«Google Сообщения» начали отправлять людям чужие сообщения из старых переписок 2 ч.
Selectel усиливает ИИ-платформу новой функциональностью в кaталоге ИИ-моделей 2 ч.
Broadcom представила частное ИИ-облако VMware AI Factory, позаимствовав у NVIDIA термин для партнёрства с AMD 3 ч.
Медиаплеер VLC преодолел отметку в 7 миллиардов загрузок 5 ч.
Debian наполнится кодом, который сгенерировал ИИ 5 ч.
Steam Deck получила поддержку более 30 тыс. игр из библиотеки Steam 13 мин.
SilverStone выпустила блок питания HELA 3000Rz на 3000 Вт — он справится с четвёркой RTX 5090 57 мин.
Samsung пустила на производство Galaxy Z Fold8 комплектующие от будущих моделей из-за ажиотажного спроса 2 ч.
При Тиме Куке акции Apple выросли на 2275 % — но Джону Тернусу не обязательно повторять его успех 2 ч.
Asus раскрыла характеристики ноутбука ProArt P14 — одного из первых на процессоре Nvidia RTX Spark 2 ч.
OpenAI отвергла новые обвинения Apple в краже технологий как безосновательные 2 ч.
Samsung рассказала, чем будет хороша память HBM5, zHBM и zNAND-O 2 ч.
Представлен компактный флагман POCO F9 Pro с двумя процессорами, быстрым экраном и 200-Мп камерой 2 ч.
Клиенты ASML уже используют 10 сканеров High-NA EUV, позволяющие делать чипы «тоньше» 2 нм 2 ч.
Анонсирован флагман POCO F9 Ultra с батареей на 8050 мА·ч и поддержкой игр в 185 FPS 2 ч.