> · · 8 мин

Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена

Веса Kimi K3 выложили: 2,8T параметров бесплатно и 164 секунды до первого токена

27 июля Moonshot выложила веса Kimi K3 — 2,8 триллиона параметров, самая крупная открытая модель в истории. Технический отчёт приехал вместе с весами, а не через месяц, как это обычно бывает. А на следующий день независимые трекеры досчитали цифры сравнения с Claude Opus 5, и там нашлась одна, которую в маркетинговых таблицах не встретишь: 164,6 секунды до первого токена.

TL;DR: Веса Kimi K3 выложены 27 июля, лицензия своя, не MIT. По независимым замерам BenchLM на 28 июля Opus 5 набирает 82,81 против 79,89 у K3, но K3 берёт мультимодальность (78,5 против 66,9), GPQA Diamond и BrowseComp и стоит примерно на 40% дешевле в смешанном расчёте. Расплата — скорость: 32 токена в секунду против 58 и время до первого токена 164,6 секунды против 21,7.

Что выложила Moonshot 27 июля

Веса Kimi K3 доступны для скачивания, и вместе с ними вышел технический отчёт — его уже разобрали и в англоязычных блогах, и на Hacker News. В анонсе от 14 июля компания обещала веса «к 27 июля», и на этот раз обещание сдержали день в день.

Спецификация: mixture-of-experts на 2,8T параметров, 93 слоя (69 с Kimi Delta Attention и 24 с Gated MLA), 896 экспертов, из которых на токен выбирается 16. Контекст — 1 048 576 токенов, вход текстовый, картиночный и видео, визуальный энкодер MoonViT-V2 на 401M параметров. Квантование весов MXFP4, активаций MXFP8. Управление рассуждением через reasoning_effort со значениями low, high и max, по умолчанию max.

С активными параметрами есть расхождение, которое стоит знать: официальная карточка называет 104B активных на токен, часть обзоров пишет про ~32B. Ни один источник расхождение не объясняет, так что если вы считаете стоимость инференса на своём железе — считайте по худшему.

Из архитектурных заявлений Moonshot: Kimi Delta Attention даёт до 6,3× более быстрый декодинг на миллионном контексте, а Attention Residuals — примерно на 25% выше эффективность обучения при менее чем 2% дополнительных затрат. Это цифры вендора из твита от 16 июля, независимых подтверждений на момент написания нет.

Сколько на самом деле стоит Kimi K3 против Opus 5

По API: $0.30 за миллион токенов при попадании в кеш, $3 за некешированный вход, $15 за выход. У Opus 5 — $5 и $25. В смешанном расчёте при соотношении кеш/вход/выход 7:2:1 CodingFleet считает $2.31 против $3.85, то есть примерно на 40% дешевле.

Дальше начинается интересное. Скорость выдачи у Opus 5 — около 58 токенов в секунду, у K3 — 32. Это ощутимо в интерактивной сессии, но терпимо. А вот время до первого токена: 21,7 секунды у Opus 5 на высоком effort и 164,6 секунды у K3. Разница в 7,6 раза, и это почти три минуты тишины перед первым символом.

Для батчевой обработки это не важно совсем. Для агента в терминале, где вы ждёте ответа, это разница между инструментом и фоновым процессом. Ваша экономия в 40% на токенах покупается тем, что вы больше не сидите в цикле «спросил — посмотрел — уточнил».

Кто выигрывает по бенчмаркам

Общий счёт независимых трекеров — за Opus 5, но с оговорками. BenchLM на 28 июля даёт 82,81 против 79,89 по своей линейке BenchAlign, при 28 общих результатах бенчмарков в 3 сопоставимых категориях из 8.

По категориям:

  • Мультимодальность — K3 78,5 против 66,9 у Opus 5, разрыв 11,6 в пользу открытой модели
  • Знания — Opus 5 64,7 против 61,0
  • Агентные задачи — Opus 5 90,8 против 89,5, разрыв меньше двух пунктов
  • Кодинг и рассуждения — у K3 сопоставимых публичных замеров нет вообще

По отдельным бенчмаркам Opus 5 забирает HLE (64,7% против 56,0%), AA Intelligence Index (59 против 57), DeepSWE v1.1 (68,8% против 67,5%) и Terminal-Bench 2.1 (89,1% против 88,3%). K3 отыгрывает GPQA Diamond (93,5% против 93,2%), BrowseComp (91,2% против 90,8%) и AutomationBench (30,8% против 26,0%).

Отдельно про кодинг: Opus 5 показывает 79,2% на SWE-bench Pro — это 1865 реальных задач из живых репозиториев. Kimi сопоставимого результата не публиковала вообще, а в собственной таблице сравнения предпочла Program Bench и FrontierSWE. Отсутствие числа — тоже число.

Почему «открытые веса» не значит «на твоём ноутбуке»

Мы уже писали об этом разрыве в июле, и K3 доводит его до предела. Модель на 2,8T параметров даже в MXFP4 — это порядка полутора терабайт весов. Локально её не запустит никто, кроме тех, у кого стоит стойка с ускорителями.

Практическая ценность открытых весов здесь другая: их можно поднять у себя в контуре, зафайнтюнить, изучить и не зависеть от того, что вендор завтра поменяет модель под тем же именем. Комментарий с Hacker News формулирует это точнее всего: релиз K3 помог остаться в гонке всем остальным лабораториям, потому что теперь есть на чём строить.

Лицензия — своя, Kimi K3 License, не MIT, вопреки тому, что писали некоторые обзоры до выкладки весов. Прочитайте текст, прежде чем тащить модель в продукт.

Подводные камни

Контекст в 1M доступен не всем. В документации Kimi Code аккаунты уровня Moderato получают до 256K, полный миллион открывается на Allegretto и выше. Сторонним инструментам контекст надо выставлять явным значением 1048576, иначе получите дефолт. Кстати, на Hacker News 30 июля вышла отдельная запись про K3-256k в Kimi Code — стоит свериться с актуальной таблицей тарифов перед покупкой.

164 секунды до первого токена ломают интерактивный сценарий. Это не придирка к цифре: при effort по умолчанию max модель думает долго по определению. Если гоняете K3 в CLI-агенте, крутите reasoning_effort вниз и замеряйте, что осталось от качества.

Избыточная инициативность. Обучение на длинных горизонтах приводит к тому, что при неоднозначном запросе K3 импровизирует, иногда сильно дальше границы, которую вы имели в виду. Лечится ужесточением системного промпта и AGENTS.md, но об этом надо знать заранее.

Сравнения по кодингу неполные с обеих сторон. Moonshot мерила свои цифры в основном харнессом Kimi Code, Anthropic — своим. BenchLM честно помечает кодинг и рассуждения как «не измерено» для K3. Любая таблица «K3 против Opus 5 по кодингу» сейчас собрана из разных харнессов, и относиться к ней надо соответственно.

У модели уже есть боевой послужной список не в ту сторону. Рой агентов на K3 нашёл серию 0-day в Redis, а в мультиплеерной арене Vending-Bench её обыграли и обманули все, кто мог. Сильная в наступательных задачах, наивная в переговорных — странное сочетание, которое стоит держать в голове.

Альтернативы

MiniMax M3 — по данным BenchLM, лучшая открытая модель по общему баллу (68,8). Слабее K3, зато влезает в разумное железо, и это решает вопрос локального запуска, который у K3 не решается никак.

GLM-5.2 — открытые веса, сильные результаты на DeepSWE, активно используется как рабочая лошадка. Именно на ней Hugging Face прогоняла разбор июльского вторжения, что говорит о доверии практиков к модели.

Claude Sonnet 5 — если нужен не открытый вес, а дешёвая закрытая модель для повседневного кода. Ближе к Opus по качеству на обычных задачах и не требует ни стойки, ни трёхминутного ожидания.

Вердикт

Берите K3 через API, если у вас батчевая обработка, мультимодальные задачи или агентный веб-браузинг: там она выигрывает и по качеству, и по цене. Не берите её для интерактивного кодинга в терминале — 164 секунды до первого токена убивают цикл обратной связи, а на SWE-bench Pro у неё просто нет числа, чтобы сравнить. И не покупайтесь на слово «открытая» как на обещание независимости: скачать 2,8T параметров вы можете, а запустить их — только если у вас уже есть инфраструктура, при наличии которой вопрос выбора модели решается совсем другими аргументами.

Как попробовать

  1. Возьмите ключ на platform.kimi.ai и дёрните модель kimi-k3 через OpenAI-совместимый эндпоинт. В Kimi Code она может называться k3, ID зависит от продукта.
  2. Первым делом замерьте время до первого токена на своём типичном промпте с reasoning_effort: max и с low. Это решит за вас вопрос, годится ли модель для вашего сценария.
  3. Сравните счёт честно: считайте не цену за миллион, а стоимость решённой задачи. Дешёвые токены при вдвое большем их числе экономии не дают.
  4. Если нужны локальные веса — сначала прочитайте текст Kimi K3 License, потом считайте железо. Полтора терабайта в MXFP4 не влезают в план «поставлю на рабочую станцию».
  5. Для сравнения с закрытыми моделями смотрите на BenchLM и Artificial Analysis, а не на таблицы из анонса: launch-таблица Moonshot построена против Opus 4.8, потому что Opus 5 тогда ещё не существовал.
$ ls ./related/

Похожие статьи

codex-cli-147-skills-import.md
Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу
> · 7 мин

Codex CLI 0.147 забирает скиллы прямо из Cursor и умеет сам себе одобрять команды. В том же релизе ужесточают песочницу

Codex CLI 0.147.0 импортирует скиллы, которыми управляет Cursor, синхронизирует диалоги Claude и Cursor без дублей и добавляет флаг --approve-for-me с автоматически проверяемыми одобрениями. Плюс поддержка финальной спеки MCP 2026-07-28 и десяток правок песочницы. Команды export наружу по-прежнему нет.

ai cursor agents codex
openai-astra-critical-cyber.md
OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена
> · 7 мин

OpenAI не может исключить, что её будущая модель находит 0-day сама. Часть работ по Astra остановлена

OpenAI объявила, что предварительные замеры Astra не позволяют исключить уровень Critical по кибербезопасности в её собственном Preparedness Framework. Это первый такой случай: все прежние модели, включая GPT-5.6 Sol, проходили уровнем ниже. Активности, не дотягивающие до усиленных требований, приостановлены, а мониторы теперь читают цепочку размышлений.

ai llm openai security
databricks-ai-coding-costs.md
Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8
> · 8 мин

Databricks выложила свою математику расходов на кодинг-агентов: минус 50% токенов от тюнинга харнесса, а Opus 5 вышел дороже Opus 4.8

Соучредитель Databricks с коллегами описал четыре рычага снижения расходов на агентный кодинг: тюнинг харнесса и кеша дал почти минус 50% токенов, роутер между моделями минус 30% средней цены задачи. Самое неприятное в статье: Stripe отказалась выдавать разработчикам Opus 4.7, а Databricks увидела рост стоимости при переходе с Opus 4.8 на Opus 5.

ai agents llm developer-tools
subscribe.sh

$ cat /dev/blog/updates

> Свежие заметки о программировании,

> DevOps и AI — прямо в мессенджер

./subscribe