Kimi-K3

размышляющая
мультимодальная
русскоязычная
для кодинга

Kimi K3 – флагманская Mixture-of-Experts (MoE) модель от Moonshot AI с 2.8 триллионами параметров, из которых на каждый токен активируется только 104 миллиарда. Архитектура включает нативную поддержку текстов, изображений и видео через энкодер MoonViT-V2 (401M параметров). Модель обучалась с применением QAT (quantization-aware training): веса нативно квантованы в MXFP4, а активации в MXFP8, что обеспечивает существенную экономию на инфраструктуру.

Первая особенность — это новый гибридный механизм внимания. Модель состоит из 93 слоёв: 69 слоёв реализуют Kimi Delta Attention (KDA) — линейно-рекуррентный механизм внимания с фиксированным размером состояния, а 24 слоя используют полноценное Gated MLA (Multi-head Latent Attention) для точного глобального контроля. Такой подход позволяет обрабатывать контекст длиной до 1 миллиона токенов без экспоненциального роста памяти KV-кэша.

Вторая ключевая инновация K3 — технология Attention Residuals, которая заменяет классическое residual-соединение. Вместо того чтобы просто прибавлять вход блока к его выходу, AttnRes использует обучаемый механизм depth-wise attention: каждый слой формирует pseudo-query и взвешивает RMS-нормализованные residual-состояния из предыдущих блоков (в окне `attn_res_block_size=12`). Таким образом, информация из глубины модели извлекается селективно. Это улучшает поток информации через глубину сети и позволяет модели более гибко комбинировать представления с разных уровней, что особенно важно при масштабировании за триллион параметров.

Третий важный аспект - Stable LatentMoE. Это фреймворк для стабильного обучения и инференса Mixture-of-Experts на экстремальном уровне разреженности идея которого заимствована у NVIDIA. В отличие от классических MoE, где токены напрямую проходят через экспертов полной размерности, LatentMoE сначала проектирует активации в сжатое латентное пространство (размерность 3584, что вдвое меньше), затем применяет routed experts, после чего проецирует обратно. Это сокращает вычисления и коммуникации, позволяя использовать больше экспертов при схожей стоимости инференса.

По сравнению с моделями линейки Kimi K2, которая опиралась на MLA-архитектуру, K3 демонстрирует примерно 2.5-кратное улучшение эффективности масштабирования за счёт упомянутых KDA, AttnRes и Stable LatentMoE. Фактически это первая в мире открытая модель класса 3T, доступная для исследований и деплоя под лицензией Kimi K3 License.

На бенчмарках Kimi K3 демонстрирует фронтирный уровень среди открытых весов и конкурирует с лучшими проприетарными решениями: она лидирует в SWE-Marathon — марафонском программном инжиниринге с длительными сессиями разработки, — обогнав Claude Fable 5, GPT-5.6 Sol и Claude Opus 4.8, а также занимает первые места в BrowseComp (навигация и поиск в вебе), MCPMark-Verified (использование инструментов через протокол MCP), AutomationBench (автоматизация рабочих процессов), Video-MME (понимание видеоконтента) и MMVU. При этом модель показывает выдающиеся абсолютные показатели в GPQA Diamond (93.5) — сложнейших вопросах PhD-уровня по точным наукам, ProgramBench (77.8) — генерации кода по спецификациям, Terminal-Bench 2.1 (88.3) — работе в терминальной среде и DeepSearchQA (95.0) — глубоком поиске и синтезе информации из множества источников.

Kimi K3 оптимальна для долгосрочной разработки ПО и системного программирования — от оптимизации GPU-ядер и написания компиляторов до проектирования сайтов и разработки игр в режиме длительных агентных сессий с минимальным человеческим контролем. Модель эффективна и в сегменте мультимодальных задач, она способна создавать глубокие исследовательские отчёты с интерактивными визуализациями и дашбордами на основе анализа документов, финансовых данных и научной литературы, а также решать целый спектр направлений в области обработки видео. Наконец, K3 надёжно закрывает задачи автоматизации бизнес-процессов и интеграции с корпоративными SaaS-инструментами, что критически важно для enterprise-агентов.


Дата анонса: 27.06.2026
Параметров: 3T
Экспертов: 896
Активно параметров при инференсе: 104B
Контекст: 1049K
Слоев: 93, с полным вниманием: 24
Тип внимания: Kimi Delta Attention (KDA)
Разработчик: Moonshot AI
Версия Transformers: 4.56.2
Версия vLLM: >=0.27.0
Лицензия: Kimi K3 License

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с Kimi-K3. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга Kimi-K3

Для данной модели, контекста и квантизации пока нет подходящих конфигураций.
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям nn@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.