DeepSeek-V4-Pro-0813

размышляющая
русскоязычная
для кодинга

DeepSeek-V4-Pro-0813 построена на архитектуре Mixture-of-Experts (MoE) с 1,6 трлн общих параметров, из которых активируется лишь 49 млрд на каждый токен. Конфигурация включает квантование FP8 для активаций и весов, а также FP4 для экспертных слоёв. Модель эффективно работает с длинными последовательностями и способна обрабатывать до 1 048 576 токенов. В отличие от preview-версии, релиз 0813 оснащён модулем спекулятивного декодирования DSpark, который ускоряет генерацию без потери качества.

Как и версия DeepSeek-V4-Pro модель использует гибридный механизм внимания, сочетающий Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). CSA сначала сжимает KV-кэш вдоль последовательности, объединяя записи каждых четырех токенов в одну, а затем применяет DeepSeek Sparse Attention (DSA), при котором каждый query-токен обращается лишь к сжатым KV-записям. HCA идёт дальше: он агрессивно сжимает KV-кэш каждых 128 токенов в одну запись, сохраняя при этом dense attention. Чередование CSA и HCA в разных слоях позволяет радикально снизить вычислительную нагрузку и требования к памяти для KV-кэша по сравнению с DeepSeek-V3.2. Дополнительно архитектура усилена Manifold-Constrained Hyper-Connections (mHC) — модификацией residual-связей, которая обеспечивает численную стабильность. Для обучения использован оптимизатор Muon, ускоряющий сходимость и повышающий качество обучения.

Модель демонстрирует сильные результаты на ряде ключевых бенчмарков. На Terminal Bench 2.1 (проверка способности решать задачи в терминале, включая работу с командной строкой и файловой системой) модель набирает 87,9, опережая DeepSeek-V4-Flash-0731 (82,7) и DeepSeek-V4-Pro Preview (72,1), приближаясь к Kimi K3 (88,3) и Opus-4.8 (85,0). На NL2Repo (генерация репозиториев кода по описанию на естественном языке) результат составляет 61,5 — значительный отрыв от preview-версии (38,5) и Flash-версии (54,2). В Cybergym (задачи кибербезопасности) модель показывает 83,3, обгоняя Kimi K3 (80,0), Opus-4.8 (78,3) и Fable-5 (83,1). На DeepSWE (программная инженерия) — 62,7, что выше Flash (54,4) и Kimi K3 (67,5), но ниже Opus-4.8 (58,0) и Fable-5 (70,0). В Toolathlon-Verified (многошаговые задачи с инструментами) модель набирает 74,1, уступая лишь Kimi K3 (76,5), Opus-4.8 (76,2) и Fable-5 (77,9). Наконец, на HLE (Humanity's Last Exam) без инструментов модель показывает 42,7, с инструментами — 60,0, обгоняя preview-версию (37,7 / 48,2) и Flash-версию (34,8 / 45,1).Таким образом по сравнению с DeepSeek-V4-Pro (Preview) релиз 0813 обеспечивает кардинальный рост агентных возможностей и является полноценным продакшн-решением, оптимизированным для реальных сценариев.

Благодаря миллионному контексту и высокой эффективности CSA + HCA, модель в первую очередь предназначена для анализа сверхдлинных документов — юридических, научных, финансовых отчётов, кодовых баз и многотомных архивов. Агентные бенчмарки подтверждают ее пригодность для автономных агентов, выполняющих многошаговые задачи: управление терминалом, навигацию по файловой системе, вызов внешних инструментов и API. Также модель является эффективным инструментом для полноценной разработки ПО — от генерации репозиториев по описанию до решения сложных задач уровня full-stack. В области кибербезопасности модель может применяться для анализа уязвимостей, симуляции атак и автоматизированного аудита безопасности. Кроме того, поддержка reasoning_effort с тремя уровнями (low, medium, high) позволяет гибко настраивать баланс между скоростью и глубиной рассуждений в зависимости от задачи.


Дата анонса: 13.08.2026
Параметров: 2T
Экспертов: 384
Активно параметров при инференсе: 49B
Контекст: 1049K
Слоев: 61, с полным вниманием: 30
Тип внимания: Compressed Sparse Attention (CSA) and Heavily Compressed Attention (HCA)
Разработчик: DeepSeek
Версия Transformers: 4.57.1
Версия vLLM: >=0.25.0
Лицензия: MIT

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с DeepSeek-V4-Pro-0813. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга DeepSeek-V4-Pro-0813

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-8.52.1024.1280
1 048 576
tensor
8 3 341,41 ₽ 1,08 Запустить
h200-8.52.1024.1280.nvlink
1 048 576
tensor
8 3 341,41 ₽ 1,08 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-8.52.1024.960
1 048 576
tensor
8 3 338,30 ₽ 1,48 Запустить
h200-8.52.1024.960.nvlink
1 048 576
tensor
8 3 338,30 ₽ 1,48 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.