DeepSeek-V4-Pro-0813 построена на архитектуре Mixture-of-Experts (MoE) с 1,6 трлн общих параметров, из которых активируется лишь 49 млрд на каждый токен. Конфигурация включает квантование FP8 для активаций и весов, а также FP4 для экспертных слоёв. Модель эффективно работает с длинными последовательностями и способна обрабатывать до 1 048 576 токенов. В отличие от preview-версии, релиз 0813 оснащён модулем спекулятивного декодирования DSpark, который ускоряет генерацию без потери качества.
Как и версия DeepSeek-V4-Pro модель использует гибридный механизм внимания, сочетающий Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA). CSA сначала сжимает KV-кэш вдоль последовательности, объединяя записи каждых четырех токенов в одну, а затем применяет DeepSeek Sparse Attention (DSA), при котором каждый query-токен обращается лишь к сжатым KV-записям. HCA идёт дальше: он агрессивно сжимает KV-кэш каждых 128 токенов в одну запись, сохраняя при этом dense attention. Чередование CSA и HCA в разных слоях позволяет радикально снизить вычислительную нагрузку и требования к памяти для KV-кэша по сравнению с DeepSeek-V3.2. Дополнительно архитектура усилена Manifold-Constrained Hyper-Connections (mHC) — модификацией residual-связей, которая обеспечивает численную стабильность. Для обучения использован оптимизатор Muon, ускоряющий сходимость и повышающий качество обучения.
Модель демонстрирует сильные результаты на ряде ключевых бенчмарков. На Terminal Bench 2.1 (проверка способности решать задачи в терминале, включая работу с командной строкой и файловой системой) модель набирает 87,9, опережая DeepSeek-V4-Flash-0731 (82,7) и DeepSeek-V4-Pro Preview (72,1), приближаясь к Kimi K3 (88,3) и Opus-4.8 (85,0). На NL2Repo (генерация репозиториев кода по описанию на естественном языке) результат составляет 61,5 — значительный отрыв от preview-версии (38,5) и Flash-версии (54,2). В Cybergym (задачи кибербезопасности) модель показывает 83,3, обгоняя Kimi K3 (80,0), Opus-4.8 (78,3) и Fable-5 (83,1). На DeepSWE (программная инженерия) — 62,7, что выше Flash (54,4) и Kimi K3 (67,5), но ниже Opus-4.8 (58,0) и Fable-5 (70,0). В Toolathlon-Verified (многошаговые задачи с инструментами) модель набирает 74,1, уступая лишь Kimi K3 (76,5), Opus-4.8 (76,2) и Fable-5 (77,9). Наконец, на HLE (Humanity's Last Exam) без инструментов модель показывает 42,7, с инструментами — 60,0, обгоняя preview-версию (37,7 / 48,2) и Flash-версию (34,8 / 45,1).Таким образом по сравнению с DeepSeek-V4-Pro (Preview) релиз 0813 обеспечивает кардинальный рост агентных возможностей и является полноценным продакшн-решением, оптимизированным для реальных сценариев.
Благодаря миллионному контексту и высокой эффективности CSA + HCA, модель в первую очередь предназначена для анализа сверхдлинных документов — юридических, научных, финансовых отчётов, кодовых баз и многотомных архивов. Агентные бенчмарки подтверждают ее пригодность для автономных агентов, выполняющих многошаговые задачи: управление терминалом, навигацию по файловой системе, вызов внешних инструментов и API. Также модель является эффективным инструментом для полноценной разработки ПО — от генерации репозиториев по описанию до решения сложных задач уровня full-stack. В области кибербезопасности модель может применяться для анализа уязвимостей, симуляции атак и автоматизированного аудита безопасности. Кроме того, поддержка reasoning_effort с тремя уровнями (low, medium, high) позволяет гибко настраивать баланс между скоростью и глубиной рассуждений в зависимости от задачи.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.