DeepSeek-V4-Flash-0731

размышляющая
русскоязычная
для кодинга

DeepSeek-V4-Flash-0731 — это официальный обновленная версия модели DeepSeek-V4-Flash. Модель построена на той же архитектуре Mixture-of-Experts (MoE) с 284 миллиардами параметров, из которых на каждый токен активируется лишь 13 миллиардов, что обеспечивает высокую производительность при относительно скромных вычислительных затратах на инференс. Модель поддерживает контекст длиной до одного миллиона токенов. Используется главная инженерная инновация линейки V4 — гибридный механизм внимания, который радикально снижает затраты на длинный контекст. Вместо однородной обработки всех токенов модель использует три режима одновременно: Compressed Sparse Attention (CSA) сжимает контекст в пропорции 1:4, после чего индексатор Lightning Indexer отбирает только наиболее релевантные блоки для вычислений; Heavily Compressed Attention (HCA) применяет экстремальное сжатие 1:128 и выполняет полное глобальное внимание над сверхкомпактными представлениями всей истории; параллельно скользящее окно из 128 токенов обрабатывает ближайший контекст без сжатия, сохраняя детальную локальную осведомлённость.

В версии 0731 к базовой модели добавлен встроенный модуль DSpark, который реализует спекулятивное декодирование: модель способна генерировать несколько токенов «наперёд» и проверять их за один шаг, что заметно ускоряет инференс без потери качества (он увеличивает объем весов в памяти и по умолчанию отключен, подключается через настройки параметра speculative по-разному в различных инференсных движках). Но главное новшество - усовершенствование пост-обучения (post-training) в результате чего агентные способности модели выросли в разы: по сравнению с preview-версией показатели на Terminal Bench 2.1 выросли с 61,8% до 82,7%, на DeepSWE — с 7,3% до 54,4%, на Cybergym — с 38,7% до 76,7%. При этом 0731 обгоняет гораздо более крупные модели, в частности, DeepSeek-V4-Pro (Preview) и популярную GLM-5.2 по большинству агентных бенчмарков и вплотную приближается к сильнейшим проприетарным моделям, таким как Opus-4.8.

Сценарии использования модели охватывают широкий спектр задач, где критичны одновременно длина контекста и экономичность развёртывания: анализ и суммаризация больших документов — юридических досье, научных статей, корпоративных отчётов объёмом до миллиона токенов; поиск по обширным корпоративным базам знаний и извлечение информации из многотомных архивов; многошаговая работа агентов с длинными сессиями и большим числом инструментов; задачи программирования и математического моделирования, где важны как точность рассуждений, так и способность удерживать в поле зрения объёмный код или спецификации; создание чат-ботов, систем автоматической генерации кода, интеллектуальных ассистентов для работы с документами и research-агентов. Лицензия MIT позволяет использовать модель в коммерческих продуктах без ограничений.


Дата анонса: 31.07.2026
Параметров: 305B
Экспертов: 256
Активно параметров при инференсе: 13B
Контекст: 1049K
Слоев: 43, с полным вниманием: 21
Тип внимания: Compressed Sparse Attention (CSA) and Heavily Compressed Attention (HCA)
Разработчик: DeepSeek
Версия Transformers: 4.57.1
Версия vLLM: >=0.25.0
Лицензия: MIT

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с DeepSeek-V4-Flash-0731. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга DeepSeek-V4-Flash-0731

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-3.32.384.320
1 048 576
pipeline
3 658,44 ₽ 7,95 Запустить
h100nvl-2.24.192.480
1 048 576
tensor
2 731,81 ₽ 1,59 Запустить
teslaa100-4.16.256.480
1 048 576
tensor
4 818,68 ₽ 4,72 Запустить
h200-2.24.256.320
1 048 576
tensor
2 841,52 ₽ 7,53 Запустить
h200-2.24.256.320.nvlink
1 048 576
tensor
2 841,52 ₽ 7,53 Запустить
teslaa100-4.32.384.320.nvlink
1 048 576
tensor
4 848,44 ₽ 4,72 Запустить
rtx5090-8.44.256.480
1 048 576
tensor
8 1 034,08 ₽ 1,16 Запустить
h100-3.32.384.320
1 048 576
pipeline
3 1 048,44 ₽ 7,92 Запустить
h100-4.16.256.480
1 048 576
tensor
4 1 338,68 ₽ 4,71 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-3.32.384.320
1 048 576
pipeline
3 658,44 ₽ 6,06 Запустить
teslaa100-4.16.256.480
1 048 576
tensor
4 818,68 ₽ 4,25 Запустить
h200-2.24.256.320
1 048 576
tensor
2 841,52 ₽ 6,58 Запустить
h200-2.24.256.320.nvlink
1 048 576
tensor
2 841,52 ₽ 6,58 Запустить
teslaa100-4.32.384.320.nvlink
1 048 576
tensor
4 848,44 ₽ 4,25 Запустить
h100-3.32.384.320
1 048 576
pipeline
3 1 048,44 ₽ 6,03 Запустить
h100nvl-3.24.384.480
1 048 576
pipeline
3 1 105,60 ₽ 11,07 Запустить
h100-4.16.256.480
1 048 576
tensor
4 1 338,68 ₽ 4,24 Запустить
h100nvl-4.32.384.480
1 048 576
tensor
4 1 450,00 ₽ 6,01 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-6.52.896.960
1 048 576
pipeline
6 2 535,78 ₽ 12,24 Запустить
h200-8.52.1024.960
1 048 576
tensor
8 3 338,30 ₽ 7,53 Запустить
h200-8.52.1024.960.nvlink
1 048 576
tensor
8 3 338,30 ₽ 7,53 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.