DeepSeek-V4-Flash-0731 — это официальный обновленная версия модели DeepSeek-V4-Flash. Модель построена на той же архитектуре Mixture-of-Experts (MoE) с 284 миллиардами параметров, из которых на каждый токен активируется лишь 13 миллиардов, что обеспечивает высокую производительность при относительно скромных вычислительных затратах на инференс. Модель поддерживает контекст длиной до одного миллиона токенов. Используется главная инженерная инновация линейки V4 — гибридный механизм внимания, который радикально снижает затраты на длинный контекст. Вместо однородной обработки всех токенов модель использует три режима одновременно: Compressed Sparse Attention (CSA) сжимает контекст в пропорции 1:4, после чего индексатор Lightning Indexer отбирает только наиболее релевантные блоки для вычислений; Heavily Compressed Attention (HCA) применяет экстремальное сжатие 1:128 и выполняет полное глобальное внимание над сверхкомпактными представлениями всей истории; параллельно скользящее окно из 128 токенов обрабатывает ближайший контекст без сжатия, сохраняя детальную локальную осведомлённость.
В версии 0731 к базовой модели добавлен встроенный модуль DSpark, который реализует спекулятивное декодирование: модель способна генерировать несколько токенов «наперёд» и проверять их за один шаг, что заметно ускоряет инференс без потери качества (он увеличивает объем весов в памяти и по умолчанию отключен, подключается через настройки параметра speculative по-разному в различных инференсных движках). Но главное новшество - усовершенствование пост-обучения (post-training) в результате чего агентные способности модели выросли в разы: по сравнению с preview-версией показатели на Terminal Bench 2.1 выросли с 61,8% до 82,7%, на DeepSWE — с 7,3% до 54,4%, на Cybergym — с 38,7% до 76,7%. При этом 0731 обгоняет гораздо более крупные модели, в частности, DeepSeek-V4-Pro (Preview) и популярную GLM-5.2 по большинству агентных бенчмарков и вплотную приближается к сильнейшим проприетарным моделям, таким как Opus-4.8.
Сценарии использования модели охватывают широкий спектр задач, где критичны одновременно длина контекста и экономичность развёртывания: анализ и суммаризация больших документов — юридических досье, научных статей, корпоративных отчётов объёмом до миллиона токенов; поиск по обширным корпоративным базам знаний и извлечение информации из многотомных архивов; многошаговая работа агентов с длинными сессиями и большим числом инструментов; задачи программирования и математического моделирования, где важны как точность рассуждений, так и способность удерживать в поле зрения объёмный код или спецификации; создание чат-ботов, систем автоматической генерации кода, интеллектуальных ассистентов для работы с документами и research-агентов. Лицензия MIT позволяет использовать модель в коммерческих продуктах без ограничений.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
1 048 576 pipeline |
3 | 658,44 ₽ | 7,95 | Запустить | ||
1 048 576 tensor |
2 | 731,81 ₽ | 1,59 | Запустить | ||
1 048 576 tensor |
4 | 818,68 ₽ | 4,72 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 7,53 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 7,53 | Запустить | ||
1 048 576 tensor |
4 | 848,44 ₽ | 4,72 | Запустить | ||
1 048 576 tensor |
8 | 1 034,08 ₽ | 1,16 | Запустить | ||
1 048 576 pipeline |
3 | 1 048,44 ₽ | 7,92 | Запустить | ||
1 048 576 tensor |
4 | 1 338,68 ₽ | 4,71 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
1 048 576 pipeline |
3 | 658,44 ₽ | 6,06 | Запустить | ||
1 048 576 tensor |
4 | 818,68 ₽ | 4,25 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 6,58 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 6,58 | Запустить | ||
1 048 576 tensor |
4 | 848,44 ₽ | 4,25 | Запустить | ||
1 048 576 pipeline |
3 | 1 048,44 ₽ | 6,03 | Запустить | ||
1 048 576 pipeline |
3 | 1 105,60 ₽ | 11,07 | Запустить | ||
1 048 576 tensor |
4 | 1 338,68 ₽ | 4,24 | Запустить | ||
1 048 576 tensor |
4 | 1 450,00 ₽ | 6,01 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.