DeepSeek-V4-Flash-0731 — это официальный обновленная версия модели DeepSeek-V4-Flash. Модель построена на той же архитектуре Mixture-of-Experts (MoE) с 284 миллиардами параметров, из которых на каждый токен активируется лишь 13 миллиардов, что обеспечивает высокую производительность при относительно скромных вычислительных затратах на инференс. Модель поддерживает контекст длиной до одного миллиона токенов. Используется главная инженерная инновация линейки V4 — гибридный механизм внимания, который радикально снижает затраты на длинный контекст. Вместо однородной обработки всех токенов модель использует три режима одновременно: Compressed Sparse Attention (CSA) сжимает контекст в пропорции 1:4, после чего индексатор Lightning Indexer отбирает только наиболее релевантные блоки для вычислений; Heavily Compressed Attention (HCA) применяет экстремальное сжатие 1:128 и выполняет полное глобальное внимание над сверхкомпактными представлениями всей истории; параллельно скользящее окно из 128 токенов обрабатывает ближайший контекст без сжатия, сохраняя детальную локальную осведомлённость.
В версии 0731 к базовой модели добавлен встроенный модуль DSpark, который реализует спекулятивное декодирование: модель способна генерировать несколько токенов «наперёд» и проверять их за один шаг, что заметно ускоряет инференс без потери качества (он увеличивает объем весов в памяти и по умолчанию отключен, подключается через настройки параметра speculative по-разному в различных инференсных движках). Но главное новшество - усовершенствование пост-обучения (post-training) в результате чего агентные способности модели выросли в разы: по сравнению с preview-версией показатели на Terminal Bench 2.1 выросли с 61,8% до 82,7%, на DeepSWE — с 7,3% до 54,4%, на Cybergym — с 38,7% до 76,7%. При этом 0731 обгоняет гораздо более крупные модели, в частности, DeepSeek-V4-Pro (Preview) и популярную GLM-5.2 по большинству агентных бенчмарков и вплотную приближается к сильнейшим проприетарным моделям, таким как Opus-4.8.
Сценарии использования модели охватывают широкий спектр задач, где критичны одновременно длина контекста и экономичность развёртывания: анализ и суммаризация больших документов — юридических досье, научных статей, корпоративных отчётов объёмом до миллиона токенов; поиск по обширным корпоративным базам знаний и извлечение информации из многотомных архивов; многошаговая работа агентов с длинными сессиями и большим числом инструментов; задачи программирования и математического моделирования, где важны как точность рассуждений, так и способность удерживать в поле зрения объёмный код или спецификации; создание чат-ботов, систем автоматической генерации кода, интеллектуальных ассистентов для работы с документами и research-агентов. Лицензия MIT позволяет использовать модель в коммерческих продуктах без ограничений.
| Наименование модели | Контекст | Тип | GPU | TPS | Tooling | Статус | Ссылка |
|---|---|---|---|---|---|---|---|
| deepseek-ai/DeepSeek-V4-Flash-0731 | 1M | Публичный | 8×H100 tensor |
387 | доступен | чат |
curl https://chat.immers.cloud/v1/endpoints/generate/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer USER_API_KEY" \
--data-binary @- <<"EOF"
{"model": "deepseek-v4-flash-0731", "messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Say this is a test"}
], "temperature": 0, "max_tokens": 150
}
EOF
$response = Invoke-WebRequest https://chat.immers.cloud/v1/endpoints/generate/chat/completions `
-Method POST `
-Headers @{
"Authorization" = "Bearer USER_API_KEY"
"Content-Type" = "application/json; charset=utf-8"
} `
-Body ([System.Text.Encoding]::UTF8.GetBytes((@{
model = "deepseek-v4-flash-0731"
messages = @(
@{ role = "system"; content = "You are a helpful assistant." },
@{ role = "user"; content = "Say this is a test" })
} | ConvertTo-Json -Depth 10)))
([System.Text.Encoding]::UTF8.GetString($response.RawContentStream.ToArray()) | ConvertFrom-Json).choices[0].message.content
#!pip install OpenAI --upgrade
from openai import OpenAI
client = OpenAI(
api_key="USER_API_KEY",
base_url="https://chat.immers.cloud/v1/endpoints/generate/",
)
chat_response = client.chat.completions.create(
model="deepseek-v4-flash-0731",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Say this is a test"},
]
)
print(chat_response.choices[0].message.content)
# linux
export ANTHROPIC_BASE_URL=https://chat.immers.cloud/v1/endpoints/generate/
export ANTHROPIC_API_KEY=USER_API_KEY
export ANTHROPIC_MODEL=deepseek-v4-flash-0731
# windows (ps)
[Environment]::SetEnvironmentVariable("ANTHROPIC_BASE_URL", "https://chat.immers.cloud/v1/endpoints/generate/", "User")
[Environment]::SetEnvironmentVariable("ANTHROPIC_AUTH_TOKEN", "USER_API_KEY", "User")
[Environment]::SetEnvironmentVariable("ANTHROPIC_MODEL", "deepseek-v4-flash-0731", "User")
# linux
export OPENAI_BASE_URL=https://chat.immers.cloud/v1/endpoints/generate/
export OPENAI_API_KEY=USER_API_KEY
export OPENAI_MODEL=deepseek-v4-flash-0731
# windows (ps)
[Environment]::SetEnvironmentVariable("OPENAI_BASE_URL", "https://chat.immers.cloud/v1/endpoints/generate/", "User")
[Environment]::SetEnvironmentVariable("OPENAI_API_KEY", "USER_API_KEY", "User")
[Environment]::SetEnvironmentVariable("OPENAI_MODEL", "deepseek-v4-flash-0731", "User")
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.