DeepSeek-V4-Flash-Vision-Exp — это первая открытая мультимодальная модель от компании DeepSeek AI (не считая OCR моделей), построенная на базе языковой архитектуры DeepSeek-V4-Flash и дополненная визуальным кодировщиком. Модель относится к гибридным экспертным системам (MoE) с общим объёмом параметров около 305 миллиардов (увеличение с 284 за счет DSpark), из которых при инференсе активируется только 13 миллиардов на каждый токен - это обеспечивает высокую скорость работы и экономию вычислительных ресурсов. Она поддерживает контекстное окно до 1 миллиона токенов и использует смешанную точность FP4+FP8: параметры экспертов хранятся в FP4, а большинство остальных весов - в FP8, что заметно снижает требования к видеопамяти без потери качества.
Архитектурной основой модели является комбинация двух механизмов разрежённого внимания - CSA (Compressed Sparse Attention) и HCA (Highly Compressed Attention). CSA сжимает контекстные токены в 4 раза, превращая их в компактные векторы, а затем с помощью индексатора Lightning Indexer отбирает наиболее релевантные сжатые блоки для вычисления внимания. В HCA коэффициент достигает 1:128, позволяя выполнять полноценное глобальное внимание на сверхсжатой последовательности. Дополнительно в каждом слое сохраняется скользящее окно из 128 токенов без сжатия - для точного восприятия локального контекста. Такая связка снижает потребление памяти под KV-кэш примерно на 90% по сравнению с классическим полным вниманием. Кроме того, модель включает механизм DSpark, который ускоряет генерацию за счёт предсказания нескольких токенов вперёд (спекулятивное декодирование), повышая скорость вывода на 60-85%. Также интегрированы Manifold-Constrained Hyper-Connections (mHC), усиливающие распространение сигнала между слоями.
Визуальный кодировщик модели реализован на основе классического Vision Transformer (ViT) — это стандартное для индустрии решение, которое уже проверено во многих мультимодальных моделях. Он не использует экспериментальные подходы, как, например, "DeepEncoder V2" в специализированной модели DeepSeek-OCR, где применена особая причинная обработка изображений от грубого к детальному. Разработчики выбрали надёжный ViT с 32 слоями, размерностью 1024 и 16 головами внимания, дополненный двухслойным адаптером для стыковки с текстовой частью. Такой подход обеспечивает быструю интеграцию визуального понимания в текстовую модель.
По результатам бенчмарков модель показывает впечатляющие результаты. В текстовых агентских тестах она набирает 83,9 на Terminal Bench 2.1 (проверяет способность работать с терминалом и командной строкой) и 75,9 на Toolathlon-Verified (оценивает умение пользоваться внешними инструментами). В мультимодальных агентских задачах Vision-Exp демонстрирует рост почти на 40% по сравнению с предыдущей версией DeepSeek-V4-Flash-0731 на бенчмарке ApexBench (Pass@1) - 36,5 против 26,2. На комплексном тесте Agents' Last Exam модель получает 27,3 балла, обходя Opus-4.8 (25,7). Также она достигает 64,3 на Chartography (тест на понимание графиков и диаграмм) и 35,0 на ZeroBench (Pass@5) - бенчмарке, проверяющем способность решать новые задачи без дообучения. Таким образом модель не только улучшает сильные текстовые навыки, но и значительно превосходит предшественников поскольку способна решать задачи, требующие одновременной обработки визуальной и текстовой информации.
Благодаря своей архитектуре и показателям, модель идеально подходит для автоматического анализа изображений - диаграмм, скриншотов интерфейсов, научных графиков, документов с иллюстрациями. Мощные агентские способности позволяют создавать ИИ-помощников, которые "видят" экран и выполняют действия в графических приложениях (например, для автоматизации тестирования ПО или веб-скрапинга). Длинное контекстное окно даёт возможность обрабатывать целые книги, код проектов или юридические дела в одном запросе. Также модель отлично справляется с ролью интеллектуального ассистента разработчика, помогая в написании кода, отладке и рефакторинге, а в бизнес-среде - в извлечении данных из сложных отчётов и презентаций. Это универсальный инструмент для исследователей, разработчиков и аналитиков, работающих с мультимодальными данными.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
1 048 576 tensor |
2 | 841,52 ₽ | 6,50 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 6,50 | Запустить | ||
1 048 576 pipeline |
3 | 1 048,44 ₽ | 5,56 | Запустить | ||
1 048 576 pipeline |
3 | 1 105,60 ₽ | 10,33 | Запустить | ||
1 048 576 tensor |
4 | 1 338,68 ₽ | 4,19 | Запустить | ||
1 048 576 tensor |
4 | 1 450,00 ₽ | 5,96 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.