Qwen3.8-Flash-Next

размышляющая
мультимодальная
русскоязычная
для кодинга

Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель с 125 млрд параметров (6 млрд активируются на токен) и 51 млрд параметров N‑граммных встраиваний. Она предваряет архитектуру Qwen4 и предлагает системное переосмысление внимания, остаточных соединений и оптимизации. Модель поддерживает контекст до 262 144 токенов нативно и до 1 000 000 с YaRN.

В основе лежит гибридное внимание с чередованием 3:1: три рекуррентных слоя Gated DeltaNet (GDN) на один слой Qwen Sparse Attention (QSA). GDN сжимает историю в матричное состояние фиксированного размера, обновляя его по дельта-правилу – это предотвращает накопление дубликатов и делает память устойчивой к шуму на сверхдлинных контекстах. QSA представляет собой глобальное внимание в гибриде, но в отличие от полного внимания, используемого в архитектурах начиная с qwen3-next, является не плотным, а разряженным и состоит из лёгкого индексера (сжимает ключи в блоки по 4 токена и отбирает top‑K релевантных) и разреженного ядра, которое вычисляет полное внимание только по отобранному подмножеству. Это даёт линейно-сублинейную сложность на длинных последовательностях в отличии от квадратичной у предшественников.

Среди других новшеств – N‑граммная таблица (200 млн записей, 51 млрд параметров) на хосте, которая асинхронно подгружается и добавляет векторы к представлениям токенов на втором слое, улучшая качество почти без вычислительных затрат и без увеличения VRAM. Gated Residual (GR) расширяет остаточный поток до четырёх параллельных ветвей, маршрутизируя информацию между слоями, а оптимизатор Muon заменяет AdamW, ускоряя сходимость больших матриц и обеспечивая стабильность обучения.

На ключевых бенчмарках модель занимает первые места в своём классе. В агентном программировании DeepSWE 1.1 модель набирает 58.7%, опережая DeepSeek-V4-Flash-0731 (54.4%); на SWE-bench Pro — 62.5% против 56.0% у DeepSeek и 53.4% у Claude-Opus-4.6. На научном бенчмарке GPQA Diamond модель достигает 91.7%, обходя все перечисленные аналоги. В соревновательном программировании LiveCodeBench v6 — 91.9% против 90.6% у DeepSeek и 88.8% у Claude. В многопрофильных агентных задачах Agents' Last Exam модель набирает 51.2 балла, значительно превосходя Qwen3.7-Plus (33.6). В целом из 12 базовых тестов модель лидирует в 10 из них.

Благодаря эффективности и высокой производительности модель идеально подходит для: автономных ИИ-агентов, выполняющих сложные многошаговые сценарии в задачах программирования, офисной работе; при обработке документов (юридических контрактов, научных статей, кодовых баз и т. д.). Не стоит забывать и про мультимодальные возможности, которые позволяют встраивать модель в процедуры, требующие анализа изображений и видео.


Дата анонса: 24.08.2026
Параметров: 180B
Экспертов: 512
Активно параметров при инференсе: 6B
Контекст: 263K
Слоев: 48, с полным вниманием: 12
Тип внимания: Hybrid Attention
Тип Mamba: Gated Delta Net
Разработчик: Qwen
Версия Transformers: 5.8.0.dev0
Версия vLLM: >=0.29.0
Лицензия: Qwen Community License 1.0

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с Qwen3.8-Flash-Next. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга Qwen3.8-Flash-Next

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-4.16.256.480
262 144
tensor
4 818,68 ₽ 7,98 Запустить
h200-2.24.256.320
262 144
tensor
2 841,52 ₽ 5,82 Запустить
h200-2.24.256.320.nvlink
262 144
tensor
2 841,52 ₽ 5,82 Запустить
teslaa100-4.32.384.320.nvlink
262 144
tensor
4 848,44 ₽ 7,98 Запустить
rtx5090-8.44.256.480
262 144
tensor
8 1 034,08 ₽ 2,26 Запустить
h100-4.16.256.480
262 144
tensor
4 1 338,68 ₽ 7,96 Запустить
h100nvl-4.32.384.480
262 144
tensor
4 1 450,00 ₽ 11,91 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-4.16.256.480
262 144
tensor
4 818,68 ₽ 8,18 Запустить
h200-2.24.256.320
262 144
tensor
2 841,52 ₽ 6,02 Запустить
h200-2.24.256.320.nvlink
262 144
tensor
2 841,52 ₽ 6,02 Запустить
teslaa100-4.32.384.320.nvlink
262 144
tensor
4 848,44 ₽ 8,18 Запустить
rtx5090-8.44.256.480
262 144
tensor
8 1 034,08 ₽ 2,46 Запустить
h100-4.16.256.480
262 144
tensor
4 1 338,68 ₽ 8,16 Запустить
h100nvl-4.32.384.480
262 144
tensor
4 1 450,00 ₽ 12,11 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-8.44.512.480.nvlink
262 144
tensor
8 1 639,13 ₽ 17,15 Запустить
h200-4.32.768.480
262 144
tensor
4 1 717,59 ₽ 12,84 Запустить
h200-4.32.768.480.nvlink
262 144
tensor
4 1 717,59 ₽ 12,84 Запустить
dedicated-h100-8.96.768.5760-1.nvlink
262 144
tensor
8 2 804,12 ₽ 17,11 Запустить

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.