Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель с 125 млрд параметров (6 млрд активируются на токен) и 51 млрд параметров N‑граммных встраиваний. Она предваряет архитектуру Qwen4 и предлагает системное переосмысление внимания, остаточных соединений и оптимизации. Модель поддерживает контекст до 262 144 токенов нативно и до 1 000 000 с YaRN.
В основе лежит гибридное внимание с чередованием 3:1: три рекуррентных слоя Gated DeltaNet (GDN) на один слой Qwen Sparse Attention (QSA). GDN сжимает историю в матричное состояние фиксированного размера, обновляя его по дельта-правилу – это предотвращает накопление дубликатов и делает память устойчивой к шуму на сверхдлинных контекстах. QSA представляет собой глобальное внимание в гибриде, но в отличие от полного внимания, используемого в архитектурах начиная с qwen3-next, является не плотным, а разряженным и состоит из лёгкого индексера (сжимает ключи в блоки по 4 токена и отбирает top‑K релевантных) и разреженного ядра, которое вычисляет полное внимание только по отобранному подмножеству. Это даёт линейно-сублинейную сложность на длинных последовательностях в отличии от квадратичной у предшественников.
Среди других новшеств – N‑граммная таблица (200 млн записей, 51 млрд параметров) на хосте, которая асинхронно подгружается и добавляет векторы к представлениям токенов на втором слое, улучшая качество почти без вычислительных затрат и без увеличения VRAM. Gated Residual (GR) расширяет остаточный поток до четырёх параллельных ветвей, маршрутизируя информацию между слоями, а оптимизатор Muon заменяет AdamW, ускоряя сходимость больших матриц и обеспечивая стабильность обучения.
На ключевых бенчмарках модель занимает первые места в своём классе. В агентном программировании DeepSWE 1.1 модель набирает 58.7%, опережая DeepSeek-V4-Flash-0731 (54.4%); на SWE-bench Pro — 62.5% против 56.0% у DeepSeek и 53.4% у Claude-Opus-4.6. На научном бенчмарке GPQA Diamond модель достигает 91.7%, обходя все перечисленные аналоги. В соревновательном программировании LiveCodeBench v6 — 91.9% против 90.6% у DeepSeek и 88.8% у Claude. В многопрофильных агентных задачах Agents' Last Exam модель набирает 51.2 балла, значительно превосходя Qwen3.7-Plus (33.6). В целом из 12 базовых тестов модель лидирует в 10 из них.
Благодаря эффективности и высокой производительности модель идеально подходит для: автономных ИИ-агентов, выполняющих сложные многошаговые сценарии в задачах программирования, офисной работе; при обработке документов (юридических контрактов, научных статей, кодовых баз и т. д.). Не стоит забывать и про мультимодальные возможности, которые позволяют встраивать модель в процедуры, требующие анализа изображений и видео.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
262 144 tensor |
4 | 818,68 ₽ | 7,98 | Запустить | ||
262 144 tensor |
2 | 841,52 ₽ | 5,82 | Запустить | ||
262 144 tensor |
2 | 841,52 ₽ | 5,82 | Запустить | ||
262 144 tensor |
4 | 848,44 ₽ | 7,98 | Запустить | ||
262 144 tensor |
8 | 1 034,08 ₽ | 2,26 | Запустить | ||
262 144 tensor |
4 | 1 338,68 ₽ | 7,96 | Запустить | ||
262 144 tensor |
4 | 1 450,00 ₽ | 11,91 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
262 144 tensor |
4 | 818,68 ₽ | 8,18 | Запустить | ||
262 144 tensor |
2 | 841,52 ₽ | 6,02 | Запустить | ||
262 144 tensor |
2 | 841,52 ₽ | 6,02 | Запустить | ||
262 144 tensor |
4 | 848,44 ₽ | 8,18 | Запустить | ||
262 144 tensor |
8 | 1 034,08 ₽ | 2,46 | Запустить | ||
262 144 tensor |
4 | 1 338,68 ₽ | 8,16 | Запустить | ||
262 144 tensor |
4 | 1 450,00 ₽ | 12,11 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
262 144 tensor |
8 | 1 639,13 ₽ | 17,15 | Запустить | ||
262 144 tensor |
4 | 1 717,59 ₽ | 12,84 | Запустить | ||
262 144 tensor |
4 | 1 717,59 ₽ | 12,84 | Запустить | ||
262 144 tensor |
8 | 2 804,12 ₽ | 17,11 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.