Qwen3.8-2.4T-A95B

размышляющая
русскоязычная
для кодинга

Qwen3.8-2.4T-A95B — это первая открытая модель уровня Qwen‑Max от команды Qwen. Она построена на архитектуре MoE с общим объёмом параметров 2,4 триллиона, однако при каждом шаге вывода активируется лишь около 95 миллиардов параметров. Благодаря этому модель обеспечивает выдающуюся производительность при эффективном использовании вычислительных ресурсов. Нативный контекст модели составляет 262 144 токена, но его можно расширить до 1 миллиона токенов. Модель ориентирована на сложные задачи программирования, офисные задачи, исследования и многошаговые агентные сценарии.

В основе архитектуры лежит гибридный механизм внимания представленный в серии Qwen3.5. Модель состоит из 92 слоёв, сгруппированных в 23 повторяющихся блока. В каждом блоке сначала идут три слоя Gated DeltaNet (линейное внимание) с последующим MoE, затем один слой Gated Attention (полное внимание) с последующим MoE. Каждый MoE‑слой содержит 512 экспертов, из которых на каждом шаге активируются 10 маршрутизируемых экспертов. Такое сочетание линейного и полного внимания позволяет модели эффективно работать с длинными контекстами, сохраняя при этом глубокое понимание.

На ключевых бенчмарках модель демонстрирует выдающиеся результаты. В PaperBench (оценка воспроизведения научных статей) Qwen3.8-2.4T-A95B набрала 93,0 балла, опередив GPT 5.6 Sol (90,5) и Claude Opus 4.8 (80,3) и заняв первое место. В PLawBench (юридические задачи) результат 73,2 также является лучшим среди представленных моделей. Модель лидирует в FrontierSWE (73,5), WideSearch (81,9), HealthBench (60,2) и IFBench (82,8), обгоняя как закрытые флагманы, так и предыдущую версию Qwen3.7-Max. В задачах на длинный контекст MRCR v2 256K (поиск «иголки в стоге сена») модель показала 92,9%, что близко к лидеру и значительно превосходит Qwen3.7-Max (86,7%). В программировании отличные показатели в Terminal Bench 2.1 (86,6), AndroidBench (75,1) и внутренних бенчмарках QwenSWEBench (80,7) и QwenReactBench (1724 Elo) подтверждают её статус одной из сильнейших моделей для разработки.

Ключевое преимущество модели — её способность решать сложные, комплексные задачи от начала до конца. Она превосходно справляется с самостоятельным планированием, обработкой обратной связи от окружения и выполнением длительных многошаговых сценариев. Также модель поддерживает гибкое управление глубиной рассуждений через параметр `reasoning_effort` и сохранение истории рассуждений (`preserve_thinking`), что позволяет адаптировать вычислительные затраты под сложность конкретной задачи. Но стоит отметить, что в отличии от открытых моделей серии 3.5, 3.6 эта модель не мультимодальная и обрабатывает только текст.

Сценарии использования охватывают широкий спектр областей: от программирования и разработки ПО — включая полный цикл создания проектов с нуля, автономную генерацию кода и тестов, работу с pull request'ами и CI‑проверками, где модель показывает выдающиеся результаты в агентных задачах, — до научных исследований, где она помогает воспроизводить и улучшать эксперименты из научных статей, а также проводить анализ и синтез новых идей. Кроме того, модель эффективна в долгосрочных агентных задачах, требующих планирования, выполнения и итеративного уточнения решений в сложных динамических средах, и в профессиональной офисной работе, включая ответы на сложные вопросы по документам (юриспруденция, финансы, медицина), генерацию отчётов, аналитику и экспертные рассуждения в различных предметных областях.


Дата анонса: 08.08.2026
Параметров: 3T
Экспертов: 512
Активно параметров при инференсе: 95B
Контекст: 263K
Слоев: 92, с полным вниманием: 23
Тип внимания: Hybrid Attention
Тип Mamba: Gated Delta Net
Разработчик: Qwen
Версия Transformers: 4.57.3
Версия vLLM: >=0.25.0
Лицензия: Qwen3.8-Max License

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с Qwen3.8-2.4T-A95B. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга Qwen3.8-2.4T-A95B

Для данной модели, контекста и квантизации пока нет подходящих конфигураций.
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.