GLM-5.3-Flash

размышляющая
мультимодальная
для кодинга

GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. До официального релиза модель тестировалась анонимно как ox-alpha на платформах OpenCode и OpenRouter и быстро стала самой популярной моделью недели по объёму обработанных токенов. Модель использует разреженную смесь экспертов (MoE) с 288 маршрутизируемыми экспертами и 8 активными на токен плюс один общий эксперт — таким образом, из 320 млрд общих параметров на каждом токене задействуется лишь около 18 млрд. Языковая часть содержит 45 слоёв, которая работает в связке с 24-слойным визуальным энкодер для обработки изображений и видео. Модель поддерживает настраиваемый бюджет рассуждений через параметр `reasoning_effort` с тремя уровнями: low, high и max (по умолчанию — max).

GLM-5.3-Flash построена на принципиально новой архитектуре, спроектированной вокруг эффективности инференса. Главная архитектурная инновация — гибридное внимание, впервые применённое в серии GLM. Оно объединяет два типа слоёв: 34 слоя линейного внимания Kimi Delta Attention (KDA) и 11 слоёв разреженного внимания DeepSeek Sparse Attention (DSA), чередующихся в фиксированном паттерне 3:1. Смысл гибрида в том, что локальное линейное внимание обрабатывает последовательность с постоянной вычислительной сложностью, не требуя хранения растущего KV-кэша, тогда как разреженное внимание анализирует контекст глобально, сохраняя точность на длинных дистанциях. На практике это снижает вычислительные затраты на внимание примерно в 3,01 раза и размер KV-кэша — в 4,44 раза по сравнению с архитектурой GLM-5.3.

Дополнительно модель использует Manifold-Constrained Hyper-Connections (mHC) — замену стандартного residual-потока, что позволяет стабилизировать обучение при масштабировании. Ещё одна деталь: слои Multi-head Latent Attention работают в режиме NoPE (без позиционного кодирования) — отслеживание позиций делегировано линейным слоям внимания.

Модель демонстрирует сильные результаты на агентных и кодинг-бенчмарках. DeepSWE v1.1 (оценка способности агента автономно решать задачи в реальной среде разработки) выросла с 46,2 у GLM-5.2 до 63,4 — это одно из крупнейших улучшений в серии. AutomationBench (проверка автоматизации рутинных рабочих процессов) поднялась с 26,2 до 48,8. Terminal-Bench 2.1 (работа в терминале и командной строке) достигла 84,3 — вплотную приблизившись к результату Claude Opus 4.8 (85,0). На GDPval-AA v2 (оценка практической ценности агента в реальных задачах) модель лидирует с 1773 Elo.

Благодаря нативной мультимодальности и гибридной архитектуре GLM-5.3-Flash подходит для широкого спектра задач. В первую очередь это агентные сценарии и автоматизация рабочих процессов. Далее отметим, еще одно сильное направление практического использования - разработка и программирование. Мультимодальный анализ позволяет интегрировать модель с процессы требующие понимания изображений, таблиц, диаграмм и видео. Отдельной строкой разработчики выделяют Office-сценарии полного цикла от изучения финансовых, юридических и любых других документов до построения на их основе отчетов, диаграмм, excel таблиц и презентаций. Не стоит забывать и о длине контекста, который позволяет справляться с вышеперечисленными задачами гораздо эффективнее и без дополнительных инструментов и итераций.


Дата анонса: 25.08.2026
Параметров: 322B
Экспертов: 288
Активно параметров при инференсе: 2B
Контекст: 1049K
Слоев: 45, с полным вниманием: 11
Тип внимания: Kimi Delta Attention (KDA) + DeepSeek Spare Attention (DSA)
Разработчик: Z.ai
Версия Transformers: 5.16.0
Версия vLLM: >=0.29.0
Лицензия: MIT

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с GLM-5.3-Flash. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга GLM-5.3-Flash

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-2.24.256.320
1 048 576
tensor
2 841,52 ₽ 2,86 Запустить
h200-2.24.256.320.nvlink
1 048 576
tensor
2 841,52 ₽ 2,86 Запустить
h100nvl-4.32.384.480
1 048 576
tensor
4 1 450,00 ₽ 3,53 Запустить
dedicated-h100-8.96.768.5760-1.nvlink
1 048 576
tensor
8 2 804,12 ₽ 5,12 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa100-8.44.512.480.nvlink
1 048 576
tensor
8 1 639,13 ₽ 14,32 Запустить
h200-4.32.768.480
1 048 576
tensor
4 1 717,59 ₽ 13,09 Запустить
h200-4.32.768.480.nvlink
1 048 576
tensor
4 1 717,59 ₽ 13,09 Запустить
dedicated-h100-8.96.768.5760-1.nvlink
1 048 576
tensor
8 2 804,12 ₽ 14,27 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-8.52.1024.960
1 048 576
tensor
8 3 338,30 ₽ 27,30 Запустить
h200-8.52.1024.960.nvlink
1 048 576
tensor
8 3 338,30 ₽ 27,30 Запустить

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.