GLM-5.3-Flash — первая нативно мультимодальная модель в серии GLM-5. До официального релиза модель тестировалась анонимно как ox-alpha на платформах OpenCode и OpenRouter и быстро стала самой популярной моделью недели по объёму обработанных токенов. Модель использует разреженную смесь экспертов (MoE) с 288 маршрутизируемыми экспертами и 8 активными на токен плюс один общий эксперт — таким образом, из 320 млрд общих параметров на каждом токене задействуется лишь около 18 млрд. Языковая часть содержит 45 слоёв, которая работает в связке с 24-слойным визуальным энкодер для обработки изображений и видео. Модель поддерживает настраиваемый бюджет рассуждений через параметр `reasoning_effort` с тремя уровнями: low, high и max (по умолчанию — max).
GLM-5.3-Flash построена на принципиально новой архитектуре, спроектированной вокруг эффективности инференса. Главная архитектурная инновация — гибридное внимание, впервые применённое в серии GLM. Оно объединяет два типа слоёв: 34 слоя линейного внимания Kimi Delta Attention (KDA) и 11 слоёв разреженного внимания DeepSeek Sparse Attention (DSA), чередующихся в фиксированном паттерне 3:1. Смысл гибрида в том, что локальное линейное внимание обрабатывает последовательность с постоянной вычислительной сложностью, не требуя хранения растущего KV-кэша, тогда как разреженное внимание анализирует контекст глобально, сохраняя точность на длинных дистанциях. На практике это снижает вычислительные затраты на внимание примерно в 3,01 раза и размер KV-кэша — в 4,44 раза по сравнению с архитектурой GLM-5.3.
Дополнительно модель использует Manifold-Constrained Hyper-Connections (mHC) — замену стандартного residual-потока, что позволяет стабилизировать обучение при масштабировании. Ещё одна деталь: слои Multi-head Latent Attention работают в режиме NoPE (без позиционного кодирования) — отслеживание позиций делегировано линейным слоям внимания.
Модель демонстрирует сильные результаты на агентных и кодинг-бенчмарках. DeepSWE v1.1 (оценка способности агента автономно решать задачи в реальной среде разработки) выросла с 46,2 у GLM-5.2 до 63,4 — это одно из крупнейших улучшений в серии. AutomationBench (проверка автоматизации рутинных рабочих процессов) поднялась с 26,2 до 48,8. Terminal-Bench 2.1 (работа в терминале и командной строке) достигла 84,3 — вплотную приблизившись к результату Claude Opus 4.8 (85,0). На GDPval-AA v2 (оценка практической ценности агента в реальных задачах) модель лидирует с 1773 Elo.
Благодаря нативной мультимодальности и гибридной архитектуре GLM-5.3-Flash подходит для широкого спектра задач. В первую очередь это агентные сценарии и автоматизация рабочих процессов. Далее отметим, еще одно сильное направление практического использования - разработка и программирование. Мультимодальный анализ позволяет интегрировать модель с процессы требующие понимания изображений, таблиц, диаграмм и видео. Отдельной строкой разработчики выделяют Office-сценарии полного цикла от изучения финансовых, юридических и любых других документов до построения на их основе отчетов, диаграмм, excel таблиц и презентаций. Не стоит забывать и о длине контекста, который позволяет справляться с вышеперечисленными задачами гораздо эффективнее и без дополнительных инструментов и итераций.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
1 048 576 tensor |
2 | 841,52 ₽ | 2,86 | Запустить | ||
1 048 576 tensor |
2 | 841,52 ₽ | 2,86 | Запустить | ||
1 048 576 tensor |
4 | 1 450,00 ₽ | 3,53 | Запустить | ||
1 048 576 tensor |
8 | 2 804,12 ₽ | 5,12 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
1 048 576 tensor |
8 | 1 639,13 ₽ | 14,32 | Запустить | ||
1 048 576 tensor |
4 | 1 717,59 ₽ | 13,09 | Запустить | ||
1 048 576 tensor |
4 | 1 717,59 ₽ | 13,09 | Запустить | ||
1 048 576 tensor |
8 | 2 804,12 ₽ | 14,27 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.