GLM-5.3 — флагманская модель семейства GLM-5 от Z.ai. Модель построена на базе GLM-5.2: DSA внимание, Mixture-of-Experts с 744 млрд параметров суммарно при 40 млрд активных на каждый токен, контекст в 1 048 576 токенов, и для эффективной работы предусмотрен MTP-слой для спекулятивного декодинга. Ключевая особенность релиза заключается в том, что все улучшения достигнуты исключительно за счёт масштабирования пост-тренировки (post-training). Разработчики существенно расширили набор сред для длительных задач, разнообразили тренировочные сценарии и увеличили вычислительные ресурсы, затраченные на обучение. Такой подход позволил добиться значительного прогресса в решении сложных задач программирования и длительных агентных сценариев и открыл новые возможности в части работы в сфере кибербезопасности. При этом основные веса модели, в отличии от GLM-5.2, распространяются в точности FP8, что снижает требования к памяти.
GLM-5.3 использует IndexShare - архитектурную инновацию, также унаследованную от GLM-5.2. Эта технология устраняет узкое место разреженного внимания — дорогостоящий индексатор, который на каждом слое вычисляет top‑k релевантных токенов за O(L²). Решая эту проблему, разработчики обратили внимание, что соседние слои трансформера формируют похожие паттерны внимания, поэтому вычислять их для всех слоев нет необходимости. IndexShare объединяет слои в группы: лишь небольшое число «полных» слоёв (Full layers) выполняет все вычисления индексатора, а все остальные «общие» слои (Shared layers) переиспользуют индексы от ближайшего полного слоя. Это сокращает вычисления индексатора до 75% и при контексте в 1 млн токенов.
По результатам бенчмарков GLM-5.3 демонстрирует отличные показатели, особенно в области программирования и длительных агентных задач. На Terminal Bench 3.0 модель набрала 28.3%, что значительно превосходит GLM-5.2 (4.6%), а на DeepSWE v1.1 — 66.9% против 46.2% у предыдущей версии. Модель занимает первое место (open-source SOTA) среди моделей с открытым весом на бенчмарках Terminal Bench 3.0 и Agents' Last Exam. Особого внимания заслуживает CyberGym (84.5%), где GLM-5.3 превосходит все сравниваемые модели, включая Kimi K3, DeepSeek-V4 Pro, GPT-5.6 Sol и Fable 5. На бенчмарке эксплуатации уязвимостей ExploitBench модель показывает 54.4%, более чем вдвое превосходя GLM-5.2 (24.4%). Также стоит отметить AutomationBench (48.2% против 26.2% у GLM-5.2) и HLE w/ Tools (62.5%), подтверждающие превосходство модели в задачах автоматизации и использования инструментов.
GLM-5.3 оптимизирован для длительных задач, где модель должна автономно работать часами и итеративно уточнять стратегию — прежде всего это агентная разработка ПО в терминале и IDE (Claude Code, ZCode, OpenCode): рефакторинг крупных репозиториев, решение SWE-задач с реальными баг-репортами, генерация целых репозиториев по текстовому описанию (NL2Repo), где контекст 1M токенов позволяет держать в памяти весь проект целиком. Близкий кейс — ML-инфраструктурные и research-задачи, где модель диагностирует узкие места в тренировочных стеках, запускает эксперименты оптимизирует пайплайны. Отдельно выделяется кибербезопасность и vulnerability research — белый поиск уязвимостей в исходном коде, построение цепочек эксплойтов и аудит open-source зависимостей. Для большинства задач по работе с кодом разработчики рекомендуют `reasoning_effort=max`, а для быстрых интерактивных чат-сценариев — `low` или `high` с `clear_thinking=true`.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
134 656 tensor |
4 | 1 719,14 ₽ | 2,45 | Запустить | ||
134 656 tensor |
4 | 1 719,14 ₽ | 2,45 | Запустить | ||
134 656 tensor |
8 | 2 804,12 ₽ | 2,21 | Запустить | ||
507 904 pipeline |
6 | 2 532,67 ₽ | 12,18 | Запустить | ||
507 904 tensor |
8 | 3 335,19 ₽ | 2,72 | Запустить | ||
507 904 tensor |
8 | 3 335,19 ₽ | 2,72 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
134 656 tensor |
8 | 3 338,30 ₽ | 2,96 | Запустить | ||
134 656 tensor |
8 | 3 338,30 ₽ | 2,96 | Запустить | ||
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.