GLM-5.3

размышляющая
русскоязычная
для кодинга

GLM-5.3 — флагманская модель семейства GLM-5 от Z.ai. Модель построена на базе GLM-5.2: DSA внимание, Mixture-of-Experts с 744 млрд параметров суммарно при 40 млрд активных на каждый токен, контекст в 1 048 576 токенов, и для эффективной работы предусмотрен MTP-слой для спекулятивного декодинга. Ключевая особенность релиза заключается в том, что все улучшения достигнуты исключительно за счёт масштабирования пост-тренировки (post-training). Разработчики существенно расширили набор сред для длительных задач, разнообразили тренировочные сценарии и увеличили вычислительные ресурсы, затраченные на обучение. Такой подход позволил добиться значительного прогресса в решении сложных задач программирования и длительных агентных сценариев и открыл новые возможности в части работы в сфере кибербезопасности. При этом основные веса модели, в отличии от GLM-5.2, распространяются в точности FP8, что снижает требования к памяти.

GLM-5.3 использует IndexShare - архитектурную инновацию, также унаследованную от GLM-5.2. Эта технология устраняет узкое место разреженного внимания — дорогостоящий индексатор, который на каждом слое вычисляет top‑k релевантных токенов за O(L²). Решая эту проблему, разработчики обратили внимание, что соседние слои трансформера формируют похожие паттерны внимания, поэтому вычислять их для всех слоев нет необходимости. IndexShare объединяет слои в группы: лишь небольшое число «полных» слоёв (Full layers) выполняет все вычисления индексатора, а все остальные «общие» слои (Shared layers) переиспользуют индексы от ближайшего полного слоя. Это сокращает вычисления индексатора до 75% и при контексте в 1 млн токенов.

По результатам бенчмарков GLM-5.3 демонстрирует отличные показатели, особенно в области программирования и длительных агентных задач. На Terminal Bench 3.0 модель набрала 28.3%, что значительно превосходит GLM-5.2 (4.6%), а на DeepSWE v1.1 — 66.9% против 46.2% у предыдущей версии. Модель занимает первое место (open-source SOTA) среди моделей с открытым весом на бенчмарках Terminal Bench 3.0 и Agents' Last Exam. Особого внимания заслуживает CyberGym (84.5%), где GLM-5.3 превосходит все сравниваемые модели, включая Kimi K3, DeepSeek-V4 Pro, GPT-5.6 Sol и Fable 5. На бенчмарке эксплуатации уязвимостей ExploitBench модель показывает 54.4%, более чем вдвое превосходя GLM-5.2 (24.4%). Также стоит отметить AutomationBench (48.2% против 26.2% у GLM-5.2) и HLE w/ Tools (62.5%), подтверждающие превосходство модели в задачах автоматизации и использования инструментов.

GLM-5.3 оптимизирован для длительных задач, где модель должна автономно работать часами и итеративно уточнять стратегию — прежде всего это агентная разработка ПО в терминале и IDE (Claude Code, ZCode, OpenCode): рефакторинг крупных репозиториев, решение SWE-задач с реальными баг-репортами, генерация целых репозиториев по текстовому описанию (NL2Repo), где контекст 1M токенов позволяет держать в памяти весь проект целиком. Близкий кейс — ML-инфраструктурные и research-задачи, где модель диагностирует узкие места в тренировочных стеках, запускает эксперименты оптимизирует пайплайны. Отдельно выделяется кибербезопасность и vulnerability research — белый поиск уязвимостей в исходном коде, построение цепочек эксплойтов и аудит open-source зависимостей. Для большинства задач по работе с кодом разработчики рекомендуют `reasoning_effort=max`, а для быстрых интерактивных чат-сценариев — `low` или `high` с `clear_thinking=true`.


Дата анонса: 25.08.2026
Параметров: 754B
Экспертов: 256
Активно параметров при инференсе: 40B
Контекст: 1049K
Слоев: 78
Тип внимания: DeepSeek Sparse Attention
Разработчик: Z.ai
Версия Transformers: 5.15.0
Версия vLLM: >=0.28.0
Лицензия: GLM-5.3 License

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с GLM-5.3. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга GLM-5.3

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-4.32.768.640
134 656
tensor
4 1 719,14 ₽ 2,45 Запустить
h200-4.32.768.640.nvlink
134 656
tensor
4 1 719,14 ₽ 2,45 Запустить
dedicated-h100-8.96.768.5760-1.nvlink
134 656
tensor
8 2 804,12 ₽ 2,21 Запустить
h200-6.52.896.640
507 904
pipeline
6 2 532,67 ₽ 12,18 Запустить
h200-8.52.1024.640
507 904
tensor
8 3 335,19 ₽ 2,72 Запустить
h200-8.52.1024.640.nvlink
507 904
tensor
8 3 335,19 ₽ 2,72 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
h200-8.52.1024.960
134 656
tensor
8 3 338,30 ₽ 2,96 Запустить
h200-8.52.1024.960.nvlink
134 656
tensor
8 3 338,30 ₽ 2,96 Запустить
Для данной модели, контекста и квантизации пока нет подходящих конфигураций.

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.