granite-4.1-3b

для кодинга

Модель Granite‑4.1‑3B – самый маленький представитель семейства 4.1 плотных нейросетей от IBM. Она использует проверенную архитектуру decoder‑only с полным вниманием, что в сочетании с высококачественными данными и многоступенчатым пайплайном обучения позволяет компенсировать небольшой размер и маршрутизацию. В отличие от старших версий, трёхмиллиардная модификация ориентирована на максимальную эффективность при ограниченных ресурсах, однако сохраняет конкурентоспособность в ключевых метриках. Архитектурные элементы типичны для линейки: GQA для экономии памяти, RoPE для длинных контекстов, SwiGLU, RMSNorm и раздельные эмбеддинги.

Этапы предобучения совпадают с общей стратегией: пять фаз на корпусе из 15 трлн токенов с распределением по источникам (CommonCrawl ~59%, код ~20%, математика ~7%, техдокументация ~10.5%, многоязычие ~2%, предметные данные ~1.5%). Третья и четвёртая фазы – это промежуточное джообучение на очищенных выборках с постепенным затуханием скорости, пятая – наращивание окна до 512K. Пост‑тренинг включает supervised fine‑tuning на 4.1 млн образцов с оценкой от LLM‑асессора и подкрепляющее обучение через GRPO с DAPO‑лоссом, что существенно улучшает показатели в математике, программировании и диалогах.

Несмотря на компактность, результаты бенчмарков выглядят вполне достойно: MMLU (5‑shot) – 67.02%, MMLU‑Pro (5‑shot, CoT) – 49.83%, GSM8K (8‑shot) – 86.88%, DeepMind Math (0‑shot, CoT) – 64.64%, HumanEval pass@1 – 79.27%, MBPP pass@1 – 61.64%, BBH (3‑shot, CoT) – 75.83%, AGI EVAL – 65.16%. Эти достижения сопоставимы с моделями вдвое большего размера, что служит подтверждением удачного выбора обучающей методологии.

Сценарии использования Granite 4.1‑3B сосредоточены вокруг развёртывания в средах с жёсткими лимитами по памяти и вычислительной мощности. Поддержка FP8‑квантования и базовый малый размер модели позволяют запускать её локально на устройствах, в мобильных приложениях и даже в IoT‑шлюзах. При этом она не теряет способности к интеграции с внешними инструментами и аккуратному выполнению инструкций, что делает её пригодной для построения несложных агентов и RAG‑систем или использовать ее в качестве диалогового ассистента и в пайплайнах различных корпоративных процедур.


Дата анонса: 06.04.2026
Параметров: 4B
Контекст: 132K
Слоев: 40
Тип внимания: Full Attention
Разработчик: IBM
Версия Transformers: 4.53.3
Версия vLLM: >=0.17.0
Лицензия: Apache 2.0

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с granite-4.1-3b. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга granite-4.1-3b

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 1,51 Запустить
teslaa2-2.16.32.160
131 072
tensor
2 51,34 ₽ 1,79 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 1,61 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 1,60 Запустить
rtx3080-3.16.64.160
131 072
pipeline
3 127,37 ₽ 1,33 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 3,43 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 2,32 Запустить
rtx3080-4.16.64.160
131 072
tensor
4 162,57 ₽ 1,95 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 6,73 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 6,73 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 8,01 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 13,68 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 12,30 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 24,82 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 1,34 Запустить
teslaa2-2.16.32.160
131 072
tensor
2 51,34 ₽ 1,61 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 1,44 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 1,43 Запустить
rtx3080-3.16.64.160
131 072
pipeline
3 127,37 ₽ 1,16 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 3,26 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 2,15 Запустить
rtx3080-4.16.64.160
131 072
tensor
4 162,57 ₽ 1,78 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 6,56 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 6,55 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 7,83 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 13,51 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 12,13 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 24,65 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 1,09 Запустить
teslaa2-2.16.32.160
131 072
tensor
2 51,34 ₽ 1,37 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 1,19 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 1,19 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 3,02 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 1,91 Запустить
rtx3080-4.16.64.160
131 072
tensor
4 162,57 ₽ 1,53 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 6,32 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 6,31 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 7,59 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 13,26 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 11,89 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 24,41 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.