Модель Granite‑4.1‑3B – самый маленький представитель семейства 4.1 плотных нейросетей от IBM. Она использует проверенную архитектуру decoder‑only с полным вниманием, что в сочетании с высококачественными данными и многоступенчатым пайплайном обучения позволяет компенсировать небольшой размер и маршрутизацию. В отличие от старших версий, трёхмиллиардная модификация ориентирована на максимальную эффективность при ограниченных ресурсах, однако сохраняет конкурентоспособность в ключевых метриках. Архитектурные элементы типичны для линейки: GQA для экономии памяти, RoPE для длинных контекстов, SwiGLU, RMSNorm и раздельные эмбеддинги.
Этапы предобучения совпадают с общей стратегией: пять фаз на корпусе из 15 трлн токенов с распределением по источникам (CommonCrawl ~59%, код ~20%, математика ~7%, техдокументация ~10.5%, многоязычие ~2%, предметные данные ~1.5%). Третья и четвёртая фазы – это промежуточное джообучение на очищенных выборках с постепенным затуханием скорости, пятая – наращивание окна до 512K. Пост‑тренинг включает supervised fine‑tuning на 4.1 млн образцов с оценкой от LLM‑асессора и подкрепляющее обучение через GRPO с DAPO‑лоссом, что существенно улучшает показатели в математике, программировании и диалогах.
Несмотря на компактность, результаты бенчмарков выглядят вполне достойно: MMLU (5‑shot) – 67.02%, MMLU‑Pro (5‑shot, CoT) – 49.83%, GSM8K (8‑shot) – 86.88%, DeepMind Math (0‑shot, CoT) – 64.64%, HumanEval pass@1 – 79.27%, MBPP pass@1 – 61.64%, BBH (3‑shot, CoT) – 75.83%, AGI EVAL – 65.16%. Эти достижения сопоставимы с моделями вдвое большего размера, что служит подтверждением удачного выбора обучающей методологии.
Сценарии использования Granite 4.1‑3B сосредоточены вокруг развёртывания в средах с жёсткими лимитами по памяти и вычислительной мощности. Поддержка FP8‑квантования и базовый малый размер модели позволяют запускать её локально на устройствах, в мобильных приложениях и даже в IoT‑шлюзах. При этом она не теряет способности к интеграции с внешними инструментами и аккуратному выполнению инструкций, что делает её пригодной для построения несложных агентов и RAG‑систем или использовать ее в качестве диалогового ассистента и в пайплайнах различных корпоративных процедур.
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 46,94 ₽ | 1,51 | Запустить | ||
131 072 tensor |
2 | 51,34 ₽ | 1,79 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 1,61 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 1,60 | Запустить | ||
131 072 pipeline |
3 | 127,37 ₽ | 1,33 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 3,43 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 2,32 | Запустить | ||
131 072 tensor |
4 | 162,57 ₽ | 1,95 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 6,73 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 6,73 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 8,01 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 13,68 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 12,30 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 24,82 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 46,94 ₽ | 1,34 | Запустить | ||
131 072 tensor |
2 | 51,34 ₽ | 1,61 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 1,44 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 1,43 | Запустить | ||
131 072 pipeline |
3 | 127,37 ₽ | 1,16 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 3,26 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 2,15 | Запустить | ||
131 072 tensor |
4 | 162,57 ₽ | 1,78 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 6,56 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 6,55 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 7,83 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 13,51 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 12,13 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 24,65 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 46,94 ₽ | 1,09 | Запустить | ||
131 072 tensor |
2 | 51,34 ₽ | 1,37 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 1,19 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 1,19 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 3,02 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 1,91 | Запустить | ||
131 072 tensor |
4 | 162,57 ₽ | 1,53 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 6,32 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 6,31 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 7,59 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 13,26 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 11,89 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 24,41 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.