Gemma-4-E2B-it — это самая компактная и энергоэффективная модель в линейке, предназначенная для работы в условиях предельно ограниченных ресурсов. Как и версия E4B, модель использует технику Per-Layer Embeddings (PLE), позволяющую достичь высокой производительности при минимальном потреблении памяти. Общий объем параметров модели составляет 5.1 миллиарда, но во время вывода активна лишь эффективная часть — 2.3 миллиарда. Модель построена на 35 слоях, поддерживает контекстное окно в 128 тысяч токенов и использует гибридное внимание со скользящим окном на 512 токенов.
E2B является полностью мультимодальной и способна обрабатывать не только текст и изображения, но и аудио (оснащена аудио-энкодером на ~300M параметров). Этот набор возможностей при крайне низких требованиях к памяти делает модель уникальной в своём классе. Разработчики подчеркивают, что E2B специально спроектирована для эффективного локального использования на ноутбуках и мобильных устройствах. По оценкам сообщества, модель способна работать на устройствах с оперативной памятью менее 1.5 ГБ, включая смартфоны.
Несмотря на скромный размер, E2B демонстрирует впечатляющие результаты. По многочисленным независимым оценкам сообщества, эта модель превосходит Gemma-3 27B в некоторых задачах несмотря на то, что её эффективный размер в 12 раз меньше. Разработчики особенно рекомендуют E2B для рутинных агентных процессов, задач оптического распознавания символов (OCR) и сценариев, где критически важны низкая задержка и возможность инференса на периферийных устройствах. При этом лицензия Apache 2.0 открывает широкие возможности для внедрения модели в самые разнообразные коммерческие приложения.
С рекомендации по использованию модели от разработчиков можно ознакомиться по этой ссылке - https://ai.google.dev/gemma/docs/core/model_card_4?hl=ru
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 73,73 ₽ | 217.80 | 16,45 | Запустить | |
131 072 |
1 | 46,94 ₽ | 145.50 | 14,29 | Запустить | |
131 072 |
1 | 91,14 ₽ | 253.75 | 15,37 | Запустить | |
131 072 |
1 | 211,77 ₽ | 215.75 | 68,14 | Запустить | |
131 072 |
1 | 341,77 ₽ | 238.45 | 67,36 | Запустить | |
131 072 |
1 | 367,41 ₽ | 255.85 | 80,91 | Запустить | |
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 73,73 ₽ | 162.70 | 14,62 | Запустить | |
131 072 |
1 | 46,94 ₽ | 108.28 | 13,40 | Запустить | |
131 072 |
1 | 91,14 ₽ | 166.56 | 14,57 | Запустить | |
131 072 |
1 | 341,77 ₽ | 205.98 | 66,68 | Запустить | |
131 072 |
1 | 367,41 ₽ | 80,25 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 2,16 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 77.20 | 11,24 | Запустить | |
131 072 |
1 | 73,73 ₽ | 124.89 | 12,43 | Запустить | |
131 072 tensor |
2 | 86,54 ₽ | 2,54 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 12,38 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 18,52 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 21,35 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 65,66 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 64,74 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 78,38 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 70,07 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 123,94 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 129,13 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.