Immers Foundation Models

 

  • В каталоге собраны наиболее популярные, свободно распространяемые нейросетевые модели от разработчиков со всего мира, включая большие языковые, мультимодальные и диффузионные модели. Попробуйте интересующие модели в одном месте.
  • Для знакомства с моделью и ее тестирования, вы можете воспользоваться публичным эндпоинтом. А для production и self-hosted, файнтюнинга или специфичных весов лучше арендовать виртуальный или выделенный сервер с GPU.

NVIDIA-Nemotron-3-Nano-30B-A3B

Модель от компании NVIDIA с 31,6B параметров (3,5B активных) специально оптимизированная для высокопроизводительных агентских систем. Модель использует гибридную архитектуру Mamba-Transformer MoE, обеспечивающую одновременно экономию памяти, высокую пропускную способность, рассуждения и точность ответов и на контекстах до 1М токенов.

размышляющая
русскоязычная
можно попробовать
15.12.2025

GLM-4.6V

Мультимодальная модель с 106B параметров, архитектурой MoE и контекстом 128K токенов. Её ключевая особенность заключается в нативной поддержке вызова инструментов, позволяющей напрямую работать с изображениями как входными и выходными данными, что делает её идеальной платформой для создания сложных AI-агентов для анализа документов, визуального поиска и автоматизации процесса фронт-энд разработки.

размышляющая
мультимодальная
русскоязычная
07.12.2025

GLM-4.6V-Flash

Компактная 9-миллиардная мультимодальная модель с контекстом 128K токенов и нативной поддержкой визуального Function Calling. Достигает state-of-the-art результатов на бенчмарках MMBench, MathVista и OCRBench среди моделей сопоставимого размера, оптимизирована для локального развёртывания и агентных сценариев.

размышляющая
мультимодальная
русскоязычная
07.12.2025

LongCat-Image-Edit

Модель для редактирования изображений, разработанная на основе LongCat-Image. Она поддерживает билингвальное (китайско-английское) редактирование, демонстрируя ведущие показатели среди открытых моделей в части соблюдения инструкций, качества изображений и сохранения визуальной консистентности.

05.12.2025

LongCat-Image

Открытая мультиязычная (китайский и английский) фундаментальная модель для генерации изображений, разработанная для решения ключевых проблем в области мультиязычного отображения текста, фотореализма, эффективности развертывания и удобства использования для разработчиков.

04.12.2025

DeepSeek-V3.2

Модель от DeepSeek-Ai с продвинутыми возможностями рассуждений и агентскими функциями, сочетающая высокую вычислительную эффективность с производительностью на уровне GPT-5. Благодаря архитектуре разреженного внимания (DSA) и уникальной механике «мышления внутри вызова инструментов», модель идеально подходит для создания автономных агентов, обеспечивая баланс между скоростью, затратами ресурсов и сложностью решаемых задач.

размышляющая
русскоязычная
01.12.2025

DeepSeek-V3.2-Speciale

Специализированная версия DeepSeek-V3.2 для глубоких рассуждений достигающая уровня GPT-5 и Gemini-3.0-Pro в решении сложных задач в области олимпиадной математики и программирования. Модель не поддерживает вызов инструментов, но обладает неограниченной глубиной «мышления», которая и позволяет ей добиваться феноменальных результатов в обозначенных узкоспециализированных областях знания. DeepSeek-V3.2-Speciale стала первой открытой моделью, достигшей золотых медалей на крупнейших международных олимпиадах по математике и информатике.

размышляющая
русскоязычная
01.12.2025

Ovis-Image-7B

Модель с 7 миллиардами параметров, разработанная для генерации изображений высокого качества с акцентом на точное отображение текста, при этом оптимизированная для работы на ограниченных вычислительных ресурсах. Модель построена на основе предшественника Ovis-U1 и предназначена для эффективной работы на одном высокопроизводительном GPU.  

28.11.2025

GigaChat3-702B-A36B-preview

Флагманская и самая большая на момент выхода русскоязычная instruct-модель на базе архитектуры Mixture-of-Experts (MoE) с 702B общих и 36B активных параметров. Модель интегрирует Multi-head Latent Attention (MLA) и Multi-Token Prediction (MTP), обеспечивая высокую пропускную способность при инференсе и оптимизирована для работы в fp8. GigaChat 3 Ultra Preview работает с контекстом в 128К токенов, демонстрирует сильные результаты на задачах генерации текста, программировании, математики и обеспечивает наиболее глубокое понимание русского языка и культуры.

русскоязычная
19.11.2025

Kandinsky-5.0-T2I-Lite-sft-Diffusers

Kandinsky-5.0-T2I-Lite-sft-Diffusers — это text-to-image (T2I) модель с 6 миллиардами параметров, разработанная для генерации изображений на основе текстовых запросов. Модель относится к семейству Kandinsky 5.0, которое включает модели для генерации видео и изображений.

19.11.2025

Kandinsky-5.0-I2I-Lite-sft-Diffusers

Kandinsky-5.0-I2I-Lite-sft-Diffusers — это image-to-image (I2I) модель с 6 миллиардами параметров, разработанная для изменения изображений на основе текстовых запросов. Модель относится к семейству Kandinsky 5.0, которое включает модели для генерации видео и изображений.

19.11.2025

GigaChat3-10B-A1.8B

Компактная диалоговая MoE‑модель семейства GigaChat с 10 млрд общих и 1,8 млрд активных параметров, оптимизированная под высокую скорость инференса и локальный/высоконагруженный продакшен (упрощенное наименование GigaChat 3 Lightning). По качеству понимания русского языка она превосходит популярные модели масштаба 3–4B, при этом работает существенно быстрее.

русскоязычная
19.11.2025

HunyuanVideo-1.5

HunyuanVideo-1.5 — это модель генерации видео по тексту (text-to-video) и изображению (image-to-video) с 8,3 млрд параметров, обеспечивающая высокое качество видео при относительно низких вычислительных затратах. Она разработана для работы на потребительских GPU, что делает её доступной для разработчиков и создателей контента.

18.11.2025

FLUX.2-dev

Модель на основе rectified flow transformer с 32 миллиардами параметров, разработанная для генерации, редактирования и комбинирования изображений на основе текстовых инструкций. Поддерживает задачи генерации изображений по тексту, редактирование с одиночным референсом и многореференсное редактирование, без необходимости дополнительной настройки. Обучена с использованием метода дистилляции с подсказками для повышения эффективности, оптимизирована для исследовательских и творческих задач при условии некоммерческого использования.

18.11.2025

Kandinsky-5.0-I2V-Pro-sft-5s-Diffusers

Модель Kandinsky-5.0-I2V-Pro-sft-5s-Diffusers относится к серии Kandinsky 5.0 Pro и предназначена для генерации видео высокого качества. Она содержит 19 миллиардов параметров и поддерживает форматы разрешения HD и другие.

12.11.2025

Kandinsky-5.0-T2V-Pro-sft-5s-Diffusers

Это модель для генерации видео на основе текста. Она включает 19 миллиардов параметров и обеспечивает высокое качество генерации в формате HD. Модель относится к семейству Kandinsky 5.0, которое включает модели для генерации видео и изображений.

12.11.2025

ERNIE-4.5-VL-28B-A3B-Thinking

Компактная мультимодальная модель от Baidu, построенная на новаторской архитектуре гетерогенной архитектуре Mixture-of-Experts (MoE), отделяющую параметры для текстовых и визуальных экспертов. На инверенсе активируются только 3 миллиардов параметров при общем размере модели в 28 миллиардов параметров. Модель представляет собой обновленную версию базовой ERNIE-4.5-VL-28B-A3B, специально оптимизированную для задач мультимодального рассуждения через режим "мышления". Поддерживает работу с изображениями, видео, визуальную привязку (grounding) и вызов инструментов при нативной максимальной длине контекста 131K токенов и выгодно отличается умеренными требованиями к вычислительным ресурсам.

размышляющая
мультимодальная
07.11.2025

Kimi-K2-Thinking

Самая большая на момент выхода открытая reasoning-модель от Moonshot AI с архитектурой Mixture-of-Experts (1T параметров, 32B активных), способная выполнять 200–300 последовательных вызовов инструментов без деградации качества, при этом чередовать вызовы функций с цепочками рассуждений. Модель поддерживает контекст 256K токенов, оснащена нативной INT4-квантизацией, что способствует ускорению инференса практически без потери точности и использует механизм Multi-Head Latent Attention (MLA) для эффективной работы с длинными последовательностями. Kimi K2 Thinking устанавливает новые рекорды среди open-source моделей, а по целому ряду бенчмарков превосходит лучшие коммерческие проекты такие как GPT-5 и Claude Sonnet 4.5.

размышляющая
русскоязычная
04.11.2025

Ministral-3-3B-Instruct-2512

Ministral-3-3B-Instruct — самая компактная модель семейства Ministral 3. При 3 млрд параметров, мультимодальность, 256k контекст и агентные функции. Идеальна для локального развертывания и прототипирования.

мультимодальная
31.10.2025

Ministral-3-8B-Instruct-2512

Ministral-3-8B-Instruct — сбалансированная мультимодальная модель на 8 млрд параметров. Сочетает высокую производительность с низкими системными требованиями, поддерживает 256k контекст, уверенно реализует агентные функции и поддерживает более 10 языков.

мультимодальная
31.10.2025

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.