Immers Foundation Models

 

  • В каталоге собраны наиболее популярные, свободно распространяемые нейросетевые модели от разработчиков со всего мира, включая большие языковые, мультимодальные и диффузионные модели. Попробуйте интересующие модели в одном месте.
  • Для знакомства с моделью и ее тестирования, вы можете воспользоваться публичным эндпоинтом. А для production и self-hosted, файнтюнинга или специфичных весов лучше арендовать виртуальный или выделенный сервер с GPU.

Ministral-3-14B-Instruct-2512

Ministral-3-14B-Instruct — самая мощная модель в семействе Ministral 3 с 14 млрд параметров. Обучена с применением технологии Cascade Distillation, обладает мультимодальными и агентными возможностями, поддерживает 256k контекста и квантованная версия может стабильно работать на оборудовании с 24 ГБ VRAM. Лицензия Apache 2.0.

мультимодальная
31.10.2025

Ministral-3-14B-Reasoning-2512

Крупнейшая рассуждающая модель в семействе Ministral 3 (13.5B языковая LLM + 0.4B визуальный энкодер), обеспечивающая передовые возможности размышления и мультимодального понимания. Демонстрирует производительность, сопоставимую с более крупной 24B Mistral Small 3.2, при значительно меньших требованиях к ресурсам.

размышляющая
мультимодальная
31.10.2025

Ministral-3-8B-Reasoning-2512

Сбалансированная модель в семействе Ministral 3 (8.4B LLM + 0.4B vision encoder), оптимизированная для эффективного выполнения сложных рассуждений на периферийных устройствах. Обеспечивает оптимальное соотношение производительности и ресурсов, отлично подходит для локального развёртывания.

размышляющая
мультимодальная
31.10.2025

Ministral-3-3B-Reasoning-2512

Ministral-3-3B-Reasoning-2512 — самая компактная рассуждающая, мультимодальная модель в семействе Ministral-3, оптимизированная для выполнения задач на периферийных и встраиваемых устройствах. Поддерживает контекстное окно 256k токенов и распространяется под лицензией Apache 2.0.

размышляющая
мультимодальная
31.10.2025

LongCat-Video

LongCat-Video — это базовая модель генерации видео с 13,6 миллиардами параметров, разработанная для выполнения задач: генерации видео по тексту (Text-to-Video), по изображению (Image-to-Video) и продолжения видео (Video-Continuation). Модель обеспечивает эффективную и качественную генерацию длительных видео (вплоть до нескольких минут) без дрейфа цвета или потери качества, что достигается за счет предобучения на задачах Video-Continuation.

24.10.2025

MiniMax-M2

Языковая модель, которая объединяет мощные способности к рассуждению (reasoning) с надежными навыками агента (agent), предназначенная для решения сложных, многошаговых задач в реальных динамических средах. Благодаря инновационному подходу к обучению с использованием высококачественных, разнообразных данных и "перемежающегося мышления", M2 эффективно сочетает высокую производительность на академических бенчмарках с исключительной устойчивостью и адаптивностью при работе с незнакомыми инструментами и сценариями

размышляющая
русскоязычная
22.10.2025

Qwen3-VL-2B-Thinking

Всего 2 миллиарда параметров, контекст 256К и возможность edge инференса. Это одна из самых маленьких visual reasoning-моделей, специализирующаяся на многоступенчатом рассуждении при визуальном анализе изображений и видео, то есть она почти буквально способна "думать, глядя на изображения". В отличие от Instruct-версии, эта модель генерирует развернутые цепочки мышления перед финальным ответом, что повышает точность, но сказывается на скорости работы.

размышляющая
мультимодальная
русскоязычная
22.10.2025

Qwen3-VL-2B-Instruct

Самая компактная модель из семейства мультимодальных Qwen3-VL. 2 миллиарда параметров, dense архитектура, оптимизирована для быстрых диалоговых систем и запуска на edge-устройствах. При этом модель сохраняет и поддерживает все передовые достижения серии: качественное понимание изображений, видео и текста, поддержку OCR на 32 языках, позиционирование объектов, тайминг и нативный контекст в 256K токенов.

мультимодальная
русскоязычная
22.10.2025

Qwen3-VL-32B-Instruct

Мощная мультимодальная модель с 32 миллиардами параметров и нативной поддержкой 256K контекста, обеспечивающая state-of-the-art качество мультимодального понимания. Модель превосходит на большинстве бенчмарков версию предыдущего поколения с 72B параметров, а также схожие по размеру решения GPT-5, Claude 4 и других разработчиков.

мультимодальная
русскоязычная
22.10.2025

Qwen3-VL-32B-Thinking

Reasoning-версия флагманской 32-миллиардной danse модели из семейства Qwen3-VL оптимизированная для многоэтапного мышления и решения сложнейших мультимодальных задач, требующих глубокого анализа и логических выводов на основе визуальной информации. Поддерживает нативный контекст 256K (с возможностью увеличения до 1М) и достигает state-of-the-art среди мультимодальных, рассуждающих моделей схожего размера.

размышляющая
мультимодальная
русскоязычная
22.10.2025

avision

Адаптированная под русский язык и специфику работы с объявлениями мультимодальная модель от Авито на базе Qwen2.5-VL-7B-Instruct с оптимизацией архитектуры. Модель обрабатывает русскоязычные запросы в 2 раза быстрее оригинала и значительно превосходит его в задачах генерации описаний для объявлений, сохраняя при этом универсальные способности работы с изображениями.

мультимодальная
русскоязычная
21.10.2025

avibe

Русскоязычная LLM от Авито на базе Qwen3-8B, с уникальным гибридным токенизатором, адаптированным под русские токены. Модель демонстрирует выдающиеся результаты на русскоязычных бенчмарках, особенно в математике и function calling, при этом благодаря оптимизированной архитектуре обрабатывает запросы на 15-25% быстрее оригинальной версии.

русскоязычная
20.10.2025

Krea Realtime 14B

Модель Krea Realtime 14B представляет собой дистилляцию модели Wan 2.1 14B (разработанной Wan-AI) для задач генерации видео на основе текста. Она была преобразована в автокорректирующуюся (autoregressive) модель с помощью метода Self-Forcing, что позволило достичь скорости инференса 11 кадров в секунду при использовании 4 шагов вывода на одном GPU NVIDIA B200. 

20.10.2025

DeepSeek-OCR

Инновационная VLM-модель для распознавания текста и парсинга документов, разработанная DeepSeek.ai в рамках исследований возможностей представления информации через визуальную модальность. Модель предлагает уникальный подход: вместо традиционных текстовых токенов, она использует визуальные токены для кодирования информации из документов,сжимая текст в 10–20 раз, при этом достигая точности OCR 97%.

мультимодальная
русскоязычная
20.10.2025

Qwen3-VL-4B-Thinking

Reasoning-оптимизированная версия 4B модели серии Qwen3-VL с контекстом 256К (и возможностью увеличения до 1М). Вывод ответа всегда задействует цепочки рассуждений, что позволяет решать непростые мультимодальные задачи, но сказывается на скорости. Демонстрирует производительность лишь немногим уступающую Qwen3-8B-VL при гораздо более скромных аппаратных требованиях.

размышляющая
мультимодальная
русскоязычная
15.10.2025

Qwen3-VL-8B-Instruct

Мультимодальная dense модель с 8 миллиардами параметров, оптимизированная для диалога и следования инструкциям, обеспечивающая понимание изображений, видео и текста. Поддерживает нативный контекст 256K токенов, расширенное OCR на 32 языках и работу визуального агента. Демонстрирует конкурентные результаты с более крупными моделями на ключевых бенчмарках.

мультимодальная
русскоязычная
15.10.2025

Qwen3-VL-8B-Thinking

Небольшая dense модель с 8-миллиардами параметров и усиленными возможностями пошагового рассуждения, специализирующаяся на сложных мультимодальных задачах, требующих глубокого анализа и отличного понимания визуального контента. Нативно поддерживает контекст в 256K токенов. Практически по всем ключевым бенчмаркам превосходит такие известные модели как Gemeni-2.5 Flash-Lite и GPT-5 nano high.

размышляющая
мультимодальная
русскоязычная
15.10.2025

Qwen3-VL-4B-Instruct

Компактная 4-миллиардная модель, сохраняющая полный функционал серии Qwen3-VL: скорость ответов, высококачественное мультимодальное понимание с пространственными и временными отметками. При этом существенно снижает требования к оборудованию – при использовании половины от нативно поддерживаемого контекста в 256K, модель стабильно работает всего на одной GPU с 24GB памяти.

мультимодальная
русскоязычная
15.10.2025

granite-4.0-h-small

Флагманская MoE модель линейки Granite-4.0 от IBM с 32B параметров (9B активных), архитектурой Mamba-2/трансформер. Обеспечивает производительность уровня крупных моделей при снижении требований к памяти на 70% и удвоенной скорости инференса. Оптимизированная для корпоративных задач RAG и агентских рабочих процессов.

русскоязычная
02.10.2025

granite-4.0-h-tiny

Компактная, гибридная модель архитектуры mamba2/transformers в сочетании с mixture of experts, где активируется только 1 млрд из 7 млрд параметров. Разработана для быстрого выполнения задач в том числе на периферийных устройствах и локального развертывания. Требует всего 8 ГБ памяти (в 8-битном формате) и обеспечивает высокую производительность в function calling при минимальных затратах ресурсов.

русскоязычная
02.10.2025

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.