Kandinsky 3.0

Kandinsky-3 — это диффузионная модель для генерации изображений на основе текстового описания, разработанная на основе предыдущих версий семейства Kandinsky2-x. Она улучшена за счет увеличения объема обучающих данных, в том числе включающих информацию, связанную с русской культурой, что позволяет генерировать изображения, отражающие эту тематику. Модель также демонстрирует улучшенное понимание текста и повышение качества визуальных результатов благодаря увеличению размеров текстового энкодера и модели Diffusion U-Net.

Модель состоит из трех компонентов:

  • Text encoder на основе Flan-UL2 (часть энкодера) с 8,6 миллиардами параметров.
  • Latent Diffusion U-Net с 3 миллиардами параметров.
  • MoVQ энкодер/декодер с 267 миллионами параметров.

Базовая модель обучена за 2 млн шагов на 400 GPU A100. Инпейнтинг-модель инициализирована на основе базовой модели и обучена за 250 тыс. шагов на 300 GPU A100.

Возможна генерация:

  • в стиле конкретных художников (например, Alfons Mucha, Claude Monet).
  • сцен с детализацией (например, «драконовый фрукт в реалистичном стиле»).
  • фэнтезийных или сюрреалистических сцен (например, «дворец на фоне Млечного Пути»). 

Модель является составной частью пайплайна генерации изображений, состоящего из:

  • VQModel: ~271M параметров,
  • T5 text encoder: ~8.7B параметров, 
  • UNET: ~3B параметров.

Всего: ~12B параметров


Дата анонса: 21.11.2023
Параметров: 12B
Разработчик: Sber AI
Версия Diffusers: 0.26.2
Лицензия: Apache 2.0

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с Kandinsky 3.0. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга Kandinsky 3.0

Цены:
Наименование GPU Цена, час Время генерации, с.
rtx5090-1.16.64.160 1 141,77 ₽ Запустить
teslaa100-1.16.64.160 1 211,77 ₽ Запустить
h100-1.16.64.160 1 341,77 ₽ Запустить
h100nvl-1.16.96.160 1 367,41 ₽ Запустить
h200-1.16.128.160 1 423,04 ₽ Запустить
Цены:
Наименование GPU Цена, час Время генерации, с.
teslaa2-1.16.32.160 1 33,74 ₽ Запустить
teslaa10-1.16.32.160 1 46,94 ₽ Запустить
rtx3090-1.16.24.160 1 73,73 ₽ Запустить
rtx4090-1.16.32.160 1 91,14 ₽ Запустить
rtx5090-1.16.64.160 1 141,77 ₽ Запустить
teslaa100-1.16.64.160 1 211,77 ₽ Запустить
h100-1.16.64.160 1 341,77 ₽ Запустить
h100nvl-1.16.96.160 1 367,41 ₽ Запустить
h200-1.16.128.160 1 423,04 ₽ Запустить
Цены:
Наименование GPU Цена, час Время генерации, с.
teslaa2-1.16.32.160 1 33,74 ₽ Запустить
teslaa10-1.16.32.160 1 46,94 ₽ Запустить
rtx3080-1.16.32.160 1 51,34 ₽ Запустить
rtx3090-1.16.24.160 1 73,73 ₽ Запустить
rtx4090-1.16.32.160 1 91,14 ₽ Запустить
rtx5090-1.16.64.160 1 141,77 ₽ Запустить
teslaa100-1.16.64.160 1 211,77 ₽ Запустить
h100-1.16.64.160 1 341,77 ₽ Запустить
h100nvl-1.16.96.160 1 367,41 ₽ Запустить
h200-1.16.128.160 1 423,04 ₽ Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям nn@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.