PaddleOCR-VL-1.6

мультимодальная
русскоязычная

PaddleOCR-VL-1.6 — это компактная модель для обработки документов от команды PaddlePaddle (Baidu). Архитектура модели полностью унаследована от PaddleOCR-VL-1.5 и состоит из четырёх ключевых блоков. Визуальный энкодер реализован в стиле NaViT (Native Resolution Visual Encoder) — это трансформер с динамическим разрешением, который обрабатывает патчи изображения в их исходном масштабе без принудительного ресайза, что критически важно для сохранения мелких деталей в документах. Коннектор — адаптивный MLP-мост (Adaptive MLP Connector), проецирующий визуальные признаки в пространство языковой модели. Текстовая модель — компактная ERNIE-4.5-0.3B от Baidu, обеспечивающая генерацию структурированного текстового вывода. В полном пайплайне обработки документов дополнительно используется четвертый элемент PP-DocLayoutV3 — модель анализа макета (layout), выполняющая многоточечную локализацию регионов с поддержкой перспективных искажений, изогнутых страниц и нестандартных компоновок.

Ключевая идея версии 1.6 заключается не в увеличении параметров или изменении архитектуры, а в целенаправленной работе с «недооптимизированными регионами» (Under-Optimized Regions) — участками данных, где предыдущая модель демонстрировала нестабильные предсказания. Для этого разработан специализированный Data Engine, который выявляет три типа проблемных зон: boundary-fragile (нестабильные предсказания при минимальных визуальных изменениях), coverage-sparse (редкие сценарии с недостаточным представительством в данных) и unreliable-supervision (ошибочные разметки в обучающем наборе). Далее применяется прогрессивный рецепт пост-тренировки CPT → SFT → RL (GRPO), где каждая стадия работает с определённым подмножеством данных в зависимости от его надёжности и обучающей ценности.

PaddleOCR-VL-1.6 в отличие от универсальных мультимодальных LLM (Gemini, GPT, Qwen-VL), узко специализирована на задачах OCR обработки документов и как результат при 0.9B параметров превосходит модели в 80–260 раз большего размера и демонстрирует лучший результат на OmniDocBench v1.6 (комплексная оценка парсинга PDF-документов: текст, формулы, таблицы, порядок чтения) - 96.33%, обходя MinerU2.5-Pro (95.75%), GLM-OCR (95.22%), Gemini 3 Pro (92.91%), Qwen3-VL-235B (89.78%) и GPT-5.2 (86.59%). На Real5-OmniDocBench (парсинг в реальных условиях: сканирование, деформация, съёмка с экрана, освещение, наклон) — также 1-е место (93.19%).

PaddleOCR-VL-1.6 ориентирована на широкий спектр задач работы с документами и наиболее эффективна там, где требуется высокая точность при ограниченных вычислительных ресурсах. Базовый сценарий: конвертация PDF, сканов и фотографий в Markdown/JSON с сохранением структуры, порядка чтения, таблиц и формул. Далее обработка сложных таблиц и финансовых документов — распознавание таблиц с объединёнными ячейками, вложенной структурой, без границ, включая финансовые отчёты, счета, регистрационные формы, статистические таблицы, с поддержкой склейки таблиц при переносе страниц и восстановление иерархии заголовков. Добавим работу со специализированными элементами — распознавание математических формул (вывод в LaTeX), парсинг графиков и диаграмм в табличные данные, чтение круглых/овальных/прямоугольных печатей и штампов даже при наложении текста и низком контрасте. И не стоит забывать о возможности End-to-end текстового споттинга — одновременная локализация и распознавание текста на удостоверениях личности, древних рукописях, рекламных постерах, скриншотах диалогов, вывесках, многоязычных изображениях. И всё это в рамках открытой лицензии Apache 2.0.

Для получения наиболее эффективного результата рекомендуется использование модели в связке с PP-DocLayout, подробнее об этом, а также об особенностях направления запросов к модели можно ознакомиться во ссылке https://docs.vllm.ai/projects/recipes/en/latest/PaddlePaddle/PaddleOCR-VL.html


Дата анонса: 27.05.2026
Параметров: 959M
Контекст: 132K
Слоев: 18
Тип внимания: Full Attention
Разработчик: Baidu, Inc.
Версия Transformers: 4.55.0
Версия vLLM: >=0.11.1
Лицензия: Apache 2.0

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с PaddleOCR-VL-1.6. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга PaddleOCR-VL-1.6

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 4,30 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 7,53 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 2,26 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 7,97 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 7,95 Запустить
rtxa5000-2.16.64.160.nvlink
131 072
tensor
2 109,77 ₽ 15,27 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 11,15 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 30,74 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 30,71 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 36,40 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,68 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 55,50 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 111,19 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 4,11 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 7,34 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 2,07 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 7,77 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 7,75 Запустить
rtxa5000-2.16.64.160.nvlink
131 072
tensor
2 109,77 ₽ 15,07 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 10,96 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 30,54 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 30,51 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 36,20 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,48 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 55,30 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 111,00 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 3,71 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 6,94 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 1,67 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 7,37 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 7,36 Запустить
rtxa5000-2.16.64.160.nvlink
131 072
tensor
2 109,77 ₽ 14,67 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 10,56 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 30,14 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 30,12 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 35,80 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,08 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 54,90 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 110,60 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям nn@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.