PaddleOCR-VL-1.6 — это компактная модель для обработки документов от команды PaddlePaddle (Baidu). Архитектура модели полностью унаследована от PaddleOCR-VL-1.5 и состоит из четырёх ключевых блоков. Визуальный энкодер реализован в стиле NaViT (Native Resolution Visual Encoder) — это трансформер с динамическим разрешением, который обрабатывает патчи изображения в их исходном масштабе без принудительного ресайза, что критически важно для сохранения мелких деталей в документах. Коннектор — адаптивный MLP-мост (Adaptive MLP Connector), проецирующий визуальные признаки в пространство языковой модели. Текстовая модель — компактная ERNIE-4.5-0.3B от Baidu, обеспечивающая генерацию структурированного текстового вывода. В полном пайплайне обработки документов дополнительно используется четвертый элемент PP-DocLayoutV3 — модель анализа макета (layout), выполняющая многоточечную локализацию регионов с поддержкой перспективных искажений, изогнутых страниц и нестандартных компоновок.
Ключевая идея версии 1.6 заключается не в увеличении параметров или изменении архитектуры, а в целенаправленной работе с «недооптимизированными регионами» (Under-Optimized Regions) — участками данных, где предыдущая модель демонстрировала нестабильные предсказания. Для этого разработан специализированный Data Engine, который выявляет три типа проблемных зон: boundary-fragile (нестабильные предсказания при минимальных визуальных изменениях), coverage-sparse (редкие сценарии с недостаточным представительством в данных) и unreliable-supervision (ошибочные разметки в обучающем наборе). Далее применяется прогрессивный рецепт пост-тренировки CPT → SFT → RL (GRPO), где каждая стадия работает с определённым подмножеством данных в зависимости от его надёжности и обучающей ценности.
PaddleOCR-VL-1.6 в отличие от универсальных мультимодальных LLM (Gemini, GPT, Qwen-VL), узко специализирована на задачах OCR обработки документов и как результат при 0.9B параметров превосходит модели в 80–260 раз большего размера и демонстрирует лучший результат на OmniDocBench v1.6 (комплексная оценка парсинга PDF-документов: текст, формулы, таблицы, порядок чтения) - 96.33%, обходя MinerU2.5-Pro (95.75%), GLM-OCR (95.22%), Gemini 3 Pro (92.91%), Qwen3-VL-235B (89.78%) и GPT-5.2 (86.59%). На Real5-OmniDocBench (парсинг в реальных условиях: сканирование, деформация, съёмка с экрана, освещение, наклон) — также 1-е место (93.19%).
PaddleOCR-VL-1.6 ориентирована на широкий спектр задач работы с документами и наиболее эффективна там, где требуется высокая точность при ограниченных вычислительных ресурсах. Базовый сценарий: конвертация PDF, сканов и фотографий в Markdown/JSON с сохранением структуры, порядка чтения, таблиц и формул. Далее обработка сложных таблиц и финансовых документов — распознавание таблиц с объединёнными ячейками, вложенной структурой, без границ, включая финансовые отчёты, счета, регистрационные формы, статистические таблицы, с поддержкой склейки таблиц при переносе страниц и восстановление иерархии заголовков. Добавим работу со специализированными элементами — распознавание математических формул (вывод в LaTeX), парсинг графиков и диаграмм в табличные данные, чтение круглых/овальных/прямоугольных печатей и штампов даже при наложении текста и низком контрасте. И не стоит забывать о возможности End-to-end текстового споттинга — одновременная локализация и распознавание текста на удостоверениях личности, древних рукописях, рекламных постерах, скриншотах диалогов, вывесках, многоязычных изображениях. И всё это в рамках открытой лицензии Apache 2.0.
Для получения наиболее эффективного результата рекомендуется использование модели в связке с PP-DocLayout, подробнее об этом, а также об особенностях направления запросов к модели можно ознакомиться во ссылке https://docs.vllm.ai/projects/recipes/en/latest/PaddlePaddle/PaddleOCR-VL.html
| Наименование модели | Контекст | Тип | GPU | Статус | Ссылка |
|---|
Для данной модели пока нет публичных эндпоинтов.
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 4,30 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 7,53 | Запустить | ||
131 072 |
1 | 51,34 ₽ | 2,26 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 7,97 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 7,95 | Запустить | ||
131 072 tensor |
2 | 109,77 ₽ | 15,27 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 11,15 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 30,74 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 30,71 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 36,40 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 61,68 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 55,50 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 111,19 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 4,11 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 7,34 | Запустить | ||
131 072 |
1 | 51,34 ₽ | 2,07 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 7,77 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 7,75 | Запустить | ||
131 072 tensor |
2 | 109,77 ₽ | 15,07 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 10,96 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 30,54 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 30,51 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 36,20 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 61,48 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 55,30 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 111,00 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 3,71 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 6,94 | Запустить | ||
131 072 |
1 | 51,34 ₽ | 1,67 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 7,37 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 7,36 | Запустить | ||
131 072 tensor |
2 | 109,77 ₽ | 14,67 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 10,56 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 30,14 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 30,12 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 35,80 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 61,08 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 54,90 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 110,60 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям nn@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.