PaddleOCR-VL-1.6

мультимодальная
русскоязычная

PaddleOCR-VL-1.6 — это компактная модель для обработки документов от команды PaddlePaddle (Baidu). Архитектура модели полностью унаследована от PaddleOCR-VL-1.5 и состоит из четырёх ключевых блоков. Визуальный энкодер реализован в стиле NaViT (Native Resolution Visual Encoder) — это трансформер с динамическим разрешением, который обрабатывает патчи изображения в их исходном масштабе без принудительного ресайза, что критически важно для сохранения мелких деталей в документах. Коннектор — адаптивный MLP-мост (Adaptive MLP Connector), проецирующий визуальные признаки в пространство языковой модели. Текстовая модель — компактная ERNIE-4.5-0.3B от Baidu, обеспечивающая генерацию структурированного текстового вывода. В полном пайплайне обработки документов дополнительно используется четвертый элемент PP-DocLayoutV3 — модель анализа макета (layout), выполняющая многоточечную локализацию регионов с поддержкой перспективных искажений, изогнутых страниц и нестандартных компоновок.

Ключевая идея версии 1.6 заключается не в увеличении параметров или изменении архитектуры, а в целенаправленной работе с «недооптимизированными регионами» (Under-Optimized Regions) — участками данных, где предыдущая модель демонстрировала нестабильные предсказания. Для этого разработан специализированный Data Engine, который выявляет три типа проблемных зон: boundary-fragile (нестабильные предсказания при минимальных визуальных изменениях), coverage-sparse (редкие сценарии с недостаточным представительством в данных) и unreliable-supervision (ошибочные разметки в обучающем наборе). Далее применяется прогрессивный рецепт пост-тренировки CPT → SFT → RL (GRPO), где каждая стадия работает с определённым подмножеством данных в зависимости от его надёжности и обучающей ценности.

PaddleOCR-VL-1.6 в отличие от универсальных мультимодальных LLM (Gemini, GPT, Qwen-VL), узко специализирована на задачах OCR обработки документов и как результат при 0.9B параметров превосходит модели в 80–260 раз большего размера и демонстрирует лучший результат на OmniDocBench v1.6 (комплексная оценка парсинга PDF-документов: текст, формулы, таблицы, порядок чтения) - 96.33%, обходя MinerU2.5-Pro (95.75%), GLM-OCR (95.22%), Gemini 3 Pro (92.91%), Qwen3-VL-235B (89.78%) и GPT-5.2 (86.59%). На Real5-OmniDocBench (парсинг в реальных условиях: сканирование, деформация, съёмка с экрана, освещение, наклон) — также 1-е место (93.19%).

PaddleOCR-VL-1.6 ориентирована на широкий спектр задач работы с документами и наиболее эффективна там, где требуется высокая точность при ограниченных вычислительных ресурсах. Базовый сценарий: конвертация PDF, сканов и фотографий в Markdown/JSON с сохранением структуры, порядка чтения, таблиц и формул. Далее обработка сложных таблиц и финансовых документов — распознавание таблиц с объединёнными ячейками, вложенной структурой, без границ, включая финансовые отчёты, счета, регистрационные формы, статистические таблицы, с поддержкой склейки таблиц при переносе страниц и восстановление иерархии заголовков. Добавим работу со специализированными элементами — распознавание математических формул (вывод в LaTeX), парсинг графиков и диаграмм в табличные данные, чтение круглых/овальных/прямоугольных печатей и штампов даже при наложении текста и низком контрасте. И не стоит забывать о возможности End-to-end текстового споттинга — одновременная локализация и распознавание текста на удостоверениях личности, древних рукописях, рекламных постерах, скриншотах диалогов, вывесках, многоязычных изображениях. И всё это в рамках открытой лицензии Apache 2.0.

Для получения наиболее эффективного результата рекомендуется использование модели в связке с PP-DocLayout, подробнее об этом, а также об особенностях направления запросов к модели можно ознакомиться во ссылке https://docs.vllm.ai/projects/recipes/en/latest/PaddlePaddle/PaddleOCR-VL.html


Дата анонса: 27.05.2026
Параметров: 959M
Контекст: 132K
Слоев: 18
Тип внимания: Full Attention
Разработчик: Baidu, Inc.
Версия Transformers: 4.55.0
Версия vLLM: >=0.11.1
Лицензия: Apache 2.0

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с PaddleOCR-VL-1.6. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU TPS Tooling Статус Ссылка
PaddlePaddle/PaddleOCR-VL-1.6 131K Публичный A2 11 доступен чат

API доступ к PaddleOCR-VL-1.6 эндпоинтам

curl https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer USER_API_KEY" \
--data-binary @- <<"EOF"
{"model": "paddleocr-vl-1.6", "temperature": 0.0, "skip_special_tokens": false, "messages": [
{"role": "user", "content": [
{ "type": "text", "text": "OCR:" },
{ "type": "image_url", "image_url": { "url": "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg" }}
]}
]}
EOF
$response = Invoke-WebRequest https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/chat/completions `
-Method POST `
-Headers @{
"Authorization" = "Bearer USER_API_KEY"
"Content-Type" = "application/json; charset=utf-8"
} `
-Body ([System.Text.Encoding]::UTF8.GetBytes((@{
model = "paddleocr-vl-1.6"
skip_special_tokens = $false
temperature = 0.0
messages = @(
@{ role = "user"; content = @(
@{ type = "text"; text = "OCR:" },
@{ type = "image_url"; image_url = @{ url = "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg" } })
})
} | ConvertTo-Json -Depth 10)))
([System.Text.Encoding]::UTF8.GetString($response.RawContentStream.ToArray()) | ConvertFrom-Json).choices[0].message.content
#!pip install OpenAI --upgrade

from openai import OpenAI

client = OpenAI(
api_key="USER_API_KEY",
base_url="https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/",
)

chat_response = client.chat.completions.create(
model="paddleocr-vl-1.6",
temperature=0.0,
extra_body={
"skip_special_tokens": False
},
messages=[
{"role": "user", "content": [
{"type": "text", "text": "OCR:"},
{"type": "image_url", "image_url": {"url": "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg"}}
]},
]
)
print(chat_response.choices[0].message.content)

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга PaddleOCR-VL-1.6

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 4,30 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 7,53 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 2,26 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 7,97 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 7,95 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 16,14 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 11,15 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 30,74 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 30,71 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 36,40 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,68 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 55,50 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 111,19 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 4,11 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 7,34 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 2,07 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 7,77 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 7,75 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 15,94 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 10,96 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 30,54 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 30,51 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 36,20 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,48 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 55,30 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 111,00 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
131 072
1 33,74 ₽ 136.27 3,71 Запустить
teslaa10-1.16.32.160
131 072
1 46,94 ₽ 86.14 6,94 Запустить
rtx3080-1.16.32.160
131 072
1 51,34 ₽ 204.54 1,67 Запустить
rtx3090-1.16.24.160
131 072
1 73,73 ₽ 107.01 7,37 Запустить
rtx4090-1.16.32.160
131 072
1 91,14 ₽ 255.50 7,36 Запустить
rtx3090-2.16.64.160.nvlink
131 072
tensor
2 139,77 ₽ 15,54 Запустить
rtx5090-1.16.64.160
131 072
1 141,77 ₽ 10,56 Запустить
teslaa100-1.16.64.160
131 072
1 211,77 ₽ 193.00 30,14 Запустить
h100-1.16.64.160
131 072
1 341,77 ₽ 234.17 30,12 Запустить
h100nvl-1.16.96.160
131 072
1 367,41 ₽ 240.93 35,80 Запустить
teslaa100-2.24.96.160.nvlink
131 072
tensor
2 411,81 ₽ 61,08 Запустить
h200-1.16.128.160
131 072
1 423,04 ₽ 54,90 Запустить
h200-2.24.256.160.nvlink
131 072
tensor
2 839,97 ₽ 110,60 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.