PaddleOCR-VL-1.6 — это компактная модель для обработки документов от команды PaddlePaddle (Baidu). Архитектура модели полностью унаследована от PaddleOCR-VL-1.5 и состоит из четырёх ключевых блоков. Визуальный энкодер реализован в стиле NaViT (Native Resolution Visual Encoder) — это трансформер с динамическим разрешением, который обрабатывает патчи изображения в их исходном масштабе без принудительного ресайза, что критически важно для сохранения мелких деталей в документах. Коннектор — адаптивный MLP-мост (Adaptive MLP Connector), проецирующий визуальные признаки в пространство языковой модели. Текстовая модель — компактная ERNIE-4.5-0.3B от Baidu, обеспечивающая генерацию структурированного текстового вывода. В полном пайплайне обработки документов дополнительно используется четвертый элемент PP-DocLayoutV3 — модель анализа макета (layout), выполняющая многоточечную локализацию регионов с поддержкой перспективных искажений, изогнутых страниц и нестандартных компоновок.
Ключевая идея версии 1.6 заключается не в увеличении параметров или изменении архитектуры, а в целенаправленной работе с «недооптимизированными регионами» (Under-Optimized Regions) — участками данных, где предыдущая модель демонстрировала нестабильные предсказания. Для этого разработан специализированный Data Engine, который выявляет три типа проблемных зон: boundary-fragile (нестабильные предсказания при минимальных визуальных изменениях), coverage-sparse (редкие сценарии с недостаточным представительством в данных) и unreliable-supervision (ошибочные разметки в обучающем наборе). Далее применяется прогрессивный рецепт пост-тренировки CPT → SFT → RL (GRPO), где каждая стадия работает с определённым подмножеством данных в зависимости от его надёжности и обучающей ценности.
PaddleOCR-VL-1.6 в отличие от универсальных мультимодальных LLM (Gemini, GPT, Qwen-VL), узко специализирована на задачах OCR обработки документов и как результат при 0.9B параметров превосходит модели в 80–260 раз большего размера и демонстрирует лучший результат на OmniDocBench v1.6 (комплексная оценка парсинга PDF-документов: текст, формулы, таблицы, порядок чтения) - 96.33%, обходя MinerU2.5-Pro (95.75%), GLM-OCR (95.22%), Gemini 3 Pro (92.91%), Qwen3-VL-235B (89.78%) и GPT-5.2 (86.59%). На Real5-OmniDocBench (парсинг в реальных условиях: сканирование, деформация, съёмка с экрана, освещение, наклон) — также 1-е место (93.19%).
PaddleOCR-VL-1.6 ориентирована на широкий спектр задач работы с документами и наиболее эффективна там, где требуется высокая точность при ограниченных вычислительных ресурсах. Базовый сценарий: конвертация PDF, сканов и фотографий в Markdown/JSON с сохранением структуры, порядка чтения, таблиц и формул. Далее обработка сложных таблиц и финансовых документов — распознавание таблиц с объединёнными ячейками, вложенной структурой, без границ, включая финансовые отчёты, счета, регистрационные формы, статистические таблицы, с поддержкой склейки таблиц при переносе страниц и восстановление иерархии заголовков. Добавим работу со специализированными элементами — распознавание математических формул (вывод в LaTeX), парсинг графиков и диаграмм в табличные данные, чтение круглых/овальных/прямоугольных печатей и штампов даже при наложении текста и низком контрасте. И не стоит забывать о возможности End-to-end текстового споттинга — одновременная локализация и распознавание текста на удостоверениях личности, древних рукописях, рекламных постерах, скриншотах диалогов, вывесках, многоязычных изображениях. И всё это в рамках открытой лицензии Apache 2.0.
Для получения наиболее эффективного результата рекомендуется использование модели в связке с PP-DocLayout, подробнее об этом, а также об особенностях направления запросов к модели можно ознакомиться во ссылке https://docs.vllm.ai/projects/recipes/en/latest/PaddlePaddle/PaddleOCR-VL.html
| Наименование модели | Контекст | Тип | GPU | TPS | Tooling | Статус | Ссылка |
|---|---|---|---|---|---|---|---|
| PaddlePaddle/PaddleOCR-VL-1.6 | 131K | Публичный | A2 | 11 | доступен | чат |
curl https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer USER_API_KEY" \
--data-binary @- <<"EOF"
{"model": "paddleocr-vl-1.6", "temperature": 0.0, "skip_special_tokens": false, "messages": [
{"role": "user", "content": [
{ "type": "text", "text": "OCR:" },
{ "type": "image_url", "image_url": { "url": "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg" }}
]}
]}
EOF
$response = Invoke-WebRequest https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/chat/completions `
-Method POST `
-Headers @{
"Authorization" = "Bearer USER_API_KEY"
"Content-Type" = "application/json; charset=utf-8"
} `
-Body ([System.Text.Encoding]::UTF8.GetBytes((@{
model = "paddleocr-vl-1.6"
skip_special_tokens = $false
temperature = 0.0
messages = @(
@{ role = "user"; content = @(
@{ type = "text"; text = "OCR:" },
@{ type = "image_url"; image_url = @{ url = "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg" } })
})
} | ConvertTo-Json -Depth 10)))
([System.Text.Encoding]::UTF8.GetString($response.RawContentStream.ToArray()) | ConvertFrom-Json).choices[0].message.content
#!pip install OpenAI --upgrade
from openai import OpenAI
client = OpenAI(
api_key="USER_API_KEY",
base_url="https://chat.immers.cloud/v1/endpoints/paddleocr-vl-1.6/generate/",
)
chat_response = client.chat.completions.create(
model="paddleocr-vl-1.6",
temperature=0.0,
extra_body={
"skip_special_tokens": False
},
messages=[
{"role": "user", "content": [
{"type": "text", "text": "OCR:"},
{"type": "image_url", "image_url": {"url": "https://raw.githubusercontent.com/open-mmlab/mmocr/refs/heads/main/demo/demo_text_det.jpg"}}
]},
]
)
print(chat_response.choices[0].message.content)
Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.
Мы рекомендуем создание частных инстансов в случаях, если необходимо:
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 4,30 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 7,53 | Запустить | ||
131 072 |
1 | 51,34 ₽ | 2,26 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 7,97 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 7,95 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 16,14 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 11,15 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 30,74 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 30,71 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 36,40 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 61,68 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 55,50 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 111,19 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 4,11 | Запустить | ||
131 072 |
1 | 46,94 ₽ | 7,34 | Запустить | ||
131 072 |
1 | 51,34 ₽ | 2,07 | Запустить | ||
131 072 |
1 | 73,73 ₽ | 7,77 | Запустить | ||
131 072 |
1 | 91,14 ₽ | 7,75 | Запустить | ||
131 072 tensor |
2 | 139,77 ₽ | 15,94 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 10,96 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 30,54 | Запустить | ||
131 072 |
1 | 341,77 ₽ | 30,51 | Запустить | ||
131 072 |
1 | 367,41 ₽ | 36,20 | Запустить | ||
131 072 tensor |
2 | 411,81 ₽ | 61,48 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 55,30 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 111,00 | Запустить | ||
| Наименование | GPU | TPS | Параллельность (макс.) | |||
|---|---|---|---|---|---|---|
131 072 |
1 | 33,74 ₽ | 136.27 | 3,71 | Запустить | |
131 072 |
1 | 46,94 ₽ | 86.14 | 6,94 | Запустить | |
131 072 |
1 | 51,34 ₽ | 204.54 | 1,67 | Запустить | |
131 072 |
1 | 73,73 ₽ | 107.01 | 7,37 | Запустить | |
131 072 |
1 | 91,14 ₽ | 255.50 | 7,36 | Запустить | |
131 072 tensor |
2 | 139,77 ₽ | 15,54 | Запустить | ||
131 072 |
1 | 141,77 ₽ | 10,56 | Запустить | ||
131 072 |
1 | 211,77 ₽ | 193.00 | 30,14 | Запустить | |
131 072 |
1 | 341,77 ₽ | 234.17 | 30,12 | Запустить | |
131 072 |
1 | 367,41 ₽ | 240.93 | 35,80 | Запустить | |
131 072 tensor |
2 | 411,81 ₽ | 61,08 | Запустить | ||
131 072 |
1 | 423,04 ₽ | 54,90 | Запустить | ||
131 072 tensor |
2 | 839,97 ₽ | 110,60 | Запустить | ||
Свяжитесь с нашей специализированной группой поддержки по нейросетям support@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.