Unlimited-OCR

мультимодальная
русскоязычная

Unlimited-OCR — это end-to-end модель оптического распознавания символов (OCR) и парсинга документов, разработанная компанией Baidu и позиционируемая как модель, открывающая «эру одноэтапного парсинга с длинным горизонтом» (Era of One-shot Long-horizon Parsing). В отличие от существующих OCR-систем, которые, как правило, обрабатывают многостраничные документы постранично в цикле, сбрасывая память между итерациями, Unlimited-OCR способна за один прямой проход распознать и преобразовать в структурированный формат десятки страниц документа. Это фундаментальное преимущество стало возможным благодаря сочетанию двух ключевых архитектурных решений: высокоэффективного визуального энкодера DeepEncoder с 16-кратной компрессией визуальных токенов и инновационного механизма внимания R-SWA, который поддерживает постоянный размер KV-кэша на протяжении всего процесса декодирования.

Базовая архитектура модели унаследована от DeepSeek-OCR и состоит из двух основных компонентов. Визуальный энкодер DeepEncoder представляет собой каскадную архитектуру SAM-ViT-B + CLIP-L, которая сжимает изображение 1024×1024 пикселя всего до 256 токенов — это критически важно для работы с многостраничными документами, так как радикально сокращает базовый размер KV-кэша. Декодер построен на базе MoE-архитектуры (Mixture of Experts) с 3 млрд общих параметров и лишь 500 млн активируемых при инференсе. Модель включает 12 скрытых слоёв, 64 маршрутизируемых эксперта и 2 общих эксперта, максимальный контекст – 32768 токенов.

Главное архитектурное новшество Unlimited-OCR — Reference Sliding Window Attention (R-SWA), который полностью заменяет стандартное Multi-Head Attention (MHA) в декодере. R-SWA решает фундаментальную проблему линейного роста KV-кэша и замедления генерации по мере удлинения выходной последовательности. При генерации каждого нового токена R-SWA вычисляет внимание к двум группам токенов: ко всем референсным токенам (в случае OCR — это визуальные токены и промпт) и к ограниченному числу предшествующих выходных токенов (по умолчанию — окно в 128 токенов, но для сложных документов рекомендуется увеличить его до 1024). В отличие от стандартного Sliding Window Attention (SWA), в R-SWA референсные токены исключаются из циклического обновления состояния и присутствуют всегда, что предотвращает их постепенное «размывание» при продвижении окна. KV-кэш реализован как очередь фиксированной ёмкости m + n, где m — референсные токены, а n — окно выходных токенов, и при генерации каждого нового токена из очереди удаляется наиболее старый KV-элемент группы выходных токенов – n. Благодаря этому размер KV-кэша остается постоянным на протяжении всего процесса декодирования, независимо от длины выходного текста, что обеспечивает не только предсказуемое потребление памяти, но и стабильную скорость генерации.

Ключевое преимущество Unlimited-OCR перед другими LLM-моделями для задач OCR заключается в том, что она решает проблему переполнения KV-кэша, которая делала невозможным одновременную обработку сразу нескольких страниц и проблему снижения скорости генерации с накоплением декодированных токенов. При этом модель не только не теряет в качестве по сравнению с полным вниманием, но и превосходит базовый DeepSeek-OCR на 6,22% по общему показателю на бенчмарке OmniDocBench v1.5, достигая 93,23% — это первое место среди всех энд-ту-энд моделей, включая значительно более крупные модели: GPT-4o (75,02%), Gemini-2.5 Pro (88,03%), Qwen2.5-VL 72B (87,02%) и Qwen3-VL 235B (89,15%). На актуальном бенчмарке OmniDocBench v1.6 Unlimited-OCR также занимает первую позицию с результатом 93,92%, демонстрируя лучшие показатели в распознавании формул (Formula CDM: 95,79%) и извлечении структуры таблиц (Table TEDS-S: 93,32%).

Ключевой сценарий использования Unlimited-OCR - одноэтапный парсинг многостраничных документов. Модель способна транскрибировать PDF-файлы, книги, научные статьи и другие документы объемом до десятков страниц за один проход, без необходимости постраничной обработки и сброса памяти. Эта особенность модели приобретает максимальную актуальность при оцифровке архивов, библиотек, юридических документов и решении других OCR задач, где важна не только точность, но и скорость получения финального результата при существенных объемах.  

С информацией об особенностях направления запросов к модели можно ознакомиться по ссылке - https://recipes.vllm.ai/baidu/Unlimited-OCR


Дата анонса: 19.06.2026
Параметров: 4B
Экспертов: 64
Активно параметров при инференсе: 500M
Контекст: 33K
Слоев: 12
Тип внимания: Reference Sliding Window Attention (R-SWA)
Разработчик: Baidu, Inc.
Версия Transformers: 4.46.3
Версия vLLM: >=0.25.0
Лицензия: MIT

Публичный эндпоинт

Воспользуйтесь нашими готовыми публичными эндпоинтами бесплатно для теста инференса и знакомства с Unlimited-OCR. Получить токен для доступа к API вы можете на странице управления токенами после регистрации и верификации.
Наименование модели Контекст Тип GPU Статус Ссылка
Для данной модели пока нет публичных эндпоинтов.

Частный сервер

Арендуйте собственный физически выделенный инстанс с почасовой оплатой или на длительный срок с помесячной оплатой.

Мы рекомендуем создание частных инстансов в случаях, если необходимо:

  • получить максимальную производительность эндпоинта,
  • получить полный контекст для обработки больших запросов и диалогов,
  • обеспечить максимальную безопасность, для обработки данных в выделенном изолированном пространстве,
  • использовать кастомизированные веса: fine-tuned версии или lora-адаптеры.

Рекомендуемые конфигурации сервера для хостинга Unlimited-OCR

Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
32 768
1 33,74 ₽ 4,00 Запустить
teslaa10-1.16.32.160
32 768
1 46,94 ₽ 7,88 Запустить
rtx3080-1.16.32.160
32 768
1 51,34 ₽ 1,55 Запустить
rtx3090-1.16.24.160
32 768
1 73,73 ₽ 8,40 Запустить
rtx4090-1.16.32.160
32 768
1 91,14 ₽ 8,38 Запустить
rtxa5000-2.16.64.160.nvlink
32 768
tensor
2 109,77 ₽ 17,16 Запустить
rtx5090-1.16.64.160
32 768
1 141,77 ₽ 12,22 Запустить
teslaa100-1.16.64.160
32 768
1 211,77 ₽ 35,72 Запустить
h100-1.16.64.160
32 768
1 341,77 ₽ 35,69 Запустить
h100nvl-1.16.96.160
32 768
1 367,41 ₽ 42,51 Запустить
teslaa100-2.24.96.160.nvlink
32 768
tensor
2 411,81 ₽ 72,85 Запустить
h200-1.16.128.160
32 768
1 423,04 ₽ 65,43 Запустить
h200-2.24.256.160.nvlink
32 768
tensor
2 839,97 ₽ 132,27 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
32 768
1 33,74 ₽ 3,75 Запустить
teslaa10-1.16.32.160
32 768
1 46,94 ₽ 7,62 Запустить
rtx3080-1.16.32.160
32 768
1 51,34 ₽ 1,30 Запустить
rtx3090-1.16.24.160
32 768
1 73,73 ₽ 8,14 Запустить
rtx4090-1.16.32.160
32 768
1 91,14 ₽ 8,12 Запустить
rtxa5000-2.16.64.160.nvlink
32 768
tensor
2 109,77 ₽ 16,90 Запустить
rtx5090-1.16.64.160
32 768
1 141,77 ₽ 11,97 Запустить
teslaa100-1.16.64.160
32 768
1 211,77 ₽ 35,47 Запустить
h100-1.16.64.160
32 768
1 341,77 ₽ 35,43 Запустить
h100nvl-1.16.96.160
32 768
1 367,41 ₽ 42,26 Запустить
teslaa100-2.24.96.160.nvlink
32 768
tensor
2 411,81 ₽ 72,59 Запустить
h200-1.16.128.160
32 768
1 423,04 ₽ 65,18 Запустить
h200-2.24.256.160.nvlink
32 768
tensor
2 839,97 ₽ 132,01 Запустить
Цены:
Наименование GPU Цена, час TPS Параллельность (макс.)
teslaa2-1.16.32.160
32 768
1 33,74 ₽ 2,09 Запустить
teslaa10-1.16.32.160
32 768
1 46,94 ₽ 5,97 Запустить
rtx3090-1.16.24.160
32 768
1 73,73 ₽ 6,49 Запустить
rtx3080-2.16.32.160
32 768
tensor
2 86,54 ₽ 2,60 Запустить
rtx4090-1.16.32.160
32 768
1 91,14 ₽ 6,47 Запустить
rtxa5000-2.16.64.160.nvlink
32 768
tensor
2 109,77 ₽ 15,25 Запустить
rtx5090-1.16.64.160
32 768
1 141,77 ₽ 10,31 Запустить
teslaa100-1.16.64.160
32 768
1 211,77 ₽ 33,81 Запустить
h100-1.16.64.160
32 768
1 341,77 ₽ 33,78 Запустить
h100nvl-1.16.96.160
32 768
1 367,41 ₽ 40,60 Запустить
teslaa100-2.24.96.160.nvlink
32 768
tensor
2 411,81 ₽ 70,94 Запустить
h200-1.16.128.160
32 768
1 423,04 ₽ 63,52 Запустить
h200-2.24.256.160.nvlink
32 768
tensor
2 839,97 ₽ 130,36 Запустить

Связанные модели

Остались вопросы?

Свяжитесь с нашей специализированной группой поддержки по нейросетям nn@immers.cloud или отправьте ваш запрос в отдел продаж sale@immers.cloud.

Мы используем файлы cookie и сервисы веб-аналитики для обеспечения работы сайта, анализа посещаемости и улучшения качества наших услуг.
Продолжая использовать сайт, вы соглашаетесь с Политикой конфиденциальности и даете согласие на обработку cookie-файлов и технических данных.