1 сентября 2026 г.
PereStruct обошёл VLM на сканах старых газет: BLEU 0,965 против 0,347
Яндекс открыл PereStruct: конвейер из четырёх модулей разбирает советские газеты с BLEU 0,965, у Qwen3.6-Plus на том же тесте 0,347.
Человек за секунду видит на полосе заголовок, продолжение колонки и подпись к фото. VLM на том же скане собирает текст с BLEU 0,347.
Яндекс выложил PereStruct 1 сентября 2026: код, размеченный датасет и бенчмарк. Модульный конвейер на том же тесте дал BLEU 0,965 и ROUGE-1 0,985, у Qwen3.6-35B-A3B вышло 0,121 и 0,320.
Четыре модуля вместо одной модели. Вёрстку размечает YOLOv10 с весами DocLayout-YOLO, текст снимает Yandex Vision OCR, ошибки правят модели Yandex AI Studio по ограничивающему промпту. Блоки в статьи склеивает XGBoost-классификатор пар с иерархической кластеризацией.
Раньше детектор вёрстки читал советскую полосу с mAP50 0,698. Доменная адаптация подняла метрику до 0,845, на финальном тесте до 0,981. Визуальные признаки поверх текстовых подняли F1 сборки основного текста с 0,743 до 0,850, а связей с заголовками с 0,882 до 0,904.
Ставится в четыре команды. git clone репозитория, cd PereStruct, conda create -n perestruct python=3.12, pip install -r requirements.txt. Запуск идёт одной функцией run_full_pipeline(images_dir, output_dir, threshold=0.5), примеры разобраны в ноутбуках test.ipynb и step_by_step.ipynb.
Локально конвейер не поедет без облака. Шаги OCR и коррекции требуют ключей Yandex Cloud, их кладут в .env по образцу env_example, на вход идут только .jpg и .jpeg. Потрогать без установки можно на демо-стенде в Yandex Cloud Containers.
Датасет лежит на Zenodo с 3 июня 2026 под лицензией CC BY 4.0. Это 3,7 ГБ и 599 опубликованных страниц из 1426 размеченных, сканы из фонда библиотеки им. Н. А. Некрасова, разметка по четырём классам. Бенчмарк отдельный: 110 страниц экспертной разметки, 93 из них в публичной версии.
Статья «PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing» подана на arXiv 3 июня 2026.
Первоисточник