САНКТ-ПЕТЕРБУРГ, 7 октября. /ТАСС/. Ученые Санкт-Петербургского государственного университета промышленных технологий и дизайна (СПбГУПТД) создали и запатентовали программное обеспечение на базе искусственного интеллекта, способное автоматически восстанавливать структуру и содержание исторических документов с дефектами. Об этом сообщили ТАСС в пресс-службе вуза.
"Система на основе методов компьютерного зрения и языкового моделирования восстанавливает структуру и содержание исторических документов и других материалов, включая утраченный текст с сохранением оригинального контекста и стиля. В качестве экспериментального исследования, учеными был оцифрован ряд архивных документов Ленинградского института текстильной и легкой промышленности им. С.М. Кирова (ныне - СПбГУПТД) за 1968 год", - говорится в сообщении.
Уточняется, что программа включает визуальный и лингвистический модули. Первый отвечает за диагностику повреждений и подготовку изображения, второй - за распознавание символов и смысловое восстановление текста. Одной из главных особенностей разработки стала способность системы корректно обрабатывать сложные архивные издания с многоколоночной версткой, например, старые газеты. Для этого ученые обучили собственную языковую модель, которая учитывает пространственное расположение блоков на странице и правильно выстраивает последовательность текста.
"Модель была дообучена на подшивке газеты "Кадры стране" за 1968 год, которая выпускалась в Ленинградском институте текстильной и легкой промышленности им. С.М. Кирова (ныне - СПбГУПТД). Это позволило системе "выучить" характерные для той эпохи типографские особенности и распространенные артефакты печати. В результате модель обеспечивает значительно более высокую точность распознавания, включая корректную обработку специфической лексики, аббревиатур и орфографических норм того времени", - рассказал автор разработки, ассистент кафедры интеллектуальных систем и защиты информации СПбГУПТД Никита Сиротенко.
По данным пресс-службы, процесс работы программы включает поэтапную обработку: сначала система анализирует скан и разделяет его на смысловые блоки (заголовки, текст, таблицы, изображения), после чего проводит визуальную очистку фрагментов путем повышения контрастности, устранения микроразрывов и отделения текста от пожелтевшего фона для последующего распознавания через OCR-движок. На завершающем этапе разработанная вузом языковая модель (LLM) выполняет структурное и смысловое восстановление, корректно объединяя слова, разорванные дефисами или физическими повреждениями, а также выстраивая правильную последовательность абзацев и заголовков.
Использование программы
По словам разработчиков, программа предназначена для архивов, библиотек и исследователей, занимающихся массовой оцифровкой исторических фондов. В будущем технологию планируется адаптировать для нужд юриспруденции и криминалистики (восстановление поврежденных договоров, завещаний и писем), а также для сферы страхования при обработке документов, поврежденных при чрезвычайных ситуациях.