Назад к блогу✏️
AI-инжиниринг
Персидский Пиксель: крупномасштабный синтетический датасет для оптического распознавания символов персидского языка
Исследователи представили «Persian Pixel» — масштабный синтетический набор данных для оптического распознавания символов (OCR) персидского языка. Датасет содержит 8 миллионов изображений, сгенерированных на основе 340 тысяч уникальных текстовых строк, охватывающих такие сложные аспекты, как вязь (прописное написание соединённых букв), различные шрифты и многообразие начертаний.
Персидское письмо — арабица с дополнительными буквами — представляет особый вызов для OCR. В отличие от латиницы, где буквы редко соединяются, в персидском языке большинство символов меняют форму в зависимости от позиции в слове (начальная, срединная, конечная или изолированная). Модели, обученные на латинских или даже арабских данных, часто путают похожие буквы (например, «ب» и «پ») или неправильно распознают диакритические знаки.
«Persian Pixel» решает проблему нехватки качественной разметки благодаря генерируемому синтезу. Алгоритм случайным образом комбинирует слова из персидского словаря, добавляя различные шрифты (Nastaliq, Naskh, Kufic), фоновый шум, искажения перспективы и вариации освещения. Такой подход имитирует реальные условия сканирования — от древних рукописей до современных документов.
Для тестирования авторы создали бенчмарк из реальных изображений, включая отсканированные страницы книг XIX века и современные чеки. Лучшие модели OCR, обученные на «Persian Pixel», показали точность 97,2% на синтетических данных и 91,7% на реальных — это на 14% выше, чем у моделей, обученных на существующих датасетах вроде «Hoda» или «Shotor».
Проект важен не только для лингвистики, но и для сохранения культурного наследия. Многие исторические персидские тексты, написанные столетия назад, до сих пор не оцифрованы из-за низкого качества сканирования. Большой синтетический датасет может стать ключом к автоматической расшифровке таких документов.
Исходный код и сгенерированные изображения доступны на [GitHub](https://github.com/persian-pixel/ocr-dataset). Для исследователей, работающих с арабским или урду, набор также полезен — персидский алфавит является базовым для многих письменностей региона.
📎 [Источник](http://arxiv.org/abs/2607.20385v1)