lab-ii/sakha-ocr-synth download history
lab-ii/sakha-ocr-synth is an image to text dataset on the Hugging Face Hub. In the last 30 days it was downloaded 177 times (32 in the last 7 days), and 177 times in total. It ranks #74,238 among datasets by monthly downloads.
Синтетические строки якутского текста для OCR 500 000 изображений строк с точной разметкой. Сделано для обучения распознавателя якутского (саха) текста: готовые движки для этого языка не работают, а размеченных строк почти нет. Зачем вообще синтетика: у tesseract-rus и ABBYY FineReade
Models trained on sakha-ocr-synth
1 models list it as training data.
- lab-ii/sakha-ocr – downloads in 30 days