Cognitive-Lab/NayanaOCR_Corpus_2025 download history

Cognitive-Lab/NayanaOCR_Corpus_2025 is an image to text dataset on the Hugging Face Hub. In the last 30 days it was downloaded 2,976 times (1,522 in the last 7 days), and 54,753 times in total. It ranks #8,402 among datasets by monthly downloads.

🪷 NayanaOCR Corpus 2025 A 1M-page, 22-language fully-parallel synthetic OCR + VQA corpus for document-centric vision-language models — every page rendered in every language. NayanaOCR Corpus 2025 is one of the largest open-source multilingual, multi-task document datasets for training a

Models trained on NayanaOCR_Corpus_2025

1 models list it as training data.

Spaces using NayanaOCR_Corpus_2025

Open Cognitive-Lab/NayanaOCR_Corpus_2025 on Hugging Face

Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.