Cognitive-Lab/NayanaOCR_Corpus_2025 download history
Cognitive-Lab/NayanaOCR_Corpus_2025 is an image to text dataset on the Hugging Face Hub. In the last 30 days it was downloaded 2,976 times (1,522 in the last 7 days), and 54,753 times in total. It ranks #8,402 among datasets by monthly downloads.
🪷 NayanaOCR Corpus 2025 A 1M-page, 22-language fully-parallel synthetic OCR + VQA corpus for document-centric vision-language models — every page rendered in every language. NayanaOCR Corpus 2025 is one of the largest open-source multilingual, multi-task document datasets for training a
Models trained on NayanaOCR_Corpus_2025
1 models list it as training data.
- FineEnvs/gemma-4-E4B-it-kannada-ocr-grpo 19 downloads in 30 days
Spaces using NayanaOCR_Corpus_2025
- FineEnvs/nayana-ocr-env 0 likes
Open Cognitive-Lab/NayanaOCR_Corpus_2025 on Hugging Face
Sister project: Paper Pulse, the upvote history of every Hugging Face Daily Paper.