[{"@type":"PropertyValue","name":"Data size","value":"20,011 pictures, 20,011descriptions"},{"@type":"PropertyValue","name":"Language distribution","value":"Asian languages: Korean, Indonesian, Malay, Vietnamese, Thai, Chinese, Japanese European languages: French, German, Italian, Portuguese, Russian, Spanish, English"},{"@type":"PropertyValue","name":"Collection environment","value":"including store plaques, stop signs, posters, road signs, prompts and other scenes"},{"@type":"PropertyValue","name":"Collection diversity","value":"including 14 languages, various natural scenes, and multiple shooting angles"},{"@type":"PropertyValue","name":"Data format","value":"image format is .jpg, text format is .txt"},{"@type":"PropertyValue","name":"Collection equipment","value":"mobile phone, camera"},{"@type":"PropertyValue","name":"Description language","value":"English"},{"@type":"PropertyValue","name":"Text length","value":"in principle, 30~60 words, usually 3-5 sentences"},{"@type":"PropertyValue","name":"Main description content","value":"text arrangement, text content, color, scene"},{"@type":"PropertyValue","name":"Main deAccuracy ratescription content","value":"the proportion of correctly labeled images is not less than 97%"}]
{"id":1288,"datatype":"1","titleimg":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/asset/productNew/nexdata/APY231231006.jpg?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=S9MIa6xU4NUNo%2BI0K6hsmMft9oU%3D","type1":"226","type1str":null,"type2":"254","type2str":null,"dataname":"20,011 Multilingual Scene Text Image Caption Dataset for OCR & Vision AI","datazy":[{"title":"Data size","desc":"Data size","content":"20,011 pictures, 20,011descriptions"},{"title":"Language distribution","desc":"Language distribution","content":"Asian languages: Korean, Indonesian, Malay, Vietnamese, Thai, Chinese, Japanese European languages: French, German, Italian, Portuguese, Russian, Spanish, English"},{"title":"Collection environment","desc":"Collection environment","content":"including store plaques, stop signs, posters, road signs, prompts and other scenes"},{"title":"Collection diversity","desc":"Collection diversity","content":"including 14 languages, various natural scenes, and multiple shooting angles"},{"title":"Data format","desc":"Data format","content":"image format is .jpg, text format is .txt"},{"title":"Collection equipment","desc":"Collection equipment","content":"mobile phone, camera"},{"title":"Description language","desc":"Description language","content":"English"},{"title":"Text length","desc":"Text length","content":"in principle, 30~60 words, usually 3-5 sentences"},{"title":"Main description content","desc":"Main description content","content":"text arrangement, text content, color, scene"},{"title":"Main deAccuracy ratescription content","desc":"Main deAccuracy ratescription content","content":"the proportion of correctly labeled images is not less than 97%"}],"datatag":"AIGC,English caption,OCR caption,Multiple shooting angles,Multinational scenes","technologydoc":null,"downurl":null,"datainfo":null,"standard":null,"dataylurl":null,"flag":null,"publishtime":null,"createby":null,"createtime":null,"ext1":null,"samplestoreloc":null,"hosturl":null,"datasize":null,"industryPlan":null,"keyInformation":"","samplePresentation":[{"name":"/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/??10.png","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/%3F%3F10.png?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=MCVrBqb27YBjyCDI0Jnyl3bJBGA%3D","intro":"","size":0,"progress":100,"type":"jpg"},{"name":"/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/??6.png","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/%3F%3F6.png?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=YloKf4W4lvZRZqUksIOndlMhK5E%3D","intro":"","size":0,"progress":100,"type":"jpg"},{"name":"/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/??7.png","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/%3F%3F7.png?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=MaMzeRl2B1sFE7KT28iUKO33omo%3D","intro":"","size":0,"progress":100,"type":"jpg"}],"officialSummary":"This dataset contains 20,011 multilingual image-text pairs featuring natural scene text across 14 Asian and European languages. The images were collected from real-world environments, including shop signs, road signs, posters, public signage, and other outdoor and commercial scenes, with diverse camera viewpoints. All image captions are provided in English and describe the text layout, textual content, color, and other visual attributes. The dataset is ideal for Optical Character Recognition (OCR), scene text recognition, Vision-Language Models (VLMs), multimodal large language models (MLLMs), image captioning, and visual understanding applications.","dataexampl":null,"datakeyword":["scene text dataset","OCR dataset","OCR image dataset","image caption dataset","multilingual OCR dataset","vision language dataset","image-text dataset","VLM dataset"],"isDelete":null,"ids":null,"idsList":null,"datasetCode":null,"productStatus":null,"tagTypeEn":"Type","tagTypeZh":null,"website":null,"samplePresentationList":null,"datazyList":null,"keyInformationList":null,"dataexamplList":null,"bgimg":null,"datazyScriptList":null,"datakeywordListString":null,"sourceShowPage":"llm","dataShowType":"[{\"code\":\"0\",\"language\":\"ZH\"},{\"code\":\"1\",\"language\":\"ZH\"},{\"code\":\"2\",\"language\":\"EN,JP,PT,DE,KO,FR,ES\"},{\"code\":\"3\",\"language\":\"EN\"},{\"code\":\"4\",\"language\":\"JP\"}]","productNameEn":"20,011 Image Caption Data of OCR in Natural Scenes","BGimg":"","voiceBg":["/shujutang/static/image/comm/audio_bg.webp","/shujutang/static/image/comm/audio_bg2.webp","/shujutang/static/image/comm/audio_bg3.webp","/shujutang/static/image/comm/audio_bg4.webp","/shujutang/static/image/comm/audio_bg5.webp"],"firstList":[{"name":"/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/??9.png","url":"https://bj-oss-datatang-03.oss-cn-beijing.aliyuncs.com/filesInfoUpload/data/apps/damp/temp/ziptemp/APY231231006_demo1727085603555/%3F%3F9.png?Expires=4102329599&OSSAccessKeyId=LTAI8NWs2pDolLNH&Signature=VEHblArfRzk5e3PLr2jzicBVmRY%3D","intro":"","size":0,"progress":100,"type":"jpg"}]}
20,011 Multilingual Scene Text Image Caption Dataset for OCR & Vision AI
scene text dataset
OCR dataset
OCR image dataset
image caption dataset
multilingual OCR dataset
vision language dataset
image-text dataset
VLM dataset
This dataset contains 20,011 multilingual image-text pairs featuring natural scene text across 14 Asian and European languages. The images were collected from real-world environments, including shop signs, road signs, posters, public signage, and other outdoor and commercial scenes, with diverse camera viewpoints. All image captions are provided in English and describe the text layout, textual content, color, and other visual attributes. The dataset is ideal for Optical Character Recognition (OCR), scene text recognition, Vision-Language Models (VLMs), multimodal large language models (MLLMs), image captioning, and visual understanding applications.
This is a paid datasets for commercial use, research purpose and more. Licensed ready made datasets help jump-start AI projects.
Specifications
Data size
20,011 pictures, 20,011descriptions
Language distribution
Asian languages: Korean, Indonesian, Malay, Vietnamese, Thai, Chinese, Japanese European languages: French, German, Italian, Portuguese, Russian, Spanish, English
Collection environment
including store plaques, stop signs, posters, road signs, prompts and other scenes
Collection diversity
including 14 languages, various natural scenes, and multiple shooting angles
Data format
image format is .jpg, text format is .txt
Collection equipment
mobile phone, camera
Description language
English
Text length
in principle, 30~60 words, usually 3-5 sentences
Main description content
text arrangement, text content, color, scene
Main deAccuracy ratescription content
the proportion of correctly labeled images is not less than 97%