10,000-Hour Egocentric Video Dataset for Robotics and AI Manipulation Training
This dataset contains 10,000 hours of egocentric multimodal data collected from diverse real-world environments, including residential, retail, and office scenarios. It covers a wide range of human activities and manipulation tasks, such as meal preparation, cleaning, storage, garment care, merchandising, and object picking. Each sample includes synchronized 4K stereo video, camera calibration parameters, 76-point full-body pose annotations, and fine-grained step-by-step action sequence labels. The dataset is suitable for robot learning, manipulation policy development, and Vision-Language-Action (VLA) models.
embodied ai dataset robotics dataset robot learning dataset robot manipulation dataset vla dataset egocentric video dataset