China’s Embodied Dataset Bet — Open Trajectories for Physical AI
Chinese research/industry consortium open-sourced a large multimodal embodied dataset (March coverage): 10M+ trajectories, multi-morphology robots, vision/force/audio/proprioception, CN/EN language annotations — claimed among world’s largest open physical-interaction sets. Strategic open-data move; ‘largest’ is claimant language.

Sim-to-real still dies on missing real trajectories. China’s proprietary play: open a national-scale embodied multimodal corpus so physical AI training is not only a closed lab asset — and claim global “largest” status while doing it.
A consortium of Chinese research institutions and companies released what they claim is among the world’s largest open multimodal datasets focused on physical interaction and robotics. Reported contents: over 10 million trajectories; multiple robot morphologies; synchronized vision, touch/force, audio, proprioception; natural language annotations in Chinese and English. Access via national research platforms and open-source communities; builds on standardized embodied-data efforts (coverage cites PaXini and related national programs around early 2026). Pandaily and industry reports carried the March window.
Claims vs checks
Release existence and scale claims are consortium / secondary press (Pandaily, industry). “World’s largest” is claimant — not independently measured here against Open X-Embodiment-class corpora. Annotation quality and license terms need primary dataset cards.
Limits
- Trajectory count ≠ task diversity or success-rate labels.
- Export/access controls may limit non-China researchers in practice.
- Embodied progress still needs hardware and policy, not only data.
Sources
- Pandaily and industry reports on China open-source embodied AI dataset platform (March 2026).
- Company and research announcements (e.g., PaXini and national efforts around early 2026).
- Coverage of embodied AI data initiatives in Chinese tech ecosystem (March 2026).