WanJuan 1.0 Corpus
dataset Your tags
Your notes
Massive high-quality multimodal pre-training corpus containing over 2TB of English and Chinese text, image-text pairs, and video.
Related
Notes
arXiv submission Aug 21, 2023.
arXiv submission Aug 21, 2023.