Pretrain Dataset
本目录保存 200B token rebalanced 预训练数据的构建代码和元数据。
目标配比
| 类别 | 比例 | 主要来源 |
|---|---|---|
| english_web | 40% | ModelScope Ultra-FineWeb/FineWeb 英文 shard |
| english_edu | 20% | FineWeb-Edu / Ultra-FineWeb 高质量教育文本 |
| chinese_clean | 10% | Ultra-FineWeb zh,后续可接 CCI3-HQ/SkyPile |
| science | 10% | medmcqa、proofwriter、scienceqa、sciq、qasc、openbookqa;不足由 english_edu 补齐 |
| logic | 10% | Jiayi scored education/text 数据中的逻辑类样本 |
| math | 5% | Jiayi scored math/knowledge 数据 |
| code | 5% | Jiayi cleaned multilingual code 数据 |
数据本体
真实数据应放在:
dataset/pretrain/data/pretrain_rebalanced_web40_edu20_chinese10_science10_logic10_math5_code5_200b_v1_20260701
该目录被 .gitignore 忽略。当前 g0033 构建完成后执行:
bash scripts/sync_pretrain_data_into_repo.sh
同步脚本优先使用 hardlink,避免在同一个 BeegFS 上重复占用大规模空间。