Hugging Face Blog·· 2026-07-06AI 评分43
PRX 第 4 部分:训练数据策略
PRX Part 4: Our Data Strategy
AI 导读
PRX 团队将公共与内部数据集混合,用 VLM 重新生成图像描述,构建用于训练的流式语料。其 7B 模型预训练重视覆盖面与多样性,采用准确的长描述和轻量过滤。数据管线用 Lance 整理、MDS 流式读取;改用 Qwen3-VL 后,训练时实时计算文本潜在表示,吞吐量代价约为 3–4%。
来源:Hugging Face Blog · huggingface.co