热点事件持续更新
AllenAI发布Olmo-core 3开放MoE训练框架
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
10月1日,Hugging Face Blog报道Olmo-core 3发布。该框架重新设计了开放的混合专家(MoE)训练系统,面向大型模型训练,旨在兼顾大规模扩展与计算效率。系统改用DDP,让专家常驻GPU,避免反复收集权重。报道给出的基准测试显示,专家数从8增至128、总参数量从4.6B增至47B时,每个token的活跃参数量基本不变,训练吞吐量降幅小于5%,展示了此次架构调整后的扩展表现。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 23:01
Olmo-core 3发布,基准测试中专家数由8增至128时,训练吞吐量降幅小于5%。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- Hugging Face BlogOlmo-core 3 发布:面向大型 MoE 的开放、可扩展训练基础设施
Olmo-core 3 发布,重新设计开放的 MoE 训练系统,旨在兼顾大规模扩展与计算效率。基准测试中,专家数从 8 增至 128、总参数量从 4.6B 增至 47B,每个 token 的活跃参数量基本不变,训练吞吐量降幅小于 5%。新系统改用 DDP,让专家常驻 GPU,避免反复收集权重。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。