跳到正文
热点事件持续更新

AllenAI发布Olmo-core 3开放MoE训练框架

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

10月1日,Hugging Face Blog报道Olmo-core 3发布。该框架重新设计了开放的混合专家(MoE)训练系统,面向大型模型训练,旨在兼顾大规模扩展与计算效率。系统改用DDP,让专家常驻GPU,避免反复收集权重。报道给出的基准测试显示,专家数从8增至128、总参数量从4.6B增至47B时,每个token的活跃参数量基本不变,训练吞吐量降幅小于5%,展示了此次架构调整后的扩展表现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. Hugging Face Blog
    Olmo-core 3 发布:面向大型 MoE 的开放、可扩展训练基础设施

    Olmo-core 3 发布,重新设计开放的 MoE 训练系统,旨在兼顾大规模扩展与计算效率。基准测试中,专家数从 8 增至 128、总参数量从 4.6B 增至 47B,每个 token 的活跃参数量基本不变,训练吞吐量降幅小于 5%。新系统改用 DDP,让专家常驻 GPU,避免反复收集权重。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。