Hugging Face Blog·· 28 天前AI 评分49
如何用 100 步 GRPO 微调 LFM2.5-350M,提升结构化输出表现
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
LFM2.5-350M 经 100 步 GRPO 微调后,IFStruct 通过率从 22.6% 提升至 29.7%。该教程使用 TRL 和约 500 个样本训练,可在免费档 Colab 或 Kaggle GPU 上运行,完整流程已在 GitHub 公开。
来源:Hugging Face Blog · huggingface.co