跳到正文
原文
Hugging Face Blog·· 28 天前精选AI 评分60

LFM2.5-350M 如何用 GRPO 提升结构化输出合规性

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face Blog 给出使用 TRL 和 GRPO 微调 LFM2.5-350M 的公开流程,在约 500 个样本和 100 个训练步骤后,IFStruct 通过率从 22.6% 提升至 29.7%。该流程使用 LoRA 训练约 6M 参数,并在相同服务栈下比较基础模型与微调模型,JSON 通过率由 18.0% 提升至 31.9%,YAML 由 27.2% 变为 27.5%。

推荐理由

文章给出基于 TRL 和 GRPO 的小模型结构化输出微调流程,并用同一 IFStruct 服务栈展示 22.6% 到 29.7% 的可复现实测变化。

来源:Hugging Face Blog · huggingface.co