核心发布

9月3日,Hugging Face 在官方博客发布《Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps》指南,公布以 Group Relative Policy Optimization(GRPO)配合 TRL 库微调 LiquidAI LFM2.5-350M 的公开配方。据官方宣布,该配方仅用约 500 样本、100 训练步,在 IFStruct 基准上将结构化输出合规率从本地基线 22.6% 提升至 29.7%。这是 Hugging Face 官方当日发布的正式内容,博客标注发布时间为 2026-09-03,配套 Notebook 已在 GitHub 开源。

方法与实现要点

官方说明,训练以较小成本完成工程闭环:基座为 LFM2.5-350M,加载 LoRA(r=16,alpha=32)约 600 万参数,目标模块覆盖注意力与前馈相关层;数据采用 nvidia/Nemotron-RL-instruction_following-structured_outputs,并对 40% 样本追加围栏代码块指令、20% 样本转为裸数组任务以贴合 IFStruct 分布;奖励由 json_format_reward、field_count_reward、schema_validation_reward 三项按 1.0/0.5/2.0 加权,训练配置为 8 路采样、温度 1.1、KL 系数 0.01,适合 16GB 免费 GPU。

  • 训练与复现要点:约 500 样本、100 步;LoRA 约 600 万参数;三项奖励加权;需 uv 与 llama.cpp,评估可通过本地 llama-server 以 OpenAI 兼容接口完成。

评测结果与复现说明

官方在本地以 llama.cpp serving BF16 GGUF 版测得基线 452/2000 通过(22.6%),其中 JSON 18.0%、YAML 27.2%,与 Liquid AI 博客公布的 21.1% 基线接近,差异来自同栈服务差异;微调后提升至 29.7%,官方称主要改善字段缺失与类型错配。编辑说明:该结果来自官方在同一本地栈的对比评测,非独立第三方复验,尚未经过同行评审,读者应在自有任务上验证迁移效果。

限制与使用建议

官方强调,该配方未复刻 Liquid AI 训练 IFStruct 基准分数所用的完整管线,仅展示面向小模型的任务级微调能力;验证限于 350M 规模与 IFStruct 2000 样本,未覆盖更大模型或全量下游任务。实际使用时,建议先在测试集评估 JSON/YAML 合规与延迟表现,再决定是否在生产接入;中英文及多格式场景需额外验证。相关 Notebook、数据集 LiquidAI/ifstruct-v1.0 与评测工具已开源,开发者可在免费 Colab/Kaggle 环境按官方步骤一键复现。