谷歌 ToolGrad:500 条数据让 12B 模型工具调用追平旗舰
Google Research 9 月 10 日发布 ToolGrad:先造出真实的工具调用链再反推用户指令,一次 LLM 调用即可产出样本,数据集生成通过率 99.8%。
用 500 条样本微调 Gemma-3-12B,BFCL 得 83.1——比 Gemini 2.5 Pro 的 83.2 只差 0.1,并超过 Claude 4.5 Opus 的 82.8。工具调用不再是旗舰模型的专属能力,数据配方比参数量更能决定这一项成绩。
原文链接:Google Research 官方博客