CRAFT:把评分标准变成模型的「待办清单」

一种新方法深挖评测细则,不只找出模型「在哪里」失败,还能定位它到底缺哪项底层能力,再生成精准针对这个短板的训练数据。

未核实 来源 arXiv preprint (author-reported experiments) ⚑ Evaluation & fine-tuning

60 秒版本

CRAFT 挖掘评分细则里的每条评分标准,诊断出模型具体的薄弱能力,再生成正好瞄准这些缺口的微调数据。

要点

  • 把每条评分标准当作一项能力的探针,再聚成一棵层级技能树。
  • 在每个节点给模型打分,并跨层级动态挑出薄弱点——选在每个失败最清楚的放大层级。
  • 在金融与法律的 4 个开源模型上,用 CRAFT 诊断重训的模型击败了提示词层的 EvalTree 和随机练习数据(作者自报结果)。
  • 注意:单篇预印本、自报数字,且需要已有基于评分细则的评测才能用。

结论. 一个锋利的重构——在「标准」层而非「提示词」层做诊断——把评测变成一份有针对性的训练计划。有前景,但尚未复现。

问题评测只说「在哪失败」,不说「为什么」

把模型跑一遍基准,你会知道它在某些题、某些话题或某类问题上考砸了。你得不到的,是背后的原因——是法律推理弱?算术马虎?还是格式出错?失败的真正成因始终被留白。而只要你说不出坏掉的是哪项能力,就无法可靠地修它,也无法为下一轮训练生成对症的练习数据。

多数评测告诉你模型在哪里失败,却很少告诉你它到底不会什么

巧思每一条评分标准都是一个能力探针

CRAFT(聚类评分标准以诊断薄弱能力并生成针对性微调数据)从一个简单的重构出发。严肃的评测往往是基于评分细则的:每道题都配着一组由裁判勾选的评分标准。CRAFT 把每一条标准——比如「正确适用诉讼时效」——都看作一次对某项具体能力的测量,而不只是一个勾选框。

  • 提取——读遍每个「提示词+评分标准」的组合,为每条标准写下它所测能力的朴素描述。
  • 聚类——把这成千上万条描述聚成一棵层级能力树:宽泛的能力在顶端,细窄的在叶子。
  • 打分——在树的每个节点上评估目标模型。
  • 选点——跨层级动态地挑出表现差的节点,在每个短板最清楚的粒度上去选。
  • 生成——用这些薄弱节点去指导有针对性的微调数据生成。

优雅之处短板藏在不同的放大层级上

模型的盲区并不都在同一分辨率上。有时一整根宽枝都弱,有时只有一片窄叶弱。CRAFT 不像提示词层或类别层方法那样预先固定放大倍数,而是逐个失败地选择「海拔」,在短板暴露得最锐利处去读它。产出是一份针对该模型的诊断,而这份诊断同时就是一份「该造哪些练习数据」的指令清单。

有效吗?重训后的模型,留出集上验证

在固定数据生成、微调和评测设置的前提下,作者让 CRAFT 对阵 EvalTree(在更粗的提示词层聚类)和纯随机(不加针对)的数据生成。他们在金融与法律领域、四个开源模型上测试,并在 13 个刻意与诊断数据不相交的留出基准上打分——让模型无法靠背题取巧。

设置含义
4 个开源模型被诊断并微调的对象
2 个领域金融与法律
13 个留出基准与诊断数据不相交
金融结果CRAFT 在全部 4 个模型上取得最强领域平均分
法律结果4 个中 3 个最强;第 4 个在波动区间之内

金融领域是最干净的胜利;法律更参差,但从未明显落后。一致的结论是:在评分标准层面(而非提示词或类别)做诊断,既给出了「模型不会什么」的更锐利画面,也在依此微调后带来了可测量的更好模型。

为何重要从「给模型打分」到「替它写作业」

更大的转变是把闭环合上。只产出一个分数的评测是死胡同;而一个能产出「按合适粒度排好序的缺失技能清单」的评测,就成了下一轮训练的第一步。CRAFT 不再问模型在哪里失败,而是问它到底不会什么——然后把补课的练习册直接递给你。