题库枯了,AI开始给自己出题:手把手跑通数据层RSI
先说个我这两天实测的场景。你训模型,喂了一堆题,跑着跑着发现效果上不去了。不是模型笨,是题被做完了。就像你刷题刷到把答案都背下来,再刷新题也没用。
这时候有个思路叫 RSI,全称 Recursive Self-Improving,大白话就是让 AI 自己参与迭代自己。不是让它自己写代码那么玄乎,我这次跑的是最接地气的一层:数据层。让 AI 自己出题,自己校验,自己筛掉烂题,然后拿这些新题去训自己。
我花了大概一周,从零跑通了一个最小流程。下面按时间线写,你照着做就行。
第一天:理解「AI 给自己出题」到底在干嘛
先别碰代码。你需要的核心就一个概念:数据增强。意思是,你手里有一批人工标注好的题(比如“这张图是猫”),AI 根据这批题“仿写”出更多类似的题(比如换个角度、换个背景的猫),然后你拿这些新题继续训练它。
为什么要这么做?因为人工标注又贵又慢。我客户那边标注一批图片分类数据,三个人标了两周,才一万张。AI 一小时能生成五万张,虽然质量参差,但筛一筛能用。
你不需要懂模型原理,只需要懂一个流程:旧题 → AI 生成新题 → 自动校验 → 留下合格的新题 → 丢回去训练。
第三天:动手跑数据生成
我建议你先别上大模型,用你自己手头现成的工具就行。我用的是之前一直跑的 OpenAI 接口,配合一个开源的小模型做校验,两头配合。
具体步骤:
- 准备一个纯文本文件,里面放 50 条你已有的“题”。我这边用的是简单的数学应用题,格式是
问题||答案,每条一行 - 写一段提示词,让 AI 模仿这些题的风格,生成 20 条新题。提示词我大概这么写的:“你是数学老师,参考以下题目风格,新出 20 道同难度的应用题,格式保持一致”
- 把生成的 20 条新题存到另一个文件里,人工看一眼,你会发现大概有 3-5 条是能用的,其余要么逻辑不通,要么格式跑偏
这一步就一个关键动作:让 AI 输出严格的格式。如果它自由发挥,你后面解析会想摔键盘。
一周后:加上自动校验,跑完全流程
我大概第四天开始写校验环节。思路很简单:让另一个 AI 当“考官”,把新题和标准答案一起丢给它,让它判断“这题有没有歧义”“答案对不对”。
- 把上一步生成的 20 条新题逐条丢给校验模型,让它输出
通过或不通过 - 通过的题人工再过一眼(我这边大概 10 条能过 6 条)
- 把通过的题和原始 50 条合并,重新训练一轮
跑完一轮之后,我拿测试集测了一下,准确率从 78% 涨到了 82%。不算惊艳,但确实动了。而且这轮跑完,我手里多了 6 条人工没标过的新题,这是纯增量。
踩坑提示:最容易翻车的地方在第一轮生成。AI 生成的题偶尔会“自己编答案”,就是问题问的是 A,答案写的却是 B,但读起来很顺。我一开始没校验直接合并训练,结果模型学歪了,准确率反而掉了 3 个点。所以校验这步不能省。
另外,生成题目的数量别贪多。我试过一次生成 100 条,结果里面有一半是重复句式,质量比 20 条的批次差很多。小批量多次,效果更稳。
这套东西值不值得折腾
说实话,如果你只是玩票,人工标点数据够用了。但如果你手上有一批数据,而且业务场景比较固定,这套流程能让你省下不少标注费。我这边测下来的成本,生成 100 条新题加校验,API 费用大概不到几块钱,比人工便宜一个量级。
硅谷那边 Jeff Dean 出来搞的 Discovery Loop 也是这个方向,不过那是全自动跑科研,咱们这个只是数据层的小闭环。但思路是通的:让 AI 参与迭代自己,先从喂给它的数据开始。
学完这个,下一步可以试试把校验环节换成更强的大模型,或者对生成结果做聚类去重。我这边正准备跑第二轮,看看连续迭代几轮之后,准确率会不会继续涨。
物界前沿