社区讨论 · 赛道

题库枯了,AI开始给自己出题:手把手跑通数据层RSI

烨霖不恰饭烨霖不恰饭8月9日2026/08/09 237 浏览

先说个我这两天实测的场景。你训模型,喂了一堆题,跑着跑着发现效果上不去了。不是模型笨,是题被做完了。就像你刷题刷到把答案都背下来,再刷新题也没用。

这时候有个思路叫 RSI,全称 Recursive Self-Improving,大白话就是让 AI 自己参与迭代自己。不是让它自己写代码那么玄乎,我这次跑的是最接地气的一层:数据层。让 AI 自己出题,自己校验,自己筛掉烂题,然后拿这些新题去训自己。

我花了大概一周,从零跑通了一个最小流程。下面按时间线写,你照着做就行。

第一天:理解「AI 给自己出题」到底在干嘛

先别碰代码。你需要的核心就一个概念:数据增强。意思是,你手里有一批人工标注好的题(比如“这张图是猫”),AI 根据这批题“仿写”出更多类似的题(比如换个角度、换个背景的猫),然后你拿这些新题继续训练它。

为什么要这么做?因为人工标注又贵又慢。我客户那边标注一批图片分类数据,三个人标了两周,才一万张。AI 一小时能生成五万张,虽然质量参差,但筛一筛能用。

你不需要懂模型原理,只需要懂一个流程:旧题 → AI 生成新题 → 自动校验 → 留下合格的新题 → 丢回去训练。

第三天:动手跑数据生成

我建议你先别上大模型,用你自己手头现成的工具就行。我用的是之前一直跑的 OpenAI 接口,配合一个开源的小模型做校验,两头配合。

具体步骤:

  1. 准备一个纯文本文件,里面放 50 条你已有的“题”。我这边用的是简单的数学应用题,格式是 问题||答案,每条一行
  2. 写一段提示词,让 AI 模仿这些题的风格,生成 20 条新题。提示词我大概这么写的:“你是数学老师,参考以下题目风格,新出 20 道同难度的应用题,格式保持一致”
  3. 把生成的 20 条新题存到另一个文件里,人工看一眼,你会发现大概有 3-5 条是能用的,其余要么逻辑不通,要么格式跑偏

这一步就一个关键动作:让 AI 输出严格的格式。如果它自由发挥,你后面解析会想摔键盘。

一周后:加上自动校验,跑完全流程

我大概第四天开始写校验环节。思路很简单:让另一个 AI 当“考官”,把新题和标准答案一起丢给它,让它判断“这题有没有歧义”“答案对不对”。

  1. 把上一步生成的 20 条新题逐条丢给校验模型,让它输出 通过 或 不通过
  2. 通过的题人工再过一眼(我这边大概 10 条能过 6 条)
  3. 把通过的题和原始 50 条合并,重新训练一轮

跑完一轮之后,我拿测试集测了一下,准确率从 78% 涨到了 82%。不算惊艳,但确实动了。而且这轮跑完,我手里多了 6 条人工没标过的新题,这是纯增量。

踩坑提示:最容易翻车的地方在第一轮生成。AI 生成的题偶尔会“自己编答案”,就是问题问的是 A,答案写的却是 B,但读起来很顺。我一开始没校验直接合并训练,结果模型学歪了,准确率反而掉了 3 个点。所以校验这步不能省。

另外,生成题目的数量别贪多。我试过一次生成 100 条,结果里面有一半是重复句式,质量比 20 条的批次差很多。小批量多次,效果更稳。

这套东西值不值得折腾

说实话,如果你只是玩票,人工标点数据够用了。但如果你手上有一批数据,而且业务场景比较固定,这套流程能让你省下不少标注费。我这边测下来的成本,生成 100 条新题加校验,API 费用大概不到几块钱,比人工便宜一个量级。

硅谷那边 Jeff Dean 出来搞的 Discovery Loop 也是这个方向,不过那是全自动跑科研,咱们这个只是数据层的小闭环。但思路是通的:让 AI 参与迭代自己,先从喂给它的数据开始。

学完这个,下一步可以试试把校验环节换成更强的大模型,或者对生成结果做聚类去重。我这边正准备跑第二轮,看看连续迭代几轮之后,准确率会不会继续涨。

3 条回复

?
Ctrl + Enter 快速回复
钟瑾瑜
钟瑾瑜8月9日

我观众反馈说,AI生成样本的多样性是个大问题,光靠校验模型很难拦住那种“看起来像但逻辑不对”的题。楼主你校验那层用的是纯规则还是小模型判?我出一期视频讲这个案例,可以帮大家避坑。

路过
路过8月9日

生成容易筛题难啊兄弟,我跑AI Agent的时候也碰到过,AI出题半小时,筛题筛了两天,烂题各种姿势烂,最后人工过一遍才敢混进训练集……你校验那层用的啥规则?纯规则匹配还是也上模型判?

座舱控
座舱控8月9日

我持保留意见。听起来很美好,但实际跑起来问题不少。我这几周在玩比亚迪人形机器人,也试过类似的数据增强路子,AI自己生成的样本很多是表面像、内核虚的,校验环节根本筛不干净。你拿这些去训模型,短期数据量涨了,但泛化能力反而可能更差。楼主这个流程跑通可以,但“照着做就行”说得太轻巧了。