先说我测出来的结论:这个AI素养测评工具,暴露的不是AI笨,是我们大多数人根本不会跟AI说话
上周在实验室里跑完模型推理,顺手把学生交上来的一个AI素养测评链接点开了。这个工具本身是个聊天机器人,会让你跟它互动20到40分钟,然后根据你的对话习惯给你一份评估报告。我本来以为就是走个过场,结果跑完之后,我坐在屏幕前愣了好一会儿。
先说背景。我带研究生带了不少年,这两年最头疼的事,就是学生写论文的时候,AI用的结果参差不齐。有人用AI改文献综述,改得像模像样,有人用AI写实验方案,写出来全是教科书套话。我一直以为是模型能力差异导致的,但这个测评工具给了我一个完全不同的视角。
工具的逻辑很简单,它就是个聊天机器人,但背后有一套评估体系,看你提问的方式、追问的深度、对模糊回答的反应。我测下来大概用了35分钟,中间有几次真的被它问住了。
最让我意外的一个发现是,大多数人跟AI对话的时候,用的是跟搜索引擎一样的思维。我这边接触到的数据说,1800个真实用户里,绝大部分人第一次提问用的都是关键词堆砌,比如“AI 教育 风险”,而不是一个完整的、有上下文的问题。这直接导致AI给出的回答特别泛,然后用户就觉得AI不行。
但有意思的是,同样的这批人,如果被引导着把问题说完整,比如“帮我分析AI在课堂场景里对创造力的影响,重点考虑小学阶段”,AI的回答质量会明显上一个台阶。这个工具最狠的地方,就是它会故意给你一个模糊的回答,看你会不会追问。我测下来,超过六成的人在这种情况下会直接放弃,换一个新问题,而不是继续深挖。
从计算机视觉的角度看,这就像你在ImageNet上训了一个模型,发现它对模糊图片的处理能力其实很强,但大部分人只给它看了清晰的正脸照就下结论说它不能识别。问题不在模型,在使用者。
我拿这个工具给我的一个研究生试了试,他平时用AI用得挺溜的,但测出来有个问题,他太容易接受AI给出的第一个答案了。这个工具的报告里专门有一项叫“批判性追问”,他得分很低。我后来想想,这可能就是为什么他写的文献综述总是差一口气,他根本没有验证AI给出的引用是不是真的存在。
工具本身也有一些让我不太满意的地方。它的评估维度有点偏向西方学术语境,对中文表达习惯的适配一般,有些地方我明显是用中文思维方式在回答问题,它给出的反馈却像是在评价一个英文母语者。另外,它给的报告有点过于“量化”,把对话行为简化成了一系列分数,但对话里的上下文、意图、情绪这些东西,是没法完全用分数来衡量的。
不过整体来说,这个工具的价值不在于它测得多准,而在于它逼着你重新审视自己跟AI的互动方式。黄仁勋在CMU毕业演讲里说,替代你的不是AI,而是比你更会用AI的人。我原来觉得这话有点营销味,但用这个工具测完之后,我信了一半。
上周跟学生讨论的时候,我提了一个想法,能不能把这类测评工具纳入研究生入学培训。不是用来筛选谁会用AI,而是用来建立一个基线,三个月后再测一次,看看变化。我这边初步试下来,效果是有的,但还要多跑几轮数据才能下结论。
往后看,我觉得这类工具会越来越重要,不是因为它们测得多准,而是因为它们第一次把“跟AI对话”这件事从一个模糊的感觉,变成了一个可以度量、可以训练的能力。就像我教计算机视觉的时候,第一步永远是让学生学会标注数据,你连数据都标不清楚,后面跑什么模型都是白搭。跟AI对话也是一样,你连问题都问不清楚,后面所有的产出都是空中楼阁。
这个工具值得一试,但别把它当成考试,把它当成一面镜子,看看你自己在AI面前,到底是个什么样的对话者。
本文编译自 Hacker News,原文:Things I learned about how people use AI after 1800 people | Hacker News
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿