社区讨论 · 政策

先说我测出来的结论:这个AI素养测评工具,暴露的不是AI笨,是我们大多数人根本不会跟AI说话

冯sir冯sir8月9日2026/08/09 328 浏览

上周在实验室里跑完模型推理,顺手把学生交上来的一个AI素养测评链接点开了。这个工具本身是个聊天机器人,会让你跟它互动20到40分钟,然后根据你的对话习惯给你一份评估报告。我本来以为就是走个过场,结果跑完之后,我坐在屏幕前愣了好一会儿。

先说背景。我带研究生带了不少年,这两年最头疼的事,就是学生写论文的时候,AI用的结果参差不齐。有人用AI改文献综述,改得像模像样,有人用AI写实验方案,写出来全是教科书套话。我一直以为是模型能力差异导致的,但这个测评工具给了我一个完全不同的视角。

工具的逻辑很简单,它就是个聊天机器人,但背后有一套评估体系,看你提问的方式、追问的深度、对模糊回答的反应。我测下来大概用了35分钟,中间有几次真的被它问住了。

最让我意外的一个发现是,大多数人跟AI对话的时候,用的是跟搜索引擎一样的思维。我这边接触到的数据说,1800个真实用户里,绝大部分人第一次提问用的都是关键词堆砌,比如“AI 教育 风险”,而不是一个完整的、有上下文的问题。这直接导致AI给出的回答特别泛,然后用户就觉得AI不行。

但有意思的是,同样的这批人,如果被引导着把问题说完整,比如“帮我分析AI在课堂场景里对创造力的影响,重点考虑小学阶段”,AI的回答质量会明显上一个台阶。这个工具最狠的地方,就是它会故意给你一个模糊的回答,看你会不会追问。我测下来,超过六成的人在这种情况下会直接放弃,换一个新问题,而不是继续深挖。

从计算机视觉的角度看,这就像你在ImageNet上训了一个模型,发现它对模糊图片的处理能力其实很强,但大部分人只给它看了清晰的正脸照就下结论说它不能识别。问题不在模型,在使用者。

我拿这个工具给我的一个研究生试了试,他平时用AI用得挺溜的,但测出来有个问题,他太容易接受AI给出的第一个答案了。这个工具的报告里专门有一项叫“批判性追问”,他得分很低。我后来想想,这可能就是为什么他写的文献综述总是差一口气,他根本没有验证AI给出的引用是不是真的存在。

工具本身也有一些让我不太满意的地方。它的评估维度有点偏向西方学术语境,对中文表达习惯的适配一般,有些地方我明显是用中文思维方式在回答问题,它给出的反馈却像是在评价一个英文母语者。另外,它给的报告有点过于“量化”,把对话行为简化成了一系列分数,但对话里的上下文、意图、情绪这些东西,是没法完全用分数来衡量的。

不过整体来说,这个工具的价值不在于它测得多准,而在于它逼着你重新审视自己跟AI的互动方式。黄仁勋在CMU毕业演讲里说,替代你的不是AI,而是比你更会用AI的人。我原来觉得这话有点营销味,但用这个工具测完之后,我信了一半。

上周跟学生讨论的时候,我提了一个想法,能不能把这类测评工具纳入研究生入学培训。不是用来筛选谁会用AI,而是用来建立一个基线,三个月后再测一次,看看变化。我这边初步试下来,效果是有的,但还要多跑几轮数据才能下结论。

往后看,我觉得这类工具会越来越重要,不是因为它们测得多准,而是因为它们第一次把“跟AI对话”这件事从一个模糊的感觉,变成了一个可以度量、可以训练的能力。就像我教计算机视觉的时候,第一步永远是让学生学会标注数据,你连数据都标不清楚,后面跑什么模型都是白搭。跟AI对话也是一样,你连问题都问不清楚,后面所有的产出都是空中楼阁。

这个工具值得一试,但别把它当成考试,把它当成一面镜子,看看你自己在AI面前,到底是个什么样的对话者。


:pushpin: 本文编译自 Hacker News,原文:Things I learned about how people use AI after 1800 people | Hacker News
版权归原作者所有,本文为基于公开报道的编译与独立分析。

2 条回复

?
Ctrl + Enter 快速回复
一只鹿
一只鹿8月9日

笑死,这说的不就是我上周面试候选人的情形吗…简历上写“精通Python”,一问项目细节就开始含糊其辞。跟AI说话一个道理,你不给上下文,它就只能给你套话。我最近用WorkBuddy筛简历也是这感觉,大家都在堆关键词,但真正会讲清楚自己做过啥的人太少了。

算子融合了吗

这个测评工具链接能私发一下不,我最近在试Qwen-7B刚上手,感觉提问方式确实影响很大。之前也遇到过类似情况,用关键词问出来的全是套话,后来改成完整的问题带上下文,回答质量完全不一样。

先说我测出来的结论:这个AI素养测评工具,暴露的不是AI笨,是我们大多数人根本不会跟AI说话 - 物界前沿论坛