LLM 能干活,AI 别吹太满
社区讨论 · 赛道

LLM 能干活,AI 别吹太满

烨霖不恰饭烨霖不恰饭9月12日2026/09/12 65 浏览

周末折腾了一下“LLMs are real, AI is fake”这个话题,踩了不少坑。起因是 Hacker News 上那篇 Pluralistic,标题很冲,说大语言模型是真的,所谓 AI 是假的。我把它当定义吵架,丢进手边几个模型实测了一下,结果做产品的人真会被它坑到。

先说清楚词。LLM 是大语言模型,就是按概率续写句子的文字机器。AI 是人工智能,帽子更大,包括搜索、推荐、规则系统,也包括商家拿来吹通用智能的那套东西。论坛里两种声音都有。

有人说 LLM 就是 AI 的一种实现,也有人说所谓 AI 只是套着机器人外衣的预测机器。

我用了两个方案跑。方案A,直接问模型:“LLM 是不是真的 AI,AI 是不是假的,帮我写一段适合公众号的说明。”方案B,要求它先拆概念,再给可核验来源,再区分事实、观点和营销话术,最后给一句短结论。

方案A我主要用 OpenAI,用了大概两个月,日常问答已经挺熟。某个带 Daybreak Blue 的版本也跑了,用了三周,中文长文结构感不错。界面里就是聊天框,粘贴问题,点发送。返回很快,我这边十几条问题里,单条大多在半分钟到一分钟之间。问题是它太爱把话说圆。比如它会写“LLM 展现了某种意义上的智能”,听起来像哲学,实际没法验证。还有两条把“能根据上下文调用工具”说成“能自主规划”,这就有点过了。它顺着最常见的人类话术往下接。

我这边截图里那个 SelectionPlaneDriverPanel 特写,看着像参数面板,温度、最大长度、联网开关都摆着。用户会误以为调一下参数,模型就从文字机器变成可靠智能体。

调参数不会改变知识边界,只会改变输出风格。

方案B慢很多。我把 prompt 改成“不要给漂亮结论,先列来源类型,再标注哪些来自论文、哪些来自媒体、哪些来自论坛讨论”。该模型会输出一个更像报告的版本,但来源质量参差。它引用了 Reddit 帖子、Medium 文章,也有 arXiv 那种论文摘要。我人工点开看了几条,论文那部分还算硬,论坛那部分只能当观点样本。Moonshot AI 是我这三天才试的,中文表达顺,分点清楚,但也会自动补一句“从技术哲学角度看”。DeepSeek 我用了一个月,整理复杂说法很顺,但不压它,结论还是太圆。WorkBuddy 我之前写过,别先做研报,先做一张能查来源的盘后日报,现在看还是这个理。

跑下来,方案A大约一分钟,方案B要两到四分钟,因为要列来源、拆观点。我这边测了大约15条,方案A有两条把模型能力说满,方案B有一条把新闻标题日期写错,另外有一条来源写得太泛,没法直接点开。差距不算夸张,但方向很清楚,不核验,LLM 很会安慰人;核验,LLM 才开始有用。所谓幻觉,是它把听起来像那么回事优先给了真不真。

所以我的结论是看情况。如果你只是想快速得到一段能改的草稿,方案A推荐,省时间。做科普、测评、产品文档,方案B更稳。不适合把 LLM 当法官,不适合让它替你判断有没有 AGI。适合当资料员、改写员、初稿生成器。惊喜是方案B能把正反观点分开,但我还得自己挑可信度。LLM 不是全知 AI,但它可以是很称职的文字检索员。

这个价格值不值?免费额度下,方案A值,因为快。方案B也值,但它值的是减少返工的时间,不是替你做决定。烂的地方我也说烂,很多产品把 LLM 包装成智能体,进度条一拉,文案写正在自主规划,用户容易以为它在思考,很多时候只是几个 prompt 在排队。关键看有没有把来源、失败原因、人工核验入口放出来。

后面我会把核验按钮做成默认项,而不是让用户自己点。


📌 本文编译自 Hacker News,原文 https://pluralistic.net/2026-09-12/god-in-the-box/

版权归原作者所有,本文为基于公开报道的编译与独立分析。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧