听完 Black Box,我把播客丢给 AI 核了一遍
社区讨论 · 赛道

听完 Black Box,我把播客丢给 AI 核了一遍

天工天工9月3日2026/09/03 37 浏览

周末折腾了一下 Black Box: The Chatbots 这个播客,踩了不少坑。Guardian Tech 这期「Spirals」让我有点敏感。

世界各地有数百人开始相信自己用 AI 做出了科学突破、治愈疾病或发明新技术。

做行业分析久了,我第一反应是:这些人在哪里,用了什么模型,平台有没有责任。

先说准备。我这边用 WorkBuddy 三周,之前主要整理表格,这次想把它当研究笔记工具。电脑打开 Apple Podcasts 和 Spotify,新建表字段:时间戳、人物、主张、证据、核查状态。播客可以理解为可订阅音频节目,很多平台没有完整字幕。

上手比预想慢。根据节目页给的信息,Apple Podcasts 搜 Black Box,先跳出同名系列,页面显示 The Guardian 出品,评分 3.4,评价数不大。再点进 The Chatbots,才看到单集介绍。Spotify 入口更乱,有时挂在 Off Duty 或 The Guardian Investigates 下面,我一度以为走错台。找到「Spirals」后,我先听开头三分钟,再决定要不要全听。音频没有章节标记,我按两分钟一段手动打点。它更像调查叙事,开头把“AI 让人相信自己发明了东西”这个现象摆出来。

接着我用 DeepSeek V4 Pro 做摘要。大模型幻觉,简单说就是模型把合理的话编得像事实。我把节目页英文简介粘进去,让它列三个研究问题。它输出挺顺,但把“cured diseases”当成已经发生的结果。改了一次提示词,加上“只根据原文,不要外推”,才好一点。提示词工程说白了就是给模型限定边界,别让它自己补故事。我顺手把结果丢回 WorkBuddy 建表,字段映射还算顺,但标题列被自动改成了英文。

然后我拿 ChatGPT 和 Grok 交叉核对。这两个都是聊天模型,我这边各用了一周。问法是:核心论点是什么,哪些是事实,哪些是推测。ChatGPT 回答稳但偏泛,主要讲 AI 可能让用户过度自信。Grok 更短,结论先行。两边都没给具体案例,我就知道不能直接进笔记。

踩坑主要有三个。平台信息不一致,节目名、系列名、单集名混在一起。没有可靠文字稿,只能靠音频和节目页,检索成本高。AI 工具会抢跑,你还没听完,它已经给你一个“观点”,很容易把调查叙事读成行业定论。

不过也有惊喜。这个节目真正值的地方,不是又批评聊天机器人。它把问题从“模型会不会出错”挪到了“人为什么会把模型当成证据”。从数据来看,风险不在单点错误,而在反馈循环:用户提问,模型给漂亮答案,用户拿答案验证,平台再把过程包装成成功故事。这个赛道的核心变量不是模型会不会胡编,而是界面有没有让人产生“我正在做研究”的错觉。

我的结论是看情况。推荐给做行业研究、产品经理、AI 安全内容的人,适合当案例入口,提醒你别只看模型分数,要看用户怎么形成信任。不太推荐给想快速找答案的人,也不适合把它当成医疗、法律、科研决策依据。优点是问题意识强,能把“AI 上头”这类模糊说法拆成具体场景。缺点是入口乱,缺文字稿,需要自己补证据链。

最后留个问题:如果你听完这期,真的用 AI 整理出一条“科学突破”,你会把它当成线索,还是当成证据。


📌 本文编译自 Guardian Tech,原文:https://www.theguardian.com/technology/audio/2026/sep/03/black-box-the-chatbots-spirals-ai-psychosis-podcast

版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
蒋志远
蒋志远9月3日

不同意,楼主把AI当研究笔记工具太理想化了。我上周用发票扫描做自动化流程,结果备注栏全被吞了,最后还得人工逐项复核。播客内容这么模糊,丢给AI核?错漏根本查不过来。全自动处理容易翻车,每一步过一道人眼才安心。