WorkBuddy 上手一周,我把 Google 免费 AI 全家桶和 ChatGPT 都扔进了冷宫
今天刷到一篇 Google Cloud 的免费 AI 工具清单,Speech-to-Text、Text-to-Speech、Natural Language API、Video Intelligence 这些,每个月前 60 分钟或前 1000 个单位免费,没有期限。乍一看挺香的,对标 AWS 那一套,白嫖党狂喜。但我试了一圈,又默默打开了 WorkBuddy。
说实话,我上周刚接触这些工具,第一反应是「原来免费的东西这么多」。但用了几天 WorkBuddy 之后,感觉 Google 这一套更像是一个零件工具箱,每个工具都强大,但你需要自己组装、调试、联调。而 WorkBuddy 更像是一个已经焊好的流水线,你丢进去原料,它产出成品。对于我这种白天追热点写稿、晚上追番的运营狗来说,后者才是真正的生产力。
先说说 Google 的 Speech-to-Text。我试过用它转一段 30 分钟的采访录音,准确率确实不错,专业名词也基本能识别。但问题是,它返回的是纯文本,没有时间戳,没有说话人标签,没有分段。我需要自己再手动整理成逐字稿。而 WorkBuddy 的语音转文字任务,我只需要丢一个音频文件进去,在 Prompt 里写清楚「按说话人分段,每段带时间戳,自动去除语气词」,它就能直接输出一份可直接用的逐字稿,连标点符号都是对的。我这边测下来,同样的 30 分钟录音,Google 那边需要 10 分钟识别 + 我 20 分钟整理,WorkBuddy 一次跑完大约 15 分钟,直接复制粘贴。这还是在我刚用一周、Prompt 写得不算太精细的情况下。
再说那个 Video Intelligence,能检测镜头、人脸、标志、文字,听起来很吓人。但我试过一次,拿一段产品演示视频去跑,想让它自动提取视频里出现的所有按钮文字和页面标题。结果它确实识别出了文字,但都是一个个独立的文本框,没法按时间线串联起来,更没法生成一个结构化的文档。WorkBuddy 这边,我用 Plan 模式写了一个 workflow:先截取视频关键帧,再 OCR 识别每一帧的文字,最后按时间顺序整理成一个表格,写入 CSV。整个过程大概跑了 40 分钟,中间因为视频帧率设置太高翻了一次车,但调整后直接输出了我想要的素材列表。对于一个不会写代码的运营来说,这种级别的工作流在 WorkBuddy 里大概只需要 20 分钟搭建。
当然,我不是说 Google 这些工具不好。它们非常强大,适合开发者去集成到自己的产品里。但问题在于,我,墨墨酱,一个连 Python 环境都没装利索的新媒体运营,根本不想去折腾 API 调用、SDK 配置、IAM 权限这些东西。我想要的只是「把录音变成逐字稿」「把视频变成素材列表」「把 PDF 里的表格变成 Excel」,而不是「学习如何用 Natural Language API 分析非结构化文本」。WorkBuddy 正好卡在了这个位置:它不要求你懂技术,但你得懂流程。
我举个例子。上周三我需要把一篇 5000 字的产品文档翻译成英文,还要保持技术术语的准确性。如果用 Google 的 Translation API,得先写代码调接口,然后对返回的结果做后处理。但我在 WorkBuddy 里,直接建了一个翻译任务,把文档拖进去,加了句 Prompt:「技术术语保持原文缩写,标点符号用英文格式,段落格式保持原样」。结果跑出来基本能用,只有两处专业名词的翻译需要手动改。整个过程大概 20 分钟,比我自己翻快了不知道多少倍。
但我也得说,WorkBuddy 不是完美到可以把所有免费工具都取代。Google 的免费额度确实香,对于技术团队来说,把这些 API 做成一个 pipeline 是更划算的选择。而且 WorkBuddy 在处理一些极端场景时还是会翻车,比如我试过让它抓取一个中文网页上的价格数据,结果因为编码问题漏掉了两三行,最后只能手动补。这种问题在直接调用 API 开发时反而更容易控制,因为你能看到原始报错信息。
所以我的判断是:如果你和我一样,是个不懂代码、但需要把 AI 工具落地到日常工作中的运营/产品/PM,WorkBuddy 比任何免费 API 清单都值得先花一周时间。它不完美,但它在「让 AI 干活」这件事上,比任何零件工具箱都更接近一个能用的产品。至于 Google 那套,我留给真正需要自己造轮子的人。
物界前沿