网站转接头,这步棋有点意思
这篇文章最有价值的信息是:Hermai 做了一个开源的命令行工具,能把任意网站变成结构化 API,直接给 AI agent 调用。说白了,就是把整个互联网变成 AI 可以读懂的接口池。
这个方向我盯着看了几天。先解释两个词。API 是程序之间对话的接口,你可以理解成一个点餐窗口,你递菜单进去,它把菜端出来。AI agent 是能自己干活的人工智能程序,比如帮你去查资料、订酒店、整理表格。过去 agent 想用网站数据,得靠爬虫去抓 HTML 再自己清洗,又慢又碎。Hermai 这个工具的思路是:把整个站点变成一个长满接口的 RESTful API,agent 直接按字段取数据。
我最近刚上手一批论文 PDF 的批量提取,用的是 Web Scraper 那种可视化爬虫,点来点去配选择器,遇到动态加载的页面就抓瞎,一上午能折腾死。看到 Hermai 的做法,第一反应是:这不就是把当年爬虫工程师的活,全部自动化了么。
一次注册,长期复用
Hermai 的核心是注册制的。你在终端里敲个命令,它探测网站结构,然后生成一组网址接口。之后 agent 需要数据,直接带着参数请求这个接口,拿 JSON 回来。不用再管页面长什么样,不用写 CSS 选择器,不用跟反爬机制玩猫鼠游戏。这像什么,像把网站的骨架单独拆出来,放在窗外晾着,agent 路过就能取。
对比一下传统方式和我这几天用下来的感受:
| 维度 | 传统爬虫 | Hermai 这类网站转 API |
|---|---|---|
| 数据获取 | 页面 HTML 里抠字段 | 直接拿结构化 JSON |
| 反爬对抗 | 高成本,经常失效 | 本质是合法接口,按需限流 |
| 维护 | 页面改版就崩 | 注册后接口相对稳定 |
| 上手门槛 | 要写代码、配环境 | 命令一行搞定 |
我拿手头的一个动态数据页试了一下,确实是普通爬虫处理不了的那种动态表格。跑完注册命令之后,agent 去取数,差不过十分钟就通了。这个体验,换个说法就是:以前你雇了个小时工来你家抄东西,现在你装了个公共取件柜,谁来取都行。
把任意网站变成 API,这个思路我越想越觉得在点子上。过去两年大家的关注点都在模型参数、上下文长度、多模态这些看得见摸得着的算法能力上。但真让 agent 去干活的瓶颈,往往卡在外部数据接不进来。网页是给浏览器看的,不是给程序读的。你让 agent 看图,它看懂了;你让它直接去操作网站,每一步都要写工具、配权限、处理异常,这层窗户纸特别厚。
Hermai 挑破这层纸的方式是用社区驱动。它不搞一个封闭的官方市场,而是让所有用户来注册、贡献、分享。每个人发现自己常用的网站,往上传一套接口映射。别人需要的时候,直接搜出来就能用。这等于把全网数据入口摊开在桌子上,谁都能来夹一筷子。
这种路径会带来一个生态,这是我觉得最有想象空间的部分。数据壁垒问题我跟人聊过很多次,一直觉得比模型本身的技术壁垒严重。模型开源搞得火热,但高质量文本烧完了,谁能把数据喂进去,谁就握住了下一轮迭代的钥匙。Hermai 这个工具等于在试图跟各种数据源签“互操作协议”,用一种标准格式,让 AI 跟任意网站对话。现在它还是开源项目,看不出什么商业前景,但等接口池子足够大的时候,入口价值会自己浮出来。
不是没有隐忧
当然,我也不是光说好话。这个方向有几个问题我得提一嘴。
网站类型参差不齐。注册接口之后,有个核心问题:网站方愿不愿意配合。有的站点有公开 API 但不是 REST 风格,有的站点本身就靠内容付费生存,你把它的内容做成接口,等于引流法院传票。虽然开源项目不参与主张,但真做起来,版权和法律风险得有人背。
动态站点还是难搞。我试的几个页面是静态渲染和简单的 JS 渲染。像那些重度依赖用户登录态的后台系统,比如银行的网银、企业内部的知识库,Hermai 自己注册出来的接口大概率拿不到完整数据。它更多的场景可能还是公共信息聚合,跟 agent 搜索结合,而不是替代所有网站的自有接口。
开源社区能不能跑起来。核心的注册、贡献机制需要足够多的人来参与,如果头两个月没人上传新站点,工具就慢慢变成自嗨的玩具了。我看了下 GitHub 的更新频率,最近是挺活跃的,但开源的东西热度起落很正常。这类需要生态养分的项目,危险期在半年后。
不过这些疑惑不影响我的整体判断。我很明确地认为,这个方向是中长期的必经之路。网页的结构化数据是一块巨大的沉睡资产。过去二十年搜索引擎靠它攒出了万亿市值,现在已经轮到 AI agent 来吃了。从模型能力到外部数据源之间的最后一公里,一定会有一段桥梁工具的红利期,Hermai 是这段时间里我看到的最直接的一个尝试。
如果屏幕前的你也在搞 agent 相关的事情,行动建议是:装一下 hermaicli,挑一个你访问最多的网站试一下注册流程,半小时就能看出它的深浅。重点关注它对动态内容的处理,这个直接决定它能不能规模化。别急着报什么期望,先用起来再说。
📌 本文编译自 ProductHunt,原文:https://www.producthunt.com/products/hermai-brand-api
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿