追了两天Bel模型的消息,参数堆到10T真的有意义吗
我花了两天试了一下追模型发布消息的两种方式。一条路是照旧开十几个标签页刷X和IT之家,另一条路是用Claude Code加MCP搭了个搜索agent,让它把散落的消息聚拢成一个时间线。三天前刚上手Claude Code,正好拿这条新闻练手。
先说结论:用agent查参数、查时间线,比人肉开网页快很多。但这次追下来,最让我在意的反而不是Bel模型本身,而是参数竞赛这套叙事,正在脱离普通人的感知范围。
agent的思路很简单。MCP相当于给Claude Code装了一双手,通过API去抓搜索结果和网页正文。
我让它做的事情是:列出关于OpenAI新模型Bel的所有公开爆料,按时间排序,标注消息源和相互矛盾的地方。大概十来分钟,它给我整理出一份三页的简报,核心信息是这些:
- Bel是Doug模型的继任者,总参数超过10T
- 爆料源是synthwavedd,在X上发的推文,还没有官方确认
- 8月这个时间点,正好和另一条流言撞上:GPT-6(Astra)据说也要在8月发布
问题是,agent自己也标注了一行小字:这些信息互相矛盾,且情绪价值大于信息价值。10T参数对使用体验意味着什么,谁都说不准。模型还没上线,应用层没有东西可以跑,那我只能对比另一件事,—用两种方式追同一条新闻,谁的效率高、谁的信息更可信。
我这边测下来,差距是肉眼可见的。人肉模式我开了13个标签页,X上刷了大概四十分钟,中间点进一个知乎专栏,发现它和另外一篇稿子的时间线对不上。一个说GPT-6本月强行发布,另一个说Astra暂缓。agent模式全程大概十五分钟,包括写指令、调搜索、让它把冲突点标出来。
| 对比项 | Claude Code + MCP | 人肉刷网页 |
|---|---|---|
| 搭建成本 | 第一次弄要半小时,之后复用就行 | 零成本 |
| 单次资讯整理 | 十五分钟左右 | 四十分钟起步 |
| 信息覆盖率 | 能把几个消息源摊开对比 | 看缘分,容易漏 |
| 可信度判断 | 自动标出冲突,但不会替你判断 | 全靠自己筛 |
不过有一个坑,准确说是这类工具的共性毛病。agent会把所有抓到的内容当成同等权重的事实来整理,synthwavedd的爆料和IT之家的报道放在一起,讯源级别全是平的。它不会因为你给它看的是X推文,就多一分警惕。这个判断得人来做。
回到Bel模型本身。10T参数这个数字,说实话我在消费端已经感受不到差别了。去年这时候大家还在为千亿参数惊叹,现在万亿参数只是转发文案里的一个数字,跟手机摄像头一样,参数越来越多,拍出来的照片该糊还是糊。反而是Anthropic在企业市场超车、中国开源模型这两条线,对普通人更实在。一个是花钱买体验,一个是拿来就能跑。
如果你也是做AI这条线的编辑,或者重度依赖信息差干活的人,给Claude Code配上MCP去追模型新闻,值得折腾。这套流程做完,类似题材的整理都能复用。但如果你只是关心哪家模型好用,等Bel真上线再说,抽卡时代的参数表看看就行。
物界前沿