社区讨论 · 政策

Ox Alpha这波热闹,我试用一晚先泼盆冷水

冷水专业户冷水专业户8月24日2026/08/24 50 浏览

被朋友安利了Ox Alpha,说圈子里都在猜这是智谱GLM-5.x的马甲,还传了个独立研究员有99%把握的说法。我一看就觉得有意思,连GLM-5.3是纯文本模型都顾不上,直接去申请了试用。毕竟做这行的,看见一个身份不明的模型冒出来,第一反应总是想拿脏数据试试它到底几斤几两。

先说准备。申请流程倒是简单,填了个邮箱就通过了,没搞排队那套。跑之前顺手查了下背景,有个细节让我挺警觉的:技术指纹指向GLM-5.x,但GLM-5.3不支持视觉输入,而Ox Alpha宣传是图文视频多模态,这中间有矛盾。要么指纹判断错了,要么这是个经过改造的变体,要么它背后根本不是智谱。还提到微软MAI是另一个嫌疑对象。带着这个疑惑我开了跑。

上手先测了文本。我丢了一段上个月业务上没处理干净的客服工单给它,里面既有繁体错别字,又有表格转文本带来的乱码,还有客户故意写的谐音词。它处理得意外干净,上下文窗口也够长,三千多行的工单一次读完没截断,分类和情绪判断基本在线。这点比好几个号称能处理长文档的工具都稳,我这边测下来确实没挑出大毛病。

接着测多模态。我给它传了两张截图,一张是带折线的报表,一张是手机拍的打印机错误码,想让它解释趋势和报错原因。文字部分回答得还行,但它对图上坐标轴刻度的读取有两处偏差,其中一处直接把拐点年份说错了。这说明什么呢,要么它视觉编码这块是拼的,要么底层还是文本模型的思路,把图转成描述再理解。这就能对上GLM-5.3纯文本模型的猜想了,大概是加了个视觉模块的缝合版,不是原生多模态。

踩坑的地方在DeepSWE这种软件工程基准上。素材里说它在这类测试里得分不错,我花了一个晚上给了它几个真实的repo让改bug,确实能跑通流程,能自己装依赖、定位报错、改代码、跑测试。但问题也在这:它对环境要求很高,我给的沙箱配置差了一点,它就卡在装依赖那步反复试错,花了快四十分钟才绕过去。这不像一个工程上成熟的产品,更像demo做得好,真到了生产环境就没那么皮实了。

还有个要命的事,越用越觉得它像一个被临时包装的壳。API的返回格式、错误码风格、甚至某些超时行为,跟我之前摸过的某个开源模型本地部署版本高度相似。我不敢下结论说它一定是谁改的,但以我做集成的经验,这种相似度不太可能是巧合。至于是不是智谱,我持保留态度。你把OpenAI的权重改改跟Claude对齐,业界也不是没干过这事。模型本身在benchmark上出成绩,跟它在现实场景里好用,是两码事。

结论是看情况。你要是想拿它做文本分类、工单处理、中等长度文档解析这类活,它值得试,尤其考虑到现在传的价格不算高。但你要是冲着多模态去,想让它看图做数据分析,或者指望它在复杂工程任务里像demo一样稳定,我劝你等一等。这类「神秘模型」上线的套路我见多了,第一波demo永远惊艳,等你真把核心业务接上去,就会发现文档跟不上、接口不稳定、行为不可预测。先用小任务跑两周再决定要不要上生产,别被早报那套叙事带着跑。

1 条回复

?
Ctrl + Enter 快速回复
天玑
天玑8月24日

等等,你说GLM-5.3纯文本不支持视觉……我上个月才跑了5.3的文本,确实没图像入口。Ox Alpha这多模态是哪来的,改过的还是压根不是智谱?好奇了。