
AI视频生成,开始像影像科一样拼交付
如果把 MiniMax H3 Max 这类产品放到医疗影像里看,它现在最像一台刚上线的阅片模型:出图快、会写报告、界面也体面,但你问一句临床验证过了吗,它只能给你一段漂亮 demo。
以前在联影做AI影像那阵,我们最怕医生实际使用反馈里那句“我还是得重看一遍”。AI进不进工作流,看的不是指标,是它有没有把某个高成本动作真正压下去。视频生成也一样,用户愿意掏钱,不是因为模型会生成一个奇怪又炫的片段,而是因为它能稳定给出可交付镜头。
MiniMax H3 Max 这次踩到了产品点。它给 H3 基座做后训练,主打更强 prompt adherence、美学和 768p 快速推理。fal 的说法是,一条 5 秒 768p 视频大约 3 秒出来,每天 5 条免费,不用注册。这个设计很务实。它不是让你直接拍电影,而是让你先把想法跑起来。
短期看,这种快就是商业价值。以前用户经常卡在等很久,或者等出来的东西不对。现在预览成本被压低,提示词写歪一点,也能重跑。Morphic 文档里提到提示词扩展,balanced 档用快速展开,quality 档会多花大约 30 秒,等于把速度优势还回去。这其实是在告诉用户:默认快,是让你试错;要成片时,再为细节付费。
但是快和能用之间,还隔着一层产品逻辑。
H3 本身又给出另一组参数:1440p、24fps、六种画幅,宽幅能到 2976×1248 附近,大约 3.7 百万像素。素材里还提到原生 2K、音频和 15 秒生成。意图很清楚,H3 Max 负责快速预览,H3 负责更完整的内容生产。问题是普通用户容易混淆。768p 和 2K 不只是分辨率,背后是不同模型版本、不同端点、不同计费方式。有评测提到,旧的 MiniMax-Hailuo-2.3 在 v1 端点上能用套餐额度,H3 要 v2 端点并按量付费。这像医院系统升级接口,医生只记得以前那个按钮能点,现在按钮背后全换了。
这类版本切换最伤体验。用户不是怕升级,是怕预期失控。以前在 PACS 里看 CT 影像,模型换版本必须明确标注、必须能追溯,也要让医生知道哪一版是临床验证过的。视频生成平台如果要把创作者当生产用户,也该把预览模型、生产模型、按量端点、套餐额度讲清楚。否则用户以为还是那套工作流,结果扣费、排队、画质、时长全变了。
长期看,竞争不会停在谁生成得更像真人。更像人的视频,demo 里已经够多了。真正决定商业价值的,是叙事控制、资产复用和交付成本。Krea 那边的 Max 套餐大约 105 美元一个月,给 60,000 compute units,支持无限 LoRA 微调、2,000 个文件、更多并发和队列、relaxed generations、批量折扣。这些词听起来很平台,其实是在告诉用户:视频生成正在从玩具变成流水线。
LoRA 这点尤其值得注意。医疗AI能不能落地,很大程度取决于能不能按科室、病种、设备参数做适配。放射科和体检中心对同一个模型的期望都不一样。视频领域也一样。一个团队要的不是通用审美,而是自己的角色、产品、镜头语言、品牌质感。能不能沉淀 LoRA 资产,能不能并发跑,能不能按量计费,决定的是它能不能进入团队协作。
我也在意空间声。摘要里提到空间声、人体动作、道具接触、工作间环境声。声音不是装饰。一个角色拿起杯子,杯子碰撞声如果不对,观众会立刻出戏。这个出戏,和报告里漏掉一个关键征象很像,技术上可能只是小偏差,用户感知上却是整个系统不可信。
产品真正要证明的不是我很快,而是我在你的工作流里可重复。
不过 H3 Max 现在最高只到 768p,文档解释是公开权重实际能生成的就是 768p。这个限制不丢人,反而很诚实。医疗AI里也有类似情况,某些模型只能处理特定扫描参数,换个机器、换个重建算法,表现就不稳定。问题在于平台有没有把边界讲清楚。如果用户拿它当成片引擎,最后发现分辨率、音频、一致性、版权、审核都接不上,口碑会掉得很快。
我对 MiniMax H3 的判断偏正面,但不是对单点技术,而是对产品路线。它把快速预览、2K 生产、多画幅、音频、LoRA、并发、套餐和按量计费都摆出来了。这说明视频生成开始进入更现实的阶段。用户不再只问能不能生成,而是问能不能稳定生成、便宜重生成、给团队用、交付出去。
后面半年到一年,AI 视频平台会明显分层。预览层拼速度,生产层拼一致性和多模态控制,企业层拼资产、并发、计费和审计。真正跑出来的,不一定是画质最高的,而是最像工作流的。就像当年医疗AI落地,最后赢的不只是模型分数,而是能把医生、设备、报告、质控串起来的那套系统。视频生成也会走到这一步。
📌 本文编译自 Hacker News,原文:https://www.maxh3.com/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿