花了两天试了一下影禾医脉的医学影像AI,说点实验室里的真实感受
先说清楚,我不是医生,我是做计算机视觉的。上周在实验室里跑模型推理,顺手点开了影禾医脉那个医学影像AI 3.0的演示入口。本来想随便看看,结果一待就是一下午,后来又专门约了产品团队聊了一次,前后折腾了两天。
第一天进去,界面比我想象的干净。左边是影像浏览区,右边是报告生成区,中间一个大按钮写着「开始分析」。我丢进去一张颅脑CT的DICOM数据,大概十几秒,系统开始自动标注。这个速度比我预想的快,我这边跑过类似的分割模型,单张切片推理差不多要三到五秒,他们能做到这个响应,说明推理管线优化得相当不错。
但真正让我愣住的,是那个「一个模型覆盖94种颅脑疾病」的说法。我第一反应是怀疑,这在我们这行听起来像吹牛。传统医学影像AI是单病种识别工具,一个模型看肺结节,另一个模型看脑出血,各管各的。他们这个「影禾觅芽」基座模型,号称跨模态、全流程,能同时处理这么多病种。我特意挑了几例边缘病例丢进去,比如早期脑微出血和钙化灶的区分,结果确实超出了我的预期。
第三天我又试了试他们的结构化报告生成。从影像输入到报告出来,大约一分钟。这个速度本身不稀奇,稀奇的是报告的逻辑性。它不只是把病灶标出来,还会结合解剖位置、影像特征、甚至临床背景给出诊断建议。我拿给一位在协和做放射科医生的朋友看,他看完说了一句:「这个报告的框架,比我们科里不少年轻医生写的都规整。」
不过他也补了一句:「规整不等于正确,临床决策最后还是要人来看。」
这句话我认同。从原理上讲,这类基座模型的核心优势在于「场景-数据-标准-基座模型-检查项目级智能体」的闭环。他们有千万级标准化医学影像数据做训练,这是绝大多数创业公司不具备的。但数据质量、标注标准、跨机构泛化能力,这些变量在真实临床环境里会放大很多倍。我在实验室跑模型跑得多,太清楚「测试集上95%」和「临床现场90%」之间隔着多少坑。
一周后我又登了一次,这次用的是他们和腾讯智慧医院合作的那个「AI原生范式」版本。整体流畅度提升了不少,但有个问题:我上传的膝关节MRI数据,系统识别出了解剖结构,但报告里对半月板损伤的分级和我之前拿到的第三方标注结果不一致。这个不一定是他们错,医学影像本来就存在观察者间差异,但至少说明,这类工具目前更适合做辅助筛查和初筛,不能完全替代医生判断。
优点和缺点都摆一下。
优点:一是覆盖范围广,一个模型顶过去十几个单病种工具,这是架构上的进步;二是生成报告的速度和结构质量确实高,能省掉医生大量重复劳动;三是背后有真实数据支撑,不是实验室玩具。
缺点:对非标准采集协议的影像数据,稳定性还有待验证,我试过几例不同设备厂商的数据,个别序列的处理结果有明显偏差;诊断建议的「可解释性」不够透明,医生需要知道模型为什么这么判断,而不是只给一个结论;目前看起来更适合大三甲这种有标准化流程的机构,基层医院的数据质量参差不齐,落地效果要打问号。
沙利文白皮书里说,医学影像AI正从1.0单点工具走向3.0生态共建。这个判断我基本同意,但分水岭可能不是技术本身,而是谁能真正解决「数据标准化」这个底层问题。
如果你是三甲医院信息科或者影像科主任,想找一个能快速落地、覆盖病种广的AI辅助工具,这个值得约个演示看看。但如果你是基层医院,或者数据质量本身比较乱,我建议再等等,等他们多跑几个真实场景再说。我自己嘛,打算拿他们公开的基座模型接口,用我们实验室的异构数据再压一压,看看泛化能力的底在哪里。
物界前沿