非 CUDA 栈能不能跑医疗影像,我先试试
被朋友安利了号称 CUDA 护城河没了的新栈,试试看到底好不好用。我这三周一直在折腾 GPU 部署,手上正好有个 CT 影像分割的小 demo,之前在联影做 AI 影像时留过类似流程。模型不大,但输入是连续层切片,对显存、调度、日志都挺敏感。干脆拿它跑一遍,看看除了能加载模型之外,产品能不能落地。
先对比两套环境。一套是老熟人 CUDA,NVIDIA 那套 GPU 计算生态,装驱动、配环境,确认 GPU 可用,基本就是以前那套。没什么惊喜,但问题也相对可预期。显存占用能看,报错栈能看,崩了大概能知道是内存不够还是 kernel 挂了。另一套是新栈,外面那期视频聊的是 CUDA 护城河被开放后端和编译器生态冲淡。我拿本地工作站试,终端里跑设备查询,能看到 GPU 被识别成计算设备。第一处惊喜是模型导入没想象中折腾,之前导出的权重和中间格式都能被认出来,设备就绪的提示出来时,我差点以为这事成了。
但真正的坑在跑数据时。我这边测下来,从装环境到跑通第一条 CT 序列大约四十分钟,前面时间都耗在依赖匹配上。第一条出结果,速度不算难看,至少不像玩具。第二条也能出。到第三条,进程直接挂住,风扇转起来,终端没报错,也没有可定位的 traceback,那种能告诉你哪一行崩了的报错栈。重启后想复现,同样数据有时能过,有时不过。这时候就能看出推文里那种抱怨不夸张,驱动还不稳,崩溃或 hang 的时候缺少调试入口,甚至没法把 GPU 状态 dump 出来。对开发者来说,这等于黑盒。
产品视角看,跑通只是第一层
如果只看技术演示,新栈确实有进步。它把只有某家 GPU 才能跑的门槛往下压了一点。对做 AI 产品的人来说,这意味着采购和部署有了第二个选项,不必所有模型、所有推理机都绑死在一条路上。尤其是一些轻量影像工具、教学 demo、边缘盒子,或者预算里不想再买高端卡的场景,值得继续跟。
但放到医疗影像里,我会立刻问临床验证过了吗。医院采购更看医生实际使用反馈,能不能接 PACS,报告能不能写回,报告站里点一下几十秒有没有结果,失败了有没有日志,漏了能不能回溯,出问题谁负责。新栈目前最难受的是不可审计。崩溃没有状态 dump,hang 没有可靠复现路径,交付给医院就像把一台没有仪表盘的车开进 ICU。模型再准,流程里没人敢签字,产品就没落地。
所以我的结论是 看情况。适合研发沙盒、个人折腾、预算敏感的多平台验证,也适合想观察 CUDA 护城河是不是真被拆掉的人。医院交付不行,尤其需要合规日志、医生签字和远程运维时不行,把医生工作流直接压上去更不行。行动建议也简单,别先拿生产模型上,先拿一个脱敏小数据集,连续跑几天,记录启动、崩溃、日志、恢复四件事。能稳定跑完,再谈替换。CUDA 护城河有没有被拆掉,我不敢下结论,但我这边测下来,医院那扇门还没开。
📌 本文编译自 Hacker News,原文见 https://www.youtube.com/watch?v=TiRxcPQNcBA
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿