
乳腺癌AI我上手试了下,技术有真东西,但有一关绕不过去
上周约了个做病理AI的团队聊,他们放出来的话术很打动我:能把中心体异常映射到整块肿瘤上,看不同区域的缺陷差异。中心体这东西,细胞生物学里管微管组织,它出问题跟染色体不稳定、肿瘤异质性都有关系,但以前只能靠高倍镜一格一格数,没人能在整块组织上做全貌分析。
他们的做法是用AI在数字病理图像上自动标注中心体异常,再把这些分布叠加到整个肿瘤切片上。我拿API跑了一个晚上的推理,输出是带坐标的标注文件,每一行对应一个异常簇,附带置信度。第一次在切片上叠加看的时候,确实能直观看到不同区域点的密度差很多,这个信息以前拿显微镜是得不出来的,或者说要想得到得累死几个博后。
不过踩坑的地方也挺实在的。第一是他们对标注数据的依赖比我预想的更重。新闻里写训练这类模型需要几十万条人工标注的细胞和组织结构,实际跑下来我理解这不是一句套话,模型对边界模糊的案例,置信度掉得非常快。第二是数据来源偏单一,我拿了一组客户那边的切片格式试,染色差异会直接影响输出稳定性,同一份样本换一种扫描仪,结果就要重新调。不是不能用,是换场景就得重新适配,这个工程成本不小。
研究层面还有个有意思的点。他们拿四个模型对比,表现最好的AUC是0.77,能识别出大约27.5%的间期癌,就是在两次筛查之间被漏掉的病例。但另一套数据说AI整体漏检了大约14%的病例,而且漏掉的更多是年轻患者。两边放一起看就有意思了,说明这技术对不同人群的适配程度差很多,不是同一个模型套在所有筛查场景里都能用。做筛查投资的人如果忽略这一点,后面落地会很被动。
我的判断,中心体这块的壁垒是真的,能在全切片尺度上看空间变异,这个能力具备稀缺性。但要拿到临床上当诊断工具卖,前面说的适配和验证成本没那么容易省。适合的路径还是老话,给制药公司做伴随诊断或药物靶点发现服务,别急着做消费品级筛查产品。这技术我暂时看属于可跟踪但不急着投,等他们哪天把跨中心数据标准化这件事跑通了,估值逻辑会清楚很多。
本文编译自 Hacker News,原文:AI reveals hidden patterns inside breast cancer
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿