一场演示会上的冷场
上周参加一个AI健康创投路演,台上创始人激动地展示一款基于可穿戴设备的“心脏风险预警”应用。他引用了谷歌刚发布的SensorFM模型,说“500万人、1万亿分钟数据训练,35项任务中34项超过基线,这就是未来”。台下投资人纷纷点头,我却忍不住在脑海里列了个清单——那些没被提到的细节。
模型规模确实唬人。500万参与者的可穿戴数据,时间跨度从2024年9月至今,将近一年。预训练语料涵盖心率、运动、睡眠、血氧等传感器信号。谷歌宣称在睡眠阶段分类、活动识别、心率异常检测等35项健康任务中,有34项优于传统的特征工程监督基线。乍看之下,这几乎是全能型健康AI的雏形。
但认真翻一翻技术博客就能发现,所谓的“优于基线”有太多隐藏前提。
首先,数据代表性是个硬伤。 500万参与者来自全球,但前提是他们都拥有兼容谷歌可穿戴生态的设备——大概率是Fitbit系列或Wear OS手表。这意味着样本天然偏向中高收入群体、习惯佩戴智能设备的人群,以及愿意主动授权数据的人。而那些最需要健康监测的老年人、低收入群体、慢性病患者,往往不在这个池子里。用这样的数据预训练出的模型,一旦部署到真实世界的医疗场景,分布偏移会直接导致性能崩塌。
其次,任务定义本身就是一场自我实现。 35项任务中的绝大多数是传感器信号分类或回归,比如“从加速度计数据判断用户是否在走路”,这类任务在实验室环境下的特征工程已经很成熟,深度学习模型天然能通过大量参数拟合噪声。但真正关键的临床任务呢?比如房颤预测、隐匿性高血压筛查、睡眠呼吸暂停严重程度分级——这些需要金标准(如心电图、血压计、多导睡眠图)作为监督信号的任务,SensorFM是否真的有效?谷歌没有公布详细的任务列表,只说了“34项优于基线”,这个说法太模糊。
更核心的问题是,可穿戴设备的传感器精度本身就不靠谱。 手表上的PPG心率测量在运动状态下误差能到20%以上,血氧检测在深色皮肤人群中有系统性偏差,睡眠分期算法经常把躺着发呆算作浅睡眠。用这些噪声数据训练出来的基础模型,即便在测试集上表现再好,也只是在“戴表的人”的特定子集上闭环自洽。现实场景中,设备不同、佩戴位置不同、个体差异都会让模型失效。谷歌的技术报告里提到,他们用了“一致性过滤”来清洗数据——但过滤掉异常值的同时,也过滤掉了真实世界中最有价值的长尾现象。
别忘了监管这道墙。 医疗设备软件(SaMD)需要FDA或CE认证,而SensorFM目前只是研究模型,没有声称用于临床决策。但已经有不少初创公司开始拿它作为核心卖点去融资,这就回到了我参加的那场路演。投资人只看到“500万”“1万亿”这些数字,却看不到模型在真实医院部署时,需要面对的数据隐私合规、设备兼容性、医生信任度等问题。谷歌自己都没有承诺任何落地时间表,它只是发了一篇论文和一个demo。
最后,这不是技术问题,是商业逻辑问题。 可穿戴健康市场已经过热了。Apple Watch的房颤监测功能至今未被主流医院作为诊断依据,Fitbit的睡眠评分更多是心理安慰。SensorFM如果真的有效,谷歌为什么不发布一个API让开发者直接调用?为什么不和梅奥诊所合作做个真实世界验证?答案可能是:它目前的性能还不足以在严格控制的临床环境中复现。那些34项任务中的“优于基线”,可能只是相对于最简单的特征工程基线,而不是相对于临床金标准。
哦对了,唯一一项落败的任务是什么?谷歌没说。要是35项中唯独这一项是房颤检测或血压估计,那这个模型的实际价值就要打折至少一半。
SensorFM是个不错的学术基准,给可穿戴数据预训练开了个头。但想让它在你的手表上改变健康管理?别指望明年。
物界前沿