Google 的 SensorFM 统一可穿戴健康数据

The Decoder··作者 Tomislav Bezmalinović

关键信息

SensorFM 使用来自五类传感器的 34 个特征,包括 PPG、加速度、皮电、皮肤温度和气压高度,并通过自监督重建、结合 Adaptive and Inherited Masking(AIM)进行训练。在三项外部研究共 13,985 名参与者的测试中,基于 SensorFM 表示的简单任务头在 35 项任务中的 34 项上优于监督基线,而最大模型相比最小模型将重建误差降低了 31%。

资讯摘要

Google Research 发布了 SensorFM,这是一种面向可穿戴健康数据的基础模型,目标是从海量未标注传感器流中学习可重复使用的人体生理和行为表示。其预训练语料超过一万亿分钟,来自五百万名 Fitbit 和 Pixel Watch 用户,覆盖 100 多个国家和 20 多种设备型号。Google 表示,这是迄今用于此类模型训练的最大、最多样化的可穿戴数据集。其核心目标是用一个共享模型取代多个单一用途的可穿戴算法,从而同时支持多种健康问题。

SensorFM 处理来自五类传感器的 34 个特征,包括光学心率监测(PPG)、加速度、皮电、皮肤温度和气压高度。模型采用自监督方式训练,通过重建被遮挡的传感器片段来学习表示,方法名为 Adaptive and Inherited Masking(AIM)。AIM 会区分真正缺失的数据和训练时人为隐藏的数据,因此模型既能处理真实世界里常见的缺口,也能适应人工遮挡。对于经常不完整、采样不规则的可穿戴数据来说,这一点尤为重要。

研究人员测试了四种模型规模,参数量大约从 10 万到 1 亿不等,训练数据集规模则从 5,000 人到 500 万人不等。结果显示,随着模型规模和数据量同步增大,性能持续提升。在最大数据集上,最大模型的重建误差比最小模型低 31%,并且在大多数下游预测任务上表现最好。这说明,可穿戴基础模型同样受益于规模化和数据多样性。

为了检验泛化能力,研究团队把 SensorFM 应用到三项独立研究的数据上,总计 13,985 名参与者,这些人都不在预训练数据中。评估覆盖 35 项任务,涉及心血管与代谢健康、心理健康、睡眠、人口统计和生活方式。结果显示,即使只在 SensorFM 学到的表示上接一个简单任务头,也能在 35 项任务中的 34 项上超过使用手工特征的监督基线。模型还更省标注数据,意味着它在新任务上可以用更少的标注样本进行适配。

Google 配套博客把 SensorFM 描述为可穿戴健康数据的“通用智能和接口层”的早期一步。在这个愿景中,一个基础模型可以把原始、凌乱、按分钟采样的传感器读数转化为对下游模型和助手有用的健康信号。Google 的结果表明,可穿戴基础模型有机会在不为每种疾病或终点单独训练模型的情况下,提供强大的通用性能。虽然这仍然是一个实验系统,但这些结果显示,消费级可穿戴设备健康数据的建模方式可能正在发生重要变化。

Google 的 SensorFM 统一可穿戴健康数据

来源与参考

  1. 原始链接
  2. Google’s SensorFM turns messy wearable sensor data into a general-purpose health intelligence layer

收录于 2026-07-14