核心发现
方法论
采用双重基础框架,结合文献基础的生理发现和统计验证的人群基础生理模式,构建可靠的问题。通过对14种专有和开源LLM的评估,WearableQA有效区分模型能力。
关键结果
- 结果1: Gemini-3.1-Pro模型在WearableQA基准测试中表现最佳,准确率达72.9%,远高于10%的随机基线。
- 结果2: 开源模型Gemma-4-26B-A4B表现最佳,准确率为42.5%。
- 结果3: 大多数模型在数据推理上表现不佳,尤其是跨信号推理。
研究意义
WearableQA提供了一个现实且诊断性的基准,用于评估LLM在真实世界可穿戴数据上的推理能力。它解决了现有基准依赖合成信号的问题,促进了个性化健康理解和监测的发展。
技术贡献
WearableQA通过双重基础框架和16种问题类型的诊断分类法,提供了对模型推理能力的细粒度诊断。它结合了文献和人群基础的生理模式,确保了问题的可靠性和非平凡性。
新颖性
WearableQA是首个在真实用户长时间可穿戴记录上进行数据和健康推理的基准,结合了血液生物标志物和人口统计信息。
局限性
- 局限1: 大多数模型在数据推理中直接从原始测量中得出答案时表现不佳。
- 局限2: 跨信号推理仍然具有挑战性,强模型在此类问题上表现明显下降。
未来方向
未来方向包括改进模型在数据推理和跨信号推理上的表现,以及扩展基准测试以涵盖更多的生理信号和健康指标。
AI 总览摘要
可穿戴设备的进步使得生理和行为信号的持续监测成为可能,但现有基准很少评估AI系统是否能在真实用户的长时间可穿戴记录上进行推理。WearableQA基准测试通过4,084个多选题评估模型在数据和健康推理上的能力,涵盖200名真实用户的长时间测量数据。评估结果显示,模型的表现差异显著,准确率从19.6%到72.9%不等。WearableQA不仅提供了对模型能力的细粒度诊断,还揭示了模型在数据推理和跨信号推理上的不足。未来的研究方向包括改进模型在这些方面的表现,并扩展基准测试以涵盖更多的生理信号和健康指标。
深度分析
研究背景
近年来,可穿戴传感技术的进步使得生理和行为信号的持续监测成为可能。这些信号被用于支持个性化健康理解和生活方式评估。然而,现有的基准测试主要依赖于合成或模拟信号,缺乏对真实用户长时间可穿戴记录的推理能力的评估。
核心问题
核心问题在于现有的LLM是否能够在真实用户的长时间可穿戴记录上进行推理,尤其是在数据推理和健康推理方面。这一问题的重要性在于,随着LLM健康助手的兴起,模型需要能够从噪声较大的生理测量中提取信息并进行健康相关的解释。
核心创新
WearableQA的核心创新在于其双重基础框架,结合了文献基础的生理发现和统计验证的人群基础生理模式。这种方法确保了问题的可靠性和非平凡性,并提供了对模型推理能力的细粒度诊断。
方法详解
- �� 采用双重基础框架,结合文献基础的生理发现和统计验证的人群基础生理模式。
- �� 构建4,084个多选题,涵盖200名真实用户的长时间测量数据。
- �� 评估14种专有和开源LLM的表现,分析其在数据推理和健康推理上的能力。
实验设计
实验设计包括对14种LLM的评估,使用WearableQA基准测试中的4,084个多选题。每个模型都在相同的协议下进行评估,问题包括可穿戴测量、人口统计信息和血液生物标志物。
结果分析
实验结果显示,模型的表现差异显著,准确率从19.6%到72.9%不等。Gemini-3.1-Pro模型表现最佳,开源模型中Gemma-4-26B-A4B表现最佳。
应用场景
WearableQA可用于评估和改进LLM在个性化健康理解和监测中的应用。它为模型在真实世界可穿戴数据上的推理能力提供了一个现实且诊断性的基准。
局限与展望
尽管WearableQA提供了一个全面的评估框架,但大多数模型在数据推理和跨信号推理上仍然表现不佳。未来的研究需要改进这些方面的表现,并扩展基准测试以涵盖更多的生理信号和健康指标。
通俗解读 非专业人士也能看懂
想象一下你有一个可以记录你每天活动的智能手表。WearableQA就像一个老师,给这些手表收集的数据出题目,看看AI能否理解这些数据意味着什么。比如,它可能会问:"如果一个人的心率在过去一个月一直很高,这意味着什么?" AI需要从这些数据中找出答案,就像学生从课本中找出答案一样。这个过程帮助我们了解AI在处理真实世界数据时的能力,以及它在健康监测中的潜力。
简单解释 像给14岁少年讲一样
想象你有一个超级智能的手表,它能记录你每天的活动,比如走了多少步、心跳有多快。WearableQA就像一个考试,测试AI能不能从这些数据中找出你的健康状况。比如,它可能会问:"如果一个人的心跳在过去一个月一直很高,这意味着什么?" AI需要从这些数据中找出答案,就像你在考试中找出答案一样。这帮助我们了解AI在处理真实世界数据时的能力,以及它在健康监测中的潜力。
术语表
长时间序列 (Longitudinal Time Series)
指在长时间内连续收集的数据序列,通常用于分析趋势和模式。
在论文中用于评估AI在长时间可穿戴记录上的推理能力。
多信号整合 (Cross-Signal Integration)
指将多个信号源的数据进行整合,以提供更全面的分析。
在论文中用于评估AI在整合多种生理信号时的推理能力。
生理标志物 (Biomarker)
指可以测量的生物指标,用于评估健康状况。
在论文中用于结合可穿戴数据进行健康推理。
双重基础框架 (Dual-Grounding Framework)
结合文献基础和人群基础的生理模式,以确保问题的可靠性。
在论文中用于构建可靠的推理问题。
诊断性基准 (Diagnostic Benchmark)
用于评估和诊断模型能力的基准测试。
在论文中用于评估LLM在真实世界可穿戴数据上的推理能力。
开放问题 这项研究留下的未解疑问
- 1 如何提高模型在跨信号推理上的表现,目前的方法在这方面仍然不足。
- 2 现有模型在数据推理中直接从原始测量中得出答案时表现不佳,需进一步研究。
应用场景
近期应用
个性化健康监测
通过评估AI在可穿戴数据上的推理能力,帮助开发更智能的健康监测系统。
远期愿景
智能健康助手
开发能够从长时间可穿戴数据中提取健康信息的AI助手,提供个性化健康建议。
原文摘要
Recent advances in wearable sensing enable continuous monitoring of physiological and behavioral signals, yet existing benchmarks rarely evaluate whether AI systems can reason over a real user's longitudinal wearable record. We introduce WearableQA, a benchmark comprising 4,084 10-option multiple-choice questions constructed from the wearable time series, blood biomarkers, and demographics of 200 real users, each with up to 500 days of daily measurements. WearableQA preserves authentic wearable distributions that include device noise and inter-individual variability. To evaluate distinct reasoning capabilities, we introduce 16 question types organized along two complementary axes: data versus health reasoning, which distinguishes computation over longitudinal measurements from physiological interpretation; and single- versus cross-signal reasoning, which separates reasoning about individual signals from the integration of multiple signals. To construct reliable questions at scale, we adopt a dual-grounding framework that combines literature-grounded physiological findings with statistically validated population-grounded physiological patterns. This enables the capture of meaningful relationships observed in real-world wearable data. Evaluation of 14 proprietary and open-source LLMs demonstrates that WearableQA effectively differentiates model capabilities, with performance ranging from 19.6% to 72.9% against a 10% chance baseline. Moreover, WearableQA remains far from solved: most models achieve accuracies below 60%. Overall, WearableQA provides a realistic and diagnostic benchmark for evaluating LLM reasoning over real-world wearable data.