患者常依赖AI聊天机器人选购家用血压计,期望获得符合临床标准的快速指导。然而,最新研究表明,这种信任是错位的。

在2026年美国心脏协会高血压科学会议上展示的初步研究显示,在四项主流AI工具中,有三项正确识别经独立验证血压计的比例仅为63%至83%。表现最佳的Google Gemini,正确率虽达86%至91%,但在9%至14%的查询中仍出现错误。

测试方法与结果

该研究于2026年4月至5月进行。研究人员选取加拿大市场上324款流行家用血压计,其中145款通过公认协议验证,其余179款未经验证。样本来源包括StrideBP、ValidateBP和Hypertension Canada三个独立注册数据库,以及亚马逊热销型号和已知未验证设备列表。

研究向ChatGPT、微软Copilot、Perplexity AI和Google Gemini提出标准化问题,并将答案与官方数据比对。结果显示,各工具性能差异显著且缺乏一致性。所有模型偶尔会将已验证设备标记为未验证,且同一AI在不同时间或设备上对相同问题的回答往往不同。

“大多数AI工具的表现仅比抛硬币猜答案略好,”蒙特利尔大学内科住院医师、研究报告作者Anna Soriano博士表示,“即使是表现最好的Gemini,也常出错,无法准确检索易于获取的信息。”

临床风险与指南建议

据美国心脏协会2026年统计更新,高血压影响超过1.25亿美国成年人,约占人口47%,但仅约四分之一的人能将血压控制在120/80 mm Hg的目标值以下。使用未经验证的血压计可能导致读数错误,进而引发漏诊、不必要的药物调整或对病情的虚假安慰。

《2025年美国心脏协会成人高血压预防、检测、评估和管理指南》明确推荐使用经过验证的设备。Soriano团队指出,验证信息存在于免费的公共数据库中,理论上AI应能轻松检索,但其反复失败引发了对AI在健康产品推荐方面局限性的质疑。

美国心脏协会志愿专家Keith C. Ferdinand医学博士审查后强调,尽管AI在心脏成像等领域具有潜力,但在直接临床决策支持中必须保持谨慎。

AI在高血压护理中的复杂角色

其他研究为这一结论提供了背景。一项2025年发表于《Hypertension》杂志的研究发现,GPT-4在分析常见高血压场景时的准确率(83%)和安全性(86%)均低于人类专家(分别为92%和93%)。另有调查显示,AI语音代理虽能提高老年人报告准确性并减轻医生负担,但这类成功主要基于结构化互动,而非开放式产品建议。

尽管部分分析显示ChatGPT在回答家庭高血压管理技术问题时优于Bing,且系统综述报告称聊天机器人干预有助于提高药物依从性,但其在降低血压方面的效果并不一致。

建议与展望

随着可穿戴和无袖带血压技术的普及,可信的上臂式血压计重要性不降反升。苹果公司2025年获批准的Apple Watch高血压通知功能,因可能在低风险群体中造成虚假安慰而受到审视。专家指出,无袖带设备目前仍缺乏用于诊断和管理的全面临床验证标准。

研究人员建议,临床医生和公众在选购血压计时应绕过聊天机器人,直接通过独立注册数据库确认验证状态。Soriano团队计划进一步分析数据,探究模型未能引用搜索结果中注册表条目的原因,并测试后续更新的模型版本。在此之前,信息依然明确:选择血压计时,请跳过AI,查阅经验证的列表。