← 返回首页目录
# 医疗人工智能的成本效益与预算影响系统评价
## 引言
人工智能(AI)是指使机器能够执行通常需要人类智能的任务的一系列计算技术,包括机器学习、深度学习以及新兴的生成式AI。这些技术已广泛应用于医疗领域的预测分析、诊断支持和个性化治疗规划。近年来,AI在医学领域的快速发展正在改变医疗服务的格局,先进的AI应用能够提高诊断精度、个性化治疗策略并优化临床工作流程。随着这些技术从实验原型过渡为临床实践的组成部分,它们有望彻底改变各专科领域的患者护理。
然而,尽管AI在医疗中的临床益处已被广泛认可,其经济影响却尚未得到明确阐释。鉴于将AI整合到临床实践中需要大量投资,评估其经济可行性变得至关重要。在人口老龄化、慢性病负担和技术创新推动医疗成本不断攀升的背景下,评估AI的财政投资是否能产生可持续的效益并物有所值,对于医疗领导者和政策制定者的决策至关重要。
经济评价涵盖不同的分析方法,主要包括完整经济评价——包括成本效果分析(CEA)、成本效用分析(CUA)和成本效益分析(CBA)——以及部分评价,如预算影响分析(BIA)。完整经济评价系统性地比较两种或以上干预方案的成本和结果,旨在确定物有所值或最佳资源配置;而预算影响分析仅评估在特定医疗环境或支付方预算中采用新干预措施的财务后果,不明确衡量临床效果或更广泛的社会结果。
## 研究方法
本系统评价遵循PRISMA 2020指南,系统检索了PubMed、Embase、Web of Science和Cochrane Library数据库。初步检索获得312条独特记录,经标题和摘要筛选排除262条,对50篇全文进行资格评估后,排除31篇(其中6篇经济报告不明确或不充分,10篇研究设计不符合要求,15篇缺乏经济结局指标),最终纳入19篇研究。
纳入的研究发表于2020年至2024年间,涵盖多个临床领域,包括肿瘤学、房颤筛查、胃肠内镜检查、糖尿病视网膜病变筛查、龋齿检测、ICU管理(出院决策和脓毒症检测)、药物管理、结核病筛查和治疗监测、青光眼筛查、肺癌筛查和乳腺癌筛查。研究的地理分布涵盖北美、欧洲和亚洲,体现了不同医疗体系和经济背景下的AI应用情况。
在评价方法方面,纳入研究采用了多种经济评价方法:成本效果分析(14项)、成本效用分析(4项)、成本最小化分析(2项)和预算影响分析(1项)。分析视角多样,其中13项采用医疗系统视角,4项采用社会视角,1项采用支付方视角。评价时间范围从短期随访(90天)到终生预测不等,均按照区域指南进行贴现处理。所有研究均一致报告了直接医疗成本(包括诊断、操作和治疗费用),而间接成本的纳入较少(仅4项)。
## 主要发现
### AI干预的临床与经济双重效益
多项研究表明,AI干预不仅达到了与传统标准护理相当的临床结果,还在质量调整生命年(QALY)和其他效果指标方面产生了可测量的改善。QALY估算最常来源于已发表的效用权重,这些权重与EQ-5D或SF-6D等患者报告结果指标相符。
在肿瘤学领域,Murtojärvi等人证明,AI驱动的特征选择可显著降低成本,同时通过增强临床精准度和资源利用来改善经济绩效。在房颤筛查方面,Hill等人报告,基于机器学习的风险预测算法实现的增量成本效果比(ICER)介于4,847至5,544英镑/QALY之间,远低于英国国家医疗服务体系(NHS)的20,000英镑/QALY阈值,其机制在于有效减少了所需筛查次数。
在糖尿病视网膜病变筛查中,Xie等人和Huang等人的研究均发现,AI驱动模型将每名患者的筛查成本降低了14%至19.5%,ICER低至1,107.63美元/QALY。这一改善在资源丰富(新加坡国家计划)和资源有限(中国农村)的环境中均得到验证,证实AI在不同资源配置条件下的临床影响具有稳健性。Schwendicke等人报告,AI辅助龋齿检测提高了牙齿保留率(64年vs. 62年),ICER为每额外保留一年牙齿-13.9欧元,表明AI在降低长期治疗成本的同时改善临床结果。
### 系统层面的成本节约
在患者和系统层面均持续报告了成本节约效果。Mori等人报告,在AI辅助结肠镜检查策略下,日本每年可节省1.492亿美元,美国每年可节省8,520万美元。在药物管理领域,Kessler等人记录了12.4:1的投资回报率。在乳腺癌筛查中,Mital和Nguyen估计AI引导筛查策略的ICER为23,755美元/QALY,远低于100,000美元/QALY的基准。Szymanski等人进一步估计,英国基于机器学习的房颤筛查可在三年内将NHS和个人社会服务(PSS)成本降低最多8,040万英镑。Salcedo等人在结核病监测领域展示了AI的主导地位,每名患者节省2,226美元,同时QALY略高(1.05 vs. 1.03)。
### 影响成本效果的关键驱动因素
#### 技术获取和实施成本
AI技术及其实施的单位成本对整体经济结果起决定性作用。Mori等人强调,将AI实施成本维持在大约每次结肠镜检查19美元对于实现成本节约至关重要。在肺癌筛查中,Ziegelmayer等人报告,如果每次扫描成本保持在1,240美元以下,AI辅助低剂量计算机断层扫描(LDCT)可保持成本节约(每名患者节省68美元)——这一阈值通过广泛概率敏感性分析得到确认。
#### 诊断准确性
诊断准确性——以敏感性、特异性和AUROC衡量——是成本效果的重现性决定因素。Hill等人阐明,诊断精确度的增量改善可显著减少不必要干预并改善经济结果。在龋齿检测中,Schwendicke等人证明,更高的敏感性(0.75 vs. 传统评估的0.36)可促进更早干预并相应减少长期治疗成本。在糖尿病视网膜病变筛查中,半自动化和全自动化AI模型之间的性能差异直接影响每名患者成本和ICER,强调即使是诊断准确性的小幅改善也可能产生显著的经济影响。
#### 工作流程整合与地区差异
AI在现有临床工作流程中的有效整合以及当地医疗融资差异进一步影响经济结果。Kessler等人阐明,简化的AI辅助药物管理通过优化药剂师工作流程减少住院并实现总体成本节约。新加坡和中国农村的糖尿病视网膜病变筛查研究报告了地区成本差异,表明优化整合和区域经济环境直接影响AI益处的可推广性。在乳腺癌筛查中,Mital和Nguyen强调,AI每张乳房X光片成本的微小变化(阈值为318美元)可能决定AI与多基因风险评分相比是否仍具有成本效果。
### 敏感性分析的稳健性
几乎所有研究都进行了广泛的敏感性分析以检验经济评价的稳健性。Ziegelmayer等人使用多达30,000次蒙特卡洛模拟证明AI辅助LDCT在各种情景下均保持成本节约。在结核病领域,Nsengiyumva等人确认,当诊断特异性维持在80%以上时,AI-based CXR分诊仍保持主导地位;Salcedo等人发现AiCure在96.4%的模拟中在150,000美元/QALY阈值下具有成本节约性。敏感性分析证实,只要关键参数(如诊断准确性、技术成本)保持在规定范围内,AI的经济效益就具有稳健性。
### 经济影响的情境依赖性
总体而言,综合分析表明临床AI干预在许多应用中具有高度成本效果甚至成本节约性。然而,并非所有应用都能产生净节省:例如,虽然AI在青光眼筛查中通过将失明减少33.3%改善了临床结果,但它导致了额外的长期成本。Gomez Rossi等人的多专科评价表明,虽然AI在黑色素瘤和龋齿检测中占主导地位,但AI在巴西糖尿病视网膜病变筛查中的经济价值较不有利——该干预具有成本效果(满足可接受的ICER阈值),但不具有成本节约性。这些细致差异强调AI的经济效益高度依赖于情境,必须根据具体医疗环境、成本结构和所使用的结果指标进行解释。
## 模型局限与方法论挑战
本评价揭示几个关键的方法论挑战。首先,约63%的研究基于动态或半动态模型,能够反映AI系统随时间推移的性能改善。相比之下,其余研究依赖静态决策分析模型,可能因固定转移概率和缺乏适应性学习效应而导致结果高估。这一区分至关重要,因为虽然许多评价已纳入适应性特征,但静态模型的成本效果估计可能呈现过度乐观的AI经济收益。
其次,成本核算不完整是一个重现性局限。许多研究报告有利的ICER或净节省主要基于减少诊断错误和简化工作流程,但通常省略了大额支出,如AI基础设施的初始投资、软件整合成本和持续维护费用。短期研究可能低估长期财务可持续性,需要更广泛的经济视角和更长的时间范围。
第三,间接成本、基础设施投资和公平性考虑经常未被充分报告,这表明所报告的经济效益可能被夸大。Karabeg等人针对服务不足少数族裔人群的研究强调了设计和评估具有包容性、人口代表性和可及性的AI干预的重要性。
## 质量评估
使用CHEERS 2022检查表对19项纳入研究的报告质量进行评估,总分范围为21/28至27/28,表明报告质量普遍较高。使用Drummond检查表(包含10个关键项目)的评估显示,研究得分介于8/10至9/10之间。这些评估表明,纳入的19项经济评价的整体质量和方法严谨性较高,增强了综合经济证据的可信度。在间接成本估值或具体成本转换细节等领域存在微小差距,但并未影响整体结果的稳健性。
## 结论与政策启示
本系统评价综合了19项跨多个专科的临床AI干预的经济证据,证明了一致的临床改善、可测量的成本节约和总体有利的增量成本效果结果。影响经济可行性的关键决定因素包括诊断性能、技术和实施成本、工作流程整合以及区域医疗融资结构。尽管总体经济结果积极,但方法论差距仍然存在,包括成本评估不完整、静态建模方法和有限公平性考虑。
证据支持在临床实践中更广泛采用AI干预,特别是在低技术成本、高诊断准确性和简化工作流程相结合的领域,可实现临床和经济双重效益。来自新加坡、中国农村和英国研究的地区成本结构差异表明,需要进行本地适应和情境特异性评价,以有效指导报销和实施决策。
地区成本差异和数字基础设施差距可能促进或阻碍AI技术的公平获取。医疗领导者和政策制定者必须认识到AI干预的成本效果取决于具体情境,需要根据当地医疗环境、成本结构和结果指标进行解释。建议未来研究采用动态建模方法以捕捉AI系统的适应性学习曲线,纳入全面的成本组成部分,进行亚组分析以确保跨人群的公平性,并延长评估时间范围以充分评估长期财务可持续性。
总之,AI在医疗领域的临床前景已得到广泛认可,但其经济复杂性需要同样严谨的评估。通过在完整的净现值框架内考虑所有相关成本,采用考虑AI随时间演进的动态模型,并优先考虑公平获取和情境特异性证据,医疗系统可以做出明智的决策,实现AI的全部价值和潜力。
---
*作者:吉祥法师*