一个漏掉七成患者的AI,为什么可能比“全找出来”更有用?


‍‍‍

最近,有一篇医学论文,摘要里说,在这个项目设定的阈值上,AI只找出了27.7%的结直肠癌患者,也就是漏掉了七成以上。要知道,放在任何AI评测里,只找到27.7%的患者,这个成绩都很难看。

这是位于美国宾州的盖辛格医疗系统做的一个项目,AI从来不负责诊断患者的病情,它只回答一个很现实的问题:护士时间和肠镜名额都有限,这周先联系谁?

接下来,请得到AI学习圈主理人快刀青衣老师,来讲讲这篇论文。
作者:快刀青衣
来源:得到App《AI学习圈》

这家医院从2019年开始用机器学习引导结直肠癌筛查。整个项目里,AI不管病情,它只负责找人。因为结直肠癌现在在全球都有非常成熟的筛查手段,难的是让逾期没查的人完成检查。
他们医院系统里有大量逾期未筛查的患者,名单很长,护士和肠镜名额却有限,不可能挨个打电话催。我想咱们同学,只要在三甲医院做过CT或者肠镜的,都特别能理解。很多时候排个类似的检查,都要到半个月之后了。
这个项目是怎么做的呢?他们把患者的年龄、性别和最近三年的血常规数据交给模型,算出风险分数。模型每周扫描大约450名逾期没来检查的患者,标出风险最高的11人,护士这一周就优先联系这些人。
AI的任务到这里其实就结束了。护士拿到名单之后,先查病历,排除正在化疗、已经住院或已经去世等不适合联系的人,再以家庭医生团队的名义打电话。护士会告诉对方:你的筛查已经逾期,AI分析也提示你的肠道疾病风险高于一般人。如果患者同意,护士就在电话里把肠镜约好;三次没有接通,就改寄挂号信。
在这个流程里,AI负责排序,人类护士负责解释风险、建立信任、处理顾虑和完成预约。模型没有跟患者说话,却决定了护士把时间花在谁身上。
到了这里,27.7%这个数字就容易理解了。我和你解释一下,它说的是:在所有真正患结直肠癌的人里,模型只标出了不到三成,剩下七成多都漏掉了。
为什么漏呢?因为要保证护士的时间和肠镜的名额,要是增加护士和肠镜名额的话,这个数字就很容易提升。另外,标记太多低风险的人去做肠镜,本身也有并发症的风险,所以宁可少标。
但反过来看,它标出来的人很准。被这个系统标记的人去做肠镜,每100人能查出6个多结直肠癌;没被标记的人去做,100人里不到1个,相差七倍以上。一边漏得多,一边标得准,其实是同一个设计的两面,也就是模型宁可少标,也要把每周450人的名单压到11人,让护士打得完电话,医院准备的肠镜名额也接得住。
那这套办法到底有没有效果?直接看整体数据,会得到一个很吓人的结果:被模型标记的人,两年内死亡率是12.1%,未被标记的人是7.9%。换句话说,被找到的人反而死亡率更高。
这也说明很多时候,数据是个好东西,但也会被人任意打扮。如果只看死亡率,感觉这个模型都可以直接点名叫“柯南系统”了。
其实原因并不神秘。因为模型本来就在挑选患者中最高风险的人,被AI标记组平均年龄67.3岁,未标记组是62.4岁,两组人的健康基础本来就不同。
拿这两个组的死亡率直接比较,就像看到ICU死亡率高于普通病房,便认定ICU害人。问题是,ICU里面本来就是重症患者,普通病房可能仅仅是感冒而已。
这个研究里,还有非常多反常识的数据,让人觉得有点儿不可思议。比如,被模型标记的人里,三个月内做了肠镜的只有11%,六个月内也只有16%。也就是说,即使进入了AI筛出来的重点外呼名单,最终真正完成肠镜检查的人,比例依然不高。我看到这个数据的时候,还是挺惊讶的。
当然,这背后也有原因。论文里说,这些用户会进入护士的外呼流程。护士最多打三次电话;如果三次都联系不上,就会寄一封挂号信。不过,哪怕像我这样,因为骚扰电话太多、基本不接陌生电话的人,如果看到有人连续打了三次电话,又收到医院寄来的挂号信,一般也会考虑回拨过去。
论文观察到一个更重要的结果:被列入外呼名单的那一侧,两年内死亡率下降了6.2个百分点,降幅43%。
这个43%该怎么看?我的建议是,信方向,别抠数字。这毕竟不是严格的临床试验,而是对真实运营数据的分析,样本不大,误差范围也宽,真实降幅可能没有43%这么漂亮。但“确实降了”这一点,在统计上是站得住的。
那命是怎么救回来的?论文给了一条线索:被标记进外呼名单的人,做上肠镜的时间平均提前了大约四个月。结直肠癌如果早发现,五年生存率超过90%;拖到晚期,只剩15%左右。对一些患者来说,这四个月,可能就是决定是癌症中期还是晚期的关键时间,因此异常珍贵。
我还专门去找了几个相关的研究,正好解释了为什么电话要由护士来打。
比如,一项发表在《内科学文献》上的随机试验,让自动语音系统给8万名健康计划成员介绍结直肠癌筛查,再让患者自己联系家庭医生。结果,接电话的测试组和对照组,筛查率分别是30.6%和30.4%,几乎没有差别。也就是说,哪怕信息送到了,用户也不会因为接到一个自动电话,就去做筛查。
那为什么需要人类护士呢?另一项发表在《内科学年鉴》上的试验,把支持分成了几档:从常规护理,到自动寄送筛查通知和材料,到电话协助,再到护士全程导航。
结果,两年内持续保持筛查达标的比例,常规对照组是26.3%,电话协助组是57.5%,支持最完整的护士导航组达到64.7%。啥意思呢?就是有人给你解释、协调、解决障碍,64.7%的人都会真的去接受检查。
想想也是,我要是接到一个AI电话,让我去某某医院做个什么检查,我肯定会在心里说“骗子”。但如果一接电话,里面说自己是某某医院的护士,根据我之前的查血情况,建议我去做一个筛查,并提供流程支持,我大概率二话不说,拔腿就去。
在这种需要高信任度的场景里,真正起作用的,不只是AI分析,还有背后的人。
说到这里,我想起昨天接到的一通电话。
我每天都会收到几十个AI骚扰电话,基本上已经练出了百毒不侵的肌肉记忆,能不接的电话全不接。但是昨天手机突然一个96110来电,我接起来,里面也是AI语音,一听就不是真人。它提醒我,前一天我接到的某个电话疑似诈骗号码,要注意防范,不要被骗了。
你看,同样是AI语音,同样是不请自来的陌生来电,我的感受却完全不同。对于这条96110的电话,我一点儿都不觉得是骚扰。当然,AI语音效果还值得再迭代一下。
那从骚扰电话到反诈电话,同样是AI电话,为什么给我们的感觉有这么大差别?什么样的AI电话会被信任呢?
这个问题我还真是思考了一会儿。我的答案有三条:它认得你,它管得了这件事,出了状况还有人接手。
这里,我也解释一下:
“认得你”,意味着这通电话来自你的真实数据和风险,而不是一张买来的号码表。
“管得了”,意味着它能直接推进解决,比如当场约好肠镜,而不是就给你念一堆材料,再让你自己找人。
“背后有人”,意味着复杂问题出现时,有一个活人能解释、判断并承担责任。比如,上周我跟一个家电品牌报修的时候,本来是AI对话,说着说着,就发现AI的反应有点迟钝,我就说了句“转人工”,接着流程非常顺滑地就转过去了。
这些都不是把AI话术训练得更像真人就能解决的。因为这里面需要数据分析,中间需要调动真实资源,最后需要有人接住,都是对真实世界的考验。