简一思迈报道 | 为什么每位患者都需要一次“AI斑马扫描”?

当AI诊断只给出一个“标准答案”时,我们可能错过了那些罕见的“斑马”。本文探讨了如何通过调整AI的“温度”来拓宽诊断视野,让每个患者都值得一次更全面的“扫描”。

简一思迈报道 | 为什么每位患者都需要一次“AI斑马扫描”?

在医学界,有一句流传已久的谚语:“当你听到马蹄声,先想想马,而不是斑马。”这句话几乎成了临床医生的第一课——大多数患者的疾病都是常见的,优秀的医生会先识别熟悉的模式,而不是去追逐那些罕见的情况。

但反过来想,这句话也有另一面。医学总是在“概率”和“可能性”之间摇摆。每一位经验丰富的医生,都记得某个患者的诊断被延误的故事——当时所有人都接受了第一个看似合理的解释,而“斑马”从未被请进诊室。有趣的是,人工智能或许正在创造类似的时刻。

越来越多的医生开始借助大型语言模型来辅助临床工作,从整理数据到辅助诊断。大多数时候,这种交互很简单:输入问题,得到答案,对话就此结束。除非有进一步的追问,否则模型似乎已经“说完了所有的话”。但我并不认为这个假设经得起仔细推敲——无论是从临床角度还是从计算原理来看。这听起来可能有点深奥,但确实很重要。

大型语言模型并不像教科书索引那样检索事实。它们生成回答时,有一个有趣的变量叫做“温度”。虽然名字听起来和医学无关,但它并不决定模型推理的深度,而是决定下一个词的可预测性。在低温下,模型会倾向于最常规的措辞;在高温下,它更愿意说出一些不那么显而易见的答案。

这看似只是一个关于语言生成的机械事实,却带来了一个值得关注的副作用:一个“高温”运行的模型,有时会说出一个“低温”模型完全不会提到的诊断。我并不认为这意味着模型在更广泛地推理,它只是不那么“谨慎”了。

大多数模型默认温度接近1.0,这是“出厂设置”。ChatGPT的消费者界面温度更低,大约0.7,这使它偏向更典型、结构化的回答。而用于临床或事实性工作的工具,温度通常更低,往往低于0.5,因为一致性比多样性更重要。据我所知,没有人会故意让模型“高温”运行,去寻求一个可能包含更多变异的“第二意见”,从而发现“斑马”。

正是这种区别让我想到,也许患者值得不止一次地获得AI的关注。想象一下,同一个临床问题,我们问三次,并故意让模型每次给出略有不同的答案。

低温扫描:贴近共识,常见病、典型表现,这些是医生每周都会遇到的病例。对大多数患者来说,答案就应该止步于此。但代价也很明显——疾病离这个中心越远,低温、谨慎的模型就越不可能把它说出来。

标准扫描:适度放宽,常见诊断仍然领先,但不太常见的可能性开始竞争。这大概接近大多数医生目前的体验,因为很少有人会在输入问题时去思考“温度”这个概念。

高温扫描:进一步推进,模型可能会提到罕见疾病,甚至奇怪的症状组合。其中一些可能是噪音,会浪费医生的时间,但偶尔,这里会说出那个没人想到的诊断——也许是第一次。

这里有一个潜在的问题:这一切不应该要求医生成为“温度工程师”,把同一个问题跑三遍再对比结果。那是一种没人想要的负担,也正是让好主意被斥为“临床不切实际”的原因。这个负担应该由系统来承担。

一个鉴别诊断工具,不应该只给出一个自信的答案,而应该自然地呈现三个层级:常见诊断、中等可能性的替代方案,以及模型考虑过但未优先列出的低概率可能性。这种范围应该来自系统的设计。

这更多是一个设计问题,而不是临床问题。大多数工具都倾向于收敛到最可能的单一答案,就像搜索引擎收敛到最相关的结果。但重要的是,收敛感并不等于完整性,而在这个差距中,可能就藏着未被发现的“斑马”。

其实,医生们早已将这种范围检查融入思考。疑难病例会与同事讨论,或在病例讨论会上呈现。患者的故事很少在一夜之间改变,改变的是视角。或许我们应该思考,AI系统是否应该自主提供这种范围,而不是等待有人想到去问第二次。

需要澄清的是,这是一个设计提议,而非临床建议。温度是我注意到的线索,而不是我完全理解的机制。我不知道有任何研究表明,改变温度或围绕它构建输出能提高诊断准确性或缩短罕见病的诊断路径。据我所知,这种临床界面尚未被构建。

医学从不信任单一视角来解决难题。患者和医生会寻求第二意见,或者更多元的视角。也许我们正在构建的工具,也应该带有这种技术本能。

奥卡姆剃刀原则是对的:第一个答案通常是最可能的。但今天,医学仍然需要知道,在当时的临床逻辑之下,常常被忽略的是什么。

简一思迈 JIANYI SIMA
简一思迈 简一思迈 JIANYI SIMA

添加专属心理助理

微信二维码

新家有爱 · 前湾新区青少年心理健康公益示范点

中国社会组织/NGO 公益运作中心 · 累计已服务 10,000+ 家庭

分享文章

简一思迈 JIANYI SIMA

手机微信扫码阅读/分享:

请点击右上角菜单
选择“发送给朋友”或“分享到朋友圈”

复制成功!