简一成长视点 | 为什么每位患者都需要一次“AI斑马扫描”

医学界常说“听到马蹄声,先想马”,但AI的“温度”设置或许能帮我们发现那些被忽略的“斑马”。本文探讨了如何通过调整AI的随机性,为患者提供更全面的诊断视角。

简一成长视点 | 为什么每位患者都需要一次“AI斑马扫描”

在医学界,有一句流传已久的谚语:“听到马蹄声,先想马,别想斑马。”这句话提醒医生们,大多数患者得的都是常见病,而优秀的临床医生会先识别熟悉的模式,再去追逐那些不太可能的诊断。

但反过来也同样重要。医学总是在概率与可能性之间摇摆。每一位经验丰富的医生都记得,有些患者的诊断被延误了,因为所有人都接受了第一个看似合理的解释,而“斑马”从未被请进诊室。有趣的是,人工智能可能正在创造类似的时刻。

越来越多的医生开始借助大型语言模型来辅助临床实践——从数据整理到临床思维。大多数这样的互动都遵循同一条路径:输入一个问题,得到一个答案。对话往往就此结束——除了偶尔的追问,模型似乎已经说完了所有该说的话。但我并不认为这个假设经得起临床和计算层面的推敲。我知道这听起来有点深奥,但它可能很重要。

大型语言模型不像教科书索引那样检索事实。它们生成回答时,有一个有趣的变量叫做“温度”。尽管名字听起来跟医学无关,它并不决定模型推理的深度,而是决定下一个词的可预测性。在低温下,模型会紧贴最可能的措辞;在高温下,它更愿意说出不那么显而易见的答案。

这虽然只是语言生成中一个微小而机械的事实,却产生了一个有趣的副作用。一个“高温”运行的LLM有时会说出一个“低温”模型根本不会提及的诊断。我并不认为这意味着模型在更广泛地推理,它只是不那么谨慎地表达而已。

大多数模型默认温度接近1.0,这是“出厂设置”。ChatGPT的消费者界面温度更低,大约0.7,这使它倾向于更典型、更结构化的回答。而用于临床或事实性工作的工具通常温度更低,往往低于0.5,因为一致性比多样性更重要。据我所知,没有人会故意让模型“高温”运行,以寻求一个可能包含更广泛差异、从而发现“斑马”的第二意见。

正是这种区别让我想到,患者或许值得不止一次地获得AI的关注。想象一下,对同一个临床问题提问三次,并让模型每次给出略有不同的回答——这是故意的。

“冷扫描”会紧贴共识:常见病、熟悉的表现、临床医生每周都会遇到的病例。对大多数患者来说,答案就应该止步于此。但代价也很明显:疾病离中心越远,冷静而谨慎的模型就越不可能把它说出来。

“标准扫描”会适度放宽:熟悉的诊断仍然领先,但不太常见的可能性开始竞争提及。这可能接近大多数医生在无意识中已经体验到的情形,因为很少有临床医生在输入问题时考虑温度。

“热扫描”则更进一步:模型可能会说出不常见的疾病,甚至奇怪的症状组合。其中有些是噪音,有些会浪费临床医生的时间,但偶尔,这里会说出没人想到的诊断,甚至可能是第一次被说出来。

潜在的问题在于:这不应该要求医生成为温度工程师,把同一个问题跑三遍再对比结果。那是一种没人要求的负担,也正是让好主意被斥为“临床不切实际”的原因。负担应该由系统来承担。

一个鉴别诊断工具不需要用一个自信的答案来隐藏其范围。它可以在单次通过中原生呈现三个层级:顶部是常见诊断,中间是合理的替代选项,以及一组标记为低概率但模型考虑过的可能性。这种范围应该来自系统的构建方式。

这是一个设计问题,而非临床问题。大多数这类工具都旨在收敛到最可能的单一答案,就像搜索引擎收敛到顶部结果一样。但重要的是要认识到,收敛虽然感觉像自信,却可能远非完整。而正是在那个间隙中,隐藏着未被发现的“斑马”。

在很多方面,医生们已经将这种范围检查融入了思考。疑难病例会与同事讨论,或在病例讨论会上呈现。患者的故事很少在一夜之间改变,但改变的是视角。或许值得一问:AI系统是否应该被构建成能自行提供这种范围,而不是等待有人想到要问两次?

我想谨慎地说,这是一个设计提议,而非临床建议。温度是我注意到的线索,而不是我完全理解的机制。我不知道有任何研究表明改变温度或围绕它构建输出能提高诊断准确性或缩短罕见诊断的路径。据我所知,这种临床界面尚未被构建。

医学从不信任对难题的单一视角。患者和医生会寻求第二意见,或者更折中的视角。也许我们正在构建的工具应该带有同样的技术本能。

奥卡姆剃刀是对的:最简单的解释通常是正确的。但今天,医学仍然需要知道,在当下的临床逻辑之下,常常隐藏着什么。

简一思迈 JIANYI SIMA
简一思迈 简一思迈 JIANYI SIMA

添加专属心理助理

微信二维码

新家有爱 · 前湾新区青少年心理健康公益示范点

中国社会组织/NGO 公益运作中心 · 累计已服务 10,000+ 家庭

分享文章

简一思迈 JIANYI SIMA

手机微信扫码阅读/分享:

请点击右上角菜单
选择“发送给朋友”或“分享到朋友圈”

复制成功!