简一成长视点 | 为什么每位患者都需要一次“AI斑马扫描”

AI诊断工具或许需要一次“斑马扫描”——通过调整温度,让模型在常见答案之外,也说出那些被忽略的罕见可能。

简一成长视点 | 为什么每位患者都需要一次“AI斑马扫描”

在医学界,有一句流传已久的箴言:当你听到马蹄声,先想马,别想斑马。这句话几乎成了临床思维的基石——大多数患者得的都是常见病,优秀的医生会先识别熟悉的模式,再去追逐那些罕见可能。

但硬币的另一面同样重要。医学始终在“概率”与“可能性”之间摇摆。每一位资深医生都记得,有些患者的诊断来得太晚,因为所有人都接受了第一个看似合理的解释,而那只“斑马”从未被请进诊室。有趣的是,人工智能或许正在重现这一幕。

越来越多的医生开始借助大型语言模型(LLM)来辅助临床工作,从整理数据到辅助诊断。大多数互动都遵循同一条路径:输入问题,得到答案,对话就此结束——除非用户反复追问,否则模型似乎已倾囊相授。但我并不认为这个假设经得起临床和计算层面的推敲。这听起来可能有些深奥,但它确实重要。

大型语言模型并不像教科书索引那样检索事实。它们生成回答时,有一个有趣的变量叫“温度”(temperature)。别被名字误导,它和医学无关,也不决定模型的推理深度,而是决定下一个词的可预测性。温度低时,模型倾向于最常规的措辞;温度高时,它更愿意说出不那么显而易见的答案。

这看似只是一个关于语言生成的机械事实,却带来了一个值得关注的副作用:一个“高温”运行的LLM,有时会说出一个“低温”模型绝不会提到的诊断。我并不认为这意味着模型在更广泛地推理,它只是不那么谨慎了。

大多数模型默认温度接近1.0,这是“出厂设置”。ChatGPT的消费者界面温度更低,约0.7,这使它偏向更典型、结构化的回答。而用于临床或事实性工作的工具通常温度更低,往往低于0.5,因为一致性比多样性更重要。据我所知,没有人会故意让模型“高温”运行,以获取一个可能包含更广泛变异、从而发现“斑马”的第二意见。

正是这个区别让我想到:患者或许值得不止一次地获得AI的关注。想象一下,同一个临床问题问三遍,每次让模型以略微不同的方式回答——故意为之。

低温扫描:紧贴共识。常见病、典型表现,医生每周都会遇到的病例。对大多数患者来说,答案就该止步于此。但代价也很明显:疾病离中心越远,低温谨慎的模型就越不可能把它说出口。

标准扫描:适度放宽。常见诊断仍占主导,但不太常见的可能性开始参与竞争。这大概接近许多医生目前的实际体验,因为很少有人会在输入问题时想到“温度”。

高温扫描:更进一步。模型可能会说出罕见病,甚至奇怪的症状组合。其中有些是噪音,有些会浪费医生的时间,但偶尔,那个没人想到的诊断会第一次被说出口。

潜在的问题在于:这一切不应要求医生成为“温度工程师”,把同一个问题跑三遍再对比结果。那是没人想要的负担,也是让好主意被斥为“临床不切实际”的典型。这个负担应该由系统承担。

一个鉴别诊断工具不必把它的范围隐藏在一个自信的答案后面。它可以在一次输出中,原生地呈现三个层级:常见诊断置顶,中间是合理的备选,最后是模型考虑过但未优先列出的低概率可能。这种范围应该来自系统的设计。

这更多是设计问题,而非临床问题。大多数工具被设计成收敛于最可能的单一答案,就像搜索引擎收敛于最佳结果。但重要的是,收敛感并不等于完整,而在这个缝隙里,就藏着未被看见的“斑马”。

其实,医生们早已将这种范围检查融入思维。疑难病例会与同事讨论,或在病例讨论会上呈现。患者的故事很少在一夜之间改变,改变的是视角。我们或许该问:AI系统是否应该被设计成主动提供这种范围,而不是等着有人想到去问第二次?

我想谨慎说明:这是一个设计提议,而非临床建议。温度只是我注意到的线索,并非我完全理解的机制。我不知道有任何研究表明,调整温度或围绕它构建输出能提高诊断准确性或缩短罕见诊断的路径。据我所知,这种临床界面尚未被构建。

医学从不信任单一视角。患者和医生会寻求第二意见,或更全面的视角。也许我们正在构建的工具,也应该承载这种技术本能。

奥卡姆剃刀是对的,最简单的解释通常正确。但今天的医学,仍然需要知道那些常常被临床逻辑掩盖的东西。

简一思迈 JIANYI SIMA
简一思迈 简一思迈 JIANYI SIMA

添加专属心理助理

微信二维码

新家有爱 · 前湾新区青少年心理健康公益示范点

中国社会组织/NGO 公益运作中心 · 累计已服务 10,000+ 家庭

分享文章

简一思迈 JIANYI SIMA

手机微信扫码阅读/分享:

请点击右上角菜单
选择“发送给朋友”或“分享到朋友圈”

复制成功!