简一成长视点 | 为什么每位患者都需要一次“AI斑马扫描”
AI诊断不应只给出一个答案。通过调整“温度”,让模型在常见病之外,也说出那些罕见但重要的可能性——就像医学中的“斑马”。
医学界有一句流传已久的箴言:当你听到马蹄声,先想马,别想斑马。这句话几乎成了临床医生的入门必修课——大多数患者得的都是常见病,优秀的医生会先识别熟悉的模式,而不是一上来就追逐那些罕见病。
但这句话的另一面同样重要。医学从来都游走在“概率”与“可能性”之间。每一位经验丰富的医生,都记得某个患者被延误诊断的案例——当时所有人都接受了第一个看似合理的解释,而那只“斑马”从未被请进诊室。有趣的是,人工智能或许正在制造类似的时刻。
越来越多的医生开始借助大型语言模型来辅助临床工作,从整理数据到辅助临床思维。大多数互动都遵循同一条路径:输入一个问题,得到一个答案,对话就此结束——除了偶尔的追问,模型似乎已经“说完了它该说的话”。但我并不认为这个假设经得起临床和计算层面的推敲。我知道这听起来有点玄妙,但它可能很重要。
大型语言模型并不像教科书索引那样检索事实。它们生成回答时,有一个有趣的变量叫“温度”。别被这个名字误导,它和医学毫无关系。它不决定模型推理的深度,而是决定下一个词的可预测性。温度低时,模型会紧贴最可能的措辞;温度高时,它更愿意说出不那么显而易见的答案。
这只是一个关于语言生成的、微不足道的机械事实,但它带来了一个值得关注的副作用:一个“高温”运行的模型,有时会说出一个“低温”模型根本不会提到的诊断。我并不认为这意味着模型在更广泛地推理——它并没有推理得更多,只是说话时没那么谨慎了。
大多数模型默认温度接近1.0,这是“出厂设置”。ChatGPT的消费者界面温度更低,大约0.7,这使它倾向于更典型、更结构化的回答。而用于临床或事实性工作的工具,温度往往更低,通常低于0.5,理由是“一致性比多样性更重要”。据我所知,没有人会故意把模型温度调高,去寻求一个可能产生更广泛变异、从而发现“斑马”的第二意见。
正是这个区别让我想到,患者或许值得不止一次地获得AI的关注。想象一下,同一个临床问题问三次,让模型每次给出略有不同的回答——这是刻意为之。
低温扫描:紧贴共识。常见病、熟悉的表现,医生每周都会遇到的病例。对大多数患者来说,答案就该止步于此。代价也很明显:疾病离这个中心越远,低温、谨慎的模型就越不可能把它说出口。
标准扫描:适度放宽。常见诊断仍占主导,但不太常见的可能性开始参与竞争。这大概接近许多医生已经在无意识中体验到的状态——毕竟,很少有人会在向LLM提问时去思考温度。
高温扫描:更进一步。模型可能会说出罕见病,甚至是一些奇怪的症状组合。其中有些是噪音,有些会浪费医生的时间,但偶尔,那个没人想到的诊断会被说出来——也许还是第一次。
潜在的问题在于:这一切不该要求医生变成“温度工程师”,把同一个问题跑三遍再对比结果。那是没人想要的负担,也正是让好主意被斥为“临床不切实际”的典型。这个负担应该由系统来承担。
一个鉴别诊断工具,不必把它的可能性范围藏在一个自信的答案背后。它可以在一次回答中,原生地呈现三个层级:上面是常见诊断,中间是合理的替代方案,下面是一组标注为“低概率”但模型考虑过的可能性。这个范围应该来自系统的设计。
这更多是一个设计问题,而非临床问题。大多数这类工具都被设计成收敛到单一最可能的答案,就像搜索引擎收敛到最靠前的结果。但重要的是要认识到,收敛虽然看起来像自信,却可能远非完整。而正是在那个缝隙里,藏着未被看见的“斑马”。
其实,医生们早已在思考中融入了这种范围检查。疑难病例会拿去和同事讨论,或在病例讨论会上呈现。患者的故事很少在一夜之间改变,改变的是视角。或许我们该问问自己:AI系统是否应该被设计成主动提供这种范围,而不是等着有人想到要问第二遍?
我想谨慎地说明:这是一个设计提议,不是临床建议。温度是我注意到的线索,而不是我完全理解的机制。我不知道有任何研究证明,改变温度或围绕它构建输出能提高诊断准确性,或缩短罕见病的诊断路径。据我所知,这种临床界面还没有被构建出来。
医学从不信任单一视角来解决难题。患者和医生会寻求第二意见,或者更全面的视角。也许我们正在构建的工具,也应该承载同样的技术直觉。
奥卡姆剃刀是对的:最简单的解释通常是正确的。但今天,医学仍然需要知道,在临床逻辑的当下,常常有什么被掩盖了。