文章探讨生成式AI在医疗诊断中的实际应用困境,指出AI虽在信息处理和推理能力上已超越单个医生,但其不可靠的数据提取、缺乏透明性(如漏读指标却不提示)及对医生提示词能力的过度依赖,构成临床风险;强调真正关键在于构建可复现、可验证、人机协同的临床AI系统,而非简单部署大模型。
多年来,布兰迪・扎卡里博士一直在把复杂的病史、化验结果、症状、用药和多年治疗经过,整理成连贯的临床方案。一个复杂病例,往往要花她三个小时研究,才敢确定什么重要、下一步怎么做。
后来,生成式AI出现了,能消化海量信息,调取医学知识的速度远超人脑,几秒钟就能看出一份病例里各项信息之间的关联。她以为,只要给大语言模型套个界面、加几道安全防护,就大功告成了。
实际上,他们花了一年左右、约100万美元,带着软件工程师和一支10人临床团队,系统却至今没建完。
原因不是AI不够聪明,而是“聪明”恰恰是最容易的部分。
做临床软件之前她就发现:同一个AI工具,自己和旁边的人用,结果天差地别。因为她不是简单提问、拿走答案,而是在跟AI争辩、质疑假设、补上漏掉的背景、纠正错误、换角度再追问。
技术上用的是同一个工具,效果上却不是同一个东西。
写广告时这只是效率问题,换成病人就完全不同。她和7万多名执业医生打过交道:有人临床非常出色,却完全不会从AI系统里问出有用的信息。
医疗行业的主流答案,似乎是让医生去学“提示词工程”。她不认为这是正经方案:如果临床AI要靠医生先修炼成提示词工程师才可靠,那它根本没造完。
2024年一项随机临床试验让50名医生做高难度诊断:用GPT-4的医生得76分,用传统资料的74分,差距不显著GPT-4单独作答时,比传统资料高出16个百分点。
2026年巴基斯坦的试验中,接受过AI素养培训、能用GPT-4o的医生诊断推理得分71.4%,用传统资料的只有42.6%,GPT-4o单独作答则是82.9%。
2026年英国的重复杂研究也类似:医生在AI辅助下虽有进步,仍比单独工作的大模型低21个百分点以上。
坦白说:在某些认知任务上,AI已经胜过单个医生。没有医生读过全部论文,也没人能及时想起每一种罕见病和药物禁忌,而AI能处理海量信息,不疲惫、不受时间限制。真正的错误,是以为放一个聊天机器人在医生面前,问题就解决了。
想象一位医生上传一份含150项指标的化验报告:回答很快回来,整理得赏心悦目,但系统并没有可靠提取全部150项指标。通用大模型不是确定性的临床文档解析器,处理表格和密集的医学报告尤其困难。
最吓人的是:它不会告诉你“我漏掉了50个数值”,可能直接给出答案。若漏掉的某个数值恰需紧急评估呢?
这是她绝不愿绕过的缺陷,团队不得不另造一套提取技术,先准确、可复现地处理化验报告,临床推理才能启动。
一个会告诉你“我不知道”的AI,只是有点麻烦;不知道自己漏掉了什么的AI,才是危险的。
临床工作硬性要求一种通用生成式AI天生给不了的东西:可复现性。必须对输入输出都有掌控——可靠的数据提取、结构化的知识、确定性的逻辑、安全防护,以及能跨病史评估指标关联的系统。
临床推理不是一堆条件句,有时信号藏在几个指标的关系里;五个单独看平平无奇的结果,合起来却至关重要。人体生物学满是例外和相互竞争的解释。答案从来不是“用AI还是不用AI”,而是弄清每项工作该交给谁。
使用得当,AI能扩展医生的记忆、加速研究、提出不常见的可能性,在海量信息中识别模式。这越来越不像取代医生,而像打造一位“仿生医生”。
医疗中的人际互动,不是机器干完脑力活后加的温情装饰,而是临床数据的另一个来源。最好的临床系统,两者都需要。
未来不一定属于聊天机器人最机灵、模型最聪明的公司,重要创新正发生在模型周围:信息如何被捕获核实、系统拥有什么知识、被允许推断什么、哪些环节由人参与。
我们不该要求每位医生都变成业余AI开发者,复杂性应该活在技术内部,而不是医生的提示词里。
未来的医生不会在记忆力上战胜AI,那场比赛已失去意义。
相反,我们应该把机器的记忆、算力和模式识别交给医生。同时保留他们对整体情况的把握、判断力、怀疑精神,以及与患者的人性连接,我们称之为“仿生医生”。
本文由雷科技编译自Unite.AI
原文链接:AI已经比你的医生更聪明了,但这还不是最吓人的部分
本文来自“雷科技”