ChatGPT 差点劝死一个人,但这次我站 OpenAI
7 月 21 日,美国佛州一位 55 岁的前牧师 Scott Winters,把 OpenAI 和奥特曼一起告上了旧金山的法庭。诉状里说,ChatGPT 劝他不用去医院,断断续续劝了大半年,最后他双肺多发血栓,大面积肺栓塞,进了 ICU,差点没出来。
两天之后,7 月 23 日,OpenAI 官宣 Health in ChatGPT 面向全美用户全量上线。可以连接你的病历,连接 Apple Health,把健康正式做成了 ChatGPT 侧边栏里的一个产品入口。
这两条新闻是前后脚出现的。一边是有人拿命指控它不该聊健康,一边是它宣布要更深地聊健康,好家伙,这个排期我盯着看了半天,确认不是同一条新闻的两种写法。
先把丑话说在前面,这篇我最后的立场是站 OpenAI 这边的,你可能不同意,没关系,看完再骂。
先讲那个案子,因为细节比标题吓人得多。
根据 IT 之家的报道,Winters 从 2024 年开始用 ChatGPT-4o 咨询身体状况,持续头晕、血压波动,反复问。一开始 ChatGPT 是提醒他去看医生的。注意这个细节,一开始它是对的。
但随着对话持续,提醒越来越少,它开始自己上手诊断。后来 Winters 出现腹股沟疼痛,ChatGPT 说情况不严重,建议他减少活动,待在家里的躺椅上。
记住这把躺椅,后面还会提到。
更离谱的在后面。Winters 是前牧师,ChatGPT 的回复居然顺着他的信仰来,说上帝并没有把你的身体设计成会不断衰竭。教会里的人看不下去了,说你不去医院是疯了,他把这话转述给 ChatGPT,ChatGPT 安抚他,说在家借助它的帮助调理身体,是大多数人根本不理解的事,包括那些好心的教会成员。
我跟你说,读到这段的时候我是真有点发毛。这不是模型答错一道题,这是模型在漫长的对话里,一点一点变成了他想听到的那个声音,最后连他身边真实的人发出的警告,都被它调低了音量。
2025 年 7 月,长期久坐的 Winters 因为双肺血栓引发大面积肺栓塞进了重症监护室。医生说,肺栓塞很可能就跟久坐有关。而建议他少动、躺着的,正是 ChatGPT。
诉状的指控里有一条很有意思,除了疏忽,还有一条是无证行医。这个我们待会再聊。
做 agent 工程的人看这个案子,看到的东西可能跟普通读者不太一样。我的日常工作就是给大模型搭运行的脚手架,就是让模型真正能干活的那层工程,工具怎么接、上下文怎么管、评测怎么跑。从这个位置看过去,诉状描述的不是一次玄学翻车,而是一个非常典型的复合故障,两个圈内人都眼熟的毛病叠在一起了。
第一个毛病,长对话里的约束衰减。模型的安全行为很大程度上靠训练时的对齐和对话里的系统约束撑着,但对话一长,几百轮聊下来,早期的提醒在上下文里的权重被越冲越淡,模型越来越像一个顺着你说话的朋友,而不是一个守规矩的工具。诉状里那条轨迹,一开始劝就医,后来提醒变少,最后开始自行诊断,就是这条衰减曲线的人间版本。
第二个毛病,讨好倾向。4o 的谄媚问题当年是公开争议,OpenAI 自己都专门发过文回滚更新。一个被训练得倾向于让你满意的模型,遇到一个不想去医院的用户,会发生什么,不难想象。你不想去,它就帮你找不去的理由,你的信仰、你的顾虑、你对医院的抗拒,全都变成它迎合你的素材。
这两个毛病叠加,再加上一个真实的人对它越来越深的信任,就是这个案子。
所以当两天后 OpenAI 发布健康功能的时候,很多人的第一反应是,这公司疯了吧,火上浇油。
我第一反应也是这个。但把官方公告完整读了一遍之后,我改了主意。
先看它到底发了什么。这功能其实不是横空出世,今年 1 月 OpenAI 就给一小拨用户开过一个独立的健康专区内测,结果发现超过 70% 的健康对话根本不发生在专区里,大家就是在日常聊天里顺嘴问的。所以这次全量版干脆把专区打散,健康上下文可以进任何对话。Health in ChatGPT 面向美国 18 岁以上用户上线,网页和 iOS,免费档到 Pro 档全都有。你可以选择连接 Apple Health、美国医院系统的电子病历、One Medical、Function Health,戴手表的运动数据也能通过 Apple Health 进来。连上之后,它能帮你把新的化验结果跟历史数据对比,总结上次就诊以来的变化,跟踪用药,看睡眠和运动的关系。在任何对话里 @Health 就能显式调用这些上下文。

隐私那部分写得很细。连接的病历和健康数据不用于训练模型,不用于广告,对话里用到健康数据的部分也不用于训练,不管你的训练开关怎么设。默认每次使用健康信息前要请求授权。断开连接后 30 天内从 OpenAI 系统里删除。这几条是白纸黑字的产品承诺,将来做不到是要被集体诉讼的,所以我倾向于认为它是认真的。
然后是整个公告里最关键的一个数字。每周有超过 3 亿人在 ChatGPT 上问健康相关的问题。
3 亿。每周。
你想想看这个数字在说什么。不是 OpenAI 上线了健康功能所以大家开始问 AI 健康问题,而是大家早就在问了,问了好几年了,规模大到相当于全人类每 25 个人里就有 1 个每周在问。Winters 不是被健康功能坑的,他出事的时候根本没有健康功能,他用的就是裸的 4o,没有专门训练、没有病历上下文、没有升级就医的识别机制,什么防护都没有的那种问法。
这就是我改主意的原因。摆在 OpenAI 面前的选项从来不是做不做健康,而是这 3 亿人每周的提问,要不要认真接。假装接不到,用户还是会问,只是问一个没有任何健康专项防护的通用模型,出了事你还可以说我只是个聊天机器人。认真接,就要把病历接进来、把医生请进评测流程、把该做的隔离和授权做了,同时把自己放到火上,接受产品化之后更重的责任。
它选了后者。这个选择在被起诉的同一周做出来,我觉得有点子牛逼,商业上是豪赌,方向上是对的。
公告里还有一组数据值得单独说。OpenAI 拉了几百个医生一起搞了个叫 HealthBench Professional 的评测,医生写真实场景的题目和评分标准,然后让模型和医生亲笔写的回答同台打分。结果是,医生的手写回答在自家标准下全面落后于模型。准确性这一项,医生 76.2 分,GPT-5.6 Sol 91.0 分。差距最大的是健康决策有用性,医生 50.8,模型 83.0。

看到这组数字先别急着喊 AI 超越医生。做评测的人都知道这里面有个老问题,评分卡天然偏爱面面俱到的长回答,模型是照着这类标准优化出来的,医生手写回答短平快,吃亏是结构性的。跑分赢了评分卡,不等于赢了临床。这个分寸 OpenAI 自己在公告里倒是没吹过头,明确写了 ChatGPT 仍然会犯错,不能替代专业医疗判断。
但这组数字至少说明一件事,专门为健康场景训练过的模型,跟两年前那个顺嘴聊病的 4o,已经不是一个物种了。OpenAI 专门写过一篇讲这块的训练,新模型重点补的能力恰恰是识别何时需要紧急就医。你看,这正好就是 Winters 案里缺的那块。
聊回那条无证行医的指控,这是整个案子在法律上最有想象力的部分。以前聊天机器人聊健康,厂商的挡箭牌一直是免责声明,我只是提供信息,不构成医疗建议。但当你把产品做成可以读病历、追踪用药、对比化验单的健康助手时,这个挡箭牌还举不举得动,就是另一回事了。产品化等于把责任从用户误用往厂商设计那边挪了一大截。OpenAI 的法务不可能看不到这一点,还是发了,说明他们赌的是,做得更认真在法庭上反而比装傻更有利。这个赌局的结果,可能要好几年后才揭晓,但它会给整个行业划出健康 AI 的责任基线。
说完立场,说点实用的。不管你站哪边,那 3 亿人里大概率有你,反正有我。怎么问 AI 健康问题才不会把自己问进 ICU,我自己的原则是这么几条,不一定对,你拿去参考。
让它解释,别让它决定。化验单看不懂、医嘱里的术语、两种治疗方案的区别,这些放心问,它讲人话的能力确实强。但要不要去医院这种决策,不交给它,一秒都不交。
红旗症状直接走人。胸痛、呼吸困难、单侧腿肿、突发剧烈头痛这类,不用问 AI,问就是去医院。AI 说不严重不算数,它没有听诊器,也没有责任。
警惕它越来越顺着你。长对话里模型会慢慢变成你情绪的回音壁,这是它的结构性缺陷,不是你的错觉。重要的健康问题,开个新会话,用第三人称把症状重新描述一遍,把你自己的倾向从问题里拆掉,看它还是不是原来的答案。
数据连进去了就管好。停了的药还挂在列表上,它就会基于错误信息推理。公告自己都提醒了,同步的信息不一定完整和最新,重要细节要对着原始记录核对。
最后一条,也是 Winters 案给我印象最深的一条。当你身边真实的人都在劝你去医院,而屏幕里的声音在告诉你他们不理解你的时候,听人的。
文章开头我说记住那把躺椅。ChatGPT 现在能把你的病历讲成人话,能看出你三次化验单的变化趋势,能在凌晨三点秒回你的每一个症状描述,这些都是真本事,我一点都不怀疑。但把你从躺椅上扶起来、塞进车里、送到急诊科门口的,从来都不是它。
技术能做的事越来越多,这条边界反而越来越值得每天默念一遍。
希望那位前牧师早日康复,也希望这场官司好好打,打出个行业标准来。