首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >医院砸钱上的 AI,为什么连"血糖高不高"都答不准

医院砸钱上的 AI,为什么连"血糖高不高"都答不准

作者头像
瑭宋元
发布2026-09-17 21:52:20
发布2026-09-17 21:52:20
750
举报

不是模型笨,是没人给医院建"字典"——一个临床信息科老兵的本体论白话

上个月跟一个在三甲做临床信息科的朋友吃饭。他跟我说了件特别尴尬的事。

他们医院去年花大价钱上了一套 AI 临床辅助系统,院长去演示现场兴致冲冲问了一句:"3 床那个老张,血糖高不高?"

AI 想了两秒,特别诚恳地回了句:"这取决于您怎么定义'高'。"

全场沉默。

你可能会笑。但笑完你会发现,这句话一点没毛病。

空腹 ≥ 7.0、随机 ≥ 11.1、糖化血红蛋白 ≥ 6.5%,三个口径,三个答案。院长问的是"高不高",系统在问"你到底想问哪种高"。

问题不在模型。模型把三种标准都背得滚瓜烂熟。问题在——从来没人跟它,也没跟医生,把"血糖高不高"这句话的准确意思钉死。

先把这个绕口的词说人话

顺着这件事,得搬出一个听起来很玄、其实很土的词:本体论(Ontology)

别被名字吓到。在医院的信息系统里,它根本不是哲学,就是一份"全院的字典 + 地图"。

· 字典:把"高血糖""血糖偏高""血糖控制不佳"这些近义词,统一成一个标准说法,并写明判定的数值边界。

· 地图:把"患者""医嘱""检验单""影像"这些东西,以及它们之间的真实关系(谁属于谁、谁引用谁),画清楚。

没有这本字典和地图,HIS、LIS、PACS 各说各的方言。AI 再聪明,也只是在五种方言里猜谜。

打个最土的比方:两拨人盖同一栋楼,A 队用"米"、B 队用"英尺",图纸怎么对都对不上,墙只能砌歪。医院的数据就是这样——每个系统一套单位、一套叫法,最后拼到一起全是缝。

那能不能让模型自己悟?

不能。这是大模型最容易被误解的地方。

大模型本质是"概率猜词",不是"查字典"。你问它"老张血糖高不高",它从训练语料里猜一个最可能的答案,但它并不知道你们院把"高"定义在哪个值、用的是空腹还是随机。它猜得再像,底子也是蒙。

反过来看——只要地基打好了,AI 真的能很准。2025 年有个研究(Doctronic,500 名患者),在病历数据被规整好的前提下,AI 给出的治疗计划和医生一致率到了 99.2%,而且零临床幻觉。注意那个前提:数据被规整好

也就是说,AI 有多聪明,上限是被你家的"字典"决定的。地基越清楚,模型越靠谱;地基是糊的,模型再大也白搭。所以本体不是锦上添花,是绕不过去的门槛。

下面这六道坎,每一道都是"没字典"闹出来的。我把它们从浅到深捋一遍,你会发现它们其实是同一件事的六个面。

第一道:一个"高"字,三种口径

技术上这叫语义标准化没做。医院里至少有三套要统一的:

· 同义词归一:病历写"血糖偏高""血糖高""血糖控制差",系统得知道它们是一回事还是三回事;

· 单位与阈值:用 mmol/L 还是 mg/dL?≥7.0 还是 ≥126?谁拍板;

· 时间窗口:"今天"是零点到零点,还是早八查房到次日早八。

这些标准其实行业早建好了——比如临床术语集 SNOMED CT、检验项目标准 LOINC、诊断编码 ICD-10。但很多医院没把它们"落地"成自己的《术语与口径手册》,于是每个科室自己发挥。AI 一来,矛盾全炸了。

第二道:数数也会数错

你想统计"本月血糖控制不佳的出院人数",得从 HIS 抓诊断、LIS 抓血糖、护理系统抓宣教记录。三个系统三个口径,数出来 23、31、28。

工程上这叫跨系统聚合(ETL + 主数据管理)没对齐。AHIMA 2025 的报告说,高达 30% 的患者记录在系统间是重复或不匹配的。这不是 AI 的锅,是地基本来就是歪的,AI 只是把歪的地方放大给你看。

第三道:AI 不能签字

这是权限模型问题。读权限和写权限是两回事。AI 能读完整病历、比对指南、给建议;但真正在医嘱单上点"确认"、签名字、担法律责任的,必须是有执业资格的医生。

监管也这么看。美国 FDA 把这类叫 CDS(临床决策支持),《21st Century Cures Act》里一部分可豁免严审,但真要"动手"的诊断治疗决策走更严监管——到 2025 年中全球已有 1250 多个 AI 医疗器械拿了授权。工程上,AI 的写权限要一道比读权限硬得多的护栏:审计日志、双人核对、人工确认。这块没设计好,宁可不接。

第四道:你有几个"老张"?

同一个患者,HIS 里 ID-001,LIS 里 ID-A37,PACS 里 IMG-882,病历、医保各一份。靠什么对上?靠 EMPI(企业级患者主索引),本质是"实体解析"——用姓名、生日、社保卡号等特征,判断几条记录是不是同一个人。

AHIMA 那报告说,约 35% 被拒付的医保索赔,根子就是身份识别不准,平均一家医院一年亏 250 万美元。

系统

"张三"的 ID

靠什么对齐

HIS 医嘱

ID-001

腕带条码

LIS 检验

ID-A37

手工录姓名+生日

PACS 影像

IMG-882

放射科登记号

EMR 病历

ZHANG_3

医生手写拼音

医保结算

3301···

社保卡号

没有 EMPI,AI 眼里的"老张"是五个互不相识的陌生人。它怎么可能给你一个靠谱的"老张今天怎么样"?

第五道:一换问题就露馅

很多医院第一版 AI 是请工程师把某病规则写成"如果 A 且 B 则 C"的表。糖尿病跑得好,问妊娠期糖尿病、术后应激性高血糖就傻。

这叫"问题形状"和"世界形状"对不上。规则引擎适合窄场景,但它不通用。真正想复用,得把知识放进"本体"里——用"糖尿病是一种代谢病,可致高血糖"这种关系来描述,而不是写死"糖尿病→开二甲双胍"。这样换场景,知识还能接着用。

我的判断(这块没硬数据,凭经验说):九成医院的第一版 AI,死就死在这张表太"专用"上。

第六道:指南会变,AI 不会自己变

糖尿病指南几年一更新,你 2023 年训练的模型背的是 2022 版共识。FDA 2025 年 PCCP(预定变更控制计划)最终指南要求:AI 改算法或改适配人群,得走预先说好的变更流程,不能自己悄悄改。

工程上,本体和模型都得版本化——谁在什么时候改了哪条规则,留痕可追溯。没走流程就默默更新的模型,才是最危险的。

把这六道坎摆一起,你会发现它们不是六个孤立的坑,是一条锁链。语义没统一,数出来的数就是错的;数错了,AI 给的建议就敢乱来;于是你不敢让它动手;可它连"谁是老张"都搞不清,给的建议又只认得那一张窄表;而这张表还在悄悄过期。

前一道不填,后一道白搭。

那本地到底怎么建?给一份能落地的蓝图

道理都懂,落地才是关键。按难度从低到高,六步:

第一步,写《术语与口径手册》(数据字典)。把科室"口头黑话"标准化。示例如下:

术语

标准定义

判定口径

来源/版本

血糖控制不佳

住院期间任一时间点空腹血糖≥7.0 或随机≥11.1 mmol/L

取 LIS 空腹+随机血糖,去重后判定

内分泌科共识 v2(2025-03)

病情平稳

连续 24h 生命体征正常且无需抢救

HIS 护理记录+监护数据联合判定

护理部规范 v1(2024-11)

第二步,建患者主索引 EMPI。把五个系统的"张三"归一成唯一患者 ID。

第三步,做术语映射。把本院诊断/检验,映射到医院标准编码(ICD-10 / LOINC / SNOMED CT),让不同系统能"说同一种话"。

第四步,搭语义层(轻量本体)。不必一上来搞复杂建模,先用一张"实体—关系"表把核心概念连起来:患者—(有)—诊断;诊断—(属于)—疾病分类;检验—(针对)—患者。

第五步,版本化与治理。本体每改一次留版本号,谁改的、为什么改,写清楚,对接指南更新节奏。

第六步,指定"语义责任人"。一个人,既懂业务又懂点数据,坐那专门盯字典。

前两步一周就能动,后四步是长期工程。但哪怕只做完第一步,AI 答"血糖高不高"就不会再回"取决于你怎么定义"。

我越琢磨越觉得,医院 AI 项目失败,锅真不该全扣在模型头上。MIT 那项跨行业研究说 95% 的生成式 AI 试点没产出正 ROI;医疗圈里也有调研(KLAS)说跳过数据基础、直接上点状方案的 AI,首年失败率能到六成。

模型不笨。是没人给模型一个"说得清的世界"。

这是我自己的观点:医院与其再买一块 GPU、再招一个算法工程师,不如先指定一个"临床语义责任人"。那篇讲本体的文章说抄本体的"形"不抄"神",会变成新一代数据治理工程;翻译回医院就是——你以为在买 AI,其实先得把自己家的"话"说清楚。

这周就能干的三件事

第一,把你科室里那些"口头黑话"列出来。什么叫"血糖控制不佳",什么叫"病情平稳",白纸黑字写清楚,贴在交班本第一页。

第二,指定一个人当"语义责任人"。不用加薪,就在科务会上当众说一句"这事归你盯"。

第三,先上一个只读的 AI 助手——它只准读、不准写、不准开医嘱。让它先把"老张今天血糖趋势"讲明白,再谈别的。

别一上来就想让 AI 开药方。先让它,把你我都说不清的话,说清楚。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-09-14,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档