在医学研究和临床治疗中,准确解读医学图像并生成有洞察力的报告对病人的护理是必不可少的,但却给人类临床专家带来了沉重的负担。
人工智能(AI),特别是多模态生成式医学图像解释(GenMI)领域的快速发展,为自动化这一复杂过程(chéng)的(de)部(bù)分(fēn)工(gōng)作(zuò)创(chuàng)造(zào)了(le)机(jī)会(huì)。尽(jǐn)管(guǎn) GenMI 有(yǒu)望(wàng)在(zài)生(shēng)成(chéng)跨(kuà)学(xué)科(kē)报(bào)告(gào)方(fāng)面(miàn)达(dá)到(dào)人(rén)类(lèi)专(zhuān)家(jiā)水(shuǐ)平(píng),但(dàn)仍(réng)在(zài)准(zhǔn)确(què)性(xìng)、透(tòu)明(míng)度(dù)等(děng)方(fāng)面(miàn)面(miàn)临(lín)障(zhàng)碍(ài)。
厘(lí)清(qīng)这(zhè)些(xiē)障(zhàng)碍(ài)并(bìng)提(tí)出(chū)针(zhēn)对(duì)性(xìng)解(jiě)决(jué)方(fāng)案(àn),对(duì)于(yú)帮(bāng)助(zhù)临(lín)床(chuáng)医(yī)生(shēng)改(gǎi)善(shàn)护(hù)理(lǐ)质(zhì)量(liàng)、加(jiā)强(qiáng)医(yī)学(xué)教(jiào)育(yù)、减(jiǎn)少(shǎo)工(gōng)作(zuò)量(liàng)、扩(kuò)大(dà)专(zhuān)业(yè)准(zhǔn)入(rù)并(bìng)提(tí)供(gōng)实(shí)时(shí)专(zhuān)业(yè)知(zhī)识(shi)至(zhì)关重(zhòng)要(yào)。
今(jīn)天(tiān),来(lái)自(zì)哈(hā)佛(fú)医(yī)学(xué)院(yuàn)的(de)研(yán)究(jiū)团(tuán)队(duì)在(zài)权(quán)威(wēi)科(kē)学(xué)期(qī)刊(kān) Nature 上(shàng)发(fā)文,全面(miàn)综(zōng)述(shù)了(le)开(kāi)发(fā)从(cóng)图(tú)像(xiàng)中(zhōng)生(shēng)成(chéng)医(yī)学(xué)报(bào)告(gào)的(de) AI 系(xì)统(tǒng)方(fāng)面(miàn)的(de)进(jìn)展(zhǎn)和(hé)挑(tiāo)战(zhàn)。

论(lùn)文链(liàn)接(jiē):
https://www.nature.com/articles/s41586-024-07618-3
除(chú)了(le)分(fēn)析(xī)医(yī)疗(liáo)报(bào)告(gào)生(shēng)成(chéng)的(de)新(xīn)模(mó)型(xíng)的(de)优(yōu)势(shì)和(hé)应(yīng)用(yòng)之(zhī)外(wài),他(tā)们(men)倡(chàng)导(dǎo)一(yī)种(zhǒng)新(xīn)的(de)范(fàn)式(shì),以(yǐ)授(shòu)权(quán)临(lín)床(chuáng)医(yī)生(shēng)及(jí)其(qí)患(huàn)者(zhě)的(de)方(fāng)式(shì)部(bù)署(shǔ) GenMI
在(zài)临床中发挥 GenMI 的优势
现有的大多数 AI 解决方案都侧重于自动完成医学影像中的单一任务,没有考虑到放射学和临床成像中涉及的更全面的综合分析。
因此,AI 有很大潜力在医学成像和报告方面实现更广泛的用途,例如快速(sù)撰写出涉及多科室的权威报告,摄取多种模式和临床数据,生成更加准确、流畅和可解释的报告等。

图|自动生成医疗报告的应用
目前,医疗报告生(shēng)成(chéng)框(kuāng)架(jià)主要(yào)由(yóu)视(shì)觉(jué)编(biān)码(mǎ)器(qì)和语言解码器组(zǔ)成(chéng)。其(qí)中(zhōng),编(biān)码(mǎ)器(qì)将(jiāng)图(tú)像(xiàng)中的视觉信息提取为向量表示,而解码器接收一个向量并产生特定的输出。
近年来,科研人员在编码器-解码器方法的基础上不断创新,从而更好地编码图像数据、考虑外部知识、筛选异常等。包括大语言模型(LLM)在内的大型预训练通用 AI 系统,通过推动开发新的 GenMI 解决方案,彻底改变了医学图像解释。
这些 GenMI 方法可以产生更准确的医疗报告,以及使用相同的基础模型执行其他几个(gè)下游任务并处理多模态数据。
这些算法大多建立在视觉语言模型(VLM)的基础上,VLM 将单个视觉和语言模型融合到一个统一的框架中,可以对图像和文本输入进行联合编码。

图|GenMI 的能力
利用 GenMI 协助临床医生和患者,在临床环境中充分发挥它们的优势,可以通过两个范例来理解。
第一个是部署 AI 住院实习医师。AI 住院实习医师首先会专门起草临床上准确的报告,作为住院实习医师或医生撰写报告的起点。在开发过程中,可以在临床环境中对模型进行前瞻性测试。然后,AI 住院实习医师可以在主治医师的监督下进行微调或校准,并从所需的修正和补充中学习。

图|部署 AI 住院(yuàn)实(shí)习(xí)医师
第二个是符合人类偏好。基于人类反馈的强化学习(RLHF)和直接偏好优化(DPO)是应用于此类任务的两种技术。
对话式医疗报告生成模型,使临床医生可以根据需要提供反馈和后续问题,还可以与临床医生合作,通过生成式 AI 改变输入图像的属性,观察模型预测中的相关差异,并将这些差异与临床医生识别出的突出特征进行比较,从而对 AI 成像工具进行审核,还可以对为患者生成的报告进行调整,使其更直白,包含更少的医学术语,更多围绕患者病情。
总的来说,临床医生可以通过 3 种途径与 AI 系统协作:
利用 AI 模型的诊断能力,获得诊断错误的反馈。模型可以结合多模态输出,其中的解释加上在原始图像上的边界框,可以突出图像中以前可能被忽略的相关区域;
模(mó)型(xíng)快(kuài)速(sù)解(jiě)析(xī)图(tú)像(xiàng)和(hé)报(bào)告(gào)的能力,有助(zhù)于(yú)临(lín)床(chuáng)医(yī)生(shēng)快(kuài)速(sù)搜(sōu)索(suǒ)类(lèi)似(shì)病(bìng)例(lì)和(hé)图(tú)像(xiàng);
模(mó)型(xíng)可(kě)以(yǐ)协(xié)助(zhù)临床医生决策,其提出的探究性问题可以让临床医生深入了解与特定病症相关的诊断模式。
仍需克服 4 大挑战
然而,研究团队表示,要想发挥 GenMI 等 AI 系统的优势,还需要解决基准、人类过度依赖、数据集和模型偏差以及新模型、新科室等挑战。
首先,是基准和评估指标。在安全实施医学报告生成模型,AI 住院实习医师将在住院治疗中发挥更重要的作用之前,必须开展评估下游临床效果的研究,明确衡量标准。
流行的 LLM 的性能会随着时间的推移而发生显著变化,这种差异可能会造成严重后果。例如,疾病预测模型可能会被操纵以输出特定的诊断和结果测量,从而导致处方过量、保险欺诈和伪造临床试验。
因此,在将 LLM 作为人工智能住院实习医师的一部分进行部署时,必须确保采取一致的安(ān)全措施和监管。
其次,是临床医生和患者的过度依赖。临床医生可能出于对错误问责的模糊性、确认偏差和自动化偏差,过于依赖机器自动化指导等各种原因,不愿意更改 AI 生成报告中的文字,忽略模型无法识别的罕见发现。
虽然 AI 住院实习医师可以让患者直接与真正的临床专家进行交流,但这些交流应该在可(kě)控(kòng)的(de)情(qíng)况(kuàng)下(xià)进(jìn)行(xíng),这(zhè)样(yàng)患(huàn)者(zhě)就(jiù)不(bù)会(huì)依(yī)赖(lài) AI 住(zhù)院(yuàn)实(shí)习(xí)医(yī)师(shī)来(lái)指(zhǐ)导他们的医疗护理。同时,临床医生应向患者传授正确的查询方法,并让他们了(le)解(jiě) AI 工(gōng)具(jù),以(yǐ)便(biàn)自(zì)己进行探索。在部署 AI 住院实习医师的整个过程中,必须承认 AI 系统的局限性,尤其是在直接护理等只有人类才能处理和提供的更广泛的语境、同理心和认知的领域。
然后,是有偏差的数据集和模型。深度学习模型,尤其是(shì) LLM,很(hěn)容(róng)易(yì)受(shòu)到(dào)训(xun)练(liàn)数(shù)据(jù)固(gù)有(yǒu)偏(piān)差(chà)的(de)影(yǐng)响(xiǎng)。在(zài) AI 住(zhù)院(yuàn)实(shí)习(xí)医(yī)师(shī)的(de)范(fàn)例(lì)中(zhōng),这(zhè)种(zhǒng)缺(quē)陷(xiàn)尤(yóu)其(qí)容(róng)易(yì)造(zào)成(chéng)问(wèn)题(tí),因(yīn)为(wèi)模(mó)型(xíng)不(bù)仅(jǐn)会(huì)在(zài)生(shēng)成(chéng)的(de)报(bào)告(gào)中(zhōng),还会在医学教育和临床医生理解等方面延续这种偏差。
此外,人类的主观反馈是改进 AI 住院医(yī)师(shī)的(de)关键因(yīn)素(sù),而(ér)这(zhè)本身就可能造成有偏见的反馈循环。训练数据的质量、规模和平衡也是决定模型偏差的重要因素,因此亟(jí)需(xū)更(gèng)广(guǎng)泛(fàn)、更(gèng)具(jù)代(dài)表(biǎo)性(xìng)的(de)数(shù)据(jù)集。
目(mù)前(qián),大(dà)多(duō)数(shù)进(jìn)展(zhǎn)都(dōu)是(shì)由(yóu) MIMIC-CXR 等(děng)数(shù)据(jù)集推(tuī)动(dòng)的(de),这(zhè)些数据集仅限于单模态胸部 X 光扫描,其他数据集也不平衡,除了配对图像和相关报告普遍不足外,与正常扫描相比,异常扫描要少得多,并且往往会捕捉到更常见的疾病,而罕见的疾病则很少出现。异常也通常只局限于图像的一小部分(fēn),因(yīn)此(cǐ)模(mó)型(xíng)很(hěn)难(nán)对(duì)其(qí)进(jìn)行(xíng)筛(shāi)选(xuǎn)。
最(zuì)后(hòu),是(shì)新(xīn)的(de)模(mó)式(shì)和(hé)新(xīn)的(de)科(kē)室(shì)。目(mù)前(qián),将(jiāng) GenMI 应(yīng)用(yòng)于(yú)三维成像(包括 MRI 和 CT 扫描)的工作十分有限。部分原因是这一领域缺乏大型标注数据集,只有少数未发布、稀少或难以获取的数据集。
除了三维放射图像,GenMI 还以有限的方式应用于其(qí)他(tā)科(kē)室(shì)。眼科和皮肤科的报告生成在一定程度上取得了(le)成(chéng)功,在其考虑中纳入了外部知识和疾病分类等标准技术。尽管纳入新科室和图像类型将扩展 AI 工具的能力,但获取大规模多模态数据集的成本非常高昂,资源充足的公司或有能力收集或授权使用这些专有数据集。
自动生成医疗报告在减轻临床负担、扩大专家级临床医疗服务覆盖面方面有广阔前景。GenMI 可以生成更高质量的报告,通过提供交互式临床专业知识授权临床医生和患者,并通过扩展教育功能改善未来的临床护理。
研究团队表示,在不同模式和科室的临床环境中,制定衡量其效果的公开基准、进行持续的临床合作(zuò)和(hé)谨(jǐn)慎(shèn)的(de)模(mó)型(xíng)验(yàn)证(zhèng)至(zhì)关重(zhòng)要(yào),这(zhè)有(yǒu)助(zhù)于(yú)学(xué)术(shù)界(jiè)更(gèng)透(tòu)明(míng)地(de)衡(héng)量(liàng)报(bào)告(gào)生(shēng)成(chéng)的(de)进(jìn)展(zhǎn),并(bìng)为(wèi)临(lín)床(chuáng)监(jiān)管(guǎn)机(jī)构(gòu)未(wèi)来(lái)的(de)工(gōng)作(zuò)提(tí)供(gōng)指(zhǐ)导(dǎo),使(shǐ)其(qí)安(ān)全有(yǒu)效(xiào)。
官方网站-首页
关注我们
小客服微信