首页 / 院系成果 / 成果详情页

基于视觉语言模型的肺结节良恶性分类方法  期刊论文  

  • 编号:
    00CEEFFABA83EDF6284BAA98794B8293
  • 作者:
    钱乾;夏天;王小童;李建华;韩磊;孙丽萍
  • 地址:
    上海理工大学健康科学与工程学院,上海 200093;上海健康医学院医疗器械学院,上海 201318
  • 语种:
    中文
  • 期刊:
    国际生物医学工程杂志 ISSN:1673-4181 2026 年 49 卷 3 期 (209 - 219) ; 2026年6月
  • 收录:
  • 关键词:
  • 摘要:

    目的探索视觉语言模型(VLM)NoduleLLaVA在肺结节良恶性分类任务中的可行性及优化方法。方法基于LIDC-IDRI公开数据集纳入1 018名患者的胸部计算机断层成像(CT)图像构建实验数据集,并依据患者ID以3∶1划分为训练集与测试集。搭建融合细节增强与特征判别模块的NoduleLLaVA,分别对比通用VLM(llava-1.5-7b-hf)与医学预训练VLM(llava-med-v1.5-mistral-7b、QoQ-Med-VL-7B、Radiology-Infer-Mini与MedGemma-4B)、肺结节放大图像与CT切片+肺结节目标框2类图像输入形式、有无细节增强与特征融合模块,以及低秩适配(LoRA)及自适应LoRA(AdaLoRA)2种参数高效微调(PEFT)方法的分类表现。选取随机森林、XGBoost、ViT-B/16、MobileNetV3-L、3D ResNet-152及CapsuleNet模型开展对照实验,以准确率、精确率、召回率和F1分数作为评价指标。结果采用CT切片+肺结节目标框数据表示方式训练模型时,llava-1.5-7b-hf、llava-med-v1.5-mistral-7b和QoQ-Med-VL-7B的准确率、精确率、召回率和F1分数[(81.32%、66.12%、81.32%、72.94%)、(81.55%、78.13%、81.55%、74.09%)、(82.32%、79.20%、82.32%、77.57%)]均高于肺结节放大图像数据表示方式[(76.21%、58.08%、76.21%、65.92%)、(78.19%、82.42%、78.19%、70.41%)、(80.09%、79.13%、80.09%、76.03%)]。在无训练情况下,llava-med-v1.5-mistral-7b模型在引入特征融合模块后,准确率、精确率、召回率和F1分数分别从68.32%、69.20%、68.32%、68.75%提高至77.23%、71.44%、77.24%、73.59%;而QoQ-Med-VL-7B准确率、精确率、召回率和F1分数分别从81.09%、69.23%、81.09%、72.93%变为83.15%、68.30%、83.17%、75.01%,精确率下降。在对模型进行1个轮次的LoRA微调后,引入特征判别模块的llava-med-v1.5-mistral-7b和QoQ-Med-VL-7B准确率、精确率、召回率和F1分数分别为87.90%、87.14%、87.90%、87.25%和87.38%、86.99%、87.38%、85.53%,均高于未引入特征判别模块的同等微调模型[(81.55%、78.13%、81.55%、74.09%)、(82.32%、79.20%、82.32%、77.57%)]。在llava-med-v1.5-mistral-7b已有特征融合模块基础上引入细节增强(即构成NoduleLLaVA),准确率、精确率、召回率和F1分数分别从96.81%、96.77%、96.81%、96.77%提升至98.71%、98.70%、97.71%、98.70%。PEFT方法中,在微调1个轮次的条件下,LoRA方法可使llava-med-v1.5-mistral-7b的准确率、精确率、召回率及F1分数分别达到87.90%、87.14%、87.90%、87.25%,QoQ-Med-VL-7B的上述指标分别为87.38%、86.99%、87.38%、85.53%。当微调轮次增加至5个轮次时,llava-med-v1.5-mistral-7b的准确率、精确率、召回率及F1分数分别提升至96.81%、96.77%、96.81%、96.77%,QoQ-Med-VL-7B分别提升至96.81%、96.79%、96.81%、96.80%。相比之下,AdaLoRA在1、5个轮次条件下的各项指标均低于同等条件下的LoRA方法。结论细节增强、特征融合与PEFT所构建的VLM NoduleLLaVA可有效改善通用VLM在肺结节良恶性分类中的不足,提升其在肺结节良恶性分类中的性能。

  • 推荐引用方式
    GB/T 7714:
    钱乾,夏天,王小童, 等. 基于视觉语言模型的肺结节良恶性分类方法 [J].国际生物医学工程杂志,2026,49(3):209-219.
  • APA:
    钱乾,夏天,王小童,李建华,&孙丽萍.(2026).基于视觉语言模型的肺结节良恶性分类方法 .国际生物医学工程杂志,49(3):209-219.
  • MLA:
    钱乾, et al. "基于视觉语言模型的肺结节良恶性分类方法" .国际生物医学工程杂志 49,3(2026):209-219.
  • 入库时间:
    7/22/2026 9:40:39 PM
  • 更新时间:
    7/22/2026 9:40:39 PM
浏览次数:15 下载次数:0
浏览次数:15
下载次数:0
打印次数:0
浏览器支持: Google Chrome   火狐   360浏览器极速模式(8.0+极速模式) 
返回顶部