目的探索视觉语言模型(VLM)NoduleLLaVA在肺结节良恶性分类任务中的可行性及优化方法。方法基于LIDC-IDRI公开数据集纳入1 018名患者的胸部计算机断层成像(CT)图像构建实验数据集,并依据患者ID以3∶1划分为训练集与测试集。搭建融合细节增强与特征判别模块的NoduleLLaVA,分别对比通用VLM(llava-1.5-7b-hf)与医学预训练VLM(llava-med-v1.5-mistral-7b、QoQ-Med-VL-7B、Radiology-Infer-Mini与MedGemma-4B)、肺结节放大图像与CT切片+肺结节目标框2类图像输入形式、有无细节增强与特征融合模块,以及低秩适配(LoRA)及自适应LoRA(AdaLoRA)2种参数高效微调(PEFT)方法的分类表现。选取随机森林、XGBoost、ViT-B/16、MobileNetV3-L、3D ResNet-152及CapsuleNet模型开展对照实验,以准确率、精确率、召回率和F1分数作为评价指标。结果采用CT切片+肺结节目标框数据表示方式训练模型时,llava-1.5-7b-hf、llava-med-v1.5-mistral-7b和QoQ-Med-VL-7B的准确率、精确率、召回率和F1分数[(81.32%、66.12%、81.32%、72.94%)、(81.55%、78.13%、81.55%、74.09%)、(82.32%、79.20%、82.32%、77.57%)]均高于肺结节放大图像数据表示方式[(76.21%、58.08%、76.21%、65.92%)、(78.19%、82.42%、78.19%、70.41%)、(80.09%、79.13%、80.09%、76.03%)]。在无训练情况下,llava-med-v1.5-mistral-7b模型在引入特征融合模块后,准确率、精确率、召回率和F1分数分别从68.32%、69.20%、68.32%、68.75%提高至77.23%、71.44%、77.24%、73.59%;而QoQ-Med-VL-7B准确率、精确率、召回率和F1分数分别从81.09%、69.23%、81.09%、72.93%变为83.15%、68.30%、83.17%、75.01%,精确率下降。在对模型进行1个轮次的LoRA微调后,引入特征判别模块的llava-med-v1.5-mistral-7b和QoQ-Med-VL-7B准确率、精确率、召回率和F1分数分别为87.90%、87.14%、87.90%、87.25%和87.38%、86.99%、87.38%、85.53%,均高于未引入特征判别模块的同等微调模型[(81.55%、78.13%、81.55%、74.09%)、(82.32%、79.20%、82.32%、77.57%)]。在llava-med-v1.5-mistral-7b已有特征融合模块基础上引入细节增强(即构成NoduleLLaVA),准确率、精确率、召回率和F1分数分别从96.81%、96.77%、96.81%、96.77%提升至98.71%、98.70%、97.71%、98.70%。PEFT方法中,在微调1个轮次的条件下,LoRA方法可使llava-med-v1.5-mistral-7b的准确率、精确率、召回率及F1分数分别达到87.90%、87.14%、87.90%、87.25%,QoQ-Med-VL-7B的上述指标分别为87.38%、86.99%、87.38%、85.53%。当微调轮次增加至5个轮次时,llava-med-v1.5-mistral-7b的准确率、精确率、召回率及F1分数分别提升至96.81%、96.77%、96.81%、96.77%,QoQ-Med-VL-7B分别提升至96.81%、96.79%、96.81%、96.80%。相比之下,AdaLoRA在1、5个轮次条件下的各项指标均低于同等条件下的LoRA方法。结论细节增强、特征融合与PEFT所构建的VLM NoduleLLaVA可有效改善通用VLM在肺结节良恶性分类中的不足,提升其在肺结节良恶性分类中的性能。