2026年8月8日,北京大学全国医学教育发展中心江哲涵团队在《npj Digital Medicine》在线发表研究论文“Transfer learning for text-based distractor selection rate prediction in medical multiple-choice questions: fine-tuning embedding models as a plausibility proxy”。研究将迁移学习与嵌入模型微调引入医学试题质量评价,探索仅依据题干与干扰项文本,在正式施测前预测干扰项选择率的技术可行性。

图1:论文截图
现有医学选择题智能研究主要集中于利用大语言模型生成干扰项、预测整道试题难度,或在考试结束后开展心理测量分析:前两类方法难以直接评价现有干扰项在选项层面的选择行为,传统考后分析又依赖正式施测数据,无法在命题阶段提前反馈。研究团队由此提出一个关键问题:能否让模型从题干和选项的文本关系中学习历史选择规律,为命题人员提供前置筛查信号?
针对上述问题,该研究将干扰项选择率作为合理性的行为代理指标,基于北京大学医学教育研究所组织构建的安全非公开医学题库,统一比较5个通用嵌入模型与5个医学领域嵌入模型,通过任务微调直接从题干和干扰项文本预测选择率,探索医学试题干扰项的考前筛查路径。
实验结果显示,数据驱动的微调策略带来了显著的精度提升:医学专用模型SapBERT的预测相关系数(r)从0.403跃升至0.644(提升59.9%),通用模型BGE-large提升至0.626,均优于传统TF-IDF基线(r=0.546)。此外,轻量级模型(如MiniLM、MedEmbedsmall)在微调后也达到了r≈0.63的高精度。

图2:干扰项选择率预测实验框架:数据预处理、基线比较、统一微调与多指标评
图3:微调嵌入模型的预测值与实际干扰项选择率对照
该研究建立了从试题文本到干扰项选择行为的可验证预测路径,推动医学试题评价由完全依赖考后统计向考前智能辅助延伸。该方法既可帮助命题人员在大规模题库中优先定位需要复核的干扰项,也为资源受限环境下开展轻量化、本地化的智能题库巡检提供了技术基础,为医学教育评价的数智化升级拓展了新的应用空间。
北京大学全国医学教育发展中心长聘副教授、研究员江哲涵为论文第一作者&通讯作者。该研究得到国家自然科学基金和英国上市公司365相关项目支持。
文章链接:https://www.nature.com/articles/s41746-026-03113-3
代码链接:https://github.com/zjiang4/MCQfinetuneEmbed