基于多任务的知识图谱构建模型

发布者:高锦发布时间:2025-10-31浏览次数:293

该研究聚焦医疗文本的高效利用 —— 过去十年间精准疾病医学相关信息以文本形式大量积累,为挖掘其中价值,研究团队提出基于硬参数共享的多任务学习框架 MKG,用于知识图谱构建,进而从文献中自动提取胃癌(GC)相关生物医学知识并筛选候选药物。MKG 包含三个独立模块:MT-BGIPN 用于实体识别,采用双向门控循环单元与交互式指针网络技术,攻克医疗实体命名冗长、不规则的难题,在多个数据集上平均 F1 值达 84.5%;MT-SGTF 负责实体归一化,融合词频 - 逆文档频率与门控注意力单元,兼顾实体语义与特征,五个数据集平均 Hits@1 得分 94.5%;MT-ScBERT 专注关系分类,整合跨文本、实体及上下文特征,在 11 个关系分类数据集上平均 F1 值达 86.9%。

基于 MKG 框架,研究构建了胃癌专属知识图谱 MKG-GC,涵盖 9129 个实体与 88482 个三元组。借助预训练语言模型 BioKGE-BERT 及 CNN-BiLSTM 药物 - 疾病判别模型,MKG-GC 成功预测潜在胃癌药物,且排名前十的药物中有九种已被证实对胃癌治疗有效。此外,团队还搭建了 MKG-GC 在线平台(https://www.yanglab-mi.org.cn/MKG-GC/),支持图谱的探索与可视化,为胃癌相关研究与药物研发提供了高效工具与丰富资源。