国内刊号:37-1390/R
国际刊号:1671-7554
发布日期:
作者:薛付忠
单位:1.山东大学齐鲁医学院公共卫生学院医学数据学系, 山东 济南 250012;2.国家健康医疗大数据研究院, 山东 济南 250003;3.山东大学齐鲁医院, 山东 济南 250012
关键词:AI语言表征,多模态队列,数字组学,数字生物标记,数字表型,PICLS/PICLSE准则,
基金:国家自然科学基金重点项目(82330108);国家自然科学基金面上项目(82173625);潍坊市中央财政支持公立医院改革与高质量发展示范项目(ZFCG-2024-0000505);河南省重大科技专项项目(241100310300)
本研究突破传统流行病学队列设计的理论框架,创立AI语言表征的多模态队列理论方法体系,形成AI语言建模的多模态队列新范式。该体系整合健康档案、电子病历、影像、基因等多源异构数据,借助Transformer等AI模型进行低维嵌入,统一量化为多模态嵌入向量。围绕“数字组学-数字生物标记-数字表型”三层架构,提出多模态融合、嵌入向量生成、因果推理等关键方法。创新性提出数字生物标记需满足PICLS准则:可预测性(predictable)、可解释性(interpretable)、可计算性(computable)、潜变量性(latent-variable)、稳定性(stable);数字表型在此基础上还应满足终点性(endpoints),即PICLSE准则,确保多模态队列的应用价值。技术方面,本文详述了嵌入生成、数据编码/解码、数据库构建及标记提取等流程。以猩红热主动监测为应用案例,展示多模态嵌入队列的实际应用效果。该体系为流行病学队列研究提供了新范式,对推动精准医疗与公共卫生智能化具有重要意义。
来源:2025年第8期
《山东大学学报(医学版)》期刊编辑部