青少年心理健康问题往往并非以单一症状出现,抑郁、焦虑、非自杀性自伤、品行问题和攻击行为等内化与外化问题常相互伴随。现有研究多围绕某一种心理障碍分别建模,既难以完整呈现共病风险,也增加了大规模筛查中的测评与结果解释负担。一般精神病理因子(general factor of psychopathology,简称p因子)能够概括不同心理问题之间的共同变异,为青少年心理健康风险识别提供了跨诊断视角的指标。基于此,本研究将p因子与机器学习方法相结合,构建兼具识别效能与可解释性的青少年心理健康早期风险预警模型。

研究开展了两轮数据收集,共纳入6,251名10-20岁的中国青少年。其中,数据集1包含5,283人,用于模型训练、算法比较、特征筛选与内部检验;独立数据集2包含968人,用于外部验证。研究首先通过探索性和验证性因素分析,从抑郁症状、焦虑症状、非自杀性自伤、品行问题、躯体化症状和攻击行为六个维度提取p因子,并根据p因子得分将参与者划分为无风险、低风险和高风险三组。在生态系统理论指导下,研究建立了覆盖个体、家庭、学校和社区的多维指标框架,共考察59项变量;排除用于构建结局的症状变量和年龄后,将52项变量纳入机器学习建模。
研究比较了随机森林、支持向量机、逻辑回归、AdaBoost、XGBoost、CatBoost和LightGBM七种算法,通过贝叶斯优化和五折交叉验证调节模型参数,并以宏平均F1值作为主要评价指标。随后,研究利用SHAP方法解释模型决策,对预测变量进行重要性排序,并通过两轮递进式特征筛选,确定兼顾简洁性与识别性能的最优变量组合。
结果显示,七种算法的总体表现较为接近,XGBoost在验证集上的宏平均F1值相对最高,因而被用于后续建模。经过特征筛选,最终模型仅保留23项预测变量,在独立测试集和外部验证集上的宏平均F1值分别为0.73和0.80,AUC分别为0.89和0.93;针对高风险组的AUC分别达到0.94和0.96。模型在不同性别、年龄和年级亚组中的表现差异较小,显示出较好的稳健性和外部验证表现。
SHAP分析表明,睡眠质量是最重要的预测因素,其后依次包括重复性消极思维、人际压力、冲动性和情绪唤醒强度。最终保留的23项变量中,17项来自个体层面,4项来自学校层面(学习倦怠、同伴言语侵害、学业压力和学校归属感),另各有1项来自家庭层面和社区层面。内部检验与外部验证中排名靠前的因素高度一致,进一步说明这些指标与青少年总体精神病理风险之间具有较稳定的关联。

本研究的主要价值在于,以单一p因子风险指标整合多种内化与外化问题,拓展了以往针对单一障碍分别建模的传统路径;同时,机器学习模型精简了预测指标体系,为学校、社区和基层服务场景中心理健康问题的早期快速评估筛选提供了可能;另外,研究识别了影响心理健康的关键风险因素,为预防与干预提供了精准靶点。
该研究于2026年6月在线发表于Journal of Child Psychology and Psychiatry (JCR Q1,中科院1区TOP期刊,IF = 6.6; 5-year IF = 9.3)。365足球比分官网硕士生李昀璟为第一作者,365足球比分官网李海江副教授为通讯作者,365足球比分官网硕士生卞雯萱、温晓红、方圆缘和王亦晗参与了研究工作。
论文信息:Li, Y., Bian, W., Wen, X., Fang, Y., Wang, Y., & Li, H. (2026). Machine learning-based early warning model for adolescent mental health risk using the p factor.Journal of Child Psychology and Psychiatry. https://doi.org/10.1111/jcpp.70194
