当机器学习用于精神障碍分型时,一个常见误读是把"聚类"(无标签分群)当成"分类"(有答案判别),从而错误地套用交叉验证和过拟合等评估框架。这篇通讯回应正是为了澄清这一概念。
有标签 · 监督学习
学规则把新样本归入已知类别
可用交叉验证评估泛化
过拟合有明确定义
无标签 · 无监督学习
按相似性把个体"分堆"
交叉验证在此"不相关"
过拟合"很难评估"
疾病分型属于聚类问题——没有预先定义好的"正确亚型标签"。
交叉验证/泛化/过拟合等概念依赖"预测标签 vs 真实标签"的比较——聚类没有标签,因此这些概念不能直接套用。
为聚类定义统计"空模型"非常困难——"no structure"的概念不清晰。强行假设单一高斯分布会引入未经证实的前提。
用扰动数据检验分群稳定性(自编码器做多次投影);用独立数据源(影像、遗传、基因表达、临床)交叉印证。
对数据做合理的小扰动(随机子集或自编码器多次投影),看分群结构是否大体一致。如果轻轻摇一摇拼图,图案还能保持,就更"稳"。
用不同来源的数据验证分群:结构影像(皮层厚度/白质)、遗传(多基因风险评分)、基因表达(组织表达谱)、临床(用药-症状关系)。信息来源越独立,证据越强。
最直接的贡献:厘清"分型 = 聚类"的问题属性,避免把分类评估框架错误套用于聚类。
提出稳定性/鲁棒性 + 外部多模态验证的可信度思路,适用于无标签分型研究。
全文仅两页通讯,未给出样本量、模型细节、分型数量或效应量。
亚型发现需要在独立人群中复现,并证明与治疗反应/预后等临床结局相关。
本页面用于科研科普与方法解读,不构成医疗建议。原文为 CC BY 4.0 许可的通讯短文,未报告具体数值或效应量。任何健康决策请咨询专业医生。