新闻通知

我院在可扩展无监督学习领域取得重要进展

近日,我院在可扩展无监督学习领域取得重要进展,相关成果以“FC²: Fast Co-Clustering With Small-Scale Similarity Graph and Bipartite Graph Learning”为题,发表于人工智能领域国际顶级期刊《IEEE Transactions on Pattern Analysis and Machine Intelligence》(IEEE TPAMI)。论文第一作者为我院赵晓伟老师,合作者包括西北工业大学聂飞平教授和中国科学技术大学常晓军教授等人。

随着大数据与人工智能的快速发展,如何从海量复杂数据中高效、准确地发现潜在类别结构,已成为模式识别和数据挖掘领域的重要基础问题。传统图聚类方法通常需要构建样本之间的完整相似图,计算和存储开销较高,难以适用于大规模数据;锚点图方法虽然能够通过少量代表性样本降低计算成本,但仍存在二部图构建与聚类标签学习相互割裂、连续表示需要二次离散化、类别分配易发生塌缩,以及锚点自身结构信息利用不足等问题。

2901_831.png

图1.  FC² 框架示意图

针对上述问题,研究团队提出快速协同聚类框架FC²,形成了“小规模图精细刻画结构、二部图高效传播关系、全局约束调节类别分布”的新思路。该方法以代表性锚点为桥梁,将样本—锚点二部图构建与样本、锚点离散伪标签学习统一起来,使图结构能够随聚类过程自适应更新,并直接获得具有明确类别语义的离散结果。与此同时,研究团队通过小规模锚点相似图及其低秩分解挖掘锚点局部流形结构,并从理论上揭示伪标签协方差与类别分配平衡之间的联系,设计全局平衡机制,有效缓解类别塌缩和极端失衡问题,从而兼顾复杂结构刻画、聚类稳定性与大规模计算效率。

研究团队在人工数据、多个小规模和大规模基准数据集上进行了系统实验。结果表明,FC²在类别边界模糊、类内分布复杂以及数据规模较大的场景下均表现出良好的结构识别能力,综合聚类性能优于多种代表性方法;同时,该方法避免了构建完整样本相似图,在保持较高聚类质量的同时具有明显的计算效率优势。消融实验和收敛性分析进一步验证了各组成模块的有效性以及优化算法的稳定性。

该研究得到国家自然科学基金项目(62506279、62541326)及中国博士后科学基金项目(GZC20232039)的支持。

IEEE TPAMI由IEEE计算机学会主办,是模式识别、机器学习、计算机视觉和人工智能领域具有重要国际影响力的学术期刊,长期刊载相关领域具有原创性和前沿性的高水平研究成果,影响因子20.4。