【创新前沿】IEEE TPAMI报道我校在数据集蒸馏领域取得新进展

稿件来源:信息学院   |作者:信息学院   |摄影:信息学院   |编辑:   |浏览量:10

信息学院

近日,我校信息科学与工程学院计算机科学与工程系陈志华教授团队在数据集蒸馏领域取得新进展。该研究引入自适应因子与扩展极小极大损失,并结合二次蒸馏,提出了基于无约束噪声生成模型的数据集蒸馏算法。相关成果以“Dataset Distillation via a Noise-Unconstrained Generative Model”为题,正式发表在人工智能领域国际顶级学术期刊IEEE Transactions on Pattern Analysis and Machine Intelligence(IEEE TPAMI)。

图1 基于无约束噪声生成模型的数据集蒸馏算法流程图‍

数据集蒸馏通过将原始数据集压缩为更小的数据集,使模型在小规模数据上训练后,在测试集上仍能达到接近在原数据集训练的性能,从而实现训练加速与存储节省。现有基于生成模型的算法无法保证生成代表性样本且未利用各生成图像间的关系。针对这一关键问题,该研究提出无约束噪声生成模型的数据集蒸馏算法,并在多个数据集上进行实验验证。

该研究在蒸馏阶段,提出自适应因子以及扩展极小极大损失;在部署阶段,通过二次蒸馏技术,分别对大小分辨率数据集采用在线蒸馏和离线蒸馏策略,并适配在生成对抗网络和扩散模型两种生成范式中,提高蒸馏图像分布的稳定性。在理论上证明所提出的算法能产生更低的泛化误差。研究表明,生成图像可作为数据集蒸馏的有效代理数据集。

该研究将为基于生成模型进行数据集蒸馏提供新的思路,为推动绿色人工智能与实现低功耗模型训练具有重要研究意义。

该论文由陈志华教授团队联合电子科技大学叶飞教授、香港理工大学李平助理教授、上海交通大学杨小康教授和盛斌教授等合作完成,华东理工大学为第一署名单位。第一作者为我校博士生张景轩,研究工作由计算机视觉实验室(CVLab)陈志华教授、戴蕾讲师共同指导,并获得国家自然科学基金面上项目、国家自然科学基金青年科学基金项目(C类)和工业控制技术全国重点实验室的支持。

原文链接:https://doi.org/10.1109/TPAMI.2026.3690778


发布时间:2026-09-24
(0)
相关新闻