摘要公开研究档案
这项 NeurIPS 2025 主会论文把 CHT 的拓扑驱动训练扩展到 Transformer 与 LLaMA 级语言模型,直接比较高稀疏度模型与 fully connected reference 的任务性能。
研究问题
研究问题
拓扑驱动的动态稀疏训练能否跨越视觉网络,稳定地进入 Transformer 翻译任务与语言模型预训练?
核心创新
核心创新
CHTss 将 Cannistraci–Hebb 机制适配到 Transformer,在 5% connections(95% sparsity)下维持可训练性,并进一步评估 LLaMA-1B 的语言建模困惑度。
关键结果
关键结果
95%稀疏度
≈2 / 3翻译任务超过 FC
CHTss 在 95% sparsity 下仍能进入 Transformer 翻译任务;但收益依赖任务,WMT 是没有超过 dense reference 的边界案例。
BLEU · 越高越好
稀疏 / CHT参考值
3224168.010
图表由后台结构化论文结果生成;每个指标使用独立坐标轴,并保留论文报告的比较方向。
PPL · 越低越好
稀疏 / CHT参考值
15127.713.850
图表由后台结构化论文结果生成;每个指标使用独立坐标轴,并保留论文报告的比较方向。
为什么重要
为什么重要
它说明稀疏拓扑不只适用于小型视觉网络,同时保留了任务差异:稀疏方法的收益不能被概括成在所有 benchmark 上都胜过 dense。
出版信息
论文档案
- 发表场合
- NeurIPS 2025
- 年份
- 2025
- 作者
- Yingtao Zhang · Diego Cerretti · Jialin Zhao · Ziheng Liao · Wenjing Wu · Umberto Michieli · Carlo Vittorio Cannistraci
- 论文状态
- Peer-reviewed conference paper · Main Conference Track
边界与来源
论文同时报告了 Transformer 翻译与语言模型结果。阅读结果时应区分 BLEU 与 PPL:前者越高越好,后者越低越好;不同稀疏比例和训练设置不能直接横向合并。

