湖南大学计算机学院赵捷教授团队在计算机体系结构领域取得新进展

TKPaper-你的智能选刊助手
查找参加最新学术会议,发表EI、SCI论文,上学术会议云
热门国际学术会议推荐 | 出版检索稳定,快至7天录用
2026年电子, 通信与计算机科学国际会议(ICECCS 2026)
2026年智能机器人与控制技术国际会议(CIRCT 2026)
2026年传感器技术、自动化与智能制造国际会议(STAIM 2026)
ICCC 2026
文章导读
二值、布尔、脉冲等离散神经网络理论上能大幅降低推理时延与能耗,但现代GPU软件栈主要面向稠密浮点与整数乘加运算优化,位运算、条件累加和事件驱动等计算模式难以被高效支持,理论效率优势长期无法兑现。湖南大学赵捷教授团队提出跨层优化框架Helios,首次从系统层面统一多类离散神经网络的计算模式,并在算子执行、算子融合与运行时集成等层面协同设计,在多代主流NVIDIA GPU上实现推理时延与能效成倍提升,成果已被MICRO 2026录用。这一统一抽象究竟如何打通从模型计算到GPU底层执行的优化链路?
— 内容由好学术AI分析文章内容生成,仅供参考。

随着人工智能推理服务在搜索、推荐、交互式AI等场景中的大规模部署,推理时延与能耗已成为制约智能计算基础设施发展的核心瓶颈。近年来,学术界与工业界积极探索二值化、布尔计算、脉冲(类脑)计算等极致离散化神经网络技术,以大幅降低推理的算术复杂度和数据搬运开销。然而,现代GPU软件栈主要面向稠密浮点与整数乘加运算进行优化,二值、布尔与脉冲等离散神经网络所依赖的位运算、条件累加和事件驱动等计算模式难以被现有深度学习框架、编译器和推理引擎高效支持,其理论上的效率优势长期难以在主流GPU平台上兑现。

针对这一难题,计算机学院赵捷教授带领的CYCLE实验室团队提出了面向离散神经网络GPU推理的跨层优化框架Helios。该工作首次从系统层面统一了二值量化、布尔和脉冲等多类离散神经网络的计算模式,并围绕这一统一抽象,在算子执行、算子融合与运行时集成等多个层面进行协同设计,打通了从模型计算到GPU底层执行的优化链路,使离散神经网络的理论效率优势能够在通用GPU上真正落地。实验结果表明,在多代主流NVIDIA GPU和多种典型离散神经网络负载上,Helios相较于业界主流深度学习框架与推理引擎,在推理时延与能效方面均取得成倍提升。

近日,该研究成果以“Efficient GPU Inference for Discrete Neural Networks”为题,被第59届IEEE/ACM国际微体系结构研讨会(The 59th IEEE/ACM International Symposium on Microarchitecture,MICRO 2026)录用。

湖南大学为论文第一完成单位,第一作者为计算机学院硕士生杨可,赵捷教授为通讯作者。

相关成果已在实际工程项目中落地应用。

湖南大学计算机学院赵捷教授团队在计算机体系结构领域取得新进展

Helios系统总体架构。

来源:计算机学院

通讯员:何莎

责任编辑:周丹

© 版权声明
TKPaper-你的智能选刊助手
热门国际学术会议推荐 | 多学科征稿、征稿主题广 | 免费主题匹配
2026年IEEE第三届先进机器人, 自动化工程与机器学习国际会议(ARAEML 2026)
2026年智能机器人与控制技术国际会议(CIRCT 2026)
2026年传感器技术、自动化与智能制造国际会议(STAIM 2026)
IEEE ICCT 2026

相关文章

查找最新学术会议,发表EI、SCI论文,上学术会议云
热门国际学术会议推荐 | 立即查看超全会议列表

6 条评论

  • 芳华才人
    芳华才人 游客

    期待开源,想在本地试试效果

    山东省烟台市
    回复
  • 千本樱
    千本樱 游客

    二值化和脉冲计算统一支持不容易

    广东省深圳市
    回复
  • 算命胡癸
    算命胡癸 读者

    想知道在实际项目中怎么应用的

    重庆重庆市
    回复
  • 炸鸡爱好者
    炸鸡爱好者 游客

    关注能效提升,对数据中心意义大

    重庆重庆市
    回复
  • NeonHavoc
    NeonHavoc 读者

    离散神经网络终于能落地了?

    广东省深圳市
    回复
  • 白骨僧
    白骨僧 读者

    这个框架听起来很有突破性

    重庆重庆市
    回复