研究组三项工作(GCL-Sampler, RSH-SpMM, BR-MoE)被ICPP 2026接收

2026-07-20

  7月2日,ICPP(International Conference on Parallel Processing)公布了2026年论文入选结果。研究组三篇论文GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning, RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs 和 BR-MoE: A Memory-Budget-Aware Co-Design Framework for Efficient MoE Inference on Resource-Constrained GPUs 成功入选。

  GCL-Sampler 面向 GPU 架构仿真太慢、采样又难以兼顾准确性和加速的问题,指出传统依赖手工特征的 kernel 采样难以表达真实执行行为。它将 SASS 执行轨迹建模为异构关系图,并用 RGCN 与对比学习自动学习 kernel 相似性,从而更可靠地选择代表性 kernel,相比PKA, Sieve, STEM+ROOT等现有方案获得更高采样加速比和更低的采样误差。

  RSH-SpMM 面向真实稀疏矩阵结构高度不规则、现有 GPU SpMM 难以稳定利用 Tensor Core 的问题,提出行结构感知的混合执行方案。它通过 RS-Tile 表示、局部性重排和自适应 TC/CUDA 分流,把适合密集 tile 的部分交给 Tensor Core,把零散不规则行交给轻量 CUDA 路径,从而兼顾高吞吐与鲁棒性。

  BR-MoE 面向 MoE 大模型在受限 GPU 显存上部署困难的问题,指出混合精度量化与低秩补偿本质上竞争同一显存预算,不宜分开优化。它将每个 expert 的 bit-width 与 compensator rank 作为联合决策变量,用全局预算约束下的优化分配决定压缩配置,并结合 fused grouped expert GEMM 后端把显存节省转化为实际推理加速。