跳到正文
arXiv 隐私论文· Ruwen Fan·· 4 天前AI 评分12

CoMoE:在消费级 GPU 上实现通信高效的 MoE 推理

Democratizing MoE inference on commodity GPUs with CoMoE

AI 导读

CoMoE 是一个面向消费级 GPU 的通信高效 MoE 推理系统,通过以主机为中心的路由解决 PCIe 带宽受限且无 P2P 支持的通信瓶颈。它用主机支持的 token 多播消除出站冗余,并用主机暂存缓冲的细粒度 token 级聚合替代全局同步。在 RTX 5090 上吞吐最高提升 1.46 倍,接近支持 NVLink 的 A800,硬件成本仅为其 23.4%。

来源:arXiv 隐私论文 · arxiv.org