@_avichawla
@_avichawla 提出技术 LLM 面试题:将稠密前馈层替换为 top-2 MoE 后,MoE 每 token FLOPs 更少,但端到端推理延迟反而增加,原因是什么。
X / Twitter查看原文 →
LLM 技术面试题与 MoE 推理工程讲解。@_avichawla 提出技术 LLM 面试题:将稠密前馈层替换为 top-2 MoE 后,MoE 每 token FLOPs 更少但端到端推理延迟反而增加,原因是服务系统需在专家分布于不同 GPU 时移动激活值(all-to-all 通信),不同 token 可选不同专家对,系统传输激活向量并经 NVLink/NVSwitch/InfiniBand 跨 GPU 与跨服务器通信,优化方式包括将高频专家保留在同一服务器、均衡路由防止某 GPU 拖慢层、通信重叠让本地专家计算与远程激活传输同时进行;结论是稀疏路由减少专家 FLOPs,但 token 调度和网络通信抵消部分节省,作者还覆盖路由、专家放置、负载均衡、通信重叠、内存、量化和卸载。
@_avichawla 提出技术 LLM 面试题:将稠密前馈层替换为 top-2 MoE 后,MoE 每 token FLOPs 更少,但端到端推理延迟反而增加,原因是什么。