模型架构Transformer、注意力与混合专家等模型结构
混合专家(MoE)
将模型拆分为多个「专家」子网络、每次只激活少数的架构。
MoE 通过路由机制让每个 Token 只经过部分专家,从而以较低计算成本获得大容量。总参数(如 671B)远大于单次激活参数(如 37B),是 DeepSeek-V3、Qwen 大杯等模型的高性价比选择。
将模型拆分为多个「专家」子网络、每次只激活少数的架构。
MoE 通过路由机制让每个 Token 只经过部分专家,从而以较低计算成本获得大容量。总参数(如 671B)远大于单次激活参数(如 37B),是 DeepSeek-V3、Qwen 大杯等模型的高性价比选择。