稀疏MoE:总参决定知识、激活决定成本
Qwen3.8-Max基于Qwen 3.5架构,通过稀疏MoE与混合注意力联合优化,首次把千问总参数拓展到2.4T、激活95B。模型内部拆成多个"专家"子网络,由轻量路由门控决定当前token交给哪几个专家算——总参数决定"知道多少",激活参数决定"跑起来多贵",本质是用总参数量换知识容量、用激活参数量控推理成本。
混合注意力:1M上下文的显存账
长上下文(1M token)的显存瓶颈在KV Cache,随序列长度线性增长。Qwen3.8-Max在层与层之间做"全局注意力+滑动窗口注意力"混合,少数层保留全局视野、多数层只在局部窗口计算,配合分页与KV量化接住1M窗口。对"整库代码理解、长文档合规审查、长周期Agent历史"三类场景尤其实在。
一道科技解读:参数为王还是效率为王
站在工程落地视角,选型不该盲目追最大参数:简单抽取用几B~十几B激活足矣,复杂推理才上大激活旗舰。一道科技在为客户做模型选型时,第一原则就是"按任务复杂度分档",把成本与延迟优势留给合适的工作负载。