结论先行:2026年9月初这一轮大模型技术动态的真正主线,是“端云协同”与“自主可控”两条线同时提速。科大讯飞发布星火X2.5,采用MoE架构、参数规模293B-A30B,重点提升代码与智能体能力,且基于全国产算力完成全流程训练及推理;华为麒麟9050 Pro在Mate XT 2首发,实现行业首个端侧MoE全模态大模型入端,总参数300亿、激活20亿,整机性能提升42%;黄仁勋披露OpenAI的GPT-6 Astra由约10万颗Grace Blackwell NVLink72芯片训练完成,并宣称“AGI已到来”、下一批40万GPU即将上线;国内侧,截至2026年6月底我国智能算力规模达2185 EFLOPS,同比增长177%。对企业选型的含义很直接:未来两年架构决策的核心,是在哪一层跑模型、以及这条链路能不能自主可控。这是杭州一道科技给客户做架构评审时的首要问题。
星火X2.5:全国产算力跑通全流程训练的意义
星火X2.5最值得关注的不是参数,而是它基于全国产算力完成了从训练到推理的全流程。这一点的分量在于,它把“国产算力能不能训大模型”从论证题变成了工程题。讯飞同时持续优化国产超长序列训推难题,说明长上下文场景下的显存与通信瓶颈正在被逐个攻克。模型能力上,X2.5重点强化了代码与智能体能力,并持续增强数学与理解等通用能力,已上线讯飞开放平台。对企业客户而言,选择这类全链路国产化的模型,直接收益是供给确定性提升、合规风险下降、私有化部署路径更短;代价则是需要同步验证自身业务系统与国产推理框架(如昇腾生态)的兼容性。建议在选型阶段就把框架兼容性压测写进POC验收项,而不是上线后再补。
麒麟9050 Pro:端侧MoE把“激活参数”变成工程常识
华为麒麟9050 Pro带来的变化更贴近终端。它实现行业首个端侧MoE全模态大模型入端,总参数300亿、激活仅20亿——这正是MoE架构的精髓:用大总参数换知识容量,用小激活参数换推理成本。整机性能提升42%,且是时隔六年华为再次在旗舰发布会上专门解读全新麒麟芯片,信号意味明显。端侧大模型的价值在工业场景尤其突出:产线质检、设备点检、巡检记录等任务往往面临网络不稳定、数据不出厂、响应要实时的三重约束,端侧推理是唯一可行解。同时它带来新的工程复杂度——模型需要针对端侧算力做量化、蒸馏与算子适配,这部分工作量常常被低估。企业在规划时应把端侧模型压缩与算子适配单独列为一道工序,而不是当作部署的附属步骤。
算力侧:规模狂奔与代价同步显现
算力侧的扩张速度仍在加快。国内智能算力规模半年内增至2185 EFLOPS、同比增长177%;海外,黄仁勋称GPT-6 Astra由约10万颗NVLink72芯片训练完成,并预告下一批40万GPU即将上线。代价同步浮现:数据中心散热与发电高度依赖水资源,AI的“水足迹”治理已成待解议题。矛盾很清楚——算力越便宜,用得越多;用得越多,能耗与成本的账越难算清。
企业架构建议:按数据敏感度分层部署
基于上述趋势,我们给企业的标准建议是按数据敏感度做三层分流。第一层端侧:工艺参数、质检图像等不出厂的高敏感数据,用压缩后的端侧模型实时处理。第二层私有云:企业经营数据、客户数据,用私有化部署的行业大模型处理,模型权重与日志全部留在内网。第三层公有云:通用问答、文案生成等低敏感任务,调用公有云大模型以控制成本。三层之间用统一的模型路由与提示词管理层衔接,避免与单一模型深度耦合。这套架构的搭建涉及模型微调、数据管道与系统集成,需要AI大模型定制、数据挖掘与软件外包能力协同交付。更多技术观察见一道科技行业资讯,落地案例见客户案例。
关于本文与AI落地,你可能还想问
MoE架构的“293B-A30B”该怎么理解?
前者是总参数量,决定模型的知识容量上限;后者是单次推理实际激活的参数量,决定推理算力与成本。MoE通过路由机制每次只调用部分专家网络,从而在大容量与低成本之间取得平衡,这也是端侧能跑300亿参数模型的原因。
制造企业什么时候必须考虑端侧部署?
当业务同时满足三个条件之一时就应优先考虑:数据因工艺保密或合规要求不能出厂;产线网络不稳定或带宽受限;任务对响应时延有毫秒级硬要求。典型场景包括视觉质检、设备异常声纹识别、AGV避障与巡检记录自动生成。
一道科技能提供哪些具体服务?
提供场景诊断、数据治理、行业大模型定制、模型压缩与端侧适配、智能体开发及私有化部署服务,并承担与MES、ERP、SCADA等既有系统的集成,交付可量化的验收指标。公司在杭州本地服务多家制造企业与科研机构,支持分阶段实施。