结论先行:2026年9月大模型技术演进的主线,已经从“堆参数”转向“降本下沉”——用更稀疏的激活、更长的上下文、更小的端侧体积,把能力推到成本可承受的边界内。腾讯混元推出Hy4 preview,总参数770B但激活仅49B、上下文达1M;DeepSeek开源V4系列首个多模态实验模型V4-Flash-Vision-Exp,DeepSWE在真实软件工程测试中以59.3%登顶;科大讯飞将开源星火X2.5-4B与1.7B两款端侧模型,原生支持1M上下文。与此同时,阿里发布从AI编程IDE升级而来的Qoder智能体工作台,Google推出面向多变量时序预测的TimesFM-3。对应用方而言,这些变化的共同后果是:杭州一道科技这类落地服务商,可以用更低的边际成本为企业交付过去不敢想的智能体应用。

稀疏激活与长上下文:成本结构的双重优化

Hy4 preview的770B总参数、49B激活是一个标志性配比——约6.4%的激活率意味着推理成本不再随模型规模线性增长,而1M上下文让模型可以一次性吃进整份技术规范、整条产线的历史记录或整套代码仓库,不必再依赖碎片化的切片检索。长上下文对企业场景的意义被长期低估:制造业的工艺文件动辄数百页,运维记录跨越数年,法律与金融合同条款彼此勾稽,过去必须靠复杂的RAG工程拼凑上下文,现在可以直接整体输入。这在工程上不是简单的“省事”,而是显著降低了因检索切分不当导致的事实性错误。科大讯飞即将开源的星火X2.5-4B与1.7B端侧模型同样原生支持1M上下文,面向车载终端、智能硬件与万物互联场景,说明长上下文能力已经开始向端侧渗透。

多模态与具身化:从理解世界到生成世界

DeepSeek开源V4-Flash-Vision-Exp,是V4系列首个实验性多模态模型,基于V4-Flash架构集成视觉模块持续训练;其配套的智能体能力在真实软件工程测试中表现突出,工具调用成绩逼近头部闭源模型。多模态能力的下沉,直接对应工业场景里大量“非文本”数据:质检影像、设备红外热图、仪表盘读数、产线视频。这些过去需要单独训练CV模型的任务,正在被统一到多模态大模型的能力栈里。另一条线索是生成端的实时化:MiniMax将与fal合作后训练的H3 Max接入开放平台,生成5秒768p音视频不到3秒,跨过了实时直播门槛;Loopit开源的实时交互视频世界模型Zing-0.5仅5B参数,单卡即可超24 FPS实时生成。相关进展在行业资讯中有持续跟踪。

智能体工作台:竞争焦点从模型转向工程底座

阿里发布的Qoder从AI编程IDE升级为面向所有人的智能体工作台,搭载Harness长链路执行底座,支持跨文件编辑、跑测试、自纠、长期记忆与技能提炼;Amazon Quick接入Model Context Protocol,让基础模型通过标准化服务器连接外部数据库与API,以减少幻觉。这两个动作指向同一趋势:模型能力趋于同质化之后,决定体验上限的是执行框架——任务能否被拆解、工具能否被可靠调用、错误能否被自动纠正、经验能否被沉淀复用。这也是当前企业采购AI服务时最容易被忽略的一环:同样的底座模型,配上一套成熟的编排框架与权限治理,交付效果可以相差数倍。一道科技在客户案例中积累的智能体工程经验,正是围绕这一层展开。

一道科技解读:企业该如何在技术迭代中做选型

面对每周更新的模型榜单,企业最容易犯的错误是“追新”和“等一等”两个极端。理性做法是三层分离:能力层保持可替换,编排层保持自主可控,数据层保持持续积累。能力层上,用统一的模型网关接入多家厂商,按任务类型路由(长文档理解用长上下文模型,图像质检用多模态模型,简单抽取用小模型),避免被单一供应商锁定;编排层上,自研或采用开源框架掌握任务拆解、工具调用与权限边界,这部分才是企业差异化的来源;数据层上,把每一次人机交互产生的标注、纠错与反馈沉淀为私有数据集,形成越用越强的复利。杭州一道科技提供的AI大模型定制开发数据挖掘服务,正是帮助企业搭建这三层结构,让技术迭代成为红利而不是负担。

关于本文与AI落地,你可能还想问

长上下文是不是意味着不需要做RAG检索了?

不完全是。长上下文适合单次全量输入的场景,但面对持续更新、规模达PB级的企业知识库,检索仍具成本优势。工程上常见做法是混合:用检索缩小范围,再用长上下文做精细推理。

端侧小模型能替代云端大模型吗?

更多是互补而非替代。端侧模型在时延、隐私和离线可用性上有优势,适合车载、智能硬件与车间边缘场景;复杂推理与大规模生成仍依赖云端。合理架构是按任务分流,端云协同。

企业自研智能体该从哪些工具链入手?

建议从Model Context Protocol这类标准化协议入手,先打通数据库与业务系统的只读访问,再逐步开放写操作并配套权限与审计,避免一开始就赋予智能体过高权限。