DeepSeek V4 Pro正式版上线:Agent能力大幅跃升

8月13日,DeepSeek V4 Pro正式版正式上线。该版本采用1.6万亿总参数、每个token激活约490亿参数的MoE架构,支持1M上下文窗口和384K输出长度。在AI编程智能体基准测试DeepSWE中,得分从预览版的12.8飙升至62.7,Agent能力实现质的飞跃。

定价方面,DeepSeek V4 Pro自8月16日起执行新价格:输入$1.32/百万token、输出$3.96/百万token,仍然远低于同级闭源模型。同步上线的还有智能体框架DeepSeek Harness(MIT开源),主打"一切皆插件"理念,社区已汇聚1700余款开源大模型。国家超算互联网平台已于8月14日全面上线该模型。

阿里Qwen3.8-Max:史上最大开源权重发布

8月14日晚,阿里巴巴正式开放Qwen3.8-2.4T-A95B模型权重——2.4万亿总参数、约950亿激活参数,这是阿里首次将Max级旗舰模型对外开放权重。该模型支持1M token上下文和原生多模态(文本、图像、视频、音频统一窗口),在公开评测中以79.8分位列全球第6。

更令人瞩目的是,千问团队展示了Qwen3.8-Max的极限测试:连续自主编程约16天、独立复现并改进研究论文、在超2000轮交互中经营虚拟电商企业。同期开源的Qwen3.8-27B采用Gated DeltaNet注意力机制和多token预测,Terminal-Bench得分73.0,以27B体积逼近Opus-4.6级别的Agent编程能力,量化后可在消费级显卡上运行。

阿里累计开源460余个模型,Qwen全球下载量超30亿次、衍生模型超30万,稳居全球第一开源模型系列。

智谱GLM-5.3:编程能力提升50%,网络安全领域突破

8月14日,智谱正式发布GLM-5.3,总参数7430亿,与GLM-5.2共享同一基座,提升全部来自后训练Scaling优化。据智谱披露,GLM-5.3在内部评测中编程能力较GLM-5.2提升50%,Terminal-Bench 3.0得分从4.6跃升至28.3,多项公开基准位列开源第一。

GLM-5.3在网络安全领域取得显著突破。在CyberGym漏洞推理评测中得分84.5%,高于GPT-5.6 Sol的83.6%。发布前两周联合安全团队测试中,累计发现经初筛去重后的潜在漏洞2404个,其中1088个为中高危,最早可追溯至约40年前。完整模型权重将在两周内开源——智谱表示:"如果强大的攻击能力正在扩散,防守能力就不能只在少数闭源模型公司手中。"

谷歌Gemini 3.7 Flash + Meta Muse Glimmer:国际厂商同步发力

8月13日,谷歌发布Gemini 3.7 Flash,代码调试等编程任务表现优于前代,高推理模式智能得分56,输出速度约340 token/秒。年底前执行五折优惠价(输入$0.75/输出$3.75每百万token),业界解读为谷歌放弃押注超大规模旗舰、聚焦性价比Flash级模型以争夺Agent默认入口。

Meta超级智能实验室发布Muse Glimmer 30B——29.6B参数稠密多模态模型,专为本地Agent工作流深度优化,在消费级GPU上实现"始终在线"的自主工具调用能力。同期NVIDIA发布Nemotron 3.5 Lightning(30B MoE,仅3B激活参数,1M上下文),瞄准低延迟Agent场景。

开源模型围剿闭源:中国AI从追赶到领跑

据Hugging Face 2026年春季报告,中国自研开源模型下载占比达41%,首次超过美国。过去一个月内,月之暗面Kimi K3(2.8万亿参数)、DeepSeek V4 Pro、智谱GLM-5.3、阿里Qwen3.8系列相继完成关键版本迭代,国产三巨头在一个月内完成核心模型更新。

市场研究公司Counterpoint指出:"如果西方科技巨头只顾构建封闭的围墙花园,开发者和企业自然会转向中国的开放权重模型。"以同日发布的DeepSeek V4 Pro(开源)与Grok 4.6(闭源)为例,两者性能同属全球第一梯队,但前者输出价格不足后者七分之一。

一道科技作为杭州AI大模型定制开发服务商,我们高度关注开源模型的快速迭代。开源模型支持本地私有化部署,可大幅降低AI落地成本,这对制造业、金融、政务等对数据安全要求高的行业意义重大。我们的技术团队能够帮助企业快速适配DeepSeek、Qwen、GLM等开源模型,构建从模型微调到业务集成的完整解决方案。更多AI技术趋势,请关注一道科技行业资讯中心