GPT-5.6三档发布:Sol碾压Fable 5, 成本砍半

2026年7月29日,OpenAI正式发布GPT-5.6模型家族,包含三个定位清晰的版本:旗舰款Sol开启最大推理时计算,在Artificial Analysis Coding Agent Index上正式超越Claude Fable 5,且成本不到后者一半;中间款Terra智能持平此前的GPT-5.5但价格减半,瞄准企业大规模部署场景;轻量款Luna定价比Sol低80%,专为端侧和高并发场景优化。该系列通过负载均衡、推测解码等全栈优化实现了更高的token效率。

同日,OpenAI还发布了两项关键发现:通过启用保留推理过程(retaining reasoning)和启用压缩(compaction)两项API设置,GPT-5.6在ARC-AGI-3基准测试上的得分提升至原来的三倍。这意味着大模型的性能潜力和实际表现之间仍存在巨大的“调优鸿沟”,而这恰恰为企业级AI工程化打开了新的优化空间。

对于杭州制造业企业而言,GPT-5.6家族的分层定价策略释放了一个明确信号:大模型API成本正在进入“大规模工程化降本”阶段。一道科技在AI大模型定制开发中,已形成“旗舰模型做复杂推理+轻量模型做高频场景+本地模型做隐私敏感场景”的三层架构,帮助客户在性能、成本和安全之间取得最优平衡。

腾讯混元AngelSpec开源:端到端推理加速2.4倍

7月29日,腾讯混元团队开源AngelSpec——一个端到端投机解码(speculative decoding)框架,同步支持训练与部署。在Hy3-A21B模型上,其DFly方案相比传统自回归解码实现1.98-2.40倍端到端加速,吞吐量比此前最佳的DFlash方案高10.5-11.8%。训练代码及Hy3-A21B MTP/DFly草稿模型权重已全部开源。

投机解码的核心思想是“用小模型快速生成候选token,再用大模型并行验证”。AngelSpec通过端到端训练优化了草稿模型与大模型的协同效率,将KV cache使用量降低了75%,在1M上下文下实现最高6倍解码吞吐量。这是继月之暗面Kimi Linear注意力架构后,中国AI团队在推理效率上的又一次系统性突破。

Microsoft也不甘落后:7月28日发布了MAI-Cyber-1-Flash,一款137B总参数(仅5B活跃参数)、256k上下文的稀疏MoE网络安全模型,驱动MDASH在CyberGym基准上达到95.95%准确率。Perplexity同日开源Numbat智能体检测与响应层,为安全团队提供对AI智能体活动的跨框架可见性。

一道科技在数据挖掘与工业AI实践中深刻体会到:大模型从“能用”到“好用”,技术工程化能力决定了90%的落地效果。我们已将这些最新的推理加速和网络安全技术融入工业质检、供应链优化等客户项目中。访问一道科技官网了解更多技术方案,或查阅行业资讯中心获取每日AI动态。