H3:高压缩Tokenizer+动作迁移

H3通过高压缩率把单位视频所需token数压下来,直接换来成本与速度优势;其V2V Motion Transfer(视频到视频动作迁移)给定参考视频把动作/姿态迁移到生成结果,更贴近广告、电商、游戏等商业工作流——要的是"基于素材改"而非"从零生成"。底层基于DiT+Flow Matching,并把文本模型里验证过的方法迁移到多模态训练。

DeepSeek V4-Flash:后训练拉高Agent能力

DeepSeek 7月31日开放V4-Flash正式版API,架构与预览版一致(284B总参/13B激活MoE),靠后训练优化把Agent能力拉高约6倍。后训练不改变参数规模,却能显著改善"会不会按流程调用工具、会不会自我纠正"这类Agent关键能力,是开源模型切入工程执行的关键一跃。

一道科技解读:多模态与智能体是开源下一站

0.8元/秒的定价让商品短视频、营销素材这类"模板化但量大"的需求可以认真评估本地/私有化视频模型。一道科技在制造业数字化中同样看重"可控、可验证、低成本"的多模态能力,欢迎就您的视频与Agent场景交流。