AI News (2026/9/16): 生数科技推出实时交互与编辑视频模型 Vidu S2
Executive Summary:
生数科技于9月16日发布新一代视频生成系统 Vidu S2 系列模型,在动态参考图更新、高分辨率输出及实时编辑能力方面取得显著进展。
资讯详情
该系列包含 Vidu S2-Avatar 与 Vidu S2-Editing 两款专用模型。通过优化运动建模算法与引入增量式训练框架,在保持低延迟特性的同时提升了视觉质量与交互灵活性。
核心要点
动态参考图更新
Vidu S2-Avatar 支持在对话流程中即时修改人物形象参数(如发型/服装),系统通过增量学习机制实现毫秒级响应。分辨率提升至720P
相较上代540P输出标准,在相同硬件条件下推理速度仅增加18%,但画面细节密度提升36%(基于 SSIM 指标测试)。连续动作与状态保持
新增物理引擎耦合模块(PEM),可稳定执行摘戴帽子等复杂操作序列,在30秒长视频中实现98.7%的动作连贯性。
核心要点
风格迁移实时化
Vidu S2-Editing 集成轻量级风格适配器(Style Adapter),支持在不重采样全帧的情况下完成局部区域风格重绘。虚拟试穿零样本迁移
采用改进型 Diffusion Transformer 架构(DiT++),可直接处理未标注服装数据集(如 DeepFashion3D),实现跨品类穿戴效果模拟。多模态编辑接口标准化
提供统一 API 入口支持四类编辑任务切换,在电商场景测试中将商品预览制作周期从4小时压缩至8分钟以内。
AI-ALL 深度点评
该系列模型通过模块化设计解决了传统视频生成工具的两大痛点:静态参考图限制与高成本后期制作流程。其增量式训练框架为 Agentic Workflow 在视觉领域的落地提供了新范式——开发者可将动态参数注入过程拆解为独立微服务单元进行分布式部署。
在技术演进路径上值得关注的是 PEM 模块对运动矢量场的显式建模能力(论文引用率已进入 CVPR 2024 前10%),这可能成为突破当前 RAG 架构瓶颈的关键技术节点之一。不过目前尚未披露开源计划及云服务定价策略,在商业化落地层面仍需观察实际部署成本控制效果。

