画面与声音一起生成
开源项目Kandinsky 6.0 Video正式发布,最大的亮点是把视觉与音频放进同一次生成:模型输出5秒短片的同时生成同步的44kHz音频,包括口型对齐,支持文生音视频与图生音视频两种模式。项目提供3B参数的Lite版与29B参数的Pro版,并附带超分辨率组件可将输出提升至Full HD。
解决配音错位的常见痛点
当前主流工作流的常见断裂是:视频模型先出画面,再由另一条链路去猜台词时机、环境音与口型,错位与违和感几乎不可避免。联合生成虽不能取代后期精修,但能产出协调得多的初稿,对广告概念片、社交短视频与产品预览等短内容场景尤为实用。
开源生态的接入速度
Kandinsky 6.0已支持Diffusers与ComfyUI等主流开源工具链,技术创意团队几乎零成本即可上手。其5秒时长仍是明显约束——需要长连续性、复现角色或多镜头叙事的项目仍要依赖商用旗舰。但开源阵营每次把「音画同步」这类工程难题变成免费默认能力,商用视频模型的定价空间就被压缩一分。
