Kandinsky 6.0开源音视频同步生成:3B Lite与29B Pro双版本,支持口型对齐

作者:GitHub / Volanea 发布时间:2026-10-11 18:36:31 浏览:3
关键字:
开源项目Kandinsky 6.0 Video发布,提供3B参数Lite版与29B参数Pro版,可生成带44kHz同步音频(含口型对齐)的5秒短片,支持文生音视频与图生音视频双模式,已集成进Diffusers与ComfyUI。

画面与声音一起生成

开源项目Kandinsky 6.0 Video正式发布,最大的亮点是把视觉与音频放进同一次生成:模型输出5秒短片的同时生成同步的44kHz音频,包括口型对齐,支持文生音视频与图生音视频两种模式。项目提供3B参数的Lite版与29B参数的Pro版,并附带超分辨率组件可将输出提升至Full HD。

解决配音错位的常见痛点

当前主流工作流的常见断裂是:视频模型先出画面,再由另一条链路去猜台词时机、环境音与口型,错位与违和感几乎不可避免。联合生成虽不能取代后期精修,但能产出协调得多的初稿,对广告概念片、社交短视频与产品预览等短内容场景尤为实用。

开源生态的接入速度

Kandinsky 6.0已支持Diffusers与ComfyUI等主流开源工具链,技术创意团队几乎零成本即可上手。其5秒时长仍是明显约束——需要长连续性、复现角色或多镜头叙事的项目仍要依赖商用旗舰。但开源阵营每次把「音画同步」这类工程难题变成免费默认能力,商用视频模型的定价空间就被压缩一分。

阅读原文

本文由AI融业云采集并编辑,仅供学习使用!

本文来自volanea.com,作者GitHub / Volanea

关于AI融业云:一站式AI应用服务平台,了解创始人 | 联系我们

有问题,请联系客服!http://www.rongyeyun.com/kefu/