专栏中心

EEPW首页 > 专栏 > 时间、空间可控的视频生成走进现实,阿里大模型新作VideoComposer火了(1)

时间、空间可控的视频生成走进现实,阿里大模型新作VideoComposer火了(1)

发布人:机器之心 时间:2023-06-12 来源:工程师 发布文章

在 AI 绘画领域,阿里提出的 Composer 和斯坦福提出的基于 Stable diffusion 的 ControlNet 引领了可控图像生成的理论发展。但是,业界在可控视频生成上的探索依旧处于相对空白的状态。


相比于图像生成,可控的视频更加复杂,因为除了视频内容的空间的可控性之外,还需要满足时间维度的可控性。基于此,阿里巴巴和蚂蚁集团的研究团队率先做出尝试并提出了 VideoComposer,即通过组合式生成范式同时实现视频在时间和空间两个维度上的可控性。


图片


  • 论文地址:https://arxiv.org/abs/2306.02018

  • 项目主页:https://videocomposer.github.io


前段时间,阿里巴巴在魔搭社区和 Hugging Face 低调开源了文生视频大模型,意外地受到国内外开发者的广泛关注,该模型生成的视频甚至得到马斯克本尊的回应,模型在魔搭社区上连续多天获得单日上万次国际访问量。


图片


图片

Text-to-Video 在推特


VideoComposer 作为该研究团队的最新成果,又一次受到了国际社区的广泛关注。


图片


图片


图片

VideoComposer 在推特


事实上,可控性已经成为视觉内容创作的更高基准,其在定制化的图像生成方面取得了显着进步,但在视频生成领域仍然具有三大挑战:


  • 复杂的数据结构,生成的视频需同时满足时间维度上的动态变化的多样性和时空维度的内容一致性;

  • 复杂的引导条件,已存在的可控的视频生成需要复杂的条件是无法人为手动构建的。比如 Runway 提出的 Gen-1/2 需要依赖深度序列作条件,其能较好的实现视频间的结构迁移,但不能很好的解决可控性问题;

  • 缺乏运动可控性,运动模式是视频即复杂又抽象的属性,运动可控性是解决视频生成可控性的必要条件。


专栏文章内容及配图由作者撰写发布,仅供工程师学习之用,如有侵权或者其他违规问题,请联系本站处理。 联系我们

关键词: AI

相关推荐

存储器转型AI战略资源 台厂受惠

网络与存储 2026-05-19

基于Microchip MCU的AI/ML培训教程1

视频 2025-11-12

电子元件培训教材

AI/HPC新世代 COUPE光互连扮要角

网络与存储 2026-05-15

重新构想AI电源:塑造AI加速的未来(第三部分)

国家“算力网”:像用水用电一样用AI

2026-05-18

EEPW2018年3月刊(工业物联网)

基于Microchip MCU的AI/ML培训教程2

视频 2025-11-12

CSR8670CSR8675智能语音Alexa蓝牙方案开发

资源下载 2017-12-14

被动元件新周期:AI时代高端化、服务器化重构MLCC产业格局

尼吉康的事业介绍

视频 2025-07-25

基于Microchip MCU的AI/ML培训教程3

视频 2025-11-12

联发科加速AI在地化应用布局

智能计算 2026-05-19

AI聊天机器人能像医生一样推理吗?

前Qwen负责人林俊旸创业,目标融资规模为数亿美元

2026-05-14

PowiGaN for AI Data Centers: Unmatched Power Density and Reliability

视频 2025-12-19

研华科技与Axelera AI深化战略合作 加速推动基于Europa平台的边缘AI创新

EEPW2018年6月刊(5G)

资源下载 2018-06-11

思科凭借通用商用芯片与光模块赢得 AI 领域客户

更多 培训课堂
更多 焦点
更多 视频

技术专区