能说会演的AI来了:Flux3一口气生成20秒音画同步视频

作者: 智享AI发布日期: 2026/7/24阅读时间: 3分钟
能说会演的AI来了:Flux3一口气生成20秒音画同步视频 封面图

德国一家AI初创公司黑森林实验室,今天扔出一枚重磅炸弹:他们发布了多模态模型Flux3,能一次性生成20秒带声音的视频。你没看错,不是先出画面再后期配音,而是画面和声音一起出,张嘴就对上口型。

这打破了过去AI视频的“哑巴”困境。以前的文生视频模型,哪怕画面再逼真,声音要么得单独生成再拼接,要么干脆没有。Flux3直接把音频编解码器融进模型,理解剧本后,一口气输出20秒音视频片段,人物说话、环境音效、背景音乐全同步搞定。

怎么做到的?黑森林实验室用了自研的Self-Flow架构,给模型配了一套“多个编解码器”——图像、视频、音频、动作各一个,相当于让AI同时学会看、听、动。这样一来,它不仅能理解一张图或一段文字,还能生成对应的画面和声音,甚至能根据关键帧驱动视频转场。

在早期测试中,720p分辨率、10秒长度的片段,Flux3的表现吊打对手:胜率比Luma Ray3.2高出93%,比Runway Gen-4.5高出77%,和谷歌的Gemini Omni Flash、Seedance 2.0比也占微弱优势。换句话说,目前市面上能打的文生视频模型,基本都不是它对手。

不只会做视频。Flux3还能处理文本、图像、视频互相转换,甚至能实现多语言对话。黑森林实验室还跟做机器人的Mimic Robotics合作,搞了个视频动作模型Flux-mimic,目前已经在奥迪工厂里测试,用来控制机器人完成生产任务。

发布策略也很务实:Flux3 Video已经上线,Flux3 Image和开源版“Flux3 Dev”也快来了。一步步开放,让开发者和用户先玩起来。

从单一生成到多模态统一,Flux3标志着AI开始从“看到世界”走向“理解世界并做出行动”。黑森林实验室的目标,是做那个能感知、能行动的“世界模型”——不是只会写诗画图的聊天机器人,而是能帮工厂干活、帮导演拍片的全能选手。

aidesigntechupdate
精选评论
评论加载中…
发表讨论 »