您所在的位置:首页 - 科技 - 正文科技
音频扛把子刚上谷歌,第一个视频音频全自动工具,完全开源免费
周桐
2024-07-12
【科技】
151人已围观
摘要文|乌鸦智能说这几天的视频生成AI一经推出就好评不断。无论是Runaway新模型Gen-3Alpha,还是LumaAI推出的DreamMachine,都有着逼真的画面、多样的电影叙事手法,艺术气息拉满。目前最顶尖的工具如Sora生成的视频都是没有声音的,而声音是让AI视频变得更为真实的重要一步。如果AI能完成从脚本/图片-视频-配音的工作流,那才是真的完美。昨日凌晨,谷歌DeepMind悄悄发布了V2A(Video-to-Audio)系统。这个系统能根据画面内容或者手动输入的提示词直接为视频配音
文|乌鸦智能说
这几天的视频生成AI一经推出就好评不断。无论是Runaway新模型Gen-3Alpha,还是LumaAI推出的DreamMachine,都有着逼真的画面、多样的电影叙事手法,艺术气息拉满。
目前最顶尖的工具如Sora生成的视频都是没有声音的,而声音是让AI视频变得更为真实的重要一步。如果AI能完成从脚本/图片-视频-配音的工作流,那才是真的完美。
昨日凌晨,谷歌DeepMind悄悄发布了V2A(Video-to-Audio)系统。这个系统能根据画面内容或者手动输入的提示词直接为视频配音。
没过几小时,另一个AI音频克隆“扛把子”ElevenLabs就发布了文字到音频模型的API,并基于这一API做了一个Demo应用。这是当前唯一一个全自动将视频与音频相结合的AI工具,且完全开源、免费在线使用。
花开两朵,各表一枝。由于谷歌并不打算向公众开放V2A系统,那我们就先试用一下ElevenLabs的这个版本~
看懂 对齐,生成全自动,但不能理解复杂画面▲ElevenLabs生成配音视频step1→step2
我将luma生成的着火meme视频、OpenAI成员暴走视频、电影《闪灵》视频等,以及Gen-3的示例视频都投喂给了ElevenLabs,看看它会为这些画面配上什么声音。
效果还不错呀!其中,“某个歌手在独唱”、“一个女人奔向正在发射的火箭”、“白头发女人大笑”等等配音跟场景很契合,“水下呼吸的女人”、“一个男人身后燃起大火”的视频配音逼真细腻,非常有大片感。
经过约20个视频的试炼,ElevenLabs能自动生成与视频内容同步的音轨,而且生成配音基本已覆盖影视配音的全部类型:
-环境声,例如水下呼吸声、燃烧声、滚轮声、爆竹声、乐器演奏、白噪音、嘈杂人声等;
-人声,哭声/笑声、对白/独白和歌声等,但不能生成旁白;
-音乐,比如马戏团插画的欢乐音乐、闪灵双胞胎镜头的恐怖音乐等;
-音效,例如枪声、喜剧效果的搓碟声、“OpneAI成员打架”时的机械崩坏声等。
对比其他AI配音工具,ElevenLabs是第一个做到全自动为视频结合生成式配音的工具,无需人工输入提示词也可以为视频配音,且使用AI创建4个音轨供选择,无需人工对齐音频与视频。
ElevenLabs能理解视频的画面,读懂里面的元素,知道画面里正在发生什么,应该出现什么声音,自动匹配上环境音、人声、音乐和音效,在口型同步上表现也不错。
再从声音本身来说,乌鸦君发现ElevenLabs在声音保真度方面表现不错,水下呼吸声、燃烧声、滚轮声、爆竹声,甚至白噪音、嘈杂人声等声音都非常逼真,且音源丰富、音质尚可。
令人最想吐槽的一点是,ElevenLabs的音轨选择较少(只有4条),我用同一个视频多次投喂给ElevenLabs,始终只能得到相同的4个音轨。
音轨选择少意味着使用者的控制范围小、创作灵活度低,这使得ElevenLabs在一致性和运动性方面不稳定的缺陷被暴露无疑。理解简单的画面对ElevenLabs来说不是难题,但一旦画面元素有了动态,配音时常出现节奏韵律不对、不能贴合画面内容的情况,例如脚步声不能符合人物走动的节奏等。
不过,这还只是ElevenLabs做视频配音的一个Demo程序,期待它后续增加可选择的音轨条数,提高理解复杂画面的能力。
完全开源,理解画面能力弱于V2A不到一天,ElevenLabs研究人员说这是他们的视频到声音应用的开发用时。这个敢直接硬刚谷歌的AI语音公司由前Google机器学习工程师PiotrDabkowski和前Palantir策略分析师Staniszewski于2022年1月共同创立,自2022年以来一直从事生成AI语音。
对比谷歌V2A示例视频和ElevenLabs的生成视频,我们发现后者要逊色前者不少,这可能是由于二者的工作原理存在的本质的差别。Demo是基于公司在5月底发布的文字到音频模型打造的,工作原理如下:
-以1秒钟的间隔从视频中提取4帧图像(全部在客户端提取)
-将帧和提示发送到GPT-4o,以创建自定义的文本音效提示

-使用ElevenLabs文本转声音特效API创建提示音效
-在客户端使用ffmpeg.wasm将视频和音频合并为一个文件供下载
-托管于vercel
ElevenLabs并不能直接实现画面到音频的转换,而是利用了GPT-4o将视频截图转换为文字提示词,之后再输入文字转在几秒内生成多条与画面内容匹配的音频。而DeepMind在博客中称V2A能依靠自己的视觉能力理解视频中的像素,这意味着ElevenLabs理解视频的能力可能会弱于V2A。
另外,在API使用过程中,Elevenlabs按每次生成100个字符收费,在设置持续时间时按每秒生成25个字符收费。
结语:视频生成带飞音频生成,深度伪造技术带来自检挑战一方面,OpenAI不断推出高品质AI视频生成模型Sora的新演示,另一方面目前这项技术对公众仍然不可见,包括谷歌V2A。然而为了解决视频配音这个问题,竞争对手Pika研究名叫“LipSync”的对口型功能。
AI视频赛道在“百团大战”的同时,AI音频生成企业也正在扶摇直上。
ElevenLabs今年2月获得了8000万美元的B轮融资,估值超过10亿美元,跻身独角兽行列,估值在半年多的时间暴增10倍,音频扛把子刚上谷歌,第一个视频音频全自动工具,完全开源免费包括像网易等游戏开发商、《华盛顿邮报》等传统媒体,都已经在大量使用ElevenLabs的文生语音技术。
声音是影视作品给人以身临其境之感的元素,未来,AI音频生成可能会细化到人声模拟、对口型、方言等各个部分,无限逼近真实世界。
与此同时,企业需要研究更多类似生物指纹嵌入应用的技术,来防范Deepfake(深度伪造)技术被用作不法用途。ElevenLabs曾表示将会推出新的措施,克隆声音仅供付费用户使用,禁止多次违反平台协议的用户使用这种功能,将会推出一种新的AI检测工具。
Tags: 音频扛把子刚上谷歌第一个视频音频全自动工具完全开源免费
版权声明: 感谢您对【奚诗百科网】网站平台的认可,无特别说明,本站所有文章均归【奚诗百科网】平台所有,转载请说明文章出处“来源【奚诗百科网】”。 https://www.sptgyg.com/post/8815.html
最近发表
- 林俊杰音乐免费听,探索音乐共享的新纪元
- 华为手环6 Pro,智能生活的新伙伴
- 穿越时空的智慧,四书五经中的现代启示
- 音乐宝库,探索1000首经典歌曲的魅力
- 无论学说源自哪本书小学,探索知识的无限可能
- 五年级孩子读四书五经,开启智慧之门的金钥匙
- 艺术设计专业就业前景分析,机遇与挑战并存
- 艺术设计专业,描绘未来的色彩
- 华为MatePad Pro,重新定义生产力工具的智能平板
- 三星W系列手机,奢华与科技的完美融合
- 探索北京,十大免费景点排名及深度体验指南
- 探索知识宝库,小学四书的奥秘
- 时光的旋律,探索一百首经典老歌曲的魅力
- 艺术设计专业,创意与薪酬的完美融合
- 探索北京,30个免费景点全攻略
- 开启你的学术之旅,研究生择校咨询的艺术与科学
- 探索北京,免费景点的宝藏之旅
- 华为云账号登录官网,一站式指南
- 三星Galaxy S7 Edge,2016年的旗舰手机及其历史价值
- 985工程大学排名名单,中国顶尖学府的荣耀与挑战
- 华为荣耀10青春版,青春的风采,一图尽览
- 考研路上的钱包指南,预算大揭秘
- 华为MatePad Pro,您的智能生活新伙伴
- 时光回响,一千首经典老歌曲大全
- 考研路上的灯塔,揭秘考研辅导机构的神奇力量
- 穿越时空的旋律,一千首经典老歌曲的不朽魅力
- 旋律中的世界,全球著名音乐剧的魅力与影响
- 三星手机图片大全,视觉盛宴,科技与美学的结晶
- 旋律中的世界,探索全球著名音乐剧的魅力
- 三星W系列手机,高端奢华与卓越性能的完美结合
- 函授硕士研究生报考条件,开启你的远程学习之旅
- 英文经典音乐剧,穿越时空的旋律与故事
- 福建省美术学院排名大揭秘,艺术殿堂的十座灯塔
- 探索京城,北京免费景点全攻略
- 四书五经,古典智慧的宝库
- 索尼摄像机使用指南,轻松掌握拍摄技巧
- 考研路上的灯塔,为何选择多样的考研课程至关重要
- 旋律与梦想,探索著名英语音乐剧的魅力与影响
- 电影中的音乐之旅,西方音乐电影的魅力与启示
- 深入了解考研课程班的费用,一个全面的指南
- 探索北京,揭秘免门票的宝藏景区
- 考研课程费用解析,如何判断合适的投资
- 艺术之门,揭秘美术公办二本最低分数线的秘密
- 探索北京,十大必去景点深度游
- 舞动经典,探索歌舞剧电影的魅力
- 戴尔最新款笔记本型号,性能、特点与购买指南
- 深入解析,考研课程费用大揭秘
- 揭秘考研课程费用,如何辨别正规课程,避免经济与时间的双重损失
- 荣耀Magic系统,智能生活的新篇章
- 电影之旅,探索英美经典电影的魅力