首页|必读|视频|专访|运营|制造|监管|芯片|物联网|量子|低空经济|智能汽车|特约记者
手机|互联网|IT|5G|光通信|人工智能|云计算|大数据|报告|智慧城市|移动互联网|会展
首页 >> 头条资讯 >> 正文

自研视频生成模型姗姗来迟 快手“可灵”、字节“即梦”珠玉在前,百度胜算几何?

2025年7月3日 07:05  每日经济新闻  

7月2日,《每日经济新闻》记者获悉,百度商业研发团队对外发布了自研视频生成模型“MuseSteamer”及配套创作平台“绘想”,正式进军AI(人工智能)视频生成领域。

2024年,Sora爆火引发生成式视频大模型热潮,李彦宏则在一场内部讲话中称,Sora这种视频生成模型的投入周期太长,10年、20年都可能拿不到业务收益,无论多火爆,百度都不去做。

7月2日,一位接近百度的人士对《每日经济新闻》记者分析称,Robin(李彦宏)点评Sora其实还有后半句,基于多模态需求,可以做一个相对特定的视频生成场景。“包括百度前段时间的罗永浩数字人其实也是特定场景的视频生成。原本商业侧已有擎舵这个平台,那么去服务B端商业客户生成AIGC(人工智能生成内容)产品宣传视频,其实就是特定场景,也是有用户需求的。”

关键优势在于极致遵循力

当前,AI生成视频在生成质量、画面稳定性和长度等方面仍是各大技术厂商持续攻坚的领域。

百度商业体系商业研发总经理刘林表示,在数字内容创作领域,视频时长与画质的突破往往意味着创作自由度的质变。MuseSteamer可支持电影级审美下的10秒长视频的生成,1080P的高清晰度,为视频创作提供了更大的表现空间。

刘林表示,传统AIGC视频创作实践中,往往是先生成视频,再进行配音和添加音效。割裂的创作环节不仅消耗大量时间,更会削弱作品的完整艺术表达。MuseSteamer创新性支持一体化生成带有音效和人物台词的视频。

此外,在视频长度方面,MuseSteamer目前支持生成5秒和10秒两个版本,并可达1080p清晰度。百度此次同步发布了MuseSteamer模型的家族版本,包括Turbo、Lite、Pro,以及各版本对应的有声版,分别面向不同的创作需求和成本考量。

刘林强调,MuseSteamer的关键优势在于其对创作指令的理解与执行能力,即所谓的极致遵循力,能实现创作者“所思即所得”的表达自由。此外,镜头运用能力也是其差异化竞争力之一,百度希望通过该模型降低专业创作门槛,让更多人获得“镜头平权”。

据介绍,MuseSteamer模型的技术基础包括三大方面:首先,在数据准备阶段,通过“筛选—净化—配比”的方式,对超过10亿条异构数据进行处理,并结合三级标签体系和Active Learning(主动学习)机制,以保证训练数据的审美和结构质量。

其次,在模型训练过程中,采用多目标反馈的强化学习优化路径,试图在保证视频动作幅度的同时,保持主体内容的一致性稳定输出。同时,MuseSteamer引入美学条件控制调优,通过隐式批判学习和影视标准严选,让模型懂美、创造美。

MuseSteamer如何面对劲敌

相比OpenAI、字节跳动、Pika等更早投入文生视频赛道的企业,百度此次推出MuseSteamer确属“后发”。无论是国外如Pika、Runway,还是国内如快手旗下的可灵AI、字节跳动旗下剪映团队孵化的AI创作平台即梦AI,均从2024年起就密集发布各类模型、功能和平台,并已完成多次迭代。

今年5月,快手可灵AI宣布推出全新2.1系列模型,高品质模式(1080p)下生成5秒视频仅需不到1分钟。快手官网信息显示,可灵AI在推出10个月之后(即今年3月)的年化收入运行率(Annualized Revenue Run Rate)突破1亿美金,其今年4月和5月的月度付费金额均超过1亿元人民币。

百度是最早布局大模型的国内科技企业之一。自2023年起,百度发布文心一言、迭代多个版本的文心大模型,同时已在搜索、地图、文档、企业服务等多个业务线中落地大模型能力。

但在视频生成这一AIGC下一个爆发点上,百度此前并未公开大动作,仅在2024年宣布领投清华系视频大模型公司生数科技。此外,2025年3月,百度发布的文心大模型4.5和4.5 Turbo实现了文本、图像和视频的混合训练。

2024年,Sora爆火引发国内生成式视频大模型热潮,李彦宏则在一场内部讲话中称,Sora这种视频生成模型的投入周期太长,10年、20年都可能拿不到业务收益,无论多火爆,百度都不去做。

7月2日,一位接近百度的人士对《每日经济新闻》记者分析称:“之前提到的不做类似Sora,更多是不去训一个general-purpose(通用)的视频生成模型,但是在特定场景、特定目的下的视频生成能力是需要的,或者说基于对市场需求的判断,外界确实没有这种能力,会自己来生产、研发这样的能力。”

上述人士表示,Robin(指李彦宏)点评Sora其实还有后半句,基于多模态需求,可以做一个相对特定的视频生成场景。“包括百度前段时间的罗永浩数字人其实也是特定场景的视频生成。原本商业侧已有擎舵这个平台,那么去服务B端商业客户生成AIGC产品宣传视频,其实就是特定场景,也是有用户需求的。”

记者注意到,MuseSteamer由百度商业研发团队主导推出,或许意味着其背后的直接应用场景有可能是广告创意生成与内容投放。

此外,7月2日,百度搜索还宣布进行十年来最大改版,从搜索框、搜索结果页到搜索生态全面革新。具体而言,百度搜索框升级为“智能框”,支持超千字的文本输入,拍照、语音、视频等能力也全面加强,支持直接调取AI写作、AI作图等工具。 百度搜索还宣布接入视频生成模型MuseSteamer。

未来,MuseSteamer如何融入百度搜索、营销与智能助手等核心业务,将决定它是否能从工具演化为平台,从模型能力走向商业杠杆。

编 辑:魏德龄
飞象网版权及免责声明:
1.本网刊载内容,凡注明来源为“飞象网”和“飞象原创”皆属飞象网版权所有,未经允许禁止转载、摘编及镜像,违者必究。对于经过授权可以转载,请必须保持转载文章、图像、音视频的完整性,并完整标注作者信息和飞象网来源。
2.凡注明“来源:XXXX”的作品,均转载自其它媒体,在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。
3.如因作品内容、版权和其它问题,请在相关作品刊发之日起30日内与本网联系,我们将第一时间予以处理。
本站联系电话为86-010-87765777,邮件后缀为cctime.com,冒充本站员工以任何其他联系方式,进行的“内容核实”、“商务联系”等行为,均不能代表本站。本站拥有对此声明的最终解释权。
推荐新闻              
 
人物
飞象访谈:对话InterDigital副总裁兼无线实验室负责人Milind Kulkarni
精彩视频
未来出行的芯力量 向“智能移动终端”跃迁
飞象访谈:对话InterDigital副总裁兼无线实验室负责人Milind Kulkarni
2025MWC上海丨中兴通讯副总裁熊杰就AI万兆全光园区话题进行交流
2025MWC上海|中国信科:全栈算力创新应用 为AI时代构筑数智基石
精彩专题
2025 MWC 上海
2025工业互联网大会
2025世界电信和信息社会日大会
第八届数字中国建设峰会
关于我们 | 广告报价 | 联系我们 | 隐私声明 | 本站地图
CCTIME飞象网 CopyRight © 2007-2024 By CCTIME.COM
京ICP备08004280号-1  电信与信息服务业务经营许可证080234号 京公网安备110105000771号
公司名称: 北京飞象互动文化传媒有限公司
未经书面许可,禁止转载、摘编、复制、镜像