咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
【导语】视频生成大模型领域竞争激烈,商业化探索仍面临挑战过去一年,视频生成大模型领域迎来了爆发式增长,众多企业纷纷推出自家产品,行业竞争愈发激烈。然而,在探索商业化的道路上,众多创业者却遭遇了困境。尽管技术在不断进步,但离真正的商业应用仍有一段距离。近日,在北京智源大会大模型产业CEO论坛上,多位行业领袖就视频生成模型的商业化困境和技术瓶颈展开了深入探讨,为未来的发展指明了方向。

过去一年,是视频生成大模型领域众声喧哗的一年,年初Sora引爆全场,随后国内众多企业也都推出了自己的产品。行业竞争愈发激烈,能够成功“跑通”的路径也变得更加陡峭。探索如何实现商业化,成为众多视频生成创业者的困境。
在日前举行的第7届北京智源大会大模型产业CEO论坛上,智象未来创始人兼CEO 梅涛谈及当前视频生成模型商业化过程中面临的困境时坦言:“(目前)大模型商业化仍不明显,离最后的商业应用还是差‘最后一公里’”。
智源研究院院长王仲远在论坛上指出,过去一年,大语言模型的推理能力和智能化水平有了明显的提升,然而,原生多模态技术尤其在文生视频、文生图方面仍处于探索期,距离“多模态的ChatGPT时刻”尚有距离。
澎湃科技(www.thepaper.cn)注意到,尽管近期国产大模型在多模态融合、生成质量等方面取得显著进展,也在训练效率、推理成本等关键指标上不断优化,但当前技术上仍存在一定瓶颈,而这一定程度上也影响了视频生成模型商业化路径。
Sand.AI(北京三代科技有限公司)的创始人兼CEO曹越认为,虽然Sora已经证明可以生成高质量视频,但从底层技术路径上看,当前主流的Diffusion模型和Transformer模型的训练方案有很大问题,核心问题在于不够“Scalable”(可扩展性)。
这一情况类似2018年语言模型的发展阶段,当时BERT模型刚(gāng)推(tuī)出(chū)时(shí),在(zài)10B参(cān)数(shù)量(liàng)级(jí)内(nèi)表(biǎo)现(xiàn)良(liáng)好(hǎo),但(dàn)一(yī)旦(dàn)继(jì)续(xù)扩(kuò)大(dà)模(mó)型(xíng)规(guī)模(mó),其(qí)性(xìng)能(néng)提(tí)升(shēng)却(què)趋(qū)于(yú)停(tíng)滞(zhì),难(nán)以(yǐ)获(huò)得(de)预(yù)期(qī)收(shōu)益(yì)。这(zhè)也(yě)是(shì)后(hòu)来(lái)ChatGPT能(néng)够(gòu)后(hòu)来(lái)居(jū)上(shàng)的原因之一,它能够有效地扩展到千亿(1000B)级别,从而实现质的飞跃。
然而,在视频生成方向,Diffusion和Transformer目前虽然已能生成5秒左右的视频并(bìng)呈(chéng)现(xiàn)出(chū)不(bù)错(cuò)的(de)效(xiào)果(guǒ),但(dàn)随(suí)着(zhe)模(mó)型(xíng)参(cān)数(shù)规(guī)模(mó)的(de)扩(kuò)大(dà),则(zé)快(kuài)速(sù)达(dá)到(dào)瓶(píng)颈(jǐng)。在(zài)现(xiàn)有(yǒu)技(jì)术(shù)框(kuāng)架(jià)下(xià),如(rú)何(hé)实(shí)现(xiàn)真(zhēn)正(zhèng)可(kě)扩(kuò)展(zhǎn)的(de)视(shì)频(pín)生(shēng)成(chéng)解(jiě)决(jué)方(fāng)案(àn),仍是一个悬而未决的问题。
智象未来创始人兼CEO 梅涛指出,视频生成大模型目前正处于ChatGPT2到ChatGPT3的阶段。要解决视频创作的问题,有三个关键点要达到,即叙事性、稳定性和可控性,这是突破商业化瓶颈的关键所在。
梅涛称,从2023年到2025年,这三年他对于商业化有不同阶段的思考。2023年,他认为模型就是产品,2024年觉得可以卖工具,但后来发现,工具的门槛比较高,即便用了特效的方式,也很难满足用户所有需求。
2025年,他再将产品升级,即不用关心如何做,工具只是降本增效的方法,关键在于用低成本、极高效率,创造极高价值。“我们希望直接把结果交付给用户,帮用户做增长,跟用户分佣,这种模式更贴近商业的本质。”
梅涛表示,无论是做视频生成还是大模型,最关键的挑战在于如何从技术能力出发,走到一个可持续、可闭环、有现金流的商业模型中去。如果无法实现这一点(diǎn),终(zhōng)究(jiū)只(zhǐ)能(néng)停(tíng)留(liú)在(zài)“技(jì)术(shù)提(tí)供(gōng)者(zhě)”的(de)角(jiǎo)色(sè)。在(zài)这(zhè)一(yī)过(guò)程(chéng)中(zhōng),梅(méi)涛(tāo)说(shuō)他得出一个清晰的判断,无论模型底座能力多强,离真正的商业应用仍然差“最后一公里”。下一步,他的策略不仅是向用户交付结果,还将进一步构建完整生态。比如,签约大量具备流量优势的内容创作者(UP主)、MCN机构,搭建自有账号体系,从而推动整个生态系统的运转。
“最终我们可能进入电商领域,转向卖货,构建起一个稳定、有现金流支撑的业务闭环。”梅涛说。
曹越认为,视频生成模型在不同的发展阶段,会展现出完全不同的产品契合度(PMF)。在早期阶段,尽管生成效果还不完美,甚至需要频繁“抽卡”才能生成一个可用片段,但与传统拍摄相比,其成本优势依然显著。他预测,视频生成方向在未来三到五年内会大有可为。
公众号

电话
需求反馈