AI造剧的速度,正在改变很多人的日常。当AI参与制作后,新剧上线的速度明显加快,观众几乎每天都能刷到不同题材、不同画风的短剧。
根据QuestMobile数据显示,2026年2月,国内短剧行业覆盖用户达到7.18亿;短短三个月,短剧的增长速度越来越快,到5月,短剧行业去重用户规模达到8.51亿。
用户规模扩大,内容需求也随之增长。从内容生产到产品交互,再到商业化和市场竞争,AI视频行业正在同时经历多方面变化。
智象未来联合创始人兼首席运营官王科告诉腾讯科技:“短剧和漫剧的需求增长非常快,正在从流量红利期逐渐进入优胜劣汰的阶段。”
对于创作者来说,一个好用的AI视频工具极为重要,不仅能降低制作成本,还能做出更有审美的画面和创意表达。
目前,AI视频产品的功能,已经从输入提示词、生成片段,延伸到更多创作环节。创作者们可以上传角色和场景参考,反复调整镜头,给画面配音配乐,有些产品还会根据剧本安排分镜。
一位视频内容创作者向腾讯科技表示:“做爆款的内容难度非常大。从制作角度来看,目前比较难的环节还是出片时要反复‘抽卡’。一个镜头可能会生成好几次,才挑出能用的版本;如果一集有几十个镜头,时间和成本就这样叠上去了。我们更关心生成一次有多少内容能用”。
并且,生成镜头只是制作的一部分。面对一集中的几十个镜头,创作者还要逐一筛选、修改和拼接,同时处理整集节奏,并确保人物、场景和声音前后衔接。
这些具体的制作难题,也在不断推动AI视频产品演变。
智象未来联合创始人兼首席运营官王科告诉腾讯科技,目前,AI视频工具大致有两类交互方式:一类是画布式或节点式工作流,强调专业控制和自由度。另一类是对话式交互,试图降低操作门槛。随着Agent承担任务拆解和执行,创作者可以更多地表达目标,复杂的模型调用和制作流程则由系统在后台完成。
王科强调,AI参与的环节越多,创作者的判断力、审美和叙事能力越重要。内容供给增加后,创作者的价值会更加突出。AI可以降低制作门槛、承担更多执行工作,但对于剧本、审美、节奏和情绪等关键判断仍然依赖创作者。

以下为王科的分享交流实录内容(精选版):
01
流量红利过后,AI视频拼什么
问:随着AI视频进入影视、广告和短视频的实际制作流程,行业对产品的要求发生了哪些变化?这种变化会分别给这些行业带来什么影响?
王科:过去两年,行业更多关注谁能生成质量更高的视频片段。随着AI进入实际生产流程,用户的需求也变得更加具体:最终交付的内容能否直接使用。
这一变化对不同行业的影响有所不同。
对影视行业来说,AI会降低执行和制作环节的门槛,同时对创作者的判断力、审美和叙事能力提出更高要求。剧本是否成立、节奏是否合适、情绪是否到位,这些关键的创作判断仍然需要由人完成。AI可以承担越来越多执行工作,创作者则要对作品作出最终判断。
对广告行业来说,内容生产的颗粒度会越来越细。过去,一个品牌可能只制作十几条广告;有了AI之后,可以针对不同人群、平台和使用场景批量生成差异化素材,再根据投放数据持续调整。广告内容将更接近实时生产和精准匹配。
对短视频行业来说,AI会进一步扩大内容供给,但用户的时间和注意力不会同步增加。
未来,内容和渠道之间的竞争可能更加激烈,也会推动短视频向更垂直、更个性化和更精品化的方向发展。
问:目前,AI视频最热的几个落地场景,包括短剧、漫剧、广告和电商营销。你怎么看这些需求的可持续性?哪些是真正能够长期形成稳定付费的市场,哪些更多还处于流量红利或者早期“尝鲜”阶段?
王科:短剧和漫剧的需求增长很快,目前正从流量红利期逐渐进入优胜劣汰阶段。未来能够形成长期付费的,主要是那些可以持续生产精品内容、沉淀IP资产,并保持高效稳定产出的平台。
相比之下,广告和电商营销的需求更为稳健。这些场景的内容生产频率高、反馈周期短,投入产出也更容易量化。
跨境电商商家会直接计算一条AI营销视频能够带来多少转化。只要投入产出能够算得过来,商家的付费就可以持续。
OPC市场目前仍处于快速放量阶段,距离天花板还比较远。以智象自身为例,随着vivago R1全球上线,我们预计用户规模还会进入一个新的增长阶段。
问:前两年大家最容易比较的是画质、运动幅度、生成时长。到现在,哪些指标正在取代这些参数,成为决定产品竞争力的新标准?哪些能力仍然能够形成真正的差异?
王科:画质、运动幅度、生成时长这些指标今天依然重要,只是它们正在逐渐成为产品的基础能力。
现在评价视频生成产品,需要看的维度更多。基于自己的实践,我们提出了一套“CHATS™视频Agent评估标准”,总体主要看这几个方面,供大家参考:
C,Consistency,一致性。角色、场景和风格能否在多个镜头之间保持稳定。
H,Human Intent,意图理解。系统能否准确理解用户的创意,并且在多轮对话中持续推进任务。
A,Audio & Visual,视听完整度。除了生成画面,还要能够处理声音、节奏以及整体视听体验。
T,Timeline & Tale,时间线与叙事。一个故事能否在多个镜头、多个段落之间持续成立。
S,Stability,稳定交付。能否减少反复生成和返工,提高最终内容的可用率。
未来真正能够形成差异的,我认为会是系统工程能力。
行业正在发生一个比较明显的变化,竞争正在从单点模型能力,进一步走向整条创作链路的协同。从脚本规划、分镜设计、角色管理到音效匹配,最终考验的是整套系统的组织效率和交付确定性。
比如vivago R1也在验证这个方向。根据我们的统计,其背后的HD-AgentOS调度系统目前可以大幅提高有效内容的可用率,减少视频生成过程中反复“抽卡”带来的不确定性。这套系统需要理解整个项目,再完成需求分析、任务拆解和模型调度,让不同能力围绕同一个创作目标协同工作,逐步提高完整作品的交付能力。
问:目前大语言模型已经出现明显的价格竞争,视觉多模态赛道是否也会走上类似的路径?智象未来怎么避免陷入价格战?
王科:当一类产品逐渐标准化,大家能够生成的内容越来越接近,价格很容易成为重要的竞争维度。
智象更希望把竞争放在价值和差异化能力上。
第一,继续做目前市场上还比较难完成的事情。比如R1希望一次完成更长视频的生成,同时提高商业可用成功率、角色一致性和整体稳定性。这些能力很难单纯通过降价获得。
第二,通过系统能力建立壁垒。智象目前重点投入的是“模型+智能体+数据”这套闭环:模型提供理解和生成的基础能力,智能体负责把这些能力组织成完整创作流程,数据再通过真实使用不断反馈到系统中。
随着这几个部分持续循环,最终竞争会越来越多地落到整体系统能力上。
问:面对字节Seedance、Seedream以及快手可灵等大厂产品,独立创业公司在基础模型、产品和流量等方面会存在资源差距。未来最现实的竞争空间在哪里?
王科:创业公司的融资规模和资源体量与大厂相比确实存在很大差距。我觉得要竞争,主要有三点。
第一,认知要快。对于模型架构、下一代模型的技术方向以及技术选型,要尽可能做出更早、更准确的判断。有时候只要比大厂提前半个身位,甚至提前三个月,就可能出现机会窗口。
第二,落地速度要快。方向确定之后,要尽快完成模型迭代,同时推进产品化和商业化,在窗口期形成产品壁垒或者用户壁垒。
第三,组织调整要快。创业公司的一个优势是组织更加扁平,决策链条更短,可以根据技术和产品变化快速调整方向。
智象也有比较明确的生态位。比如我们与TikTok有比较紧密的合作,大厂拥有流量和资本优势,我们更希望依靠底层模型创新和工程落地速度参与竞争。
在这个市场里,我们不会和大厂在所有方向全面竞争,而是希望在关键节点抓住技术和产品窗口。比如出现新的技术方向之后,我们可以很快把算法、工程和产品团队拉到一起,当天讨论,第二天就开始做Demo。
这种速度,就是创业公司的生存空间之一。
公司的核心策略依然是在图片和视频多模态模型上持续投入,希望长期保持在全球第一梯队,这也是我们最核心的竞争力。
02
AI视频的两种交互路线
问:近日,智象未来上线内容创作智能体vivago R1,并同步升级国内版本“够搭”。vivago R1定位为“内容创作智能体”,而非单纯的视频生成工具。“智能体”和“工具”的核心区别是什么?
王科:这里最核心的区别是,使用传统工具时,用户需要自己决定每一步怎么做;使用智能体时,用户更多只需要说明自己最终想得到什么结果,系统会自己规划中间过程。
以vivago R1为例,底层采用自研的原生全模态架构,可以把文本、图片、视频、参考资产、文档说明以及历史创作结果放进同一个任务语境中,让Agent理解整个项目的上下文,而非只执行一个单点指令。
在此基础上,智能体系统再把模型能力组织成持续推进的创作流程,在脚本、分镜、角色、场景、镜头和音效之间进行规划和调度,同时处理复杂叙事中的角色形象、声音特征和风格一致性。
传统视频生成工具中,用户输入提示词,模型生成一个片段。如果想完成一部完整短片,用户往往还需要自己拆分镜、调整提示词、逐个生成镜头、手动拼接以及完成后期处理。
我们希望用户先告诉系统自己想做什么,后面的任务拆解和环节协调尽量交给Agent完成,最终围绕同一个项目持续推进。
问:长视频生成涉及几十个甚至更多镜头,行业目前普遍面临角色、风格和叙事难以保持一致的问题,智象未来通过哪些方式解决?
王科:我们的思路是采用“多Agent协作机制”。
比如R1的主Agent可以先理解用户的整体创意,将其拆解成不同任务,再由子Agent分别处理脚本、分镜、角色、场景和音效等环节。
这些Agent共享同一套项目上下文。用户提供的文本、图片、视频和其他参考素材都会进入同一个任务语境,各个Agent据此理解人物设定、故事走向和视觉风格,减少不同环节之间的偏差。
HD-AgentOS负责调度整个制作流程,协调各个Agent的任务和输出,尽量让角色形象、画面风格、叙事节奏和整体质感保持一致。
我们认为,系统协同是其中一个重要原因。长视频涉及多个连续环节,最终效果取决于这些能力能否稳定配合,而非某一个环节能够生成多好的单个镜头。
问:R1强调“Chat-First”(以对话为主要的交互方式)。自然语言会成为下一代专业创作软件的主要交互方式吗?像Photoshop、Premiere这类复杂的专业软件,未来可能发生多大变化?
王科:好的创作工具应该尽可能顺应人的表达习惯。对于视频创作来说,创作者最先想到的通常是自己想表达什么,而非节点、画布或者具体参数、。
目前,AI视频工具大致有两类交互方式。
一类是画布式或节点式工作流。产品将模型、工具和参数交给用户,由用户自行连接和调试。这种方式自由度较高,对专业用户很有价值,但学习和使用门槛也相对较高。
另一类是R1采用的对话式交互。用户可以直接通过自然语言提出需求,由系统生成视频,并通过多轮对话继续修改和调整。
在这一过程中,用户主要负责表达目标,Agent负责拆解和执行任务。SkillHub承担类似“翻译层”的作用,根据用户意图匹配和编排不同的Skill,将创作需求转化为可以执行的任务序列。
我们希望通过这种方式封装复杂的系统能力,为用户提供一个更简单的创作入口,缩短从产生灵感到开始执行之间的操作链条。
(转载自腾讯科技)
扫码下载app 最新资讯实时掌握
