今年 ChinaJoy,AI 游戏第一次被写进主视觉 Slogan。展会上最出圈的,是字节朝夕光年江南工作室那款《不问凡尘》:20 人团队、2025 年 10 月立项、2026 年 7 月公测,一年时间做出买断制单机,画面全部由 Seedance 2.0 视频大模型生成,NPC 全员搭载智能体内核——你能跟它聊宗门秘辛,看它吐槽炼丹翻车,它甚至会对你的"道心动摇"给出哲学式回应。
很多人以为这只是"用 AI 画图加配音"的升级版互动影游,真看懂了才发现,它干了一件更狠的事:重写了"内容引擎"。今天我们把这条 AI 视频生成做游戏画面的管线拆开,看看它到底怎么落地,以及中小团队能从中抄到什么。
用视频模型做游戏,和传统引擎差在哪?
传统游戏引擎是"空间建筑师":搭场景、放模型、设物理碰撞,一切都在三维坐标系里严丝合缝。而 Seedance 2.0 这类视频大模型本质是"时间导演":它只认一条时间轴,输出的是连贯影像流,没有 Z 轴,没有空间锚点,更不认"玩家按 W 键往前走"这套逻辑。
这两种引擎的思维方式完全不同:空间引擎管的是"物体在哪、怎么动",视频模型管的是"这段画面怎么演"。直接拿视频模型当游戏引擎,等于让一个拍电影的导演去搞电子游戏——他拍得出画面,但接不住你的操作。
所以《不问凡尘》做了一件关键的事:把"时间"打碎重组,让视频流能响应玩家的输入。这不是把 AI 塞进传统管线,而是围绕视频模型重新设计了一套游戏架构。
实时影视合成管线是怎么把画面"缝"起来的?
江南工作室的做法是研发了一套实时影视合成管线:把角色施法、怪物受击、环境反馈拆成多个带 Alpha 通道的视频流,再用动态光照算法"缝合"进同一帧场景。每一段都是独立的视频片段,通过合成层组合出玩家眼前完整、可交互的画面。
这套管线的价值在产能上体现得特别夸张:只需制作 100 个技能镜头、100 个怪物反应、100 个地形模板,就能组合出百万级战斗变体。放到传统 3D 管线里,这得上万套动画加骨骼绑定加物理模拟的地狱工程。
对中小团队来说,这个思路比技术本身更值得抄:与其追求"所有内容都由 AI 实时生成",不如把 AI 生成的内容模块化、组件化,用小样本组合出大变化。做塔防小游戏的时候我们也是这么干的——炮塔攻击特效、怪物受击反馈、场景装饰,全部做成可复用组件,AI 批量产出素材,代码层面组合调用,一套素材库撑起几十个关卡的表现力。
全 AI 生产流水线长什么样:从策划到出包
《不问凡尘》背后的生产流水线是这样的:策划提需求 → AI Agent 自动拆解任务 → 调用多模态模型生成分镜、台词、音效、运镜 → 人工审核加精修 → 打包进游戏框架。
岗位职责被彻底改写:美术不再画原画,而是写"风格提示词加情绪权重表";程序不写 Shader,而是训练轻量化渲染调度 Agent;连导演的活都变了——从"喊卡"变成"喂数据、调温度"。
这种"人定标准、AI 出内容、人做审核"的分工,本质是把游戏生产从"手工作坊"推向"标准化工场"。注意关键点:AI 生成只是中间环节,前面有策划定调,后面有人工审核精修。所谓全 AI 管线,不是没人,而是人的工作重心从"产出"变成了"把关"。
这条经验对任何规模的团队都适用。哪怕你只做休闲小游戏,把"AI 批量产出初稿 + 人工统一风格 + 组件化复用"跑起来,美术和内容的产能都能上一个台阶。真正的门槛不在 AI 工具本身,而在你愿不愿意把审核标准、素材规范沉淀成制度。
中小团队能从《不问凡尘》抄到什么?
你当然不会去做一款视频大模型驱动的买断制单机,但至少有三样东西可以直接抄:
- 抄"组件化组合"的思路。AI 单次生成的内容不可控、风格不稳定,但把它切成小块组件、用代码规则组合,不可控就被驯服了。技能、特效、反馈音,全部模块化,这就是"小样本组合出大变化"。
- 抄"AI Agent 拆任务"的分工。把"做一个系统"拆成"AI 能逐个执行的小任务",每个任务有明确输入输出和验收标准。这不只是大厂玩法,一个小团队用现成的 Agent 工具也能搭出类似的流水线。
- 抄"人机分工"的边界。AI 负责批量产出和初稿,人负责定标准、审质量、管风格。别让 AI 自由发挥,也别把 AI 当免费劳动力——它在"量产初稿"和"生成变体"上效率无敌,在"风格统一"和"玩法手感"上仍然需要人兜底。
更现实的用法是:把 AI 视频生成用在买量素材上。现在信息流里的游戏广告,大量已经是 AI 视频素材——真机画面切片加 AI 变体批量生成,成本不到传统素材的十分之一。这条路径技术成熟度远高于"视频模型当游戏引擎",对做台球小游戏、密室逃脱小游戏这类产品投放的团队来说,是当下性价比最高的 AI 视频落地场景。
别把视频引擎想太美:三个现实问题
看完了热闹,也得泼三盆冷水:
第一,可控性还是老大难。视频大模型生成的内容细节不可控,同一个指令跑十遍出十种结果。合成管线能缓解,但无法根除。做需要精确碰撞、精确反馈的核心玩法,视频引擎目前撑不住。
第二,算力成本不便宜。100 个镜头加 100 个反应模板的产能,背后是海量推理调用。大厂扛得住,中小团队按量付费,成本要精打细算。先算清楚单分钟内容成本,再决定用不用。
第三,人才模型还没跟上。写"风格提示词加情绪权重表"的美术、"喂数据调温度"的导演,这些新岗位市面上几乎没有现成人才。团队要么自己培养,要么请有 AI 工作流经验的人来搭体系,这不是买两个工具就能解决的。
AI 视频生成做游戏画面,方向是真的,路径也是真的——只是它现在更适合当"素材工厂",还没到当"游戏引擎"的成熟度。《不问凡尘》证明的是这套逻辑在大厂手里能跑通,而中小团队真正该做的,是把这套思路里"组件化、人机分工、标准沉淀"的部分抽出来,用到自己的产品线上。想了解更多 AI 游戏开发的落地实践,欢迎逛逛巨游工坊资讯中心,我们持续在更新一线打法。