当前生成式AI已在单帧图像与短视频合成上具备成熟能力,但将小说文本系统性转化为具有叙事连贯性的短视频或分格漫画,仍然面临大量人工瓶颈。创作者需自行完成情节拆解、画面描述、风格统一与人物跨场景一致性维护,规模化生产成本高、效率低。
本项目目标是构建一套端到端自动化管线:输入小说文本后,系统自动完成情节理解、剧本结构化、分镜设计,并驱动模型生成对应视觉内容,最终输出短视频(MP4)或漫画面板序列(PNG)。整个系统在Next.js全栈框架内完成,核心在于将AI能力通过工程结构约束在可靠、可追踪、可复现的轨道上。
系统架构与技术选型
平台采用Next.js 16 App Router作为统一运行环境,前端使用React 19 + TailwindCSS v4构建交互界面。所有后端逻辑收敛到Route Handlers,长任务通过Server-Sent Events实现流式进度推送,无需独立后端服务或额外消息队列。
数据持久化选用PostgreSQL + Prisma ORM。复杂推理与结构化输出阶段主要调用Anthropic Claude系列模型(重度分析使用更高能力模型,轻量翻译使用更快模型)。图像生成支持本地Stable Diffusion与云端图像服务双模式切换;视频生成通过抽象适配层对接多家提供商。
这种“轻后端”设计显著降低了维护成本,适合内容生产类工具的快速迭代。
层级化数据模型设计
系统围绕五层模型运转,支持系列级共享与子项目独立管理:
- Series(系列):顶层容器
- Project/Part(子项目/分集):对应具体小说章节或集数
- Analysis(分析结果):存储结构化提取信息
- Episode(剧本层):包含完整剧本JSON、视频分镜数组或漫画面板数组
- CharacterModel(角色模型):系列级共享,支持版本迭代与激活标记
关键工程决策:
剧本正文以JSON字段存储全量数据,而非进一步拆表。因为剧本是生成后整体消费的artifact,JSON提供了足够灵活性,也避免过度设计。
CharacterModel实现版本管理:每次重新建模创建新版本,通过isActive标记当前激活版本。系列内所有子项目共享激活版本的角色参考图,确保跨集视觉一致性。
异步任务使用标准四态状态机(pending / processing / completed / failed)。前端通过SSE事件实时更新单个分镜或面板状态,无需轮询。
MangaPanel模型示例(Prisma schema片段):
prisma
model MangaPanel {
id String @id @default(cuid())
episodeId String
panelNumber Int
description String @db.Text // 中文画面描述
prompt String @db.Text // 适配图像模型的提示词
dialogue String? @db.Text // 对话气泡
innerMonologue String? @db.Text // 心理独白云
sfx String? // 拟声词
expressionType String? // 表情类型
panelSize String @default("medium") // big/medium/small
imageStatus String @default("pending")
imageUrl String?
}
Shot模型结构类似,增加运镜、光线、情绪等视频专属字段,并用videoStatus追踪生成状态。
AI智能落地的核心:四阶段专业化流水线
将复杂任务拆分为职责单一的四个阶段,是保障输出质量与系统可维护性的关键。每个阶段独立调用模型,输入输出严格结构化,便于调试、重试与针对性优化。
阶段1:内容深度分析(整个管线的地基)
系统提示要求模型从小说中提取高度结构化信息:
- 主要角色:必须给出8维度外貌描述(脸型、眼型、鼻梁、嘴唇、肤色、身材比例、发型发色、标志性特征)。这是后续所有角色建模与图像生成的唯一事实依据。
- 标志性场景:提取具有叙事功能或视觉辨识度的环境元素与氛围色调。
- 情节节拍:按故事节奏拆解关键转折点,用于指导后续剧本结构。
落地实践:输入文本截断至约60,000字符,避免超出上下文窗口。输出JSON常出现格式瑕疵(末尾多余逗号、括号不匹配等),因此在解析前集成自动修复机制(jsonrepair库或自定义正则清理),将格式错误导致的中断率降至极低。
阶段2:剧本结构化生成
基于分析结果生成符合短剧叙事规律的剧本,采用“钩子引入—冲突递进—高潮爽点—悬念留白”四段式结构。支持多集批量生成,并针对首集(强化开场吸引力)和收尾集(注重开放式悬念)设计差异化系统提示。
阶段3:分镜生成(视频与漫画策略完全分叉)
视频分镜Prompt约束:每集12–24个镜头,每镜约5秒,总时长60–120秒。每镜必须明确标注景别、运镜方式(推/拉/摇/跟)、光线条件与情绪标签。
漫画分镜Prompt则要求模型真正理解漫画叙事语法:大格承载情绪高潮,小格用于节奏过渡;明确区分对话气泡与心理独白云;标注表情类型与拟声词。系统提示中嵌入2–3个高质量示例面板,可显著提升输出格式稳定性与节奏合理性。经过多轮真实案例迭代后,模型才能输出真正符合漫画阅读体验的分镜结构。
阶段4:提示词语言与风格适配
将前序中文描述转化为图像/视频模型可高效理解的提示词,使用轻量模型执行翻译以控制成本与延迟。
针对本地Stable Diffusion类模型的特殊处理:无论上游生成何种描述,都强制将主体性别描述词(1girl, 1boy等)置于整个prompt最前端。该类模型对词序敏感,主体信息若被后续修饰词稀释,性别一致性会显著下降。
生成层的工程化一致性保障
图像生成:参数锁定与参考图机制
系统通过配置参数在本地SD与云端服务间切换。
本地路径核心是“可复现性优先”:固定随机种子(例如42)、锁定采样步数(30步)与引导系数(CFG=9.0),定义受控风格前缀,并在注入LLM生成的prompt前先剥离其中可能携带的风格类词汇,防止双重风格指令冲突导致视觉漂移。
云端路径充分利用图生图能力:当系列已存在激活的CharacterModel参考图时,自动切换为img2img模式,设置适中denoise强度(约0.55),在忠实角色核心特征的基础上生成新姿态与新场景画面。
视频生成:抽象适配与并发即时反馈
采用工厂模式实现多提供商统一接入。每个Provider只需实现提交任务、轮询状态、返回URL三方法。
批量分镜生成时使用并发控制 + 即时反馈策略:单个镜头任务完成后立即通过SSE向客户端推送完成事件(包含URL)。用户界面可看到镜头逐个渲染完成,而非等待整集全部结束才刷新,极大改善长任务感知体验。
实时体验与前端工作流
前端将生产过程抽象为四步清晰向导:
- 文件上传与解析(支持PDF、EPUB、TXT)
- 内容分析 + 角色/场景建模
- 剧本生成与确认
- 分镜生成 + 批量视觉内容合成(视频/漫画模式在此分叉)
所有SSE事件均触发乐观状态更新:收到单个面板生成完成事件后,直接更新本地state并重新渲染,无需额外请求,避免界面闪烁。漫画格布局根据panelSize动态应用列跨度(big格占两列),自然还原传统漫画版式。
开发注意:修改Prisma schema后必须清理.next缓存目录再重启,否则Turbopack缓存可能导致Prisma Client运行时参数不匹配错误。
生产落地 checklist 与避坑指南
实际构建中,以下实践对系统稳定性和开发效率至关重要:
- 提示词迭代是主战场,尤其是漫画分镜阶段,需准备多组真实小说案例进行多轮review与微调,直到输出格式稳定且叙事节奏自然。
- JSON鲁棒层必不可少:在每处LLM调用后增加双重修复(服务端自动修复 + 客户端简单正则),可将格式错误中断率降至极低。
- 一致性优先于多样性:固定种子、参考图、版本化角色模型是跨集视觉统一的关键。对IP改编项目而言,可控一致性比随机惊喜更重要。
- 状态可见性:长任务必须全流程SSE化,且事件粒度细到单个镜头/面板级别。
- 扩展性设计:所有外部AI服务调用均通过抽象接口,新增模型或服务商只需新增Provider实现类。
- 监控与调优:记录各阶段耗时与失败率,针对性优化慢Prompt。
整个系统从零到核心流程跑通约两周时间,绝大部分精力用于提示词的精细打磨与真实案例验证。
总结
通过将AI智能拆解为职责清晰的阶段化流水线、引入结构化数据模型与版本管理、采用流式通信保障用户体验、并在生成层实施严格的参数锁定与参考控制,我们成功构建了一套从小说文本到高质量短视频/漫画的自动化生产系统。
这套方案的核心价值不在于单一模型调用,而在于围绕AI能力构建的完整工程闭环——让模型输出始终服务于叙事目标,并在可预测、可调试、可复现的框架内运行。对于希望在内容生产领域落地类似AI能力的团队,以上架构分层、提示策略、一致性机制与避坑经验可作为直接参考。