项目概览
ArcReel 是一个开源的 AI 视频生成工作台,由 AI Agent 全程驱动,能够将小说文本自动转化为完整的短视频。其完整工作流为:小说 → 角色/场景/道具设计 → 剧本 → 分镜图 → 视频片段 → 最终成片。它本身不训练模型,而是通过统一的抽象层集成 Google Gemini、火山方舟、xAI Grok、OpenAI 等多个 AI 供应商,用 Agent 智能体协调完成从文本到视频的端到端生产流程。项目采用 React 19、Python 3.12+ / FastAPI、Claude Agent SDK 等技术栈,支持 SQLite 与 PostgreSQL 数据库,可通过 Docker 一键部署。ArcReel 旨在解决 AI 视频生成中角色一致性、场景连贯性、分镜拆分、多供应商调度与任务编排等工程问题,将传统人工串联多个 AI 工具的制作流程,转变为 Agent 自动编排与人工确认相结合的标准化流水线。
解决什么问题
在 AI 视频生成领域,模型能力(如 Veo、Sora、Seedance 等)已经很强,但从一段小说文本到一部完整的短视频之间存在巨大的工程鸿沟。传统 AI 视频制作流程需要人工阅读小说并手动拆分场景和分镜,用 ChatGPT/Claude 辅助写剧本,手动在各个 AI 生图平台逐张生成角色设定和分镜图,再手动在视频生成平台逐个生成分镜视频,最后用剪辑软件手动拼接、配音、调色。这一过程存在六大核心痛点:角色一致性失控,每个分镜单独生成图片/视频时角色长相、服装、体型在每一帧都可能变化;场景与道具不连贯,关键道具在不同镜头中外观完全不同;多供应商碎片化;工作流不可复现,每次制作都是手工活,无法标准化和批量化;长篇小说无法自动化拆分,一部 100 万字的小说人工切分非常耗时;缺乏版本管理,生成不满意想回退只能重新生成。ArcReel 正是为了填补这一空白而生,它把“人肉串联多个 AI 工具”的痛点,变成了“Agent 自动编排 + 人在环上确认”的标准化流程。
工作方式
ArcReel 基于 Claude Agent SDK 构建 AI 助手,采用“编排 Skill + 聚焦 Subagent”的多智能体架构。编排 Skill(manga-workflow)负责感知项目状态、决定下一步做什么,聚焦 Subagent 每个只完成一项具体任务,做完就返回精炼摘要。主 Agent 与用户对话、接收指令、展示结果。其工作机制为:编排 Skill 读取 project.json 和文件系统判断项目阶段,根据当前状态调度对应的 Subagent,Subagent 完成任务后返回精炼摘要而非原始数据,主 Agent 展示摘要等待用户确认后进入下一阶段。系统通过三大 Backend 抽象层统一供应商差异:ImageBackend 支持 Gemini、火山方舟、Grok、OpenAI 的图片生成模型;VideoBackend 支持 Veo、Seedance、Grok Imagine Video、Sora 等视频生成模型;TextBackend 用于剧本创作、角色分析等文本理解任务。异步任务队列 GenerationQueue 采用 RPM 速率限制、Image 和 Video 双通道并发、Lease-based 调度和断点续传机制。角色一致性通过先生成角色设计图,再在分镜和视频生成阶段自动携带设计图作为参考图实现;线索追踪将关键道具和场景元素标记为“线索”并生成设计图,后续涉及该线索的分镜自动携带参考图。
核心能力
- 端到端自动化:从小说到成片的完整流水线,无需在多个工具之间切换
- 角色一致性方案:角色设计图 + 线索追踪的双保险机制
- 多供应商灵活切换:统一抽象层 + 全局/项目级切换,不被单一供应商锁定
- Agent 驱动的智能编排:AI Agent 根据项目状态智能决策下一步操作,支持从任意阶段进入和中断恢复
- 渐进式人机协作:关键节点保留人工确认,质量可控
- 版本历史 + 费用追踪:每次生成自动保存版本,支持一键回滚,多供应商费用分策略统计
- 渐进式分集规划:Peek 探测 → Agent 建议断点 → 用户确认 → 物理切分 → 按需制作,支持长篇小说
- 两种内容模式:说书模式(narration)适合朗读节奏的视频,剧集动画模式(drama)适合对话驱动的剧情视频
- 剪映草稿导出:按集导出剪映兼容的草稿 ZIP,支持剪映 5.x / 6+
- 零 GPU 需求:所有模型通过云端 API 调用,本地只需 Docker 环境
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- ArcReel 适合小说改编短视频、批量故事视频生产、需要角色一致性的叙事视频、自媒体内容创作等场景。不适合非叙事类的短视频(如产品展示、Vlog 等)、需要极高自定义控制的视频实验、实时视频生成。其局限包括:依赖云端 API,需要持续的网络连接,API 费用是持续的运营成本,数据需要上传到第三方服务器;视频质量取决于供应商底层模型的能力上限;对复杂的中文网文(修仙、玄幻等特殊世界观)理解可能存在偏差;作为新项目,社区规模较小,文档和教程尚不完善;大多数供应商的视频模型有最大时长限制(通常 5-10 秒),长视频需要拼接;当前架构是异步任务队列模式,不支持实时视频生成和流式输出。此外,虽然支持多供应商,但在同一个项目中通常应该保持供应商一致,否则风格差异会破坏一致性。



