跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签7TTS4声音克隆3LLM3开源2语音合成2AI短剧2FFmpeg2Python21M上下文1本地优先1大语言模型1端侧推理1

项目搜索结果

找到 7 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

Voicebox README 配图
内容创作GitHub 项目

Voicebox

本地优先的开源语音合成工作站,集成多引擎声音克隆、情感标签、后处理音效与多轨编辑

Voicebox 是由 Jamie Pine 开发的开源语音合成工作室,定位为 ElevenLabs 的免费本地替代方案。它是一个完整的桌面应用,集声音克隆、语音生成、后处理特效、多轨编辑于一体,所有模型和数据完全在本地运行。项目采用 Tauri (Rust) 桌面框架,前端使用 React + TypeScript,后端为 Python (FastAPI),音效处理由 Spotify pedalboard 驱动。内置 5 个 TTS 引擎,支持 23 种语言,最大文本长度 50,000 字符,并提供完整 REST API 供外部集成。核心能力包括多引擎声音克隆、情感表达控制(如 [laugh]、[sigh] 等副语言学标签)、8 种后处理音效、多轨时间轴编辑(Stories Editor)以及长文本自动分段与交叉淡入淡出拼接。项目采用 MIT 协议完全开源,支持 CUDA、ROCm、MLX、DirectML、XPU 及 CPU 等多种 GPU 后端。

本地优先声音克隆FastAPI
09.08
内容创作主题配图

AI短视频全流程自动化工具链

从创意到发布的全流程自动化短视频生产工具链

AI短视频全流程自动化工具链是一组开源项目按“生成→剪辑→翻译→发布”顺序串联形成的工作流体系,利用大语言模型、语音识别、语音合成、机器翻译和浏览器自动化等技术,将短视频内容创作的全生命周期从“人工逐环节操作”升级为“一键自动化流水线”。工具链由四个核心项目组成:MoneyPrinterTurbo负责视频生成,FunClip负责智能视频剪辑,KrillinAI负责视频翻译配音,social-auto-upload负责多平台一键发布。它属于“AI辅助内容创作”技术体系,核心价值是把一个短视频从“创意到上线”的全流程压缩到分钟级别,并且一个人就能完成传统需要文案、剪辑师、翻译、运营四个人协作的工作。传统短视频制作周期通常需要1-3天,该工具链可大幅缩短制作时间。

短视频
浏览器自动化
自动化
09.08
Voice-Pro README 配图
内容创作GitHub 项目

Voice-Pro

一站式 AI 语音工作台,从视频下载到多语言配音全流程自动化

Voice-Pro 是一款面向创作者和开发者的 AI 音频全流程处理工具,由韩国创业公司 ABUS 开发,基于 Gradio WebUI 构建。它将视频下载、音频分离、语音识别、多语言翻译、文本转语音(TTS)和零样本声音克隆集成到一个统一的 Web 界面中,定位为 ElevenLabs 的开源替代方案。核心价值在于将传统需要 5-8 个工具配合的流程(下载、分离、识别、翻译、配音、字幕)串联成一条自动化管道,用户只需输入视频链接,即可获得多语言配音视频和字幕。工具支持四种 Whisper 变体用于语音识别,三种零样本声音克隆引擎(F5-TTS、E2-TTS、CosyVoice),以及 Edge-TTS、kokoro 等多语言 TTS。完全开源免费,本地运行,数据不出机器。需要 NVIDIA GPU(最低 4GB 显存,推荐 8GB+),首次部署需下载模型,耗时较长。

开源声音克隆视频配音
09.08
AI 智能体主题配图

Xiaomi MiMo 大模型

小米自研的 Agent 基础模型,面向“完成任务”而非“回答问题”设计

Xiaomi MiMo(Mind in Motion)是小米集团自研的大语言模型产品线,面向 Agent 时代设计,覆盖文本生成、全模态理解、语音合成三大能力域。它被定位为一套完整的智能体基础模型体系,设计目标是“完成任务”而非仅仅是“回答问题”。MiMo 解决的核心问题是让 AI 从“能对话”进化到“能干活”,能够稳定完成近千轮工具调用的长程任务,自主诊断和恢复错误,并同时处理文本、图像、音频、视频等多种模态信息。截至 2026 年 4 月,MiMo 系列已迭代至 V2.5 版本,包含旗舰推理模型 MiMo-V2.5-Pro、全模态 Agent 模型 MiMo-V2.5、语音合成模型 MiMo-V2.5-TTS、语音识别模型 MiMo-V2.5-ASR 以及轻量快速模型 MiMo-V2-Flash。其核心架构创新包括混合注意力机制和全模态统一架构,并强调 Token 效率优化。

1M上下文大语言模型混合注意力
09.08
其他项目主题配图

Supertonic vs MOSS-TTS-Nano 开源轻量级 TTS 深度对比

对比两款开源轻量级 TTS:Supertonic 跨平台部署,MOSS-TTS-Nano 零样本声音克隆

本文档对比两款开源轻量级 TTS 系统:Supertonic 与 MOSS-TTS-Nano。Supertonic 由 Supertone Inc. 开发,基于 ONNX Runtime 完全本地运行,约 99M 参数,支持 31 种语言,提供 11 种语言 SDK,采用 Flow Matching 与语音自编码器架构,代码 MIT 许可,模型 OpenRAIL-M。MOSS-TTS-Nano 由 MOSI.AI 和复旦大学 OpenMOSS 团队开发,仅 0.1B 参数,基于 Audio Tokenizer + LLM 纯自回归架构,支持实时流式推理,可在 4 核 CPU 上运行,支持零样本声音克隆,输出 48kHz 立体声,Apache-2.0 许可。两者均解决传统 TTS 的部署、质量、工程与生态痛点,但侧重点不同:Supertonic 适合跨平台部署与极低资源设备,MOSS-TTS-Nano 适合声音克隆与中文 TTS。文档还包含架构原理、系统架构、关键流程、应用场景、优缺点与选型建议。

端侧推理声音克隆语音合成
09.08
Huobao Drama 火宝短剧 README 配图
内容创作GitHub 项目

Huobao Drama 火宝短剧

一站式 AI 短剧自动化生产平台,从剧本到成片全流程编排

Huobao Drama(火宝短剧)是由南京 AI 火宝团队开发的一站式 AI 短剧自动化生产平台,实现从剧本生成、角色设计、分镜制作到视频合成的全流程自动化。项目以 TypeScript 全栈构建,后端采用 Hono + Drizzle ORM + Mastra AI Agent 框架,前端使用 Nuxt 3 + Vue 3,数据库选用 SQLite。其核心价值在于将短剧制作拆解为剧本改写、角色提取、分镜拆解、音色分配、提示词生成五步流水线,每一步由专门的 AI Agent 负责,通过结构化数据在步骤间传递上下文。平台不依赖单一厂商,通过多厂商适配层(OpenAI、Gemini、MiniMax、火山引擎、阿里、Chatfire)实现图片、视频、TTS 的灵活切换。最终视频合成依赖 FFmpeg,支持 Docker 单镜像部署。项目采用 CC BY-NC-SA 4.0 许可证,禁止商业用途。

自动化生产AI短剧Drizzle ORM
09.08
内容创作主题配图

AI短剧开源工作流

用LLM、文生图、文生视频与TTS串联成自动化流水线,实现从剧本到成片的批量短剧生产

AI短剧开源工作流是一类利用大语言模型(LLM)、AI图像生成、AI视频生成、TTS语音合成等技术,实现从剧本或小说文本到完整短剧视频全自动化生产的开源工具链。其核心思想是将影视生产的每个环节模型化,用LLM做编剧和导演、用文生图做美术、用文生视频做摄影、用TTS做配音,再通过Agent工作流将所有环节串联成一条自动化流水线。报告覆盖三个代表性开源项目:moyin-creator(魔因漫创)为桌面端生产级工具,深度绑定Seedance 2.0,采用6层身份锚点保证角色一致性;waoowaoo为Web端工业级AI影视平台,专攻网文转视频;huobao-drama(火宝短剧)为极简一站式平台,内置5个Mastra AI Agent,支持一句话生成完整短剧。这些项目覆盖了剧本解析、角色生成、场景生成、分镜制作、视频生成、配音合成、成片导出的核心链路,旨在将传统短剧3-6个月的生产周期压缩到数小时甚至数分钟。

工作流角色一致性开源
09.08