
让 LLM 通过文本转录而非逐帧图像来理解和编辑视频的开源工具
video-use 是由 browser-use 团队开源的 LLM 驱动视频编辑工具,专为 Claude Code 设计。其核心理念是让 LLM "读"视频而不是"看"视频,通过音频转录和按需可视化,将原始视频素材压缩为约 12KB 的文本摘要,再由 Claude Code 进行对话式剪辑决策。该工具主要解决传统视频编辑流程中人工操作链条长、视频对 LLM 不可读、填充词检测依赖人工或粗粒度工具、跨镜头一致性难以保证以及动画/字幕叠加工程复杂度高等痛点。其工作流程包括素材盘点、预扫描问题、对话交互、策略确认、执行、渲染和自评估。项目包含 12 条硬规则以确保生产正确性,并支持通过并行子 Agent 生成动画。该工具适用于口播视频、教程、采访等"说话为主"的内容,不适用于音乐 MV、体育赛事剪辑、电影级特效合成等场景。

一站式 AI 语音工作台,从视频下载到多语言配音全流程自动化
Voice-Pro 是一款面向创作者和开发者的 AI 音频全流程处理工具,由韩国创业公司 ABUS 开发,基于 Gradio WebUI 构建。它将视频下载、音频分离、语音识别、多语言翻译、文本转语音(TTS)和零样本声音克隆集成到一个统一的 Web 界面中,定位为 ElevenLabs 的开源替代方案。核心价值在于将传统需要 5-8 个工具配合的流程(下载、分离、识别、翻译、配音、字幕)串联成一条自动化管道,用户只需输入视频链接,即可获得多语言配音视频和字幕。工具支持四种 Whisper 变体用于语音识别,三种零样本声音克隆引擎(F5-TTS、E2-TTS、CosyVoice),以及 Edge-TTS、kokoro 等多语言 TTS。完全开源免费,本地运行,数据不出机器。需要 NVIDIA GPU(最低 4GB 显存,推荐 8GB+),首次部署需下载模型,耗时较长。