跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签67开源34AI Agent23Python18Claude Code10MIT9TypeScript8LLM7MCP7React7CLI6Markdown6Rust6

项目搜索结果

找到 67 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

HyperFrames 提示词工程 README Logoheygen-com/hyperframes
内容创作GitHub 项目

HyperFrames 提示词工程

用自然语言指挥 AI Agent 编写 HTML 视频的声明式合成框架

HyperFrames 是由 HeyGen 开源的一款 HTML-to-Video 渲染框架,核心理念是“Write HTML. Render video. Built for agents”。它让 AI Agent(如 Claude Code、Cursor、Codex)能够用纯 HTML + GSAP 动画来“编写”视频,再通过无头浏览器确定性渲染为 MP4/WebM 视频文件。框架不是视频编辑器,而是声明式视频合成框架,用户写 HTML,输出视频。其设计哲学是 Agent-First,通过三个 Slash Command(/hyperframes、/hyperframes-cli、/gsap)将框架知识注入 Agent 上下文,并通过自然语言词汇表(如“smooth”、“bouncy”、“dramatic”)直接映射到 GSAP easing 函数,实现意图到代码的精准映射。框架支持冷启动(从零描述)和暖启动(喂素材转化)两种 Prompt 形态,并强调小步精准修改的迭代原则。

开源视频合成提示词工程
09.08
Voicebox README 配图
内容创作GitHub 项目

Voicebox

本地优先的开源语音合成工作站,集成多引擎声音克隆、情感标签、后处理音效与多轨编辑

Voicebox 是由 Jamie Pine 开发的开源语音合成工作室,定位为 ElevenLabs 的免费本地替代方案。它是一个完整的桌面应用,集声音克隆、语音生成、后处理特效、多轨编辑于一体,所有模型和数据完全在本地运行。项目采用 Tauri (Rust) 桌面框架,前端使用 React + TypeScript,后端为 Python (FastAPI),音效处理由 Spotify pedalboard 驱动。内置 5 个 TTS 引擎,支持 23 种语言,最大文本长度 50,000 字符,并提供完整 REST API 供外部集成。核心能力包括多引擎声音克隆、情感表达控制(如 [laugh]、[sigh] 等副语言学标签)、8 种后处理音效、多轨时间轴编辑(Stories Editor)以及长文本自动分段与交叉淡入淡出拼接。项目采用 MIT 协议完全开源,支持 CUDA、ROCm、MLX、DirectML、XPU 及 CPU 等多种 GPU 后端。

第 1 页第 2 页第 3 页
本地优先声音克隆FastAPI
09.08
PromptLens README 配图
内容创作GitHub 项目

PromptLens

开源 AI 视频提示词反推分析工具,自动提取关键帧并生成结构化提示词

PromptLens 是一款开源的 AI 视频提示词反推分析工具,提供完整的 Web 应用体验。其核心能力是上传 AI 生成的视频或图片,自动提取关键帧,通过多模态大模型(如智谱 GLM-4V、Google Gemini、OpenRouter)分析画面内容,反向推导出可能使用的提示词,并输出结构化的、可直接复用的英文提示词。项目采用 Next.js 15 + React 19 全栈技术,使用 Supabase PostgreSQL 存储数据,Cloudflare R2 存储媒体文件,FFmpeg 进行视频帧提取,支持 better-auth 的 Google/GitHub 登录。除画面分析外,还支持通过 AssemblyAI 进行音频识别,提取视频中的语音旁白和台词。项目以 MIT 许可证开源,代码透明,可自由修改和商用。

多模态大模型开源提示词反推
09.08
Horizon AI新闻雷达 README 配图
知识管理GitHub 项目

Horizon AI新闻雷达

AI驱动的个人新闻雷达,自动完成多源抓取、评分、去重、背景补充与双语日报生成

Horizon 是由开发者 Thysrael 开源的个人新闻雷达系统,定位为"AI 新闻编辑"而非传统 RSS 阅读器。它从 Hacker News、RSS/Atom、Reddit、Telegram、Twitter/X、GitHub 六类信息源并发抓取内容,通过 URL 归一化与标题相似度进行跨平台去重,再调用大语言模型按用户兴趣领域进行 0-10 分评分,仅保留超过阈值的高分新闻。随后自动搜索补充背景知识、收集并摘要社区评论,最终生成中英双语 Markdown 日报,并通过 GitHub Pages、邮件订阅、Webhook 通知及 MCP Server 等多渠道分发。项目使用 Python 编写,支持 Claude、GPT、Gemini、DeepSeek、豆包、MiniMax 等多种模型提供商,可通过 Docker 或 GitHub Actions 部署,并内置交互式配置向导降低使用门槛。

开源日报信息聚合
09.08
AI 智能体主题配图

hermes-agent-ecosystem

具备持续记忆与自动技能提取的自我进化型 AI Agent 框架

Hermes Agent 是由 Nous Research 团队开发的开源 AI Agent 框架,GitHub 星标超过 90,000。其核心定位不是简单的“大模型套壳聊天工具”,而是具备持续记忆、自动技能提取和跨会话成长能力的自我进化型 Agent。传统 AI Agent 每次会话后所学技能、积累经验和对用户的理解全部归零,而 Hermes Agent 引入持久化记忆系统、技能自动发现与注册机制以及三层记忆架构,使能力持续增长。框架采用“最小核心 + 最大扩展”原则,核心 Agent Loop 精简,工具、技能、记忆、提示等能力通过注册机制动态注入。记忆系统分为 MemoryStore、MemoryManager 和 MemoryProvider 三层,支持跨会话检索和上下文压缩。技能系统从实际使用中自动提取重复模式,并采用渐进式加载策略。工具体系覆盖浏览器、代码执行、语音等场景,并内置多后端架构。此外,Prompt Builder 模块化组装系统提示,内置注入守卫;Auxiliary Client 管理多模型路由与自动降级。整体生态包含 80+ 衍生项目,形成“Agent 构建生态,生态增强 Agent”的正向飞轮。

多模型路由工具集记忆系统
09.08
CLIProxyAPI 本地反代大模型 API 网关 README 配图
开发工具GitHub 项目

CLIProxyAPI 本地反代大模型 API 网关

将已授权的 AI CLI 账号统一转换为 OpenAI 兼容 API 的本地网关

CLIProxyAPI 是一个用 Go 编写的轻量级 AI 代理网关,由 router-for-me 团队开源维护,采用 MIT 协议。它能够将用户已登录授权的各种 AI CLI 工具(如 Gemini CLI、ChatGPT Codex CLI、Claude Code CLI)包装成一个统一的 OpenAI 兼容 API 接口,默认暴露在本机 localhost:8317 上。该工具解决了 AI 服务格式不统一、CLI 能力无法被代码调用、多账号管理混乱、安全暴露风险等问题。其核心设计思想包括:将 CLI 授权能力网关化、以 OpenAI 格式为标准、双层隔离架构、多账号轮询实现负载均衡、默认本机监听保障安全。CLIProxyAPI 支持流式/非流式响应、函数调用、多模态等功能,并支持多账户轮询负载均衡。它适用于本地 Agent 开发调试、多账号额度聚合、统一接入多个 AI 模型、IDE 编码助手后端等场景。但需注意,它主要代理 Chat 能力,不支持 Embeddings、Fine-tuning 等完整 API 特性,且依赖 CLI 授权,存在服务条款风险和稳定性问题。

本地部署多账号轮询协议翻译
09.08
video-use README 配图
AI 智能体GitHub 项目

video-use

让 LLM 通过文本转录而非逐帧图像来理解和编辑视频的开源工具

video-use 是由 browser-use 团队开源的 LLM 驱动视频编辑工具,专为 Claude Code 设计。其核心理念是让 LLM "读"视频而不是"看"视频,通过音频转录和按需可视化,将原始视频素材压缩为约 12KB 的文本摘要,再由 Claude Code 进行对话式剪辑决策。该工具主要解决传统视频编辑流程中人工操作链条长、视频对 LLM 不可读、填充词检测依赖人工或粗粒度工具、跨镜头一致性难以保证以及动画/字幕叠加工程复杂度高等痛点。其工作流程包括素材盘点、预扫描问题、对话交互、策略确认、执行、渲染和自评估。项目包含 12 条硬规则以确保生产正确性,并支持通过并行子 Agent 生成动画。该工具适用于口播视频、教程、采访等"说话为主"的内容,不适用于音乐 MV、体育赛事剪辑、电影级特效合成等场景。

开源视频编辑AI Agent
09.08
微软Qlib AI量化投资平台 README 配图
数据与分析GitHub 项目

微软Qlib AI量化投资平台

微软研究院开源的AI量化投资研究平台,将量化研究全流程标准化

Qlib 是微软研究院(Microsoft Research)开源的面向 AI 的量化投资平台。它将量化投资的完整研究流程——从数据获取、特征工程、模型训练到回测评估——标准化为一套模块化的 Python 框架,让开发者可以专注于策略逻辑本身,而不是底层工程实现。Qlib 采用分层模块化架构,从底向上依次为数据层、特征引擎、模型层、策略层、回测与评估层、在线服务层。数据层负责数据的获取、存储和预处理,统一存储为 qlib binary 格式;特征引擎内置 Alpha158 和 Alpha360 特征集;模型层支持传统机器学习(LightGBM、XGBoost)、深度学习(LSTM、Transformer)以及强化学习;策略层提供 TopkDropout、TopK 等策略;回测与评估层考虑滑点、交易摩擦、手续费,并提供 IC、Sharpe Ratio、Max Drawdown 等评估指标;在线服务层支持模型部署到生产环境。Qlib 支持美股、A 股、港股等市场,并集成了微软的 RD-Agent,可自动搜索最优的模型架构和因子组合。

回测机器学习开源
09.08
InfiniteTalk README 配图
内容创作GitHub 项目

InfiniteTalk

音频驱动的无限长说话视频生成框架

InfiniteTalk 是美团 MeiGen-AI 团队于 2025 年 8 月开源的音频驱动无限长说话视频生成框架,全称 "Audio-driven Video Generation for Sparse-Frame Video Dubbing"。它提出了一种新型视频配音范式——"稀疏帧视频配音",通过保留原始视频的关键参考帧,在维持身份信息、标志性手势和摄像机轨迹的同时,对全身运动进行音频同步的编辑。给定一段源视频和目标音频,可生成与音频精确口型同步、头部/身体/表情联动的全新视频;给定一张人物图片和音频,可从零生成无限长的说话人视频。支持 480P 和 720P 分辨率,默认最大 1000 帧/40 秒,可流式扩展。底层基于扩散模型构建,使用 Wan2.1-I2V-14B 作为视频生成基座,音频编码器采用 Wav2Vec2。项目以 Apache-2.0 许可证开源。

扩散模型流式生成视频配音
09.08
内容创作主题配图

AI短视频全流程自动化工具链

从创意到发布的全流程自动化短视频生产工具链

AI短视频全流程自动化工具链是一组开源项目按“生成→剪辑→翻译→发布”顺序串联形成的工作流体系,利用大语言模型、语音识别、语音合成、机器翻译和浏览器自动化等技术,将短视频内容创作的全生命周期从“人工逐环节操作”升级为“一键自动化流水线”。工具链由四个核心项目组成:MoneyPrinterTurbo负责视频生成,FunClip负责智能视频剪辑,KrillinAI负责视频翻译配音,social-auto-upload负责多平台一键发布。它属于“AI辅助内容创作”技术体系,核心价值是把一个短视频从“创意到上线”的全流程压缩到分钟级别,并且一个人就能完成传统需要文案、剪辑师、翻译、运营四个人协作的工作。传统短视频制作周期通常需要1-3天,该工具链可大幅缩短制作时间。

短视频浏览器自动化自动化
09.08
知识管理主题配图

LLM-Wiki

一套由 AI Agent 自动维护、面向 Agent 与人类共读的结构化知识库方法论

LLM-Wiki 是一套关于 AI Agent 如何建立和维护自身知识体系的最佳实践方法论,由卡比卡比(@jakevin7)设计并开源。其核心主张是“Vault 是 Agent 的外脑”,将传统知识库工具重新定义为 Agent-native 工具——由 Agent 写,给 Agent 和人类读。它通过 /ingest(知识摄入)、/query(知识查询与写回)、/lint(健康检查)、/research(外部研究)四个操作形成闭环,实现知识库随使用自增长。知识采用三层隔离:sources/ 存放不可修改的原始材料,wiki/ 存放 Agent 维护的提炼知识,wiki-log.md 记录操作日志。产物兼容 Obsidian 格式,可直接用 Obsidian 查看知识图谱。项目已集成到 OpenCLI 的项目管理中,其核心理念也可独立于 OpenCLI 实现。

知识管理知识图谱自增长知识库
09.08
val1813 的 GitHub 头像val1813/kwcode
AI 智能体GitHub 项目

KWCode天工开物

为本地小模型优化的确定性流水线 Coding Agent CLI 工具

KWCode(天工开物)是一个专为本地开源模型优化的 Coding Agent CLI 工具,由中国开发者 val1813(ValHuang)开发,MIT 协议开源。其核心定位是让 8B-30B 参数的小模型也能完成编程任务,数据不出网。 KWCode 采用确定性专家流水线架构,LLM 只负责任务分类和代码生成,文件定位、验证、调试等环节由确定性代码完成。内置 5 个确定性工具,支持 BM25+AST 调用图定位、三阶段重试、Debug Subagent 运行时调试、DAG 多任务编排、专家飞轮自动积累经验等功能。 项目支持 Windows/macOS/Linux 平台,Windows 原生运行,无需 WSL2。系统要求 Python 3.10+,支持任意 OpenAI 兼容 API。当前处于 MVP 阶段,AST 引擎主要支持 Python,社区规模较小。

本地模型开源确定性流水线
09.08
开发工具主题配图

skills-manage

一个界面统一管理 28+ 个 AI 编程代理平台 Skills 的跨平台桌面应用

skills-manage 是一款基于 Tauri v2 的跨平台桌面应用,用于在一个统一界面中管理 28+ 个 AI 编程代理(Coding Agent)平台的 Skills(技能/插件)。它由社区开发者志辉(@iamzhihuix)开发,于 2026 年 4 月 20 日发布首个公开版本 v0.8.0,采用 Apache 2.0 开源协议。该应用通过“中央技能库 + 符号链接分发”的机制,将 Skills 统一存放在 `~/.agents/skills/` 目录,并通过 symlink 链接到各平台目录,实现零副本、零同步延迟的管理。它内置 Skills 市场,支持从 GitHub 仓库一键导入,并提供 AI 自动解释功能以降低理解门槛。应用采用本地优先策略,所有数据存储在本地 SQLite 中,无需账号和云服务。当前预编译包仅支持 macOS,Windows/Linux 需从源码构建。

技能管理开源桌面应用
09.08
Voice-Pro README 配图
内容创作GitHub 项目

Voice-Pro

一站式 AI 语音工作台,从视频下载到多语言配音全流程自动化

Voice-Pro 是一款面向创作者和开发者的 AI 音频全流程处理工具,由韩国创业公司 ABUS 开发,基于 Gradio WebUI 构建。它将视频下载、音频分离、语音识别、多语言翻译、文本转语音(TTS)和零样本声音克隆集成到一个统一的 Web 界面中,定位为 ElevenLabs 的开源替代方案。核心价值在于将传统需要 5-8 个工具配合的流程(下载、分离、识别、翻译、配音、字幕)串联成一条自动化管道,用户只需输入视频链接,即可获得多语言配音视频和字幕。工具支持四种 Whisper 变体用于语音识别,三种零样本声音克隆引擎(F5-TTS、E2-TTS、CosyVoice),以及 Edge-TTS、kokoro 等多语言 TTS。完全开源免费,本地运行,数据不出机器。需要 NVIDIA GPU(最低 4GB 显存,推荐 8GB+),首次部署需下载模型,耗时较长。

开源声音克隆视频配音
09.08
opencli-rs README 配图
开发工具GitHub 项目

opencli-rs

用 Rust 重写的命令行信息获取工具,一条命令访问 55+ 网站并支持 AI 生成适配器

opencli-rs 是一款用纯 Rust 编写的命令行工具,旨在通过一条命令从 55+ 个网站获取结构化信息,覆盖 Twitter/X、Reddit、YouTube、HackerNews、Bilibili、知乎、小红书等主流平台,同时支持控制 Electron 桌面应用和集成本地 CLI 工具。它是基于 TypeScript 实现的 OpenCLI 的完整 Rust 重写版本,编译为 4.7MB 的单一静态二进制,零运行时依赖。其核心设计包括声明式 YAML Pipeline、编译时嵌入适配器、AI 原生适配器生成以及浏览器会话复用。工具内置 333+ 命令,支持 table/json/yaml/csv/markdown 等多种输出格式,并专为 AI Agent 设计了工具发现机制。项目采用 Apache-2.0 许可证,截至 2026 年 4 月开源不到两周,生态和文档仍在完善中。

开源浏览器桥接信息获取
09.08
Codex多智能体实战 README 配图
AI 智能体GitHub 项目

Codex多智能体实战

基于Git Worktree物理隔离与DAG调度的多智能体并行编程方案

Codex 是 OpenAI 于 2025 年开源的终端 AI 编程助手,其多智能体能力将编程任务拆解为有向无环图(DAG),由 Manager 调度多个 Subagent 在独立的 Git Worktree 中并行执行,通过 Harness 层统一管理上下文压缩、状态同步和执行环境隔离。该方案旨在解决多智能体并行时的 Token 消耗暴涨、上下文失控和状态无法收敛等痛点,强调控制成本、控制状态、控制依赖,而非追求最大并行度。核心机制包括 Manager 负责任务拆解、依赖分析和结果合并,Subagent 在独立工作区中执行具体编码任务,Harness 提供执行环境隔离、上下文自动压缩和状态同步。配置采用全局与项目级双层体系,支持 MCP 工具集成和自动化审批。报告指出并发数 4 左右是甜点区间,超过后 Token 消耗指数增长但收益递减。该方案适用于全栈应用并行开发、大型项目重构、多模块库开发等场景,但 Token 成本高、合并冲突风险和学习曲线陡峭等局限也需注意。

多智能体开源AI编程助手
09.08
Donchitos 的 GitHub 头像Donchitos/Claude-Code-Game-Studios
AI 智能体GitHub 项目

Claude Code Game Studios

将单个 Claude Code 会话改造为完整游戏开发工作室的开源模板仓库

Claude Code Game Studios(CCGS)是一个开源模板仓库,将单个 Claude Code 会话改造为一个完整的游戏开发工作室。它不是一个独立工具或引擎,而是一套运行在 Anthropic Claude Code CLI 环境之上的组织架构层,通过 49 个专业 AI Agent、72 个 Slash Command(Skill)、12 个自动化 Hook、11 条路径作用域规则和 39 个文档模板,模拟真实游戏工作室的层级分工与协作流程。CCGS 属于 AI 多 Agent 协作模板,不提供新的 AI 能力,而是把 Claude Code 已有的 Agent 机制组织成一套游戏开发专用的流程体系。其核心是三级 Agent 层级,对应真实工作室的组织架构,并采用用户驱动的五步协作协议。CCGS 支持 Godot 4、Unity、Unreal Engine 5 引擎,主要测试平台为 Windows 10 + Git Bash,兼容 macOS 和 Linux。

工作流模板游戏开发
09.08
ArcReel README 配图
内容创作GitHub 项目

ArcReel

AI Agent 驱动的开源小说视频生成工作台

ArcReel 是一个开源的 AI 视频生成工作台,由 AI Agent 全程驱动,能够将小说文本自动转化为完整的短视频。其完整工作流为:小说 → 角色/场景/道具设计 → 剧本 → 分镜图 → 视频片段 → 最终成片。它本身不训练模型,而是通过统一的抽象层集成 Google Gemini、火山方舟、xAI Grok、OpenAI 等多个 AI 供应商,用 Agent 智能体协调完成从文本到视频的端到端生产流程。项目采用 React 19、Python 3.12+ / FastAPI、Claude Agent SDK 等技术栈,支持 SQLite 与 PostgreSQL 数据库,可通过 Docker 一键部署。ArcReel 旨在解决 AI 视频生成中角色一致性、场景连贯性、分镜拆分、多供应商调度与任务编排等工程问题,将传统人工串联多个 AI 工具的制作流程,转变为 Agent 自动编排与人工确认相结合的标准化流水线。

多模态生成Agent编排AI视频生成
09.08
multica-ai 的 GitHub 头像multica-ai/andrej-karpathy-skills
开发工具GitHub 项目

andrej-karpathy-skills

用四条行为准则约束 AI 编码助手,减少过度工程化与越界修改

该项目是一个开源项目,由 multica-ai 维护,将 Andrej Karpathy 对 LLM 编码缺陷的观察总结为四个核心行为准则,封装在单个 CLAUDE.md 文件中,用于改善 Claude Code / Cursor 等 AI 编码助手的代码输出质量。它属于 AI 辅助编程质量保障体系,不是代码框架或 SDK,而是一份注入到 AI 编码助手上下文中的行为约束指令。项目核心要解决的问题是 LLM 在编写代码时存在的系统性缺陷,包括隐性假设、过度工程化、越界修改、目标模糊等,这些问题导致代码质量下降、维护成本上升。项目通过 Think Before Coding、Simplicity First、Surgical Changes、Goal-Driven Execution 四条准则,将 LLM 的多做倾向约束为做准、做少、做稳。安装方式极简,支持 Claude Code 插件、项目级 CLAUDE.md 和 Cursor 规则等多种方式。

开源行为约束AI编码助手
09.08
Hermes WebUI README 配图
AI 智能体GitHub 项目

Hermes WebUI

为 Hermes Agent 提供浏览器端图形界面的纯 UI 层,让会话、文件与工具调用可视化。

Hermes WebUI 是 Hermes Agent 的浏览器端图形界面,由 Nathan Esquena(@nesquena)开发并开源。它本身不运行 Agent,而是对接用户已有的 Hermes Agent 服务,所有数据仍存储在用户机器上。项目采用 Python 后端与原生 JS/CSS/HTML 前端,零框架、零构建步骤,通过 REST API 与 SSE 流式传输实现通信。它主要解决传统终端与聊天平台交互的痛点,包括会话不可追溯、文件操作割裂、Profile 管理原始、工具调用黑盒以及跨设备访问受限等问题。WebUI 提供三栏布局,左侧会话列表、中间聊天区域、右侧文件浏览器,并支持 CLI 会话桥接、Profile 热切换、工具调用卡片展示等功能。部署方式包括本地脚本启动、Docker 容器以及 macOS 原生客户端(Swift/WKWebView 封装)。项目为 MIT 开源,适合需要可视化管理 Hermes Agent 会话与工作区的用户。

零框架原生JavaScriptAI Agent
09.08
zxfccmm4 的 GitHub 头像zxfccmm4/Obsidian-OpenCode-Knowledge
知识管理GitHub 项目

Obsidian OpenCode Knowledge

本地优先的 AI 知识管理方案,通过规则驱动实现自动录入、查询与维护

Obsidian OpenCode Knowledge 是一套面向非技术用户的本地 AI 知识管理方案,由开源项目 zxfccmm4/Obsidian-OpenCode-Knowledge 提供。它结合 Obsidian 笔记软件、OpenCode 终端 AI 助手和预配置的知识库规则(AGENTS.md),通过一键部署模板,让用户在 5 分钟内拥有完全本地化、AI 驱动的个人知识库。项目主要解决信息录入成本高、知识库混乱、查询效率低、缺乏维护以及隐私担忧等问题。其核心设计包括三目录隔离(raw/wiki/assets)、四触发行为(Ingest/Query/Lint/Social Ingest)、社交媒体知识域分类、可配置的 AI_CONFIG.md 以及完全本地存储。系统支持多种 LLM 后端,并预装 9 个技能包,实现素材消化、社交媒体采集、知识库体检和自然语言查询等功能。

本地优先社交媒体采集知识管理
09.08
microsoft 的 GitHub 头像microsoft/markitdown
开发工具GitHub 项目

MarkItDown

微软开源的轻量级多格式文档转 Markdown 工具,为 LLM 与 RAG 管道提供结构化文本提取。

MarkItDown 是微软 AutoGen 团队开发并维护的开源 Python 工具,采用 MIT 协议,当前 GitHub 星标超过 105k,最新版本为 v0.1.5(2026 年 2 月发布)。它支持 PDF、Word、PowerPoint、Excel、图片、音频、HTML、EPUB 等 15 种以上文件格式,将其转换为结构化的 Markdown 文本。其核心设计目标是让 LLM 和文本分析工具能以最高效的方式“阅读”非文本文件,输出为机器可消费的结构化文本,而非人类可读的高保真转换。工具采用可插拔的 Converter 架构,每种格式对应独立转换器,核心库仅依赖 Python 标准库,其他功能通过可选依赖按需安装。v0.1.0 之后支持流式处理,不创建临时文件。基础转换不依赖 LLM,但可选用 LLM 增强图片描述与 OCR 功能。此外,项目提供 MCP 服务器,便于 AI 客户端直接调用。

开源文档转换LLM
09.08
Logo Generator Skill README 配图
AI 智能体GitHub 项目

Logo Generator Skill

一个为开发者生成可编辑 SVG Logo 与专业展示图的开源 AI Skill

Logo Generator 是由归藏(op7418/guizang.ai)开发的开源 AI Skill,用于生成专业级别的 SVG Logo 和图标,并自动创建高端展示图。它适用于 Claude Code、Gemini CLI 等 AI Agent 平台,项目托管在 GitHub,采用 MIT 协议。该工具主要解决小项目、开源项目或创业团队需要“够用的好 Logo”,但既请不起设计师、也用不好 AI 画图工具的痛点。其核心思路是“分阶段生成,先矢量后位图”:先由 AI 生成可编辑的 SVG 几何基础,再生成专业展示图。它内置设计模式库,包含点阵、线条系统、几何切割、负空间、括号/壳、六边形核心等范式,并提供 12 种静态背景风格和 6 种 WebGL 动态背景。整个流程约需 10-30 分钟,对话式交互,零设计基础也可使用。

开源设计模式库矢量图形
09.08
HyperFrames README Logoheygen-com/hyperframes
开发工具GitHub 项目

HyperFrames

用 HTML 写视频,为 AI Agent 而生的确定性渲染框架

HyperFrames 是由 HeyGen 开源的一个 HTML-to-Video 渲染框架,核心理念是“Write HTML. Render video. Built for agents.”。它允许用户用纯 HTML 文件定义视频内容,通过 data-* 属性控制时间轴、轨道和布局,然后通过 CLI 一键渲染成 MP4。该框架采用声明式数据模型、可插拔动画运行时和确定性逐帧渲染引擎,旨在解决 AI Agent 无法操作传统视频编辑工具的问题。它支持非交互式 CLI、Vercel Skills 规范,并提供 50+ 预制 Block。HyperFrames 使用 TypeScript 开发,开源协议为 Apache 2.0,最新版本为 v0.4.3。

AI AgentApache-2.0CLI
09.08