跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签41AI Agent33开源12Claude Code12Python10MCP6记忆系统5自动化5CLI5MIT5工作流4知识管理4ffmpeg4

项目搜索结果

找到 41 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

内容创作主题配图

AI短剧开源工作流

用LLM、文生图、文生视频与TTS串联成自动化流水线,实现从剧本到成片的批量短剧生产

AI短剧开源工作流是一类利用大语言模型(LLM)、AI图像生成、AI视频生成、TTS语音合成等技术,实现从剧本或小说文本到完整短剧视频全自动化生产的开源工具链。其核心思想是将影视生产的每个环节模型化,用LLM做编剧和导演、用文生图做美术、用文生视频做摄影、用TTS做配音,再通过Agent工作流将所有环节串联成一条自动化流水线。报告覆盖三个代表性开源项目:moyin-creator(魔因漫创)为桌面端生产级工具,深度绑定Seedance 2.0,采用6层身份锚点保证角色一致性;waoowaoo为Web端工业级AI影视平台,专攻网文转视频;huobao-drama(火宝短剧)为极简一站式平台,内置5个Mastra AI Agent,支持一句话生成完整短剧。这些项目覆盖了剧本解析、角色生成、场景生成、分镜制作、视频生成、配音合成、成片导出的核心链路,旨在将传统短剧3-6个月的生产周期压缩到数小时甚至数分钟。

工作流角色一致性开源
09.08
AI 智能体主题配图

Agentic Engineering

专业工程师用编码智能体放大自身能力的软件工程新范式

Agentic Engineering(智能体工程)是2025-2026年间快速兴起的软件工程新范式,核心定义来自Simon Willison:专业软件工程师使用编码智能体(Coding Agents)来放大自身专业能力的实践。该概念由Andrej Karpathy在2026年4月Sequoia Capital的AI Ascent大会上正式推向公众视野,并明确区分了Vibe Coding与Agentic Engineering:前者抬高所有人做软件的下限,后者要保住专业软件过去已有的质量门槛。它属于AI-Native软件工程范畴,横跨AI Agent技术栈、软件工程实践和人机协同设计三个领域。其出现源于三个力量:LLM能力质变、Agentic工具成熟、代码生产成本趋近于零。核心方法包括:人类编写规格(Spec)和测试,Agent生成代码,人类审查结果;测试被视为人类与Agent之间的通信协议。该范式强调代码是廉价的、理解是昂贵的,细节可以外包、结构不能外包。

第 1 页第 2 页
多智能体编排软件工程质量门控
09.08
内容创作主题配图

xiaohuai-video-translate

一套面向 AI 编程工具的视频翻译技能套件,将外语视频自动转为中文字幕视频和中文文稿。

xiaohuai-video-translate 是一套面向 AI 编程工具的视频翻译技能套件,由 xiaohuailabs(小灰)开发。它不是独立应用,而是由「脚本 + 说明书」组成的 AI Agent 技能,可被 Claude Code、OpenClaw、Gemini CLI、Codex 等工具加载和驱动。项目将下载、转写、翻译、润色、烧录等步骤编排为一条龙流水线,用户只需说一句话即可完成。转写使用本地 Whisper 引擎,不产生 API 费用;翻译复用已有的 AI 模型。项目包含三个独立技能:总指挥、字幕润色、下载专员,可单独或组合使用。支持中英双语字幕,通过 ASS 格式实现中文大、英文小的字号反差。全程本地运行,不上传数据,保护隐私。项目处于活跃状态,最新提交为 2026-06-08,采用 MIT 协议。

本地处理视频翻译字幕
09.08
Browser Harness README 配图
AI 智能体GitHub 项目

Browser Harness

一个让 LLM Agent 通过 Unix Socket 直连用户 Chrome 的自愈式浏览器控制框架

Browser Harness 是由 browser-use 团队开发的一个自愈式浏览器控制框架,总计约 592 行 Python 代码,直接基于 Chrome DevTools Protocol(CDP)构建。它让 LLM Agent 能够通过一个 Unix Socket 连接到用户已运行的 Chrome 浏览器,实现完全自由地完成任何浏览器任务。其核心定义是:最简单、最轻量的自愈式浏览器控制装置——Agent 在任务执行过程中发现缺少什么功能,就当场写出来补上,无需重启、无需框架更新。该项目旨在解决 LLM Agent 如何以最少的前置代码、最大的灵活性控制真实浏览器的问题。传统方案要么依赖重量级框架(如 Playwright、Selenium),要么把所有交互逻辑预先编码。Browser Harness 反其道而行,只提供一个极薄的 CDP 桥接层(daemon + helpers),剩下的能力由 Agent 在任务执行中即时编写。

浏览器自动化自愈式AI Agent
09.08
AI 智能体主题配图

逸尘开源Skills + 社区精选Skills

开源21个Claude Code/Codex Skills,覆盖微信数据解析、记忆系统与多模型协作

该收藏整理自X用户@genngdaJ(逸尘)的热门帖子,一次性开源了自用的8个Claude Code/Codex Skills,并推荐了多位社区大佬的优秀Skills。Skill是Claude Code/Codex的扩展能力模块,一段预先写好的指令(SKILL.md)加可选的脚本和Agent,让AI Agent获得特定领域的专业能力。帖子精选的8个Skills包括:全网搜索与归档、Agent记忆系统、微信本地数据解析、企业微信聊天解析、企业微信云端操作、公众号文章批量抓取、ChatGPT网页调研、X文章草稿上传。仓库实际包含21个Skills,涵盖视频转写、剪映对接、小红书/抖音采集、社交收藏导出等更多能力。核心设计原则是安全第一(只读+授权)、本地优先(数据不出Mac)、无副写(不自动发布/下载)、碰撞安全(不覆盖文件)。

安全设计本地优先多模型协作
09.08
yetone 的 GitHub 头像yetone/native-feel-skill
AI 智能体GitHub 项目

Native Feel Skill - 跨平台桌面应用原生体验架构

一套让 WebView 渲染的 UI 无法被用户分辨为原生应用的 AI Agent 技能包

Native Feel Skill 是一个 AI Agent 技能包,由开发者 yetone 创建,将 Raycast 2.0 的跨平台桌面应用架构经验提炼为可复用的结构化领域知识。它包含 8 条架构准则、四层架构方案(原生外壳 → 系统 WebView → Node 后端 → Rust 内核)、WebKit/WebView2 生存指南、75 项上线检查清单、IPC 契约设计指南、内存真相手册及 Raycast Beta 逆向证据。该技能包主要解决跨平台桌面开发中开发效率与原生性能不可兼得的问题,通过精确定义共享与原生边界,在 WebView 渲染表面画线,上方共享 React/TS 代码,下方使用原生 Swift/C#,让用户无法分辨是否为原生应用。安装到 Claude Code、Cursor 等兼容 AI Agent 后,讨论跨平台桌面应用架构时自动激活,提供架构建议、问题诊断和优化方案。

技能包架构跨平台桌面
09.08
TrendRadar README 配图
AI 智能体GitHub 项目

TrendRadar

AI 驱动的多平台热点聚合与智能推送工具

TrendRadar 是一款 AI 驱动的舆情监控与热点聚合工具,由开发者 sansan0 于 2025 年 4 月创建。项目定位为面向信息过载时代的一站式热点助手,核心能力包括一键聚合 35+ 平台实时热点(如抖音、B 站、知乎、微博、头条、财联社、华尔街见闻等),通过 AI 智能筛选、翻译和深度分析,生成趋势预测、情感洞察、跨平台关联等简报,并支持 10+ 智能推送渠道(企业微信、微信、飞书、钉钉、Telegram、邮件、Slack 等)。项目采用时间线智能调度,针对早高峰、晚上、周末等不同时段配置不同推送策略。技术栈包括 Python、GitHub Actions、GitHub Pages、Docker 和 MCP Server,开源协议为 GPL-3.0。项目支持 MCP 架构,可接入 AI Agent 生态,实现自然语言对话分析。

热点聚合信息推送舆情监控
09.08
Guizang PPT Skill README 配图
AI 智能体GitHub 项目

Guizang PPT Skill

将十年设计经验压缩为规则文件,让 AI 按杂志级排版生成单文件网页 PPT

Guizang PPT Skill(magazine-web-ppt)是由设计师歸藏(op7418)开源的一个 Claude Code / AI Agent Skill,用于生成单文件 HTML 横向翻页网页 PPT,视觉基调定位为“电子杂志 × 电子墨水”。它不是一个 PPT 编辑器,而是一套“人 × AI 协作做 PPT”的接口,把十年设计经验压缩成一个 SKILL.md 规则文件,让 AI 按照专业杂志排版规则自动生成网页幻灯片。项目发布于 2026-04-24,采用 MIT 协议,语言为 HTML 100%,拥有 396 Stars 和 60 Forks。核心工作流包括 6 问需求澄清、大纲与叙事弧规划、拷贝模板并选主题色、类名预检与主题节奏规划、挑选布局并填充内容、Checklist 自检。产物为单文件 index.html,浏览器直接打开,零依赖。

单文件应用开源杂志排版
09.08
AI 智能体主题配图

AI Agent 技能工具

面向 AI Agent 的影视解说自动化与互联网信息获取技能工具

本收藏条目涵盖两个面向 AI Agent 的技能工具:Narrator AI CLI Skill 与 Agent Reach。Narrator AI CLI Skill 是专为 AI Agent 设计的视频解说自动化技能文件,对应 CLI 客户端 narrator-ai-cli,封装了 Narrator AI 开放平台的完整 API,支持 Claude Code、OpenClaw、Windsurf 等主流 AI Agent 平台。其核心能力是用一句自然语言指令,自动完成从脚本生成到成片输出的全流程影视解说视频生产,内置 93 部电影素材库、146 首 BGM、63 种配音音色(覆盖 11 种语言)、90+ 解说模板,提供「改编解说」和「原创解说」两条工作路径。Agent Reach 是一个开源的 AI Agent 互联网能力脚手架,由 Panniantong 开发,作为一键安装器和配置管理器,将 15+ 个平台的内容读取能力(如 Twitter、Reddit、YouTube、B站、小红书、GitHub、微信公众号、抖音、LinkedIn、微博、V2EX、雪球、RSS 等)集成到任何 AI Agent 中,核心价值是零 API 费用、零配置门槛,所有底层工具均为开源免费的 CLI 工具,通过本地 Cookie 和抓取方式访问平台内容,数据只留在本地。

脚手架视频解说信息获取
09.08
Hermes Agent 记忆系统 README 配图
AI 智能体GitHub 项目

Hermes Agent 记忆系统

开源 AI Agent 框架 Hermes Agent 内置的多层记忆架构,以缓存优先和冷热分离为核心设计。

Hermes Agent 记忆系统是开源 AI Agent 框架 Hermes Agent(由 Nous Research 开发)内置的多层记忆架构,由四套协同工作的记忆子系统组成。第一层为固化提示词记忆,将高频关键信息存入 MEMORY.md 和 USER.md 文件,合计约 1,300 Token,会话期间固化不变。第二层为会话搜索回溯,历史对话存储在 SQLite 数据库中,通过 FTS5 全文搜索按需检索,并使用辅助模型进行摘要。第三层为技能系统,用于记住如何做事的程序记忆,技能文件存储在 ~/.hermes/skills/ 目录。第四层为可选的 Honcho 用户建模,用于跨会话、跨平台的深层用户画像。该系统的核心设计思想是缓存优先,保持系统提示词前缀稳定以最大化利用 Prompt Caching,同时采用冷热分离策略,只保存用户偏好、环境事实、错误修正、稳定规范和学到的技能五类高价值信息。

分层记忆缓存优化记忆系统
09.08
Hermes Agent 高阶工具配置 README 配图
AI 智能体GitHub 项目

Hermes Agent 高阶工具配置

一个整合终端操作、代码编辑、浏览器控制、记忆系统与语音交互的开源 AI Agent 框架。

Hermes Agent 是由 Nous Research 开发的开源 AI Agent 框架,定位为自我进化的个人 AI 助手。它整合终端操作、代码编辑、浏览器控制、记忆系统、语音交互于一体,通过 Skill 系统实现无限扩展能力。其核心差异在于内置学习循环,能从经验中创建和改进 Skill,并跨会话构建对用户的深度理解。 该框架采用 CLI 与 GUI 双形态,支持 MCP 协议,不绑定单一 LLM,可灵活切换模型提供商,并支持跨平台部署。其能力分为身份与记忆、感知、表达、效率与成本、生态扩展五大层。记忆系统包含会话内、跨会话和知识图谱三层架构。感知能力涵盖网页抓取、搜索、浏览器自动化等。表达层支持语音合成、语音识别和图片生成。效率层提供 Token 监控、压缩和智能路由工具。生态方面拥有 380+ 社区 Skill。 报告指出其优点包括全能性、丰富的 Skill 生态、强大的记忆系统和零成本可行性,但也存在学习曲线陡、生态碎片化、文档不完善等缺点。

多模型路由记忆系统开源
09.08
apify 的 GitHub 头像apify/awesome-skills
AI 智能体GitHub 项目

Apify Awesome Skills

为 AI 编程助手提供网页抓取与业务自动化能力的社区驱动 Skills 合集

Apify Awesome Skills 是 Apify 官方维护的社区驱动 AI Agent Skills 合集,为 Claude Code、Cursor、Codex、Gemini CLI 等 AI 编程助手提供网页抓取、数据提取和业务自动化的预置能力。它不是独立运行的软件,而是一套以 Markdown(SKILL.md)为载体的指令包与工具编排规则,安装后 Agent 可通过自然语言指挥 Apify 云端的爬虫 Actors 执行数据采集任务。项目包含受众分析、品牌监控、竞品情报、内容分析、电商数据、KOL 发现、线索生成、市场调研、趋势分析等九个垂直领域 Skills,覆盖 Google Maps、Instagram、TikTok、Amazon 等主流平台。其核心设计原则包括声明式触发、云端执行零本地依赖、领域垂直化、多 Agent 兼容、按结果付费和社区共建。项目采用 Apache-2.0 开源协议,主要语言为 JavaScript(91%)和 Python(9%),前置条件包括 Apify 账号、API Token 和 Node.js 20.6+。

数据提取网页抓取业务自动化
09.08
AI 智能体主题配图

飞书 CLI + AI 构建 Jira 级任务管理系统

用一句话在飞书里搭建 Jira 级任务管理系统

本项目介绍了一套利用飞书官方 CLI 工具(lark-cli)配合 AI 编程助手(如 Claude Code、Codex),通过自然语言 Prompt 在飞书多维表格(Bitable)中自动生成任务管理系统的方法。该系统包含字段设计、公式计算、自动化工作流、看板视图和数据仪表盘,旨在让小团队和个人开发者以零代码、零 UI 操作的方式,获得与 Jira 对标的任务管理能力,并直接嵌入已有的飞书工作环境。报告指出,该方案解决了传统任务管理工具录入摩擦高、工具选择困难、字段膨胀、自动化配置繁琐、平台割裂以及小团队缺乏基础设施等痛点。其核心思想是降低录入摩擦、将 AI 作为配置器,并采用 Agent-Native 三层架构。系统包含 11 个实际使用的字段和 3 条自动化工作流,支持通过自然语言进行日常任务录入和提醒。报告也指出了该方案的局限性,例如绑定飞书生态、不支持复杂工作流、依赖 AI 工具等。

低代码飞书任务管理
09.08
AI 智能体主题配图

CUA Computer-Use Agents

开源全平台 AI 桌面操控基础设施,沙盒隔离、后台驱动、模型无关

CUA(Computer-Use Agents)是由 trycua 组织开发的开源基础设施项目,为 AI Agent 提供「像人一样操控电脑」的完整能力栈,覆盖 macOS、Linux、Windows、Android 全平台。项目提供沙盒环境、Agent SDK、桌面驱动、基准测试和虚拟化工具,核心组件包括 Cua Driver(macOS 后台桌面驱动)、Cua Sandbox(跨 OS 沙盒环境)、CuaBot(多 Agent 协作沙盒 CLI)、Cua-Bench(基准测试与 RL 环境)、Lume(Apple Silicon 虚拟化管理)和 Lumier(Docker 兼容接口)。CUA 的设计强调沙盒优先、一个 API 覆盖所有平台、后台驱动不抢光标、模型无关、云加本地双模式以及内置可观测性。它通过统一的 Sandbox API 抽象了 Docker、QEMU、Apple Virtualization.Framework 等底层虚拟化技术,并支持 Claude、GPT、Gemini、Qwen 等主流视觉语言模型。项目采用 MIT 许可证,本地使用免费,云沙盒提供免费额度和按量付费选项。

跨平台沙盒虚拟化
09.08
Narrator AI CLI Skill README 配图
AI 智能体GitHub 项目

Narrator AI CLI Skill

让 AI Agent 通过自然语言对话自动完成电影解说视频全流程生产的技能描述文件

Narrator AI CLI Skill 是一个 AI Agent 技能描述文件,教会 AI Agent(如 OpenClaw、Claude Code、Cursor、Windsurf 等)如何调用 narrator-ai-cli 命令行工具,完成电影/短剧解说视频的全自动化生产。它解决的核心问题是让不懂视频剪辑、命令行和 API 调用的普通用户,通过自然语言对话就能完成从搜片、选模板、选 BGM、选配音、生成文案到合成视频的完整流水线。项目采用 SKILL.md 主文件加 references/ 子目录的结构化行为规范,将 CLI 的调用顺序、参数依赖、错误处理和决策逻辑编码为机器可读的说明书,并定义了 Fast Path(原创文案)和 Standard Path(二创文案)两条工作流路径。内置约 100 部电影素材、146 首 BGM、63 个配音音色(11 种语言)和 90+ 解说模板,支持多语种出海场景。项目采用积分计费模式,MIT 开源协议,版本 v1.0.5,已在 9 个 AI Agent 平台验证。

多语种视频生成自动化
09.08
AI 智能体主题配图

HTML作为Agent输出格式(The Unreasonable Effectiveness of HTML)

让 Agent 用 HTML 而非 Markdown 向人类传达复杂信息,以可视化与交互让人重新进入决策循环。

本文档基于 2026 年 5 月 8 日 Anthropic Claude Code 团队成员 Thariq Shihipar 发表的长文《Using Claude Code: The Unreasonable Effectiveness of HTML》整理而成。其核心主张是,当 AI Agent 需要向人类传达复杂信息时,HTML 应取代 Markdown 成为首选输出格式。文章指出 Markdown 存在信息密度不足、可读性差、分享困难、无法交互、编辑范式转移以及人与 Agent 的 Loop 断裂等六大痛点。HTML 则凭借其高表达力、视觉可读性、零摩擦分享、双向交互、数据摄取优势及情感连接等特性,成为更优的 Agent 输出格式。该方法论强调自包含的 HTML 文件、导出闭环以及让人类重新参与 Agent 决策过程。文章还对比了 HTML 与 Markdown、Claude.ai Artifacts 及 Notion/飞书文档的差异,并提供了九大输出场景、Prompt 模板、工程落地技巧及优缺点分析。

工程方法论交互设计输出格式
09.08
Hermes Agent README 配图
AI 智能体GitHub 项目

Hermes Agent

一个自带学习闭环的开源 AI Agent 运行时

Hermes Agent 是由 Nous Research 开发的开源 AI Agent 框架,定位为通用的、可自我改进的 AI Agent 平台。它通过终端 TUI 或 15+ 消息平台与用户对话,调用 47+ 内置工具操作终端、浏览器、文件系统等,并支持通过 MCP 协议扩展能力。其核心特色是闭环学习系统:通过持久化记忆(MEMORY.md + USER.md)、技能(Skills)自创建与改进、以及会话搜索(FTS5),从经验中持续成长。它支持 18+ LLM 提供商,可随时切换模型,避免供应商锁定。此外,它提供六种终端后端(本地、Docker、SSH 等)和内置 Cron 调度器,适用于开发助手、运维监控、知识管理等场景。

多平台记忆系统开源
09.08