跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签32Python11AI Agent9开源6CLI5图像生成3自动化3Claude Code3FastAPI3Go3MIT3React3本地部署2

项目搜索结果

找到 32 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

Voicebox README 配图
内容创作GitHub 项目

Voicebox

本地优先的开源语音合成工作站,集成多引擎声音克隆、情感标签、后处理音效与多轨编辑

Voicebox 是由 Jamie Pine 开发的开源语音合成工作室,定位为 ElevenLabs 的免费本地替代方案。它是一个完整的桌面应用,集声音克隆、语音生成、后处理特效、多轨编辑于一体,所有模型和数据完全在本地运行。项目采用 Tauri (Rust) 桌面框架,前端使用 React + TypeScript,后端为 Python (FastAPI),音效处理由 Spotify pedalboard 驱动。内置 5 个 TTS 引擎,支持 23 种语言,最大文本长度 50,000 字符,并提供完整 REST API 供外部集成。核心能力包括多引擎声音克隆、情感表达控制(如 [laugh]、[sigh] 等副语言学标签)、8 种后处理音效、多轨时间轴编辑(Stories Editor)以及长文本自动分段与交叉淡入淡出拼接。项目采用 MIT 协议完全开源,支持 CUDA、ROCm、MLX、DirectML、XPU 及 CPU 等多种 GPU 后端。

本地优先声音克隆FastAPI
09.08
CLIProxyAPI 本地反代大模型 API 网关 README 配图
开发工具GitHub 项目

CLIProxyAPI 本地反代大模型 API 网关

将已授权的 AI CLI 账号统一转换为 OpenAI 兼容 API 的本地网关

CLIProxyAPI 是一个用 Go 编写的轻量级 AI 代理网关,由 router-for-me 团队开源维护,采用 MIT 协议。它能够将用户已登录授权的各种 AI CLI 工具(如 Gemini CLI、ChatGPT Codex CLI、Claude Code CLI)包装成一个统一的 OpenAI 兼容 API 接口,默认暴露在本机 localhost:8317 上。该工具解决了 AI 服务格式不统一、CLI 能力无法被代码调用、多账号管理混乱、安全暴露风险等问题。其核心设计思想包括:将 CLI 授权能力网关化、以 OpenAI 格式为标准、双层隔离架构、多账号轮询实现负载均衡、默认本机监听保障安全。CLIProxyAPI 支持流式/非流式响应、函数调用、多模态等功能,并支持多账户轮询负载均衡。它适用于本地 Agent 开发调试、多账号额度聚合、统一接入多个 AI 模型、IDE 编码助手后端等场景。但需注意,它主要代理 Chat 能力,不支持 Embeddings、Fine-tuning 等完整 API 特性,且依赖 CLI 授权,存在服务条款风险和稳定性问题。

第 1 页第 2 页
本地部署多账号轮询协议翻译
09.08
内容创作主题配图

GPT-image2 社区提示词合集

社区实战验证的 GPT-image2 提示词速查手册

本合集基于社区创作者在 X 平台发布的「GPT-image2 最强玩法合集」,系统整理了 15 类经过社区实测的提示词场景,涵盖日历设计、代码海报、Logo 生成、书法复制、试卷生成、架构图绘制、UI 仿真、直播切片、MV 制作等。报告指出,GPT-image2 的核心突破在于原生文字渲染(中英日韩)和 UI 截图级逼真度,用户只需一句话中文提示词即可出图,无需学习复杂参数。合集还介绍了 URL 输入、多轮对话迭代、跨工具联动(如与 Seedance2 配合生成视频)等能力。报告同时说明,该文档是《GPT-image2 深度技术指南》的实战补充篇,侧重社区玩法而非模型原理与 API 工程。

内容管线提示词图像生成
09.08
开发工具主题配图

Mintlify

AI 原生的现代化文档平台,以 Docs-as-Code 理念简化文档创建与维护

Mintlify 是一个现代化的 AI 原生文档平台,帮助工程团队创建、管理和发布美观的文档站点。它采用 Docs-as-Code(文档即代码)理念,用 MDX(Markdown + JSX)编写内容,通过 Git 管理版本,自动构建部署。平台提供内容创作、结构组织、API 文档、AI 原生、部署托管和优化分析等核心能力。它解决了传统文档方案搭建成本高、API 文档难做、内容维护难、缺乏 AI 能力、发现性差等痛点。Mintlify 的流程是连接 GitHub、写 MDX、自动部署、AI 辅助维护,周期短且后续几乎零运维。其设计原则包括 Docs-as-Code、约定优于配置、AI 原生、托管平台和 MDX 超级 Markdown。平台支持 OpenAPI 3.0/3.1 自动生成 API 文档和交互式 Playground,内置 AI Assistant 问答和 AI Agent 自动维护,并提供 MCP Server 集成。

文档平台自动部署AI 原生
09.08
内容创作主题配图

GPT IMAGE2 角色设计卡 Prompt 工程

从单张角色图自动生成官方设定级角色设计卡的 Prompt 工程方法

本收藏聚焦于 GPT IMAGE2(gpt-image-1.5)在角色设计卡(Character Sheet)场景下的 Prompt 工程方法论。核心能力是从单张角色图片自动生成包含三视图、表情变化、装备分解、色板和世界观设定的专业级角色设定图。传统制作需资深设计师 1-3 个工作日,而该方法可在约 10 秒内完成,成本约 $0.05-0.10/张。其原理基于 VQ Token 与 Text Token 的统一空间,使模型能同时理解图像与文字指令,保持多视图一致性并自动推理世界观。标准 Prompt 包含锚定指令、质量锚词、结构要求和风格约束。实际使用通常需要 1-3 轮迭代优化,中/日/英三种语言 Prompt 均有效。该方法适用于游戏角色概念设计、漫画设定集、VTuber 形象、TRPG 角色卡及 IP 授权资料等场景,但存在细节可能出错、文字渲染有限、风格依赖原图等局限。

多视图生成角色设计色板提取
09.08
val1813 的 GitHub 头像val1813/kwcode
AI 智能体GitHub 项目

KWCode天工开物

为本地小模型优化的确定性流水线 Coding Agent CLI 工具

KWCode(天工开物)是一个专为本地开源模型优化的 Coding Agent CLI 工具,由中国开发者 val1813(ValHuang)开发,MIT 协议开源。其核心定位是让 8B-30B 参数的小模型也能完成编程任务,数据不出网。 KWCode 采用确定性专家流水线架构,LLM 只负责任务分类和代码生成,文件定位、验证、调试等环节由确定性代码完成。内置 5 个确定性工具,支持 BM25+AST 调用图定位、三阶段重试、Debug Subagent 运行时调试、DAG 多任务编排、专家飞轮自动积累经验等功能。 项目支持 Windows/macOS/Linux 平台,Windows 原生运行,无需 WSL2。系统要求 Python 3.10+,支持任意 OpenAI 兼容 API。当前处于 MVP 阶段,AST 引擎主要支持 Python,社区规模较小。

本地模型开源确定性流水线
09.08
AI 智能体主题配图

GPT Image 2 自动化生图套利实战

基于 GPT Image 2 与 MaxHermes 的自动化生图套利方法体系

本收藏记录了一套基于 OpenAI GPT Image 2 图像生成能力与 AI Agent(MaxHermes)自动化编排的商业化变现方法体系。核心思路是利用 GPT Image 2 的高质量生图能力,结合 MaxHermes 的自动化任务编排,将原本需要人工完成的生图任务变成 7×24 小时自动运行的流程。报告指出,该方法体系解决了“知道能赚钱但没时间做”的痛点,并提供了从低到高的六种变现路径,包括老照片修复、教育素材资料包、电商商品图、社媒起号、倒卖 API 和接单赚钱。报告还介绍了四层技术架构,包括图像生成能力、提示词工程、AI Agent 自动化编排和远程控制层,并说明了自进化 Skill、定时任务和微信控制等核心机制。报告同时指出了该方法的局限,如窗口期短、平台依赖、竞争加剧、质量不稳定和客户获取难等。

定时任务提示词工程图像生成
09.08
ArcReel README 配图
内容创作GitHub 项目

ArcReel

AI Agent 驱动的开源小说视频生成工作台

ArcReel 是一个开源的 AI 视频生成工作台,由 AI Agent 全程驱动,能够将小说文本自动转化为完整的短视频。其完整工作流为:小说 → 角色/场景/道具设计 → 剧本 → 分镜图 → 视频片段 → 最终成片。它本身不训练模型,而是通过统一的抽象层集成 Google Gemini、火山方舟、xAI Grok、OpenAI 等多个 AI 供应商,用 Agent 智能体协调完成从文本到视频的端到端生产流程。项目采用 React 19、Python 3.12+ / FastAPI、Claude Agent SDK 等技术栈,支持 SQLite 与 PostgreSQL 数据库,可通过 Docker 一键部署。ArcReel 旨在解决 AI 视频生成中角色一致性、场景连贯性、分镜拆分、多供应商调度与任务编排等工程问题,将传统人工串联多个 AI 工具的制作流程,转变为 Agent 自动编排与人工确认相结合的标准化流水线。

多模态生成Agent编排AI视频生成
09.08
AI 智能体主题配图

Xiaomi MiMo 大模型

小米自研的 Agent 基础模型,面向“完成任务”而非“回答问题”设计

Xiaomi MiMo(Mind in Motion)是小米集团自研的大语言模型产品线,面向 Agent 时代设计,覆盖文本生成、全模态理解、语音合成三大能力域。它被定位为一套完整的智能体基础模型体系,设计目标是“完成任务”而非仅仅是“回答问题”。MiMo 解决的核心问题是让 AI 从“能对话”进化到“能干活”,能够稳定完成近千轮工具调用的长程任务,自主诊断和恢复错误,并同时处理文本、图像、音频、视频等多种模态信息。截至 2026 年 4 月,MiMo 系列已迭代至 V2.5 版本,包含旗舰推理模型 MiMo-V2.5-Pro、全模态 Agent 模型 MiMo-V2.5、语音合成模型 MiMo-V2.5-TTS、语音识别模型 MiMo-V2.5-ASR 以及轻量快速模型 MiMo-V2-Flash。其核心架构创新包括混合注意力机制和全模态统一架构,并强调 Token 效率优化。

1M上下文大语言模型混合注意力
09.08
Hermes WebUI README 配图
AI 智能体GitHub 项目

Hermes WebUI

为 Hermes Agent 提供浏览器端图形界面的纯 UI 层,让会话、文件与工具调用可视化。

Hermes WebUI 是 Hermes Agent 的浏览器端图形界面,由 Nathan Esquena(@nesquena)开发并开源。它本身不运行 Agent,而是对接用户已有的 Hermes Agent 服务,所有数据仍存储在用户机器上。项目采用 Python 后端与原生 JS/CSS/HTML 前端,零框架、零构建步骤,通过 REST API 与 SSE 流式传输实现通信。它主要解决传统终端与聊天平台交互的痛点,包括会话不可追溯、文件操作割裂、Profile 管理原始、工具调用黑盒以及跨设备访问受限等问题。WebUI 提供三栏布局,左侧会话列表、中间聊天区域、右侧文件浏览器,并支持 CLI 会话桥接、Profile 热切换、工具调用卡片展示等功能。部署方式包括本地脚本启动、Docker 容器以及 macOS 原生客户端(Swift/WKWebView 封装)。项目为 MIT 开源,适合需要可视化管理 Hermes Agent 会话与工作区的用户。

零框架原生JavaScriptAI Agent
09.08
Logo Generator Skill README 配图
AI 智能体GitHub 项目

Logo Generator Skill

一个为开发者生成可编辑 SVG Logo 与专业展示图的开源 AI Skill

Logo Generator 是由归藏(op7418/guizang.ai)开发的开源 AI Skill,用于生成专业级别的 SVG Logo 和图标,并自动创建高端展示图。它适用于 Claude Code、Gemini CLI 等 AI Agent 平台,项目托管在 GitHub,采用 MIT 协议。该工具主要解决小项目、开源项目或创业团队需要“够用的好 Logo”,但既请不起设计师、也用不好 AI 画图工具的痛点。其核心思路是“分阶段生成,先矢量后位图”:先由 AI 生成可编辑的 SVG 几何基础,再生成专业展示图。它内置设计模式库,包含点阵、线条系统、几何切割、负空间、括号/壳、六边形核心等范式,并提供 12 种静态背景风格和 6 种 WebGL 动态背景。整个流程约需 10-30 分钟,对话式交互,零设计基础也可使用。

开源设计模式库矢量图形
09.08
CosyVoice README 配图
内容创作GitHub 项目

CosyVoice

多语种语音生成模型,支持3秒声音克隆与流式合成

CosyVoice 是阿里巴巴达摩院 FunAudioLLM 团队开发的多语种大语音生成模型,提供推理、训练和部署的全栈能力。其核心能力包括仅需 3 秒参考音频即可实现零样本声音克隆,覆盖 9 种常见语言和 18 种以上中文方言,并支持跨语种克隆。模型采用 LLM 生成语义 Token 与 Flow Matching 渲染声波的双阶段架构,CosyVoice 2.0 起支持双向流式合成,延迟低至 150ms。CosyVoice 3.0 引入多任务 Tokenizer 和可微分奖励模型后训练,训练数据扩展至 100 万小时。项目采用 Apache-2.0 许可证,支持本地部署,提供 Docker、FastAPI、gRPC、vLLM、TensorRT-LLM 等多种部署方式。

多语种流式合成深度学习
09.08
AI 智能体主题配图

B.AI

为 AI Agent 提供身份、支付与技能的全景金融基础设施平台

B.AI 定位为 AI Agent 经济时代的基础设施层,于 2026 年 4 月 10 日正式上线。其核心产品包括 LLM Service、x402 协议、8004 协议、Skills 与 BAIclaw 桌面终端。LLM Service 聚合 GPT、Claude、Gemini、DeepSeek 等 15+ 模型,提供统一 OpenAI 兼容 API 与智能路由;x402 协议基于 HTTP 402 标准实现「响应前付费」的自动链上支付;8004 协议为每个 Agent 铸造链上身份并记录信用档案;Skills 将 DeFi 交易、支付、数据分析等操作封装为标准化模块;BAIclaw 提供开箱即用的桌面级 Agent 客户端。平台支持 TRON、BNB Chain、Ethereum 三条公链,支持 Web3 钱包匿名登录,无需 KYC。报告同时指出其生态处于早期,存在加密货币门槛、合规风险、仅支持 macOS 桌面端等局限。

多模型路由金融基础设施区块链
09.08
内容创作主题配图

GPT-image2(OpenAI 图像生成模型)

OpenAI 第二代原生图像生成模型,以 Transformer 端到端架构实现印刷级文字渲染与 UI 仿真。

GPT-image2 是 OpenAI 推出的第二代原生图像生成模型,模型 ID 为 gpt-image-1.5,属于 GPT 多模态模型家族中专门负责图像输出的成员。与 DALL·E 系列不同,它不是独立的扩散模型,而是直接嵌入在 GPT 推理架构中的图像生成能力,用同一个 Transformer 做文本理解和图像输出。该模型解决的核心问题是让 AI 生成的图片不再“一眼假”,在文字渲染、UI 仿真、细节精度、多语言支持等方面实现了跨越式提升。其核心优势包括:文字渲染达到印刷级精度,能精确模拟 App 界面、网页截图、后台管理面板,支持中文等多语言原生理解,并支持对话式迭代修改。模型通过 Responses API 和 Chat Completions API 接入,适合海报、UI 截图、试卷、书法、架构图等精确性场景。其局限包括成本较高(标准输入每张 8 美元)、生成速度较慢、审美需精细 Prompt 控制、无本地部署选项。

多模态图像生成文字渲染
09.08
开发工具主题配图

Ghostty终端配置与CLI工具链

一套从 iTerm2 + oh-my-zsh 迁移到轻量化现代终端方案的完整实践

这是一套从 iTerm2 + oh-my-zsh 迁移到轻量化现代终端方案的完整实践,由三层组成:Ghostty(Zig 语言编写的 GPU 加速终端模拟器)、Starship(Rust 编写的跨平台提示符工具)、zsh 插件与现代 CLI 工具。方案核心目标是更轻量、更快、更简洁,去掉不需要的 300 个 oh-my-zsh 插件和 iTerm2 的臃肿 GUI,只保留日常真正用到的 3 个 zsh 插件和 5 个现代 CLI 工具。Ghostty 使用 Metal API 进行 GPU 渲染,文本渲染速度比 iTerm2 快约 4 倍,配置保存即生效。Starship 采用模块化渲染引擎,每个模块独立计算、独立配色。三个 zsh 插件(autosuggestions、syntax-highlighting、completions)替代整个 oh-my-zsh 框架。五个现代 CLI 工具(fzf、zoxide、eza、bat、yazi)全面替代传统 Unix 命令。方案支持一键安装,配置全部开源,可纳入 dotfiles 版本管理。

终端模拟器CLI工具Ghostty
09.08
minimind README 配图
其他项目GitHub 项目

minimind

从零开始用 PyTorch 原生实现并训练 GPT 风格语言模型的开源项目

MiniMind 是一个开源项目,目标是从绝对零开始训练一个 GPT 风格的语言模型。项目没有使用任何第三方框架的高级抽象,所有核心算法代码均使用 PyTorch 原生实现,开发者可以逐行阅读、理解、修改每一处计算逻辑。项目覆盖了从预训练、SFT 到 DPO 的完整训练链路,并支持推理、多模态、工具调用等能力。其最小模型为 26M 参数,最低硬件要求为单张 NVIDIA 3090,最短训练时间约 2 小时。项目强调“大道至简”的理念,不追求 SOTA,而是追求“最小可理解”,旨在帮助开发者理解 LLM 的每个组件如何工作。同时,项目兼容 llama.cpp、vllm、ollama 等推理部署方案,并兼容 OpenAI API,可接入 FastGPT、Open-WebUI。

预训练DPOLLM
09.08
CloakHQ 的 GitHub 头像CloakHQ/CloakBrowser
开发工具GitHub 项目

CloakBrowser

源码级修改 Chromium 指纹的反检测浏览器自动化工具

CloakBrowser 是一个基于 Chromium 的隐身浏览器自动化工具,其核心思路是在 Chromium 的 C++ 源码层面修改浏览器指纹,编译出定制二进制文件,使反爬虫/反机器人系统无法识别其为自动化浏览器。它属于反检测浏览器自动化领域,介于传统浏览器自动化和商业反检测浏览器之间,提供与 Playwright/Puppeteer 完全兼容的 Python 和 JavaScript API。项目通过修改 49–57 处 C++ 源码,覆盖 Canvas、WebGL、Audio、字体、GPU、屏幕、WebRTC、网络计时、自动化标志、CDP、硬件参数、UA 等多个指纹维度,并采用种子驱动的确定性指纹生成系统,确保指纹内部一致性。同时提供 humanize 行为模拟,通过拦截页面方法调用,将鼠标移动、键盘输入、滚动等交互替换为人类模拟版本。定制 Chromium 二进制在 TLS 层面也与正常 Chrome 一致。项目支持 HTTP/SOCKS5 代理、持久化 Profile、Docker 部署及 AWS Lambda 部署。

反检测浏览器开源C++
09.08
AI 智能体主题配图

Agentic Engineering

专业工程师用编码智能体放大自身能力的软件工程新范式

Agentic Engineering(智能体工程)是2025-2026年间快速兴起的软件工程新范式,核心定义来自Simon Willison:专业软件工程师使用编码智能体(Coding Agents)来放大自身专业能力的实践。该概念由Andrej Karpathy在2026年4月Sequoia Capital的AI Ascent大会上正式推向公众视野,并明确区分了Vibe Coding与Agentic Engineering:前者抬高所有人做软件的下限,后者要保住专业软件过去已有的质量门槛。它属于AI-Native软件工程范畴,横跨AI Agent技术栈、软件工程实践和人机协同设计三个领域。其出现源于三个力量:LLM能力质变、Agentic工具成熟、代码生产成本趋近于零。核心方法包括:人类编写规格(Spec)和测试,Agent生成代码,人类审查结果;测试被视为人类与Agent之间的通信协议。该范式强调代码是廉价的、理解是昂贵的,细节可以外包、结构不能外包。

多智能体编排软件工程质量门控
09.08
内容创作主题配图

xiaohuai-video-translate

一套面向 AI 编程工具的视频翻译技能套件,将外语视频自动转为中文字幕视频和中文文稿。

xiaohuai-video-translate 是一套面向 AI 编程工具的视频翻译技能套件,由 xiaohuailabs(小灰)开发。它不是独立应用,而是由「脚本 + 说明书」组成的 AI Agent 技能,可被 Claude Code、OpenClaw、Gemini CLI、Codex 等工具加载和驱动。项目将下载、转写、翻译、润色、烧录等步骤编排为一条龙流水线,用户只需说一句话即可完成。转写使用本地 Whisper 引擎,不产生 API 费用;翻译复用已有的 AI 模型。项目包含三个独立技能:总指挥、字幕润色、下载专员,可单独或组合使用。支持中英双语字幕,通过 ASS 格式实现中文大、英文小的字号反差。全程本地运行,不上传数据,保护隐私。项目处于活跃状态,最新提交为 2026-06-08,采用 MIT 协议。

本地处理视频翻译字幕
09.08
fireworks-tech-graph README 配图
开发工具GitHub 项目

fireworks-tech-graph

用自然语言描述系统,几秒钟生成可嵌入文档的 SVG+PNG 技术图表

Fireworks Tech Graph 是一个专为 Claude Code 设计的开源 Skill,能够将自然语言描述直接转换为生产级质量的 SVG + PNG 技术图表。它支持 8 种图表类型、5 种视觉风格,并内置了深厚的 AI/Agent 领域知识(RAG、Agentic Search、Mem0、Multi-Agent、Tool Call 等)。核心解决的问题是让开发者和技术写作者不用学习任何图表 DSL(如 Mermaid 语法、PlantUML、Graphviz DOT),也不用打开 draw.io 等可视化编辑器,只需要用自然语言描述系统,就能获得出版级的技术图表。它本质上是一套注入到 Claude Code 中的专业绘图知识和规则体系,包含 9 步固定工作流、语义形状系统、语义箭头系统、5 套完整的视觉设计系统、40+ 产品图标库以及 AI/Agent 领域的 7+ 内置架构模式。输出为可编辑的 SVG 文件和 1920px 高清 PNG 文件,完全离线使用,不依赖外部 API 或 CDN。

技术图表开源自然语言生成
09.08
伯乐 Skill / ai-news-radar README 配图
AI 智能体GitHub 项目

伯乐 Skill / ai-news-radar

AI 信息源智能筛选系统,先判断再接入

伯乐 Skill(Scout Skill)是基于开源项目 ai-news-radar 构建的 AI 信息源智能筛选与新闻雷达系统,由 LearnPrompt 创始人卡尔的AI沃茨开发,2026 年 5 月发布 v0.4.0。其核心定位不是又一个新闻聚合站,而是帮助用户从一堆信源里选出千里马的 AI 信息源筛选系统。它解决 AI 从业者追踪行业动态时的信息淹没、原始来源丢失、接入方式差异大、个性化需求无法满足、缺乏健康评估机制以及 Agent 自动化维护门槛高等痛点。核心设计思想是“先判断,再接入”,在信息源层面做第一轮判断,区分一手源与聚合源,并尊重每个源的原生接入方式。系统支持九类信源,内置 22 个默认信息源,通过六阶段 Pipeline 完成信源分类、抓取、去重、过滤、健康统计和静态站点生成。核心流程不依赖大模型 API,也不需要服务器,运行在 GitHub Actions 和 GitHub Pages 上,每 30 分钟自动更新。

静态站点生成开源信息源评估
09.08
AI-CanvasPro README 配图
内容创作GitHub 项目

AI-CanvasPro

基于节点的 AI 多模态画布编辑器,通过可视化连线编排文本、图像、视频与音频生成

AI-CanvasPro 是一款基于节点的 AI 多模态画布编辑器,由独立开发者阿硕(ashuoAI)打造,采用纯原生 HTML/CSS/JS 前端与 Python 后端,支持 Windows、macOS 与 Web 平台。它通过无限画布上的可视化节点连线,让用户组合文本、图像、视频、音频等 AI 能力,实现多模态内容的一站式创作。项目定位为 ComfyUI 的“轻量中文替代”,中文原生支持,无需本地 GPU,通过 API 调用即梦、RunningHub、PPIO、GRSAI 及 OpenAI 兼容接口等云端模型。核心机制包括连线数据流、@引用跨节点嵌入、多供应商适配、资产与工作流复用,以及遮罩重绘、抠图、高清放大等图像编辑工具链。项目采用 Source Available 许可证,禁止商业使用。

本地部署画布编辑器节点式工作流
09.08
AI 智能体主题配图

Claude Code 源码深度分析

深入解析 Claude Code 的工程体系:从动态提示词编排到工具治理与多 Agent 协作

本报告基于对 Claude Code 源码的深度分析,揭示了其作为 AI 编程助手的核心工程体系。报告指出,Claude Code 的价值不仅在于提示词,更在于一整套将行为制度、工具治理、Agent 分工、上下文经济学和生命周期管理连成闭环的系统。其动态 System Prompt 编排将静态“宪法”与动态“当期政策”分离,并通过缓存友好边界优化成本。工具调用经过完整的治理流水线,包括输入校验、权限检查、风险预判和 Hook 拦截。系统内置多个专职子 Agent,如 Explore、Plan、Verification,实现角色分离,避免利益冲突。此外,报告还介绍了 Skill、Plugin、MCP 三套扩展机制,以及上下文经济学中的缓存复用、按需加载等策略。报告也指出了其学习曲线陡峭、成本较高、依赖 Anthropic API 等局限性。

多Agent调度工具治理上下文管理
09.08
内容创作主题配图

md2wechat

面向微信公众号的 Markdown 转 HTML 排版与全流程创作 CLI 工具

md2wechat 是一款专为微信公众号设计的 Markdown 转 HTML 排版及全流程创作 CLI 工具,由开发者 geekjourneyx 创建,GitHub 2.1k+ Stars。其定位是“AI 时代的公众号创作工作台”,覆盖从写作、去 AI 痕迹、排版、AI 配图到推送草稿箱的完整流程。工具采用 Go 1.26+ 实现,提供 40+ 专业主题(Minimal / Focus / Elegant / Bold 四大系列)和 43 个结构化 `:::block` 高级排版模块。架构上分为 AI 模式(免费,生成 prompt 由 LLM 执行,输出不确定)和 API 模式(专业服务,确定性输出,需付费)。md2wechat 为 Agent 集成设计了完整的发现协议,原生兼容 Claude Code、Codex、OpenClaw。许可证为 BUSL-1.1,个人/学习/非商用免费,商用需授权,2030-01-01 后自动转为 Apache 2.0。

内容创作排版微信公众号
09.08