跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签10多模态3提示词工程3本地部署2内容创作2AI视频生成2AI图像生成2React2Transformer2产品海报1对话式设计1多模态大模型1多模态生成1

项目搜索结果

找到 10 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

PromptLens README 配图
内容创作GitHub 项目

PromptLens

开源 AI 视频提示词反推分析工具,自动提取关键帧并生成结构化提示词

PromptLens 是一款开源的 AI 视频提示词反推分析工具,提供完整的 Web 应用体验。其核心能力是上传 AI 生成的视频或图片,自动提取关键帧,通过多模态大模型(如智谱 GLM-4V、Google Gemini、OpenRouter)分析画面内容,反向推导出可能使用的提示词,并输出结构化的、可直接复用的英文提示词。项目采用 Next.js 15 + React 19 全栈技术,使用 Supabase PostgreSQL 存储数据,Cloudflare R2 存储媒体文件,FFmpeg 进行视频帧提取,支持 better-auth 的 Google/GitHub 登录。除画面分析外,还支持通过 AssemblyAI 进行音频识别,提取视频中的语音旁白和台词。项目以 MIT 许可证开源,代码透明,可自由修改和商用。

多模态大模型开源提示词反推
09.08
CLIProxyAPI 本地反代大模型 API 网关 README 配图
开发工具GitHub 项目

CLIProxyAPI 本地反代大模型 API 网关

将已授权的 AI CLI 账号统一转换为 OpenAI 兼容 API 的本地网关

CLIProxyAPI 是一个用 Go 编写的轻量级 AI 代理网关,由 router-for-me 团队开源维护,采用 MIT 协议。它能够将用户已登录授权的各种 AI CLI 工具(如 Gemini CLI、ChatGPT Codex CLI、Claude Code CLI)包装成一个统一的 OpenAI 兼容 API 接口,默认暴露在本机 localhost:8317 上。该工具解决了 AI 服务格式不统一、CLI 能力无法被代码调用、多账号管理混乱、安全暴露风险等问题。其核心设计思想包括:将 CLI 授权能力网关化、以 OpenAI 格式为标准、双层隔离架构、多账号轮询实现负载均衡、默认本机监听保障安全。CLIProxyAPI 支持流式/非流式响应、函数调用、多模态等功能,并支持多账户轮询负载均衡。它适用于本地 Agent 开发调试、多账号额度聚合、统一接入多个 AI 模型、IDE 编码助手后端等场景。但需注意,它主要代理 Chat 能力,不支持 Embeddings、Fine-tuning 等完整 API 特性,且依赖 CLI 授权,存在服务条款风险和稳定性问题。

本地部署多账号轮询协议翻译
09.08
内容创作主题配图

GPT-Image科学百科图解提示词

一套通过结构化提示词让AI自动生成百科级科学信息图的方法论

这是一套专为GPT-Image等多模态图像生成模型设计的高密度信息图提示词工程体系,通过结构化的视觉布局指令,让AI自动生成类似DK百科全书风格的专业科学图解。它并非软件或工具,而是一套提示词工程方法论,核心成果物是“单图即百科”的信息图:中央主体以逼真3D效果“跃出画面”,周围环绕6-8个知识模块,通过引导线、箭头、标注形成完整的知识网络。该体系解决了传统AI图像生成在知识密集型场景下的信息密度不足、布局不可控、文字渲染差、学科覆盖窄、专业度低等问题。其核心思想包括“太阳系布局”、战略性留白、引导线编织知识网络、中文书法体与手写注释的双层文字系统、三大领域模板化以及3:4竖版画幅与复古纸张质感。提示词结构拆解为7个控制层:角色定义、任务描述、领域选择、风格定义、视觉要求、模块结构、主题注入。用户只需修改主题名即可生成不同物种或人物的信息图。报告还提供了标准使用流程、批量生产流程、与竞品的对比、真实应用场景、工程落地步骤、优缺点与局限、常见误区及学习路径。

多模态AI科学教育内容创作
09.08
ArcReel README 配图
内容创作GitHub 项目

ArcReel

AI Agent 驱动的开源小说视频生成工作台

ArcReel 是一个开源的 AI 视频生成工作台,由 AI Agent 全程驱动,能够将小说文本自动转化为完整的短视频。其完整工作流为:小说 → 角色/场景/道具设计 → 剧本 → 分镜图 → 视频片段 → 最终成片。它本身不训练模型,而是通过统一的抽象层集成 Google Gemini、火山方舟、xAI Grok、OpenAI 等多个 AI 供应商,用 Agent 智能体协调完成从文本到视频的端到端生产流程。项目采用 React 19、Python 3.12+ / FastAPI、Claude Agent SDK 等技术栈,支持 SQLite 与 PostgreSQL 数据库,可通过 Docker 一键部署。ArcReel 旨在解决 AI 视频生成中角色一致性、场景连贯性、分镜拆分、多供应商调度与任务编排等工程问题,将传统人工串联多个 AI 工具的制作流程,转变为 Agent 自动编排与人工确认相结合的标准化流水线。

多模态生成Agent编排AI视频生成
09.08
内容创作主题配图

GPT-image2(OpenAI 图像生成模型)

OpenAI 第二代原生图像生成模型,以 Transformer 端到端架构实现印刷级文字渲染与 UI 仿真。

GPT-image2 是 OpenAI 推出的第二代原生图像生成模型,模型 ID 为 gpt-image-1.5,属于 GPT 多模态模型家族中专门负责图像输出的成员。与 DALL·E 系列不同,它不是独立的扩散模型,而是直接嵌入在 GPT 推理架构中的图像生成能力,用同一个 Transformer 做文本理解和图像输出。该模型解决的核心问题是让 AI 生成的图片不再“一眼假”,在文字渲染、UI 仿真、细节精度、多语言支持等方面实现了跨越式提升。其核心优势包括:文字渲染达到印刷级精度,能精确模拟 App 界面、网页截图、后台管理面板,支持中文等多语言原生理解,并支持对话式迭代修改。模型通过 Responses API 和 Chat Completions API 接入,适合海报、UI 截图、试卷、书法、架构图等精确性场景。其局限包括成本较高(标准输入每张 8 美元)、生成速度较慢、审美需精细 Prompt 控制、无本地部署选项。

多模态图像生成文字渲染
09.08
minimind README 配图
其他项目GitHub 项目

minimind

从零开始用 PyTorch 原生实现并训练 GPT 风格语言模型的开源项目

MiniMind 是一个开源项目,目标是从绝对零开始训练一个 GPT 风格的语言模型。项目没有使用任何第三方框架的高级抽象,所有核心算法代码均使用 PyTorch 原生实现,开发者可以逐行阅读、理解、修改每一处计算逻辑。项目覆盖了从预训练、SFT 到 DPO 的完整训练链路,并支持推理、多模态、工具调用等能力。其最小模型为 26M 参数,最低硬件要求为单张 NVIDIA 3090,最短训练时间约 2 小时。项目强调“大道至简”的理念,不追求 SOTA,而是追求“最小可理解”,旨在帮助开发者理解 LLM 的每个组件如何工作。同时,项目兼容 llama.cpp、vllm、ollama 等推理部署方案,并兼容 OpenAI API,可接入 FastGPT、Open-WebUI。

预训练DPOLLM
09.08
内容创作主题配图

GPT-Image 2 极简几何海报提示词

一段结构化提示词,让 AI 为任意产品快速生成极简几何装置风的商业级产品海报。

这是一套基于 ChatGPT Image 2.0 的提示词设计方法论,属于 AI 图像生成领域的 Prompt Engineering 范畴。其核心是通过一段精心设计的结构化提示词,让 AI 为任意产品一次性生成极简几何装置风的产品海报,达到商业级品牌 KV 级别的视觉效果。该方法旨在解决商业产品海报制作中“质量-成本-速度”的不可能三角,通过一段提示词加一张产品图,在几十秒内产出品牌级海报。提示词支持双模式输入:提供产品图时保留其核心外观特征与配色;仅输入产品名时,则自动生成符合产品定位的外观与包装设计。其底层依赖 OpenAI 的 GPT-Image 2.0 多模态图像生成模型,但提示词的设计逻辑可迁移至其他图像生成模型。

产品海报批量生产商业设计
09.08
内容创作主题配图

Seedance 2.0 提示词工程

用镜头语言导演 AI 视频:Seedance 2.0 提示词工程方法

Seedance 2.0 是字节跳动推出的 AI 视频生成模型,支持文字、图片、视频和音轨等多模态输入,在单次推理中生成音画同步的短视频。本条目整理了其提示词工程方法,核心是将“感受描述”翻译为“执行序列”,通过五层公式(主体、动作、镜头、风格、约束)构建提示词,并利用时间编码和参考文件实现精细控制。报告指出,主体描述需具体到年龄、发型、服装等属性;动作应分解为具体执行序列;镜头每代只放一个主运动;风格优先写光线和质感;约束词用于减少抖动、变形等 AI 痕迹。此外,时间编码支持按秒调度画面,参考文件(最多 9 图、3 视频、3 音轨)可提升一致性。报告还介绍了单变量迭代优化方法,并列举了 UGC、产品广告、短片等应用场景。

多模态内容创作视频生成
09.08
AI-CanvasPro README 配图
内容创作GitHub 项目

AI-CanvasPro

基于节点的 AI 多模态画布编辑器,通过可视化连线编排文本、图像、视频与音频生成

AI-CanvasPro 是一款基于节点的 AI 多模态画布编辑器,由独立开发者阿硕(ashuoAI)打造,采用纯原生 HTML/CSS/JS 前端与 Python 后端,支持 Windows、macOS 与 Web 平台。它通过无限画布上的可视化节点连线,让用户组合文本、图像、视频、音频等 AI 能力,实现多模态内容的一站式创作。项目定位为 ComfyUI 的“轻量中文替代”,中文原生支持,无需本地 GPU,通过 API 调用即梦、RunningHub、PPIO、GRSAI 及 OpenAI 兼容接口等云端模型。核心机制包括连线数据流、@引用跨节点嵌入、多供应商适配、资产与工作流复用,以及遮罩重绘、抠图、高清放大等图像编辑工具链。项目采用 Source Available 许可证,禁止商业使用。

本地部署画布编辑器节点式工作流
09.08
内容创作主题配图

Claude Design

AI 驱动的视觉设计协作工具,通过自然语言对话实现从想法到视觉的快速创作。

Claude Design 是 Anthropic Labs 于 2026 年 4 月 17 日发布的 AI 驱动视觉设计协作工具,属于 Research Preview 阶段,由 Claude Opus 4.7 驱动。它通过自然语言对话与 Claude 协作,创建设计方案、交互原型、演示文稿、产品 One-Pager 等视觉作品。该工具旨在解决传统设计工作流中探索受限、非设计人员视觉表达壁垒、设计到开发交接断层、原型制作代码依赖以及品牌一致性执行漂移等问题。其核心创新包括自动构建设计系统、多粒度编辑系统(对话级、标注级、精确级)、组织级协作以及多种交付方式(如 PDF、PPTX、HTML、Canva 集成、Claude Code Handoff)。Claude Design 支持代码驱动的原型,包括 3D、Shader、语音、视频等前沿能力。它适用于快速视觉探索、原型制作和跨角色协作,与 Figma 等专业工具形成互补而非替代关系。

对话式设计多模态设计系统
09.08