跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签13提示词工程5AI图像生成4图像生成3信息图3声音克隆2文字渲染2语音合成2Python2UI仿真2案例库1版式设计1本地部署1

项目搜索结果

找到 13 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

内容创作主题配图

GPT-Image 2 品牌包装系统提示词

一套通过约2000字模块化提示词,为任意品牌与品类生成品牌提案级包装系统展示图的方法论。

这是一套专为 ChatGPT Image 2.0 设计的品牌包装系统展示图提示词工程方法论,由 @MrLarus 实战验证。其核心是一套约 2000 字的中文提示词模板,用户只需替换【品牌名称】和【品牌类目】两个变量,即可生成包含手提袋、礼盒、单品盒、瓶罐容器、标签贴纸、产品本体等多种包装载体,且所有元素共享统一品牌视觉识别系统的展示海报。该方法论通过十层模块化控制架构,分别约束画幅、品牌系统完整性、品类适配、元素数量、视觉一致性、配色机制、构图、视觉风格、光影和最终效果。其核心设计思想包括系统感优先、受控发散配色、克制即高级、品类驱动、提案感优先和三段式构图。报告显示,该方法已在美妆、轻食、烘焙、茶饮四个不同品类品牌上生成高质量输出。该方法论适用于品牌提案、电商视觉升级、创业团队 MVP 视觉、设计灵感探索和设计教育等场景,但报告也明确指出其局限,包括品牌深度不足、Logo 真实性有限、输出为位图不可直接用于印刷、存在版权风险以及品类覆盖有限。

模板化品牌包装设计品牌视觉系统
09.08
内容创作主题配图

GPT-image2 社区提示词合集

社区实战验证的 GPT-image2 提示词速查手册

本合集基于社区创作者在 X 平台发布的「GPT-image2 最强玩法合集」,系统整理了 15 类经过社区实测的提示词场景,涵盖日历设计、代码海报、Logo 生成、书法复制、试卷生成、架构图绘制、UI 仿真、直播切片、MV 制作等。报告指出,GPT-image2 的核心突破在于原生文字渲染(中英日韩)和 UI 截图级逼真度,用户只需一句话中文提示词即可出图,无需学习复杂参数。合集还介绍了 URL 输入、多轮对话迭代、跨工具联动(如与 Seedance2 配合生成视频)等能力。报告同时说明,该文档是《GPT-image2 深度技术指南》的实战补充篇,侧重社区玩法而非模型原理与 API 工程。

内容管线提示词图像生成
09.08
内容创作主题配图

GPT-Image科学百科图解提示词

一套通过结构化提示词让AI自动生成百科级科学信息图的方法论

这是一套专为GPT-Image等多模态图像生成模型设计的高密度信息图提示词工程体系,通过结构化的视觉布局指令,让AI自动生成类似DK百科全书风格的专业科学图解。它并非软件或工具,而是一套提示词工程方法论,核心成果物是“单图即百科”的信息图:中央主体以逼真3D效果“跃出画面”,周围环绕6-8个知识模块,通过引导线、箭头、标注形成完整的知识网络。该体系解决了传统AI图像生成在知识密集型场景下的信息密度不足、布局不可控、文字渲染差、学科覆盖窄、专业度低等问题。其核心思想包括“太阳系布局”、战略性留白、引导线编织知识网络、中文书法体与手写注释的双层文字系统、三大领域模板化以及3:4竖版画幅与复古纸张质感。提示词结构拆解为7个控制层:角色定义、任务描述、领域选择、风格定义、视觉要求、模块结构、主题注入。用户只需修改主题名即可生成不同物种或人物的信息图。报告还提供了标准使用流程、批量生产流程、与竞品的对比、真实应用场景、工程落地步骤、优缺点与局限、常见误区及学习路径。

多模态AI科学教育内容创作
09.08
内容创作主题配图

OpenNana 提示词图库

中文原生的 AI 图像提示词视觉化图库,收录 104+ 条精选案例覆盖多种主流模型

OpenNana 是一个 AI 图片提示词分享平台,核心产品是提示词图库,目前已收录 104+ 条精选提示词案例,覆盖 Nano Banana Pro、GPT Image-2(ChatGPT)、Grok、Seedance 2.0 等主流 AI 图像/视频生成模型。平台定位为 AI 图像创作者的灵感库和提示词参考站,提供浏览、搜索、收藏高质量提示词的功能。核心能力包括多模型覆盖、分类筛选(按模型、媒体类型、标签)、视觉化展示(每条提示词配有生成效果图)以及一站式体验(提供 AI 生图、AI 生视频、生成记录等工具)。平台采用三维分类体系:模型、媒体类型、标签,便于用户快速定位目标提示词。设计原则包括视觉优先、多模型平等、标签化组织、创作者溯源、平台一体化和持续更新。平台还内置 AI 生图工具,用户可一键生成图片。

视觉化展示提示词图库中文原生
09.08
内容创作主题配图

GPT-Image 2 实操案例与提示词工程指南

一份基于实操案例整理的 GPT-Image 2 提示词工程指南,覆盖 13 类应用场景与模板化用法。

本指南基于一份实操报告整理,围绕 OpenAI 于 2026 年 4 月推出的图像生成模型 GPT-Image 2 展开。报告指出,该模型并非传统文生图工具,而是集成了意图理解、知识补全、设计规划与精准渲染的 Agent 系统。指南重点介绍了其四大核心亮点:高质量中文渲染、自动补全缺失信息、支持极简提示词以及可对话式追问微调。内容主体为 13 个实操案例,覆盖图鉴拆解、古文书法、科普百科、电商详情、试卷生成、旅游攻略、人物关系图、密集中文排版等场景,每个案例均提供了对应的提示词模板与通用性说明。此外,指南还对比了 GPT-Image 2 与 Midjourney、DALL-E 3、Stable Diffusion 等工具的差异,并总结了优缺点、常见误区与学习路径。报告同时指出其局限,如不适合像素级精确排版、无法本地部署或批量调用,以及存在伦理风险。

提示词工程图像生成信息图
09.08
CosyVoice README 配图
内容创作GitHub 项目

CosyVoice

多语种语音生成模型,支持3秒声音克隆与流式合成

CosyVoice 是阿里巴巴达摩院 FunAudioLLM 团队开发的多语种大语音生成模型,提供推理、训练和部署的全栈能力。其核心能力包括仅需 3 秒参考音频即可实现零样本声音克隆,覆盖 9 种常见语言和 18 种以上中文方言,并支持跨语种克隆。模型采用 LLM 生成语义 Token 与 Flow Matching 渲染声波的双阶段架构,CosyVoice 2.0 起支持双向流式合成,延迟低至 150ms。CosyVoice 3.0 引入多任务 Tokenizer 和可微分奖励模型后训练,训练数据扩展至 100 万小时。项目采用 Apache-2.0 许可证,支持本地部署,提供 Docker、FastAPI、gRPC、vLLM、TensorRT-LLM 等多种部署方式。

多语种流式合成深度学习
09.08
内容创作主题配图

GPT-image2(OpenAI 图像生成模型)

OpenAI 第二代原生图像生成模型,以 Transformer 端到端架构实现印刷级文字渲染与 UI 仿真。

GPT-image2 是 OpenAI 推出的第二代原生图像生成模型,模型 ID 为 gpt-image-1.5,属于 GPT 多模态模型家族中专门负责图像输出的成员。与 DALL·E 系列不同,它不是独立的扩散模型,而是直接嵌入在 GPT 推理架构中的图像生成能力,用同一个 Transformer 做文本理解和图像输出。该模型解决的核心问题是让 AI 生成的图片不再“一眼假”,在文字渲染、UI 仿真、细节精度、多语言支持等方面实现了跨越式提升。其核心优势包括:文字渲染达到印刷级精度,能精确模拟 App 界面、网页截图、后台管理面板,支持中文等多语言原生理解,并支持对话式迭代修改。模型通过 Responses API 和 Chat Completions API 接入,适合海报、UI 截图、试卷、书法、架构图等精确性场景。其局限包括成本较高(标准输入每张 8 美元)、生成速度较慢、审美需精细 Prompt 控制、无本地部署选项。

多模态图像生成文字渲染
09.08
其他项目主题配图

Supertonic vs MOSS-TTS-Nano 开源轻量级 TTS 深度对比

对比两款开源轻量级 TTS:Supertonic 跨平台部署,MOSS-TTS-Nano 零样本声音克隆

本文档对比两款开源轻量级 TTS 系统:Supertonic 与 MOSS-TTS-Nano。Supertonic 由 Supertone Inc. 开发,基于 ONNX Runtime 完全本地运行,约 99M 参数,支持 31 种语言,提供 11 种语言 SDK,采用 Flow Matching 与语音自编码器架构,代码 MIT 许可,模型 OpenRAIL-M。MOSS-TTS-Nano 由 MOSI.AI 和复旦大学 OpenMOSS 团队开发,仅 0.1B 参数,基于 Audio Tokenizer + LLM 纯自回归架构,支持实时流式推理,可在 4 核 CPU 上运行,支持零样本声音克隆,输出 48kHz 立体声,Apache-2.0 许可。两者均解决传统 TTS 的部署、质量、工程与生态痛点,但侧重点不同:Supertonic 适合跨平台部署与极低资源设备,MOSS-TTS-Nano 适合声音克隆与中文 TTS。文档还包含架构原理、系统架构、关键流程、应用场景、优缺点与选型建议。

端侧推理声音克隆语音合成
09.08
内容创作主题配图

xiaohuai-video-translate

一套面向 AI 编程工具的视频翻译技能套件,将外语视频自动转为中文字幕视频和中文文稿。

xiaohuai-video-translate 是一套面向 AI 编程工具的视频翻译技能套件,由 xiaohuailabs(小灰)开发。它不是独立应用,而是由「脚本 + 说明书」组成的 AI Agent 技能,可被 Claude Code、OpenClaw、Gemini CLI、Codex 等工具加载和驱动。项目将下载、转写、翻译、润色、烧录等步骤编排为一条龙流水线,用户只需说一句话即可完成。转写使用本地 Whisper 引擎,不产生 API 费用;翻译复用已有的 AI 模型。项目包含三个独立技能:总指挥、字幕润色、下载专员,可单独或组合使用。支持中英双语字幕,通过 ASS 格式实现中文大、英文小的字号反差。全程本地运行,不上传数据,保护隐私。项目处于活跃状态,最新提交为 2026-06-08,采用 MIT 协议。

本地处理视频翻译字幕
09.08
ahang008 的 GitHub 头像ahang008/ah-xhs-cover-title
内容创作GitHub 项目

ah-xhs-cover-title

短视频封面标题生成器,基于85条爆款公式进行可追溯路由匹配

ah-xhs-cover-title 是一款短视频封面标题生成器,由开发者 ahang008(阿航)于 2026 年 4 月 22 日开源发布,以 Claude Code Skill 形式运行。用户输入文章、选题或核心观点后,系统自动从 85 条经过验证的爆款封面公式中进行路由匹配,生成标题和封面三行文案。其核心是双层分类体系(8 种钩子手法 × 6 条内容赛道)和三层路由决策机制(识别赛道、匹配钩子、锁定拆法),每条输出都标注钩子代号和案例编号,实现可追溯。工具支持自然语言反馈迭代(如“再来几条”“换个方向”),并配套四种封面三行拆法模板。项目采用 MIT 协议,即开即用,无需训练。

案例库标题生成短视频
09.08
AI-CanvasPro README 配图
内容创作GitHub 项目

AI-CanvasPro

基于节点的 AI 多模态画布编辑器,通过可视化连线编排文本、图像、视频与音频生成

AI-CanvasPro 是一款基于节点的 AI 多模态画布编辑器,由独立开发者阿硕(ashuoAI)打造,采用纯原生 HTML/CSS/JS 前端与 Python 后端,支持 Windows、macOS 与 Web 平台。它通过无限画布上的可视化节点连线,让用户组合文本、图像、视频、音频等 AI 能力,实现多模态内容的一站式创作。项目定位为 ComfyUI 的“轻量中文替代”,中文原生支持,无需本地 GPU,通过 API 调用即梦、RunningHub、PPIO、GRSAI 及 OpenAI 兼容接口等云端模型。核心机制包括连线数据流、@引用跨节点嵌入、多供应商适配、资产与工作流复用,以及遮罩重绘、抠图、高清放大等图像编辑工具链。项目采用 Source Available 许可证,禁止商业使用。

本地部署画布编辑器节点式工作流
09.08
内容创作主题配图

GPT-image-2 汉服拆解图提示词工程

一套面向 GPT-image-2 的提示词模板,用于生成博物馆图鉴级中文拆解信息图。

该项目是一套针对 OpenAI GPT-image-2(gpt-image-1.5 模型)设计的提示词工程方法论,核心是一段通用模板,通过替换【主题】变量,即可生成博物馆图鉴级别的中文拆解信息图。它主要解决传统 AI 图像生成在中文文化内容上的三大短板:结构准确性不足、中文文字渲染困难、图鉴专业感缺失。其实现方式是通过版式约束、风格锚定和结构分区三重机制,并依托模型的 VQ Token 统一空间、高分辨率输出和多轮对话迭代能力。提示词包含角色设定、内容要求、自主决策权、风格锚定、排除清单、版式约束和条件分支七个层次,并固定为顶部标题、左侧拆解、右上材质、右中纹样、底部流程的五区版式。该模板适用于传统服饰、器物、建筑、盔甲、凤冠等文化主题,但存在结构准确性不可控、非矢量图、历史准确性需验证等局限。

版式设计提示词工程文化内容
09.08
内容创作主题配图

NanoBanana Pro 提示词工程

系统化掌握 NanoBanana Pro 提示词工程,释放模型全部潜力

本收藏基于社区分享的 NanoBanana Pro 提示词指南整理,系统介绍了该高性能 AI 图像生成模型的提示词工程方法论。内容涵盖模型定位、核心优势、常见使用痛点、七层提示词结构、视觉词汇表、中文提示词优势、标准生成流程、对话式迭代优化方法、真实应用场景、工程落地模板、质量检查清单、优缺点与局限、常见误区及学习路径。指南强调通过“精确描述 + 结构化组织 + 排除干扰”实现高质量输出,并指出大多数用户仅使用了模型 1% 的能力。适用于希望提升 AI 图像生成质量、掌握结构化提示词技巧的创作者。

电商产品摄影国风创作人像摄影
09.08