跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签115开源34AI Agent33Python23提示词工程13Claude Code13TypeScript12LLM11Markdown10MIT10React9知识管理8多模态3

项目搜索结果

找到 3 个项目 · 标签:多模态 移除标签

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

内容创作主题配图

GPT-image2(OpenAI 图像生成模型)

OpenAI 第二代原生图像生成模型,以 Transformer 端到端架构实现印刷级文字渲染与 UI 仿真。

GPT-image2 是 OpenAI 推出的第二代原生图像生成模型,模型 ID 为 gpt-image-1.5,属于 GPT 多模态模型家族中专门负责图像输出的成员。与 DALL·E 系列不同,它不是独立的扩散模型,而是直接嵌入在 GPT 推理架构中的图像生成能力,用同一个 Transformer 做文本理解和图像输出。该模型解决的核心问题是让 AI 生成的图片不再“一眼假”,在文字渲染、UI 仿真、细节精度、多语言支持等方面实现了跨越式提升。其核心优势包括:文字渲染达到印刷级精度,能精确模拟 App 界面、网页截图、后台管理面板,支持中文等多语言原生理解,并支持对话式迭代修改。模型通过 Responses API 和 Chat Completions API 接入,适合海报、UI 截图、试卷、书法、架构图等精确性场景。其局限包括成本较高(标准输入每张 8 美元)、生成速度较慢、审美需精细 Prompt 控制、无本地部署选项。

多模态图像生成文字渲染
09.08
内容创作主题配图

Seedance 2.0 提示词工程

用镜头语言导演 AI 视频:Seedance 2.0 提示词工程方法

Seedance 2.0 是字节跳动推出的 AI 视频生成模型,支持文字、图片、视频和音轨等多模态输入,在单次推理中生成音画同步的短视频。本条目整理了其提示词工程方法,核心是将“感受描述”翻译为“执行序列”,通过五层公式(主体、动作、镜头、风格、约束)构建提示词,并利用时间编码和参考文件实现精细控制。报告指出,主体描述需具体到年龄、发型、服装等属性;动作应分解为具体执行序列;镜头每代只放一个主运动;风格优先写光线和质感;约束词用于减少抖动、变形等 AI 痕迹。此外,时间编码支持按秒调度画面,参考文件(最多 9 图、3 视频、3 音轨)可提升一致性。报告还介绍了单变量迭代优化方法,并列举了 UGC、产品广告、短片等应用场景。

多模态
内容创作
视频生成
09.08
内容创作主题配图

Claude Design

AI 驱动的视觉设计协作工具,通过自然语言对话实现从想法到视觉的快速创作。

Claude Design 是 Anthropic Labs 于 2026 年 4 月 17 日发布的 AI 驱动视觉设计协作工具,属于 Research Preview 阶段,由 Claude Opus 4.7 驱动。它通过自然语言对话与 Claude 协作,创建设计方案、交互原型、演示文稿、产品 One-Pager 等视觉作品。该工具旨在解决传统设计工作流中探索受限、非设计人员视觉表达壁垒、设计到开发交接断层、原型制作代码依赖以及品牌一致性执行漂移等问题。其核心创新包括自动构建设计系统、多粒度编辑系统(对话级、标注级、精确级)、组织级协作以及多种交付方式(如 PDF、PPTX、HTML、Canva 集成、Claude Code Handoff)。Claude Design 支持代码驱动的原型,包括 3D、Shader、语音、视频等前沿能力。它适用于快速视觉探索、原型制作和跨角色协作,与 Figma 等专业工具形成互补而非替代关系。

对话式设计多模态设计系统
09.08