跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签97AI Agent33开源32Python19Claude Code13提示词工程12TypeScript12MIT10LLM9AI图像生成8CLI8Markdown8MCP8

项目搜索结果

找到 97 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

AI 智能体主题配图

Claude Code AI Agent 生态工具全景(Best Practice + GBrain + GStack)

围绕 Claude Code 的开源工具体系,覆盖最佳实践、个人知识记忆与虚拟工程团队三大维度

该收藏条目围绕 Claude Code 构建的开源工具体系展开,涵盖最佳实践知识库、个人知识大脑和虚拟工程团队三大维度。报告指出,Claude Code 功能丰富但官方文档分散,缺乏场景决策指导;AI Agent 缺乏记忆,无法积累个人知识;个人开发者缺少团队级工程保障。针对这些问题,Best Practice 提供功能-场景-工具三维决策矩阵,指导用户选择 Commands、Skills、Agents 等扩展机制;GBrain 通过 Markdown 知识库、混合检索和实体图谱,实现“读-答-写-同步”的知识积累循环;GStack 提供 23 个角色 Skill 和 8 个工具 Skill,以斜杠命令形式模拟虚拟工程团队。三者可独立使用,组合使用效果最大化。报告还包含安装部署、应用场景及与相似技术的对比。

混合检索虚拟工程团队知识管理
09.08
anthropics 的 GitHub 头像anthropics/claude-for-legal
AI 智能体GitHub 项目

Claude for Legal

Anthropic 官方法律工作流 AI 插件套件,覆盖 12 个业务领域

Claude for Legal 是 Anthropic 官方推出的法律工作流 AI 插件套件,为法律行业提供覆盖 12 个业务领域的专业化 AI Agent 能力。它不是单一产品,而是一套参考实现,包含预构建的 Agent、Skill、数据连接器和托管 Agent 范本,律师和法务团队可以直接安装使用,也可以基于自身业务定制。核心机制是冷启动面试,通过结构化面试学习团队业务规则并生成实践配置文件(Practice Profile),后续所有 Skill 都会读取该配置。插件通过 MCP 连接器对接真实法律数据库,确保引用可验证;没有连接器时,引用会被标记为 [verify],提醒律师必须人工验证。所有输出均为供律师审查的草稿,内置审查门控,不替代律师判断。项目采用 Apache 2.0 开源许可证,支持 Claude Cowork、Claude Code 和 Managed Agent 三种运行模式。

第 1 页第 2 页第 3 页第 4 页第 5 页
插件法律工作流
09.08
SoftwareCopyright-Skill README 配图
AI 智能体GitHub 项目

SoftwareCopyright-Skill

开源 Codex Skill,自动生成中国软著申请全套材料

SoftwareCopyright-Skill 是一个开源 Codex Skill,用于自动生成中国软件著作权申请材料。它通过阅读开发者真实项目源码,自动生成申请表信息、操作手册和代码鉴别材料,全部输出为 Word/TXT 格式。项目采用 MIT 协议,完全免费,旨在替代付费代办服务。核心功能包括自动分析项目源码、生成符合要求的操作手册、生成前 30 页和后 30 页代码鉴别材料、生成申请表辅助填报文件。代码材料只来自真实项目,禁止 AI 编造。关键节点设置人工确认门禁,确保材料准确性。支持基础 DOCX 和完整 OpenXML 两种生成路径。项目属于 AI Agent 与法律合规自动化交叉领域,面向中国开发者。

软著申请文档生成自动化
09.08
其他项目主题配图

Supertonic vs MOSS-TTS-Nano 开源轻量级 TTS 深度对比

对比两款开源轻量级 TTS:Supertonic 跨平台部署,MOSS-TTS-Nano 零样本声音克隆

本文档对比两款开源轻量级 TTS 系统:Supertonic 与 MOSS-TTS-Nano。Supertonic 由 Supertone Inc. 开发,基于 ONNX Runtime 完全本地运行,约 99M 参数,支持 31 种语言,提供 11 种语言 SDK,采用 Flow Matching 与语音自编码器架构,代码 MIT 许可,模型 OpenRAIL-M。MOSS-TTS-Nano 由 MOSI.AI 和复旦大学 OpenMOSS 团队开发,仅 0.1B 参数,基于 Audio Tokenizer + LLM 纯自回归架构,支持实时流式推理,可在 4 核 CPU 上运行,支持零样本声音克隆,输出 48kHz 立体声,Apache-2.0 许可。两者均解决传统 TTS 的部署、质量、工程与生态痛点,但侧重点不同:Supertonic 适合跨平台部署与极低资源设备,MOSS-TTS-Nano 适合声音克隆与中文 TTS。文档还包含架构原理、系统架构、关键流程、应用场景、优缺点与选型建议。

端侧推理声音克隆语音合成
09.08
minimind README 配图
其他项目GitHub 项目

minimind

从零开始用 PyTorch 原生实现并训练 GPT 风格语言模型的开源项目

MiniMind 是一个开源项目,目标是从绝对零开始训练一个 GPT 风格的语言模型。项目没有使用任何第三方框架的高级抽象,所有核心算法代码均使用 PyTorch 原生实现,开发者可以逐行阅读、理解、修改每一处计算逻辑。项目覆盖了从预训练、SFT 到 DPO 的完整训练链路,并支持推理、多模态、工具调用等能力。其最小模型为 26M 参数,最低硬件要求为单张 NVIDIA 3090,最短训练时间约 2 小时。项目强调“大道至简”的理念,不追求 SOTA,而是追求“最小可理解”,旨在帮助开发者理解 LLM 的每个组件如何工作。同时,项目兼容 llama.cpp、vllm、ollama 等推理部署方案,并兼容 OpenAI API,可接入 FastGPT、Open-WebUI。

预训练DPOLLM
09.08
Huobao Drama 火宝短剧 README 配图
内容创作GitHub 项目

Huobao Drama 火宝短剧

一站式 AI 短剧自动化生产平台,从剧本到成片全流程编排

Huobao Drama(火宝短剧)是由南京 AI 火宝团队开发的一站式 AI 短剧自动化生产平台,实现从剧本生成、角色设计、分镜制作到视频合成的全流程自动化。项目以 TypeScript 全栈构建,后端采用 Hono + Drizzle ORM + Mastra AI Agent 框架,前端使用 Nuxt 3 + Vue 3,数据库选用 SQLite。其核心价值在于将短剧制作拆解为剧本改写、角色提取、分镜拆解、音色分配、提示词生成五步流水线,每一步由专门的 AI Agent 负责,通过结构化数据在步骤间传递上下文。平台不依赖单一厂商,通过多厂商适配层(OpenAI、Gemini、MiniMax、火山引擎、阿里、Chatfire)实现图片、视频、TTS 的灵活切换。最终视频合成依赖 FFmpeg,支持 Docker 单镜像部署。项目采用 CC BY-NC-SA 4.0 许可证,禁止商业用途。

自动化生产AI短剧Drizzle ORM
09.08
内容创作主题配图

AI短剧开源工作流

用LLM、文生图、文生视频与TTS串联成自动化流水线,实现从剧本到成片的批量短剧生产

AI短剧开源工作流是一类利用大语言模型(LLM)、AI图像生成、AI视频生成、TTS语音合成等技术,实现从剧本或小说文本到完整短剧视频全自动化生产的开源工具链。其核心思想是将影视生产的每个环节模型化,用LLM做编剧和导演、用文生图做美术、用文生视频做摄影、用TTS做配音,再通过Agent工作流将所有环节串联成一条自动化流水线。报告覆盖三个代表性开源项目:moyin-creator(魔因漫创)为桌面端生产级工具,深度绑定Seedance 2.0,采用6层身份锚点保证角色一致性;waoowaoo为Web端工业级AI影视平台,专攻网文转视频;huobao-drama(火宝短剧)为极简一站式平台,内置5个Mastra AI Agent,支持一句话生成完整短剧。这些项目覆盖了剧本解析、角色生成、场景生成、分镜制作、视频生成、配音合成、成片导出的核心链路,旨在将传统短剧3-6个月的生产周期压缩到数小时甚至数分钟。

工作流角色一致性开源
09.08
内容创作主题配图

GPT-Image 2 极简几何海报提示词

一段结构化提示词,让 AI 为任意产品快速生成极简几何装置风的商业级产品海报。

这是一套基于 ChatGPT Image 2.0 的提示词设计方法论,属于 AI 图像生成领域的 Prompt Engineering 范畴。其核心是通过一段精心设计的结构化提示词,让 AI 为任意产品一次性生成极简几何装置风的产品海报,达到商业级品牌 KV 级别的视觉效果。该方法旨在解决商业产品海报制作中“质量-成本-速度”的不可能三角,通过一段提示词加一张产品图,在几十秒内产出品牌级海报。提示词支持双模式输入:提供产品图时保留其核心外观特征与配色;仅输入产品名时,则自动生成符合产品定位的外观与包装设计。其底层依赖 OpenAI 的 GPT-Image 2.0 多模态图像生成模型,但提示词的设计逻辑可迁移至其他图像生成模型。

产品海报批量生产商业设计
09.08
AI 智能体主题配图

Agentic Engineering

专业工程师用编码智能体放大自身能力的软件工程新范式

Agentic Engineering(智能体工程)是2025-2026年间快速兴起的软件工程新范式,核心定义来自Simon Willison:专业软件工程师使用编码智能体(Coding Agents)来放大自身专业能力的实践。该概念由Andrej Karpathy在2026年4月Sequoia Capital的AI Ascent大会上正式推向公众视野,并明确区分了Vibe Coding与Agentic Engineering:前者抬高所有人做软件的下限,后者要保住专业软件过去已有的质量门槛。它属于AI-Native软件工程范畴,横跨AI Agent技术栈、软件工程实践和人机协同设计三个领域。其出现源于三个力量:LLM能力质变、Agentic工具成熟、代码生产成本趋近于零。核心方法包括:人类编写规格(Spec)和测试,Agent生成代码,人类审查结果;测试被视为人类与Agent之间的通信协议。该范式强调代码是廉价的、理解是昂贵的,细节可以外包、结构不能外包。

多智能体编排软件工程质量门控
09.08
内容创作主题配图

xiaohuai-video-translate

一套面向 AI 编程工具的视频翻译技能套件,将外语视频自动转为中文字幕视频和中文文稿。

xiaohuai-video-translate 是一套面向 AI 编程工具的视频翻译技能套件,由 xiaohuailabs(小灰)开发。它不是独立应用,而是由「脚本 + 说明书」组成的 AI Agent 技能,可被 Claude Code、OpenClaw、Gemini CLI、Codex 等工具加载和驱动。项目将下载、转写、翻译、润色、烧录等步骤编排为一条龙流水线,用户只需说一句话即可完成。转写使用本地 Whisper 引擎,不产生 API 费用;翻译复用已有的 AI 模型。项目包含三个独立技能:总指挥、字幕润色、下载专员,可单独或组合使用。支持中英双语字幕,通过 ASS 格式实现中文大、英文小的字号反差。全程本地运行,不上传数据,保护隐私。项目处于活跃状态,最新提交为 2026-06-08,采用 MIT 协议。

本地处理视频翻译字幕
09.08
其他项目主题配图

设计灵感网站合集

五个高质量设计灵感网站,帮助你在AI时代提升审美判断力

本合集源自X(Twitter)博主 @Jackywine 的推荐帖子,精选了五个高质量的设计灵感网站,覆盖网页设计的不同维度,包括暗色主题、页脚设计、着陆页、综合网页设计和行业奖项。这些网站不仅是设计师的灵感来源,也是产品经理、开发者、内容创作者等非设计角色提升视觉素养的高效工具。核心思想是:在AI时代,当执行能力不再是瓶颈时,审美判断力成为核心竞争力。通过分类浏览、聚焦单一维度、接触顶级案例、可操作模板和持续训练,用户可以系统性地提升审美能力。五个网站各有侧重:Dark.design专注暗色主题,Footer.design专注页脚设计,Landingly提供着陆页灵感与Figma模板,Godly.website收录顶级设计,Awwwards提供行业奖项与评审标准。它们共同构成一个分层审美训练体系,从建立全局标准到专项深挖,再到可落地执行。

暗色主题设计奖项设计灵感
09.08
内容创作主题配图

Creao 电商视觉设计系统

用结构化 Prompt 将 AI 变成 6 人设计团队,自动生成电商视觉方案

Creao 电商视觉设计系统是由 Berryxia.AI 开源的一套 AI 驱动的电商视觉设计 Prompt 工程体系。它不是传统软件或框架,而是一套结构化的系统提示词,通过模拟 6 个专业角色的协同工作,为任何产品类别生成完整的电商视觉设计包。系统输入仅需产品名称、类别、核心特性、目标用户、价格区间 5 个字段,输出 7 个核心设计模块,包括主视觉海报、卖点卡片、细节特写、场景卡片、规格说明、物流保障和行动召唤。其核心思想包括角色分工、模块化输出、信息层级驱动、场景化叙事、数据驱动优化和可扩展的品类适配。系统支持淘宝、京东、拼多多、小红书、抖音等多平台适配,并提供 A/B 测试框架。输出为文字方案,需配合设计工具或 AI 生图工具落地。

电商视觉设计多角色协同开源
09.08
opendataloader-pdf README 配图
数据与分析GitHub 项目

opendataloader-pdf

开源 PDF 解析与无障碍标注引擎,本地优先、AI 增强

OpenDataLoader PDF 是由韩国 Hancom 开发的 PDF 解析引擎,能将 PDF 转换为 AI 可消费的结构化数据(Markdown、JSON、HTML),同时是全球首个开源端到端 PDF 无障碍自动标注工具。它采用“本地确定性解析为主,AI 混合增强为辅”的核心思想:简单页面由本地 Java 引擎快速处理,复杂页面(如无边框表格、扫描件、公式、图表)路由到自托管的 AI 后端增强,全程数据不出机器。引擎提供阅读顺序识别(XY-Cut++)、边界框坐标、表格抽取、OCR(80+ 语言)、公式提取(LaTeX)、图表描述等功能,并内置 AI 安全过滤机制。项目采用 Apache-2.0 许可证,提供 Python、Node.js、Java SDK 及 CLI,支持 LangChain 集成。报告指出其基准测试成绩为开源第一(Hybrid 模式总分 0.907),但基准由 Hancom 内部测试,缺乏第三方独立验证。

表格抽取公式提取无障碍标注
09.08
Browser Harness README 配图
AI 智能体GitHub 项目

Browser Harness

一个让 LLM Agent 通过 Unix Socket 直连用户 Chrome 的自愈式浏览器控制框架

Browser Harness 是由 browser-use 团队开发的一个自愈式浏览器控制框架,总计约 592 行 Python 代码,直接基于 Chrome DevTools Protocol(CDP)构建。它让 LLM Agent 能够通过一个 Unix Socket 连接到用户已运行的 Chrome 浏览器,实现完全自由地完成任何浏览器任务。其核心定义是:最简单、最轻量的自愈式浏览器控制装置——Agent 在任务执行过程中发现缺少什么功能,就当场写出来补上,无需重启、无需框架更新。该项目旨在解决 LLM Agent 如何以最少的前置代码、最大的灵活性控制真实浏览器的问题。传统方案要么依赖重量级框架(如 Playwright、Selenium),要么把所有交互逻辑预先编码。Browser Harness 反其道而行,只提供一个极薄的 CDP 桥接层(daemon + helpers),剩下的能力由 Agent 在任务执行中即时编写。

浏览器自动化自愈式AI Agent
09.08
AI 智能体主题配图

逸尘开源Skills + 社区精选Skills

开源21个Claude Code/Codex Skills,覆盖微信数据解析、记忆系统与多模型协作

该收藏整理自X用户@genngdaJ(逸尘)的热门帖子,一次性开源了自用的8个Claude Code/Codex Skills,并推荐了多位社区大佬的优秀Skills。Skill是Claude Code/Codex的扩展能力模块,一段预先写好的指令(SKILL.md)加可选的脚本和Agent,让AI Agent获得特定领域的专业能力。帖子精选的8个Skills包括:全网搜索与归档、Agent记忆系统、微信本地数据解析、企业微信聊天解析、企业微信云端操作、公众号文章批量抓取、ChatGPT网页调研、X文章草稿上传。仓库实际包含21个Skills,涵盖视频转写、剪映对接、小红书/抖音采集、社交收藏导出等更多能力。核心设计原则是安全第一(只读+授权)、本地优先(数据不出Mac)、无副写(不自动发布/下载)、碰撞安全(不覆盖文件)。

安全设计本地优先多模型协作
09.08
yetone 的 GitHub 头像yetone/native-feel-skill
AI 智能体GitHub 项目

Native Feel Skill - 跨平台桌面应用原生体验架构

一套让 WebView 渲染的 UI 无法被用户分辨为原生应用的 AI Agent 技能包

Native Feel Skill 是一个 AI Agent 技能包,由开发者 yetone 创建,将 Raycast 2.0 的跨平台桌面应用架构经验提炼为可复用的结构化领域知识。它包含 8 条架构准则、四层架构方案(原生外壳 → 系统 WebView → Node 后端 → Rust 内核)、WebKit/WebView2 生存指南、75 项上线检查清单、IPC 契约设计指南、内存真相手册及 Raycast Beta 逆向证据。该技能包主要解决跨平台桌面开发中开发效率与原生性能不可兼得的问题,通过精确定义共享与原生边界,在 WebView 渲染表面画线,上方共享 React/TS 代码,下方使用原生 Swift/C#,让用户无法分辨是否为原生应用。安装到 Claude Code、Cursor 等兼容 AI Agent 后,讨论跨平台桌面应用架构时自动激活,提供架构建议、问题诊断和优化方案。

技能包架构跨平台桌面
09.08
crafter-station 的 GitHub 头像crafter-station/petdex
开发工具GitHub 项目

Petdex

面向 OpenAI Codex CLI 的动画宠物公共画廊平台

Petdex 是一个面向 OpenAI Codex CLI 的动画宠物公共画廊平台,由 crafter-station 组织维护。它解决了 Codex 宠物散落在 GitHub、Reddit 等各处,缺乏统一浏览、预览和安装入口的问题。平台提供公共画廊,支持按类型、颜色、风格分类浏览,每个宠物可预览所有动画状态。用户可通过 `npx petdex install <name>` 一行命令安装宠物。宠物由社区创作和提交,平台提供自动审核(OpenAI LLM)与人工审核双重机制。此外,平台支持合集(Collections)、排行榜、个人图鉴以及社区宠物请求匹配功能。技术栈为 Next.js 15 + TypeScript + Bun + Drizzle ORM + Neon Postgres + Cloudflare R2 + Clerk 认证,采用 MIT 开源协议。截至 2026 年 5 月,平台已收录 1146+ 个社区提交的宠物。

BunClerkCloudflare R2
09.08
Magic Resume README 配图
内容创作GitHub 项目

Magic Resume

开源在线 AI 简历编辑器,所见即所得,数据本地存储

Magic Resume 是一款开源的在线 AI 简历编辑器,由开发者 Siyue 创建并维护。它提供所见即所得的编辑体验,左侧编辑内容,右侧实时预览最终效果。所有简历数据存储在浏览器 localStorage,不上传服务器,从根本上解决隐私问题。内置 AI 辅助写作,支持 Gemini、DeepSeek、豆包等多个大模型,可进行内容润色、语法检查和简历导入。基于 TanStack Start、Tiptap v3、Zustand 等现代技术栈构建,支持多套模板和深色模式。PDF 导出时自动调整字号和间距,确保简历恰好一页。采用 Apache 2.0 开源协议,个人使用免费,商业使用需单独授权。支持 Docker 一键部署,无需数据库和后端。

简历编辑器开源AI辅助
09.08
fireworks-tech-graph README 配图
开发工具GitHub 项目

fireworks-tech-graph

用自然语言描述系统,几秒钟生成可嵌入文档的 SVG+PNG 技术图表

Fireworks Tech Graph 是一个专为 Claude Code 设计的开源 Skill,能够将自然语言描述直接转换为生产级质量的 SVG + PNG 技术图表。它支持 8 种图表类型、5 种视觉风格,并内置了深厚的 AI/Agent 领域知识(RAG、Agentic Search、Mem0、Multi-Agent、Tool Call 等)。核心解决的问题是让开发者和技术写作者不用学习任何图表 DSL(如 Mermaid 语法、PlantUML、Graphviz DOT),也不用打开 draw.io 等可视化编辑器,只需要用自然语言描述系统,就能获得出版级的技术图表。它本质上是一套注入到 Claude Code 中的专业绘图知识和规则体系,包含 9 步固定工作流、语义形状系统、语义箭头系统、5 套完整的视觉设计系统、40+ 产品图标库以及 AI/Agent 领域的 7+ 内置架构模式。输出为可编辑的 SVG 文件和 1920px 高清 PNG 文件,完全离线使用,不依赖外部 API 或 CDN。

技术图表开源自然语言生成
09.08
openai 的 GitHub 头像openai/privacy-filter
开发工具GitHub 项目

OpenAI Privacy Filter

OpenAI 开源的本地化 PII 检测与脱敏模型,支持 128K 长文本与浏览器端运行

OpenAI Privacy Filter 是 OpenAI 于 2026 年 4 月 17 日开源的双向 Token 分类模型,专注于文本中个人可识别信息(PII)的检测与脱敏,属于 NLP 安全/隐私合规技术体系。其核心定位是为企业级数据清洗流水线提供一个可本地部署、高速、上下文感知且可调优的 PII 检测模型。模型采用自回归预训练加双向分类微调的方式,总参数量 1.5B,但通过稀疏 MoE 架构,每个 Token 仅激活 50M 参数,可在浏览器和笔记本上运行。模型支持 128,000 tokens 的上下文窗口,使用带状注意力将计算复杂度从 O(n²) 降至 O(n×w)。它可检测账号、私人地址、私人邮箱、人名、电话号码、私人 URL、私人日期等 8 类 PII,并通过约束 Viterbi 解码保证标签序列连贯。模型采用 Apache 2.0 许可证,支持 PyTorch、ONNX、Transformers.js 等多种部署格式。

本地部署数据脱敏隐私合规
09.08
内容创作主题配图

Seedance 2.0 提示词工程

用镜头语言导演 AI 视频:Seedance 2.0 提示词工程方法

Seedance 2.0 是字节跳动推出的 AI 视频生成模型,支持文字、图片、视频和音轨等多模态输入,在单次推理中生成音画同步的短视频。本条目整理了其提示词工程方法,核心是将“感受描述”翻译为“执行序列”,通过五层公式(主体、动作、镜头、风格、约束)构建提示词,并利用时间编码和参考文件实现精细控制。报告指出,主体描述需具体到年龄、发型、服装等属性;动作应分解为具体执行序列;镜头每代只放一个主运动;风格优先写光线和质感;约束词用于减少抖动、变形等 AI 痕迹。此外,时间编码支持按秒调度画面,参考文件(最多 9 图、3 视频、3 音轨)可提升一致性。报告还介绍了单变量迭代优化方法,并列举了 UGC、产品广告、短片等应用场景。

多模态内容创作视频生成
09.08
TrendRadar README 配图
AI 智能体GitHub 项目

TrendRadar

AI 驱动的多平台热点聚合与智能推送工具

TrendRadar 是一款 AI 驱动的舆情监控与热点聚合工具,由开发者 sansan0 于 2025 年 4 月创建。项目定位为面向信息过载时代的一站式热点助手,核心能力包括一键聚合 35+ 平台实时热点(如抖音、B 站、知乎、微博、头条、财联社、华尔街见闻等),通过 AI 智能筛选、翻译和深度分析,生成趋势预测、情感洞察、跨平台关联等简报,并支持 10+ 智能推送渠道(企业微信、微信、飞书、钉钉、Telegram、邮件、Slack 等)。项目采用时间线智能调度,针对早高峰、晚上、周末等不同时段配置不同推送策略。技术栈包括 Python、GitHub Actions、GitHub Pages、Docker 和 MCP Server,开源协议为 GPL-3.0。项目支持 MCP 架构,可接入 AI Agent 生态,实现自然语言对话分析。

热点聚合信息推送舆情监控
09.08
PDFMathTranslate README 配图
开发工具GitHub 项目

PDFMathTranslate

开源 PDF 科学文档翻译工具,翻译全文并保留公式、图表与排版。

PDFMathTranslate(命令行工具名 pdf2zh)是一个开源的 PDF 科学文档翻译工具,其核心能力是在翻译 PDF 全文的同时,完整保留原始排版、数学公式、图表、目录和批注。它通过 PDF 解析、元素分类、文本翻译、原位回填四个阶段处理文档,使用 DocLayout-YOLO 模型识别并跳过公式区域,避免公式被翻译引擎误读。翻译引擎可插拔,支持 Google、DeepL、OpenAI、Ollama 等十余种后端,并支持 CLI、GUI、Docker、MCP Server、Zotero 插件等多种部署形态。工具同时生成纯译文版和双语对照版,满足不同阅读需求。项目以 AGPL-3.0 许可证开源,论文被 EMNLP 2025 录用。

机器翻译开源文档智能
09.08
伯乐 Skill / ai-news-radar README 配图
AI 智能体GitHub 项目

伯乐 Skill / ai-news-radar

AI 信息源智能筛选系统,先判断再接入

伯乐 Skill(Scout Skill)是基于开源项目 ai-news-radar 构建的 AI 信息源智能筛选与新闻雷达系统,由 LearnPrompt 创始人卡尔的AI沃茨开发,2026 年 5 月发布 v0.4.0。其核心定位不是又一个新闻聚合站,而是帮助用户从一堆信源里选出千里马的 AI 信息源筛选系统。它解决 AI 从业者追踪行业动态时的信息淹没、原始来源丢失、接入方式差异大、个性化需求无法满足、缺乏健康评估机制以及 Agent 自动化维护门槛高等痛点。核心设计思想是“先判断,再接入”,在信息源层面做第一轮判断,区分一手源与聚合源,并尊重每个源的原生接入方式。系统支持九类信源,内置 22 个默认信息源,通过六阶段 Pipeline 完成信源分类、抓取、去重、过滤、健康统计和静态站点生成。核心流程不依赖大模型 API,也不需要服务器,运行在 GitHub Actions 和 GitHub Pages 上,每 30 分钟自动更新。

静态站点生成开源信息源评估
09.08