跳到主要内容
prolist.
发现项目AI 收集我的项目我的模型
正在确认账号…
prolist.

发现有价值的项目,留下有依据的判断。

项目专题关于我的收藏
© 2026 prolist项目知识,由人判断。

IDEAS CONNECT PROJECTS

沿着兴趣,发现项目。

从一个标签出发,打开一份值得研究的档案。

收集项目线索
筛选与排序 · 已应用
地图列表
不限标签2RAG2表格抽取1公式提取1开源1文档转换1无障碍标注1Apache-2.01Java1LLM1Markdown1MCP1MIT1

项目搜索结果

找到 2 个项目

清除筛选

以下内容已由 AI 根据历史资料整理,供本地测试,未经人工复核。

microsoft 的 GitHub 头像microsoft/markitdown
开发工具GitHub 项目

MarkItDown

微软开源的轻量级多格式文档转 Markdown 工具,为 LLM 与 RAG 管道提供结构化文本提取。

MarkItDown 是微软 AutoGen 团队开发并维护的开源 Python 工具,采用 MIT 协议,当前 GitHub 星标超过 105k,最新版本为 v0.1.5(2026 年 2 月发布)。它支持 PDF、Word、PowerPoint、Excel、图片、音频、HTML、EPUB 等 15 种以上文件格式,将其转换为结构化的 Markdown 文本。其核心设计目标是让 LLM 和文本分析工具能以最高效的方式“阅读”非文本文件,输出为机器可消费的结构化文本,而非人类可读的高保真转换。工具采用可插拔的 Converter 架构,每种格式对应独立转换器,核心库仅依赖 Python 标准库,其他功能通过可选依赖按需安装。v0.1.0 之后支持流式处理,不创建临时文件。基础转换不依赖 LLM,但可选用 LLM 增强图片描述与 OCR 功能。此外,项目提供 MCP 服务器,便于 AI 客户端直接调用。

开源文档转换LLM
09.08
opendataloader-pdf README 配图
数据与分析GitHub 项目

opendataloader-pdf

开源 PDF 解析与无障碍标注引擎,本地优先、AI 增强

OpenDataLoader PDF 是由韩国 Hancom 开发的 PDF 解析引擎,能将 PDF 转换为 AI 可消费的结构化数据(Markdown、JSON、HTML),同时是全球首个开源端到端 PDF 无障碍自动标注工具。它采用“本地确定性解析为主,AI 混合增强为辅”的核心思想:简单页面由本地 Java 引擎快速处理,复杂页面(如无边框表格、扫描件、公式、图表)路由到自托管的 AI 后端增强,全程数据不出机器。引擎提供阅读顺序识别(XY-Cut++)、边界框坐标、表格抽取、OCR(80+ 语言)、公式提取(LaTeX)、图表描述等功能,并内置 AI 安全过滤机制。项目采用 Apache-2.0 许可证,提供 Python、Node.js、Java SDK 及 CLI,支持 LangChain 集成。报告指出其基准测试成绩为开源第一(Hybrid 模式总分 0.907),但基准由 Hancom 内部测试,缺乏第三方独立验证。

表格抽取公式提取无障碍标注
09.08