
你有没有遇到过这种情况——
老板甩来一个 80 页的 PDF,让你把里面的表格和文字整理出来;或者一堆 PPT、Word、Excel,要喂给 AI 做分析,结果复制粘贴到怀疑人生;再或者,手里一堆扫描件、音频、网页,想让大模型读懂,却卡在「格式转换」这一步。
今天给你安利一个微软刚开源、已经狂揽 16.7 万 Star 的狠角色:MarkItDown。一句话——把各种文件一键转成 Markdown,专门给大模型「喂料」。
🔥 项目地址:https://github.com/microsoft/markitdown | MIT 协议 | Python | 当前 16.7 万 Star
1)一键转换,告别复制粘贴
PDF、Word、PPT、Excel、图片、音频、HTML、CSV、JSON,甚至 YouTube 链接……统统能变成干净的 Markdown。标题、列表、表格、链接,结构都给你保住。
2)为大模型量身定制
Markdown 几乎是 GPT-4o 这类主流大模型的「母语」。它们训练时就吃了海量 Markdown,理解得最顺、最准,而且比 HTML / 富文本更省 token。你喂得越「对胃口」,它答得越聪明。
3)本地免费跑,零门槛
pip 一行就能装,基础功能不联网、不要 API Key,普通笔记本就能用。对比同类工具 textract,MarkItDown 更专注保留文档结构,微软出品也更有保障。
工具其实不少,但综合「轻量 + 开源 + 格式全 + 专为 LLM 而生」,MarkItDown 是目前最省心的一个。
下面手把手教你跑起来,零基础也能照着做。
MarkItDown 需要 Python 3.10 及以上。先确认一下版本:
python --version如果版本不够,去 python.org 装个新的就行。
为了避免依赖「打架」,建议建个虚拟环境(新手照抄即可):
# macOS / Linux
python -m venv .venv
source .venv/bin/activate
# Windows
python -m venv .venv
.venv\Scripts\activate看到命令行前面多了 (.venv),说明进环境了。
pip install 'markitdown[all]'[all] 表示把 PDF、Word、PPT、Excel 等所有格式的支持一次性装齐。如果你的电脑只处理某几种文件,也可以省着装,比如:
pip install 'markitdown[pdf, docx, pptx]'装完验证一下:
markitdown --help能弹出一堆参数说明,就成功了。

(正文配图 · AI 生成:杂乱文档 → 干净 Markdown)
① 命令行,最直接
把任意文件转成 Markdown,存到本地:
markitdown 你的文件.pdf -o 输出.md也可以不落地,直接「管道」喂给别的程序:
cat 你的文件.pdf | markitdown② Python 代码里调用
from markitdown import MarkItDown
md = MarkItDown()
result = md.convert("test.xlsx")
print(result.text_content)几行就能把 Excel 变成结构化文本,接进你的 AI 流程。
③ 进阶:让 AI 给图片 / 图表「写说明」
如果你想转换图片、或让 AI 读懂 PDF 里的图,给它配个大模型客户端(需要 OpenAI Key):
from markitdown import MarkItDown
from openai import OpenAI
client = OpenAI()
md = MarkItDown(llm_client=client, llm_model="gpt-4o")
result = md.convert("example.jpg")
print(result.text_content)这样图片里的信息也能变成文字,被大模型读懂。
说真的,MarkItDown 这种「把杂乱文件变成大模型爱吃的 Markdown」的小工具,用一次就回不去了。本地免费、开源、微软背书,16.7 万 Star 不是白给的。
不管是做知识库、RAG、文档分析,还是单纯想把资料整理干净,它都能省下你大把复制粘贴的时间。