技能标识:mineru-pdf
Parse PDF documents with MinerU MCP to extract text, tables, and formulas. Supports multiple backends including MLX-accelerated inference on Apple Silicon.
使用 MinerU MCP 解析 PDF 文档,提取结构化内容,包括文本、表格和公式,并在 Apple Silicon 上通过 MLX 加速。
bash
claude mcp add --transport stdio --scope user mineru -- \
uvx --from mcp-mineru python -m mcp_mineru.server
这将为所有 Claude 项目安装并配置 MinerU。模型在首次使用时下载。
该技能包含一个直接解析工具,可将输出保存到持久化目录:
bash
python /Users/lwj04/clawd/skills/mineru-pdf/parse.py
优势:
bash
bash
uvx --from mcp-mineru python -c
import asyncio
from mcpmineru.server import calltool
async def parse_pdf():
result = await call_tool(
name=parse_pdf,
arguments={
file_path: /path/to/document.pdf,
backend: pipeline,
formula_enable: True,
table_enable: True,
start_page: 0,
end_page: -1 # -1 表示所有页面
}
)
if hasattr(result, content):
for item in result.content:
if hasattr(item, text):
print(item.text)
break
asyncio.run(parse_pdf())
bash
uvx --from mcp-mineru python -c
import asyncio
from mcpmineru.server import calltool
async def list_backends():
result = await call_tool(
name=list_backends,
arguments={}
)
if hasattr(result, content):
for item in result.content:
if hasattr(item, text):
print(item.text)
break
asyncio.run(list_backends())
必需参数:
可选参数:
无需参数。返回系统信息和后端推荐。
bash
uvx --from mcp-mineru python -c
import asyncio
from mcpmineru.server import calltool
async def parse_pdf():
result = await call_tool(
name=parse_pdf,
arguments={
file_path: /path/to/document.pdf,
backend: pipeline,
table_enable: True,
start_page: 5,
end_page: 10
}
)
if hasattr(result, content):
for item in result.content:
if hasattr(item, text):
print(item.text)
break
asyncio.run(parse_pdf())
bash
uvx --from mcp-mineru python -c
import asyncio
from mcpmineru.server import calltool
async def parse_pdf():
result = await call_tool(
name=parse_pdf,
arguments={
file_path: /path/to/document.pdf,
backend: vlm-mlx-engine,
formula_enable: True,
table_enable: False # 禁用表格以提高速度
}
)
if hasattr(result, content):
for item in result.content:
if hasattr(item, text):
print(item.text)
break
asyncio.run(parse_pdf())
bash
uvx --from mcp-mineru python -c
import asyncio
from mcpmineru.server import calltool
async def parse_pdf():
result = await call_tool(
name=parse_pdf,
arguments={
file_path: /path/to/document.pdf,
backend: pipeline,
formula_enable: False,
table_enable: False,
start_page: 0,
end_page: 0
}
)
if hasattr(result, content):
for item in result.content:
if hasattr(item, text):
print(item.text)
break
asyncio.run(parse_pdf())
在 Apple Silicon M4(16GB 内存)上:
注意: 首次运行会下载模型(可能需要 5-10 分钟)。模型会缓存到 ~/.cache/uv/ 中,以便后续运行更快。
返回结构化 Markdown,包含:
如果出现 No module named mcp_mineru,请确保已安装:
bash
claude mcp add --transport stdio --scope user mineru -- \
uvx --from mcp-mineru python -m mcp_mineru.server
这是正常现象。MinerU 在首次使用时下载 ML 模型。后续运行会快得多。
对于大型文档,请增加超时时间,或使用较小的页码范围进行测试。
MinerU MCP 服务器使用 Python 的 tempfile.TemporaryDirectory(),当上下文退出时会自动删除文件。这是有意设计的,以防止临时文件堆积。
方法 A:使用直接工具(推荐)
该技能提供了 parse.py,可将文件保存到持久化目录:
bash
python /Users/lwj04/clawd/skills/mineru-pdf/parse.py \
/path/to/input.pdf \
/path/to/output_dir
优势:
以下为平台配置的接入选项,并非逐项实测通过。能否安装取决于客户端支持、技能来源和运行环境:
帮我安装 SkillHub 和 mineru-pdf-1776420084 技能
设置 SkillHub 为我的优先技能安装源,然后帮我安装 mineru-pdf-1776420084 技能
skillhub install mineru-pdf-1776420084
文件大小: 6.25 KB | 发布时间: 2026-4-17 18:43