标签:文本提取
包含标签「文本提取」的全部资源
共 66 个结果
PDF文本提取服务
一个基于pdf2json库的MCP服务器,提供PDF文本和表单字段的提取功能,支持多种输出格式。
PDF文本提取工具
MCP服务器,用于从PDF文件中提取文本,并支持通过Tesseract OCR从嵌入的图像中提取文本。
网页内容抓取工具
一个用于Claude桌面的MCP服务器,允许通过提供链接抓取网页文本、YouTube视频字幕和PDF文件内容。
MCP PDF Reader Enhanced
MCP PDF Reader Enhanced 是一个基于 Model Context Protocol (MCP) 的服务器,提供高级的 PDF 文本提取、搜索和分析功能。该服务支持从 PDF 文件中提取文本内容、搜索特定文本、提取元数据等功能,并具备文件大小限制、异步处理等特性。适用于需要处理和分析 PDF 文档的场景。
PDF处理服务
一个基于PyPDFium2的PDF处理和分析服务,提供文本提取、元数据提取、搜索、页面操作、表格处理等功能。
语音识别服务
提供通过stdio和MCP模式的语音识别和文本提取功能,支持从文件和base64编码数据中识别语音,并生成结构化结果。
文档聊天应用
一个基于Django的聊天应用,支持文档上传并与AI代理进行交互,利用文档内容回答问题。
Office文档处理服务
一个高性能的Office文档处理服务,支持PDF、Excel、Word和PowerPoint文件的读取、文本提取和幻灯片快照生成。
文档文本提取服务
一个跨平台的文档文本提取服务,支持PDF、Excel、Word等多种格式,具有流式处理、编码检测和速率限制功能。
文档解析服务
瞬析 (DocPilot MCP) 是一个基于WindData DocParse API的本地MCP服务,用于从PDF、Word和图片中提取文本和结构。
OCR文档解析服务
一个基于Python构建的OCR(光学字符识别)服务,通过本地PaddleOCR服务从复杂图像和PDF中提取文本和布局,支持多语言文本识别。
PDF处理服务器
PDF Reader MCP是一个生产就绪的PDF处理服务器,为AI代理提供企业级PDF处理能力,包括文本、图像和元数据提取。
PDF文本解析工具
一个用于从PDF URL中提取文本内容的模型上下文协议(MCP)服务器工具。
文档处理服务器
Aparavi MCP服务器是一个集成了Aparavi文档处理能力的模型上下文协议服务器,允许语言模型通过API处理文档并获取清理后的文本输出。
二进制文档搜索工具
MCP服务器,用于搜索和读取二进制文档文件(如PDF、DOCX等),支持多种格式的文本提取和搜索功能。
EPUB解析服务
一个基于TypeScript的EPUB解析服务,用于提取元数据、目录结构和文本内容,支持AI辅助的高级搜索功能。
B站视频转文字服务
一个将B站视频内容提取并格式化为结构化文本的MCP服务器,优化用于大模型处理和分析。
PDF解析服务器
一个从URL获取PDF并智能解析以供AI使用的服务器,支持文本提取、图像渲染和混合模式。
HWP文档处理工具
一个基于Rust的CLI工具,用于处理HWP/HWPX文档,包括文本提取、元数据检查、文档转换等功能。
PDF文件处理服务
一个基于FastMCP的PDF文件阅读服务器,支持PDF文本提取、OCR识别和图像提取,提供内置的Web调试器以便测试。
PDF文本提取服务
该服务通过MCP服务器赋予LLMs读取PDF文件的能力,能够提取文本、表格和结构化内容,并以纯文本、Markdown或CSV格式返回。
PDF文本提取服务
一个高效的PDF文本提取服务,支持读取、搜索和提取PDF文件中的文本和元数据,优化了Claude Code的上下文窗口使用。
PDF文本提取工具
一个基于MCP协议的Python工具,用于从PDF文件中提取和读取页面,适用于LM Studio等前端。
YouTube转录提取服务器
一个基于Python的独立服务器,用于从YouTube视频中提取转录文本,支持自动语言检测、本地文件持久化和播放列表处理。
