返回市场
数据传输-MCP服务器

数据传输-MCP服务器

作者:Hellblazer4 星标更新:2025-09-07

项目介绍

DEVONthink MCP 服务器

一个模型上下文协议(MCP)服务器,集成 Claude Desktop 和 Claude Code 与 DEVONthink 4,提供对 DEVONthink 的人工智能能力的访问,用于文档管理和研究自动化。

最新更新(v2.1.0 - 第四阶段):通过批量操作、工作流编排和大型研究项目的基础设施,实现高级研究自动化。详情请参阅 第四阶段文档

Node.js CI License: MIT macOS DEVONthink

概述

此 MCP 服务器围绕 DEVONthink 4 的原生能力提供了一个封装,通过 MCP 协议暴露了 47 个完全实现的专业工具,用于文档操作、知识管理和高级研究自动化

所有工具都实现了完整的功能 - 没有存根、模拟或占位符。

主要特性

  • 原生 AI 集成:使用 DEVONthink 4 内置的人工智能分类和相似性检测
  • 高级搜索:支持布尔运算符和字段搜索的完整 DEVONthink 搜索语法
  • 智能组:访问 DEVONthink 的组织功能
  • 知识图谱:文档关系映射及迭代遍历
  • 研究自动化:研究任务的自动化工作流
  • 文档智能:分析、比较和综合能力
  • ⚡ 第四阶段:批量操作、工作流编排以及大型研究项目的基础设施

快速开始

先决条件

安装

# 克隆并设置
git clone https://github.com/Hellblazer/dt-mcp.git
cd dt-mcp
npm install

# 验证安装
npm run test:scripts

配置

  1. Claude Desktop - 添加到 claude_desktop_config.json

    {
      "mcpServers": {
        "devonthink": {
          "command": "node",
          "args": ["/绝对路径/to/dt-mcp/server.js"],
          "env": {}
        }
      }
    }
    
  2. Claude Code - 使用 MCP 集成

  3. 权限 - 在系统设置中授予 DEVONthink 自动化权限

工具参考

核心操作(8 个工具)

search_devonthink          # 使用 DEVONthink 语法进行文档搜索
read_document              # 文档内容和元数据
create_document            # 创建新文档
list_databases             # 数据库枚举
update_tags                # 标签管理
get_related_documents      # AI 建议的关系
create_smart_group         # 动态集合
ocr_document               # 从 PDF 和图像中提取文本

高级搜索与组织(2 个工具)

advanced_search            # 支持运算符(AND, OR, NOT, 字段:值)的完整搜索语法
list_smart_groups          # 访问 DEVONthink 的组织功能

知识图谱与关系(5 个工具)

build_knowledge_graph      # 可控深度的可视化关系映射
find_shortest_path         # 文档之间的 BFS 路径查找
detect_knowledge_clusters  # AI 驱动的文档聚类
find_connections           # 多类型关系发现
compare_documents          # 文档相似性分析

研究自动化(3 个工具)

automate_research          # 完整的研究工作流
organize_findings          # 性能优化的结果组织
create_collection          # 研究项目集合

文档智能(3 个工具)

analyze_document           # 复杂性和可读性分析
analyze_document_similarity # 多文档比较(性能优化)
batch_read_documents       # 并行文档处理

知识综合(8 个工具)

synthesize_documents       # 多文档综合(性能优化)
extract_themes             # AI 主题识别
classify_document          # 原生 DEVONthink AI 分类
get_similar_documents      # AI 驱动的相似性查找
create_multi_level_summary # 分层总结(简略/详细/全部)
track_topic_evolution      # 时间跨度的主题变化分析
create_knowledge_timeline  # 按时间顺序的知识映射
identify_trends            # 趋势主题检测

批量操作(2 个工具)

batch_search               # 并行执行多个搜索
batch_read_documents       # 多文档读取

集合(2 个工具)

create_collection          # 文档集合/研究线程
add_to_collection          # 将文档添加到集合

第四阶段:高级研究自动化(6 个工具)

bulk_import_urls           # 并发导入多个 URL 并跟踪进度
bulk_download_papers       # 批量下载学术论文并提取元数据
create_research_project    # 创建全面的研究项目结构
execute_workflow           # 执行预定义的研究工作流
monitor_operations         # 监控活动操作和系统资源
manage_operation_queue     # 管理操作队列并控制优先级

元工具(1 个工具)

get_tool_help              # 带有示例的 AI 友好帮助系统

使用示例

研究工作流

1. "搜索 2023 年的 '量子计算' 论文"
   → 使用 advanced_search,日期:2023 AND 量子 AND 计算

2. "从最佳结果构建知识图谱"
   → 使用 build_knowledge_graph,深度 3

3. "创建研究集合"
   → 使用 create_collection 创建 "量子研究项目"

4. "综合前 5 份文档"
   → 使用 synthesize_documents,共识方法

5. "哪些主题正在流行?"
   → 使用 identify_trends 跨数据库

高级搜索示例

# 布尔运算符
"量子 AND 物理学 OR 数学"

# 字段搜索
"名称:量子 标签:物理学 注释:重要"

# 通配符和模糊匹配
"quant* ~量子"

# 精确短语
"\"量子计算\""

# 日期范围
"日期:2023 AND 类型:pdf"

知识发现

# 查找文档聚类
detect_knowledge_clusters → 按 AI 主题分组

# 概念之间的最短路径
find_shortest_path from_uuid to_uuid → 连接链

# 文档相似性
get_similar_documents uuid → AI 排序的相关文档

# 智能组
list_smart_groups → 所有组织智能组

第四阶段:大规模研究自动化

# 批量操作
bulk_import_urls ["url1", "url2", "url3"] → 并发导入多个 URL
bulk_download_papers [{来源: "arxiv", id: "2301.00001"}, {...}] → 下载论文

# 研究项目设置
create_research_project "量子 AI 研究" → 完整项目结构 + 初始来源

# 工作流编排
execute_workflow "学术研究" {主题: "量子计算"} → 多步骤自动化

# 系统监控
monitor_operations → 实时进度、资源使用、活动操作
manage_operation_queue "暂停" → 控制并发操作

技术规范

参数限制与验证

  • 批量操作:每批最多 1000 项以获得最佳性能
  • 搜索结果:默认限制 50 条,最大 1000 条(更大的结果可能会超时)
  • UUID 格式:标准格式 XXXXXXXX-XXXX-XXXX-XXXX-XXXXXXXXXXXX(不区分大小写)
  • 超时:单个操作超时 2 分钟,复杂操作超时 10 分钟

性能指南

操作推荐限制性能影响
batch_search最多 20 个查询线性扩展
batch_read_documents100 份文档内存密集型
synthesize_documents50 份文档CPU 密集型(使用优化)
track_topic_evolution所有时段可能返回 200+ 条目

文档类型支持

OCR 能力

  • 支持:基于图像的 PDF、PNG、JPEG、TIFF、GIF
  • 不支持:基于文本的 PDF(已有文本)、Word 文档、电子表格
  • 注意:仅在基于图像的文档上使用 ocr_document

文档创建

  • 支持类型markdownrtftxt
  • 文件扩展名:根据类型自动添加
  • 内容验证:名称和内容必须是非空字符串

错误处理

所有工具返回结构化的错误响应:

{
  "error": "描述性错误消息",
  "details": {
    "工具": "工具名称",
    "时间戳": "ISO-8601",
    附加上下文
  }
}

响应格式标准

成功操作返回:

{
  "状态": "成功",
  "数据": { /* 工具特定的数据 */ },
  "元数据": {
    "时间戳": "ISO-8601",
    "工具": "工具名称"
  }
}

架构

设计理念

Claude ↔ MCP 服务器 ↔ DEVONthink 4 AI
   ↑         ↑              ↑
请求   薄封装   原生 AI

此服务器封装了 DEVONthink 4 的原生 AI 能力,而不是重新实现它们,提供了对训练模型和优化算法的直接访问。

性能

优化操作

多个工具具有性能优化变体,通过采样文档内容来加快处理速度:

操作原始时间优化时间采样策略
synthesize_documents30+ 秒<1 秒每篇文档前 200 词
analyze_document_similarity2+ 分钟<1 秒每篇文档前 100 词
主题提取变量0.26 秒原生 AI 分类
分类变量<1 秒原生 AI 模型

性能特征

  • 自动优化:工具在可用时自动使用优化版本
  • 智能回退:当优化版本返回的数据不足时回退到完整分析
  • 可配置超时:长时间操作具有可配置的超时保护
  • 结果验证:确保接受优化输出之前的质量结果

测试与质量

测试覆盖率

# 快速验证(30 秒)
npm run test:scripts

# 综合测试(2-5 分钟)
npm run test:comprehensive

# 单个工具测试
npm run test:tool synthesize_documents '{"documentUUIDs": ["UUID1", "UUID2"], "synthesisType": "summary"}'

# 交互式探索
npm run test:mcp

质量指标

  • 成功率:生产构建 >95%
  • 性能:大多数操作亚秒级,带有智能优化
  • 错误处理:结构化的 JSON 错误响应和优雅的回退
  • 文档:完整的工具覆盖,带有示例和性能说明
  • 代码质量:AppleScript 保留字和语法验证

开发

添加新工具

  1. AppleScript:在 scripts/devonthink/new_feature.applescript 中创建
  2. 服务方法:添加到 src/services/devonthink.js
  3. 工具注册:在 server.js 中使用 Zod 验证注册
  4. 测试:添加到测试套件
  5. 文档:更新 README 和 CLAUDE.md

性能指南

  • 当可用时使用 DEVONthink 的原生 AI 功能
  • 为计算密集型操作创建优化版本
  • 智能采样文档内容(例如,前 N 个词)
  • 直接实现结构化算法(BFS、路径查找)
  • 添加超时保护和回退机制
  • 在接受优化输出之前验证结果
  • 在工具响应中包括性能指标

第四阶段:高级研究自动化

第四阶段 将 DEVONthink MCP 服务器从单独的操作转变为一个复杂的自动化研究平台。这一阶段引入了基础设施组件,使大型研究项目能够进行批量操作和工作流编排。

基础设施组件

  • 🔄 操作队列:管理具有优先级调度和资源限制的并发操作
  • 📊 进度追踪器:实时进度追踪,带有 ETA 计算和子操作支持
  • 🖥️ 资源监控器:系统资源监控,带有内存追踪和性能警报
  • 🤖 工作流自动化:多步工作流编排,内置研究模板

可用的研究工作流

  1. 学术研究:搜索 → 下载 → 组织 → 综合 → 报告
  2. 文献综述:收集 → 分类 → 比较 → 时间线 → 综合
  3. 数据收集:导入 → 处理 → 验证 → 结构化 → 导出

性能优势

  • 并发处理:智能队列下同时处理 10+ 操作
  • 进度可见性:长运行研究任务的实时更新
  • 资源意识:基于系统性能的自动节流
  • 工作流模板:常见研究模式的预建自动化

使用案例

  • 学术研究人员:从多个来源批量下载和组织研究论文
  • 内容策展人:自动组织数十个 URL 的导入和处理
  • 知识工作者:执行复杂的研究工作流,最小的手动干预
  • 数据科学家:自动化文献综述和知识综合

项目状态

  • 版本:2.1.0(第四阶段)
  • 实现:✅ 100% 完成 - 所有 47 个工具完全实现
  • 工具:47 个专业 MCP 工具(包括 6 个第四阶段工具)
  • 基础设施:超过 76,903 行自动化代码
  • 测试:全面测试套件 + CI/CD + 第四阶段验证
  • 架构:原生 AI 封装,具备生产就绪的基础设施
  • 质量:具备批量操作和工作流编排的生产就绪
  • 状态:🚀 无存根或占位符 - 所有功能均已实现

贡献

  1. 分叉仓库
  2. 创建功能分支
  3. 为新功能添加测试
  4. 确保所有测试通过:npm run test:comprehensive
  5. 提交拉取请求

许可

MIT 许可证 - 详情见 LICENSE 文件。

相关


状态:生产就绪
架构:围绕 DEVONthink 4 原生 AI 能力的封装