Skip to main content

概览

这是一套开放的参考架构——并非匿名的客户案例。它展示了当目标是带引用的事实准确性而非快速网页摘要时,你可以在 Anysite MCP 之上构建什么。 Scientific Research Agent 是一个 Claude-Code 原生的研究编排器,覆盖 Anysite 的科研数据源(OpenAlex、Crossref、arXiv、bioRxiv、Europe PMC、Semantic Scholar、PubMed、ClinicalTrials.gov、PubChem、Google Patents、ORCID、ROR、Unpaywall 等)。它复刻了 Claude Code 的模式:一个主编排器对问题进行路由,按数据源家族分发专家子智能体,一个对抗式验证器用独立来源核实关键事实,再由综合器产出带引用的报告。 整个智能体都是纯 Markdown——角色、技能与各专家提示词。完整源码见下方,可直接复制并 fork。

5 个元工具

完全基于 discover / execute / get_page / query_cache / export_data 构建——无硬编码端点

20+ 个研究数据源

单一 MCP 接口横跨论文、身份/开放获取、临床、化学与专利

每条结论都有引用

每条非平凡结论都以规范标识符锚定到来源记录

挑战

扁平的网页搜索返回看似合理的散文;而科研工作需要可追溯、经交叉验证的事实。难点在于:
  • 选对数据源。 一个 DOI、一个 PMID、一个 NCT id、一个 ORCID、一个 ROR id、一个专利号——各自指向不同的权威来源。猜测端点和参数会浪费调用并产生错误数据。
  • 跨库连接实体。 价值不在单次查询,而在沿图游走:一篇论文到它的开放获取位置、它的作者、作者所属机构、机构的资助方、引用它的专利。这要求按标识符连接,而非按名称
  • 覆盖不止于表层。 关键词搜索只找到表面。规范的根基与前沿来自对引文图做滚雪球、并围绕实体做枢轴——以波次推进,直到饱和。
  • 彼此矛盾的指标。 引用数、样本量、优先权日期在不同数据库之间经常不一致。真正的答案会说明某个数字来自哪个来源,并标注分歧,而不是悄悄取平均。

架构

该智能体在单一 MCP 接口之上复现了 Claude Code 的编排模式:

工作原理

Discover 优先,无硬编码端点。 在对陌生的 source/category 对首次 execute 之前,智能体先调用 discover 读取端点名、参数 schema 和响应字段。新的 Anysite 解析器会被自动纳入——绝不靠猜。 自适应深度。 按 id 取数的查询会以寥寥几次 execute 线性回答。多实体、对比类或”梳理全景”类问题则升级为专家的并行 fan-out。 搜索以波次推进,直到饱和。 关键词播种(跨多引擎)→ 沿引文图滚雪球(向后引用得到根基、向前引用得到前沿、相关工作得到邻近簇)→ 实体枢轴(顶级作者、主题、机构、资助方)→ 按规范 ID 去重的覆盖登记表 → 完备性批判 → 补采轮次,直到不再出现新的规范工作。停止条件是饱和,而非调用计数器 按 ID 沿图游走是核心价值。 实体按标识符连接——DOI ↔ OpenAlex W-id ↔ Unpaywall OA ↔ ORCID ↔ ROR ↔ Crossref funder ↔ PMID/PMC ↔ patent docId——只要有 ID,就绝不按标题连接。 对抗式验证。 关键或有争议的事实(引用数、样本量、专利优先权日期)会与独立的第二来源核实;分歧作为发现被报告,而非被悄悄取平均。任何结论所依赖的工作都会检查撤稿标记。 效率内建。 discover 廉价,且总是先于首次 executeexecute 消耗额度,因此已取数据绝不重取——切片与聚合走 query_cache,翻页走 get_page
一个值得知道的字段,来自实测:对于 arXiv 原生工作(10.48550/arXiv.*),OpenAlex 会系统性地把引用数低估 1–2 个数量级——在 ML/LLM 前沿,请从 Semantic Scholar 取引用数与引文图。对于成熟的期刊 DOI,OpenAlex 则可靠且在图谱上更丰富。这类针对来源的调校都记录在 skills/source-map.md 中。

使用的数据源

所有数据源都通过同样的五个 MCP 元工具触达——智能体从不直接对接某个数据源的 SDK。

为什么是 Anysite

  • 单一 MCP 接口,众多数据源。 一套 discover / execute 契约横跨论文、身份、临床、化学与专利——无需集成十几个 API、十几套鉴权方案与 schema。
  • 图谱可触达。 引文的向后引用与向前引用、相关工作、带 ORCID 与 ROR 的署名、资助方、开放获取位置、专利引用家族——构成 360° 全景所需的跨源连接全部暴露在外。
  • 自我扩展。 因为智能体是 discover 优先的,新的 Anysite 解析器一经上线即可被它使用,无需改代码。

关键要点

  • 为引用而构建,而非为摘要。 把每条结论以 ID 锚定到来源记录,正是研究智能体区别于带联网的聊天机器人之处。
  • 价值在图谱,而非单次查询。 跨源按标识符连接实体——并用两个来源交叉核实一条事实——才是关键。
  • Discover 优先使其持久。 无硬编码端点意味着智能体随 API 接口增长,而不会被它弄坏。
  • 整个智能体就是纯 Markdown。 角色、技能与专家提示词都是可移植的文本——复制、fork,日后还能放进独立的 Agent SDK 封装里。

Full Agent Source (copy & fork)

下方的完整智能体即为事实来源。把这些文件放进一个目录,让 Claude Code 指向 CLAUDE.md,然后提出一个研究问题即可。每个文件都带复制按钮。