Connected Papers
免费
Connected Papers 是一个基于语义相似度的学术文献可视化探索工具。输入论文标题DOI 或 URL,即可生成一张力导向图,将相关论文按相似度聚类排列,并支持追溯领域奠基性工作(Prior Works)和追踪最新衍生研究(Derivative Works)。数据库依托 Semantic Scholar 论文语料库(ODC-BY 许可),覆盖数亿篇论文,适用于文献综述、课题调研、跨学科探索等学术场景。
Connected Papers 的核心参数与统计
Connected Papers 定位为学术文献的视觉探索助手,而非传统论文搜索引擎。它的核心交付物是一张力导向图(Force-Directed Graph),将语义相似的论文在二维空间中聚类展示。以下为关键参数与规格:
| 参数 | 数据 |
|---|---|
| 产品形态 | Web 应用 + API + Chrome 扩展 |
| 底层语料库 | Semantic Scholar Paper Corpus(ODC-BY 许可) |
| 论文覆盖量 | 约 2.36 亿篇(依托 Semantic Scholar) |
| 相似度算法 | 共引分析(Co-citation)+ 文献耦合(Bibliographic Coupling) |
| 可视化引擎 | 力导向图(Force-Directed Graph) |
| 图谱构建规模 | 单次分析约 50,000 篇论文,精选数十篇展示 |
| API 速率限制 | 默认 5 次构建/分钟 |
| 图谱缓存有效期 | 30 天(冷数据触发重建) |
| 图谱重建耗时 | 通常约 10 秒,最长 60 秒 |
| 开源客户端 | Python(connectedpapers-py,62 Stars,MIT) + JavaScript(connectedpapers-js,15 Stars,MIT) |
| GitHub 关注 | 64 关注者 |
| 浏览器扩展 | Chrome 扩展(支持 Google Scholar / arXiv / Semantic Scholar) |
规格解读:Connected Papers 不覆盖全部论文元数据检索,而是聚焦"给定一篇论文,找出与其最相关的论文集合"。这种 deep reading 辅助定位使其有别于 Google Scholar 的关键词搜索或 Semantic Scholar 的引用摘要。一次图谱构建需要分析约 5 万篇论文的引用关系,从中选出最具代表性的数十篇节点——这意味着查询成本并非简单的单篇论文检索,而是计算密集型的图谱运算。
Connected Papers 的用户与市场认可
Connected Papers 自 2021 年公开上线以来,在学术社区中获得了广泛的口碑传播,但团队未公开具体的注册用户数或月活跃量。
C 端采用:工具在 Reddit 的 r/MachineLearning、r/academia 等学术社区中频繁被推荐,Twitter/X 账号 @ConnectedPapers 保持产品更新推送。研究人员和研究生是核心用户群,尤其适用于领域初探、文献综述起步、跨学科课题调研等场景。Chrome 扩展的上线进一步降低了使用门槛——用户在 Google Scholar 或 arXiv 页面直接点击即可生成图谱。
B 端与 API 用户:团队在 2024 年推出了 Python 和 JavaScript SDK,面向需要批量获取论文关联数据的开发者。API 采用 Token 鉴权模式(需联系 [email protected] 申请 Early-Access Token),并设有免费测试额度。截至 2025 年 11 月的 API 更新,已引入更精细的速率限制和过载处理机制,表明 API 用户生态在持续增长。
对标与差异化:与 Semantic Scholar 的推荐功能SCITE 的引用分析Elicit 的论文问答等工具相比,Connected Papers 的核心差异在于"可视化图谱"的交互范式——它不是"告诉你哪些论文值得读",而是"让你看到论文之间的关系结构"。这种空间认知辅助可以减少研究者在大批文献中建立心理模型的时间。
Connected Papers 的成本优势
Connected Papers 的成本模型需要从 C 端用户API 开发者、企业/机构三个层面分析。
C 端/个人用户:核心 Web 功能免费开放,包括创建图谱、浏览 Prior Works 和 Derivative Works、交互式探索。免费用户受一定的使用频次限制(未公开具体额度)。Chrome 扩展同步免费。对预算有限的研究生和独立学者而言,这是一款零成本的文献探索工具。
API/开发者:API 采用 Token 制,需申请 Early-Access Token。提供 TEST_TOKEN 用于测试(仅限单篇论文)。API 的默认速率限制为 5 次构建/分钟,超出后返回 OVERLOADED 状态。已获取的论文图谱在 31 天内可免费重访,不计入配额。公开定价未发布,商务条款需联系 [email protected] 确认。
企业/机构:机构层面的定价方案未公开。对于需要大规模、批量化论文图谱分析的实验室或科研机构,当前需通过赞助渠道([email protected])沟通定制方案。
隐性成本:图谱构建等待时间(通常 10 秒,最长 60 秒)是主要的效率损耗点,但团队通过 31 天缓存在一定程度上缓解了重复查询的开销。对于批量处理场景,API 的 5 次/分钟速率限制可能导致较长的排队时间,需要应用层自行实现重试和调度。
Connected Papers 的主要功能
-
论文相似图谱(Graph):输入论文标题DOI、URL 或 Semantic Scholar ID,系统生成一张力导向图。节点代表论文,圆圈大小表示被引次数,颜色深浅表示发表时间。节点之间的边表示语义相似强度,相邻节点聚类代表研究方向相近。这是 Connected Papers 的核心交互单元,适用于快速理解一个子领域的论文分布结构。
-
Prior Works(奠基性工作):展示图谱中论文共同引用的早期经典文献。这一视图帮助研究者追溯一个研究方向的"根",快速定位奠基性论文,适合在文献综述中补充历史脉络。
-
Derivative Works(衍生工作):展示引用了图谱中论文的后继研究。这是传统"被引列表"的可视化升级——不仅能看谁引用了你,还能看到引用论文之间的聚类关系。对于追踪前沿动态、发现新兴研究方向尤其有用。
-
Chrome 浏览器扩展:在 Google Scholar、arXiv、Semantic Scholar、PubMed 等学术站点的论文页面上,嵌入"Connected Papers"按钮,一键跳转到图谱页面。这一功能消除了复制粘贴论文标题的摩擦,将图谱获取嵌入到研究者的日常检索流程中。
-
API 与 SDK:官方提供 Python 和 JavaScript 客户端,封装了图谱获取、用量查询、免费论文列表等 API 调用。支持同步/异步两种模式,以及异步迭代器实现实时进度追踪。适合需要将论文关联数据集成到自有工具链中的技术团队。
功能协同效应:Prior Works + Derivative Works + 核心图谱三者形成完整的时间轴闭有——从领域根基(Prior)到当前核心(Graph)再到前沿动态(Derivative)。Chrome 扩展将图谱入口嵌入到学术搜索场景中,消除了上下文切换成本。API 则允许实验室或机构将这种图谱能力注入到文献管理、写作辅助等自有系统,实现"一键查关系,批量建脉络"的工作流重构。
Connected Papers 的模型与版本演进
Connected Papers 不是大模型产品,没有"模型版本"概念,但其工具本身经历了清晰的功能迭代路径:
公开上线(v2021.1,约 2021 年 6 月)
工具以 Web 应用形态上线,主打力导向论文相似图。支持输入论文标题DOI 或 URL 生成图谱,提供 Prior Works 和 Derivative Works 两个辅助视图。这一阶段的重点是验证"可视化文献探索"这一交互范式是否被学术社区接受。
Chrome 扩展发布(v2023.1,约 2023 年 9 月)
发布浏览器扩展,将图谱入口嵌入 Google Scholar、arXiv、Semantic Scholar 等学术站点的论文页面。这一版本极大降低了使用门槛——用户在日常检索中就能一键获取图谱。扩展发布后成为 Connected Papers 最主要的流量入口之一。
API 与 SDK 发布(v2024.1,约 2024 年 6 月)
推出官方 Python SDK(connectedpapers-py)和 JavaScript SDK(connectedpapers-js),以 MIT 许可开源。提供 get_graph_sync/async、get_remaining_usages_sync/async、get_free_access_papers_sync/async 三个核心 API。引入 Token 鉴权机制。
API v2 与过载处理(v2025.2,约 2025 年 11 月)
重要的技术升级:将过去的 HTTP 500 错误替换为结构化的 OVERLOADED 状态码;客户端默认启用指数退避自动重试(5/10/20/40 秒,最多 4 次);引入异步迭代器模式,支持实时追踪图谱构建进度(QUEUED → IN_PROGRESS → FRESH_GRAPH);新增 fresh_only 和 wait_until_complete 参数控制缓存行为。这一版本显著提升了 API 的鲁棒性和开发者体验。
Connected Papers 的技术优势
共引+文献耦合的相似度度量:Connected Papers 不依赖论文标题或摘要的文本相似度,而是基于共引分析(Co-citation,两篇论文被同一批后来论文引用)和文献耦合(Bibliographic Coupling,两篇论文引用同一批早期文献)。这一机制的优势在于:引用关系的信噪比高于文本匹配,能发现"讨论同一问题但术语不同"的跨领域论文,同时天然规避了关键词同义异构的问题。
力导向图的可视化范式:传统文献检索呈现的是列表或引用树,而 Connected Papers 将论文在高维相似空间中的位置投影到二维平面,通过力导向布局(Force-Directed Graph)让相似论文在视觉上聚簇。用户通过观察节点的空间排布,能在几十秒内建立对一个领域论文分布结构的直觉认知——这在处理不熟悉的跨学科课题时尤其高效。
语义 Scholar 语料库的规模化支撑:底层使用 Semantic Scholar Paper Corpus(ODC-BY 许可),覆盖约 2.36 亿篇论文、横跨多学科。这意味着 Connected Papers 的覆盖范围远超仅限 PubMed 或 arXiv 的论文工具。每次图谱构建分析约 5 万篇论文的引用关系,再精选数十篇展示,是计算密集型但精度可控的方案。
缓存与冷热数据分层:构建后的图谱缓存 30 天,用户可以在缓存期内无额外延迟地重访;30 天后触发重建。API 层面更进一步,31 天内已访问的论文不计入用量配额。这种分层设计在大幅降低服务器负载的同时,保证了常规使用场景的低延迟体验。
客户端 SDK 的鲁棒性设计:Python SDK 内置指数退避重试(遇到 OVERLOADED 时依次等待 5/10/20/40 秒),verbose 模式提供实时构建进度日志,异步迭代器支持 QUEUED → IN_PROGRESS → FRESH_GRAPH 的完整状态追踪。这些工程细节在自动化聚类分析、定时文献追踪等场景中直接决定了集成的稳定性。
Connected Papers 的使用方法
Connected Papers 的使用入口分为 Web 端和 API 端两类,覆盖不同技术背景和自动化需求的使用者。
Web 端(推荐新手)
- 打开 https://www.connectedpapers.com/
- 输入论文的标题DOI、URL 或 Semantic Scholar ID
- 等待图谱构建(通常 10 秒左右,首次可能需要更长时间)
- 在力导向图中浏览:悬停节点查看论文摘要,点击节点高亮其与其他论文的相似路径
- 切换至"Prior Works"标签查看奠基性文献,切换至"Derivative Works"标签查看后续研究
- 使用搜索框右侧的"导出"功能(如有)保存图谱结果
Chrome 扩展
- 在 Chrome Web Store 安装 Connected Papers 扩展
- 打开 Google Scholar、arXiv、Semantic Scholar 或 PubMed
- 在任意论文页面找到"Connected Papers"按钮并点击
- 浏览器将自动跳转到对应的图谱页面
API 端(Python 示例)
from connectedpapers import ConnectedPapersClient
# 使用有境变量 CONNECTED_PAPERS_API_KEY 或在构造时传入
client = ConnectedPapersClient(access_token="YOUR_API_KEY")
# 获取论文图谱(同步)
graph = client.get_graph_sync("SEMANTIC_SCHOLAR_ID")
# 获取剩余用量
remaining = client.get_remaining_usages_sync()
# 列出可免费重访的论文
free_papers = client.get_free_access_papers_sync()
# 遍历 Prior Works(奠基性文献)
for paper in graph.common_references:
print(f"{paper.year}: {paper.title}")
# 遍历 Derivative Works(衍生文献)
for paper in graph.common_citations:
print(f"{paper.year}: {paper.title}")
API Key 申请:发送邮件至 [email protected] 获取 Early-Access Token。使用 TEST_TOKEN 可测试单篇固定论文的图谱获取。
Connected Papers 的产品定价
Connected Papers 的定价以分层模式覆盖不同使用深度,但高级 tier 的具体价格未公开:
| 层级 | 目标用户 | 核心权益 | 限制 | 价格 |
|---|---|---|---|---|
| 免费(Web) | 个人研究者、学生 | 创建图谱Prior/Derivative Works 浏览Chrome 扩展 | 使用频次未公开限制 | 免费 |
| API(开发者) | 技术团队、集成开发者 | Python/JS SDK、图谱构建 API、用量查询 | 5 次构建/分钟,Token 鉴权 | 需联系商务(未公开) |
| 赞助/企业 | 实验室、机构 | 自定义配额、技术支持 | 按需协商 | 需联系 [email protected] |
免费层真相:Web 端的免费使用在多数日常调研场景下足够胜任,但频次限制(未公开具体数值)可能在密集使用时触发。"免费"不等于"无限"——这是团队控制服务器负载的手段。API 的速率限制(5 次/分钟)对于批量处理场景是显性瓶颈,但 31 天的缓存重访机制提供了补偿:同一篇论文在 31 天内反复获取不计入配额。
隐性成本:主要来自图谱构建等待时间(最长 60 秒)和 API 限速带来的排队。对于需要每周追踪多个领域论文变化的团队,建议结合缓存策略和限速调度,而非实时逐篇请求。
Connected Papers 的应用场景
-
文献综述撰写:进入新课题时,输入该领域的核心论文,利用 Prior Works 定位奠基性文献,利用 Derivative Works 发现最新进展。图谱的可视化结构帮助综述作者快速形成"领域地图",避免陷入关键词搜索的盲区。核验重点:图谱是否能覆盖该领域的多方向分支,是否存在明显的关键论文遗漏。
-
跨学科课题调研:当研究涉及多个学科交叉时,关键词搜索往往因术语差异而难以奏效。Connected Papers 的共引/耦合相似度机制能发现"虽然术语不同但引用关系高度重叠"的研究——这在 AI+医学、计算社会科学等交叉领域特别有价值。核验重点:起始论文的选择直接影响图谱质量,建议从多篇代表性论文分别建图交叉验证。
-
学术写作参考书目补全:在论文初稿完成后,将引用列表中的核心论文逐一建图,检查 Prior Works 中是否有本应引用但遗漏的经典文献。这一"引用完整性检查"是 Connected Papers 的低频但高价值用法。核验重点:图谱的质量受限于 Semantic Scholar 的论文覆盖范围——少数领域或非英文文献可能存在覆盖不足。
-
研究生课程入门:导师或教授在课程开始时,为学生提供该领域的 2-3 篇起始论文,要求使用 Connected Papers 探索相关文献网络并提交领域分析报告。这一用法在教育场景中低门槛、高效率,适合培养新一代研究生的文献检索素养。
-
技术竞品/专利文献监测:企业研发团队可以使用 API 定期对关注的技术论文建图,追踪衍生工作中可能出现的新竞争者或新方向。API 的缓存机制和 Python SDK 的集成能力使这种自动化监测成为可能。
Connected Papers 的适用人群
-
科研工作者(硕博研究生、博士后、教授):最核心的用户群体。适合需要快速进入新领域、撰写文献综述、追踪前沿动态的学术研究场景。前置条件:需要有一定英文论文阅读能力(界面语言为英语);不适合对非英文文献(如大量中文论文)有强需求的领域。
-
跨学科研究者:Connected Papers 的引用关系相似度对跨学科探索特别有价值。如果你正在涉足一个不熟悉的交叉领域,它能帮你快速建立"谁在研究什么、成果之间如何关联"的认知框架。不适配边界:对于极其小众、论文量少的学科,图谱节点可能过于稀疏,参考意义下降。
-
学术写作支持者(论文编辑、科研助理):在论文参考文献审核、补充引用完整性等任务中,Connected Papers 可作为辅助工具使用。前置条件:需要能获取论文的 Semantic Scholar ID 或 DOI。
-
开发者与集成工程师:通过 Python/JS SDK 将论文图谱能力集成到自有工具链中——文献管理工具、科研助手、论文推荐系统等。前置条件:需要申请 API Token 并遵守速率限制;建议具备异步编程和错误重试处理能力。
-
研究生导师与课程教师:将 Connected Papers 作为课堂工具,引导学生探索文献图谱,培养独立文献检索能力。注意:工具适合作为"探索起点"而非"权威文献清单"——图谱结果不应替代系统性关键词检索和数据库查询。
Connected Papers 的总结与展望
Connected Papers 在学术文献工具谱系中占据了一个独特的生态位:它不是搜索工具,不是引文数据库,而是一张论文关系的"地图"。这种从"查询"到"探索"的交互范式转换,正是它被学术社区持续推荐的核心原因。它的技术路线——基于共引/耦合的相似度计算 + 力导向图的可视化——不是最前沿的 NLP 方案,但在这个具体问题上足够有效,并且在透明性和可解释性上优于黑盒嵌入模型。
当前局限:图谱质量高度依赖 Semantic Scholar 的论文覆盖和引用数据质量,非英文文献、人文社科类论文的覆盖率偏低;免费层的频次限制未公开,用户在密集使用时可能遇到不可预期的阻断;API 的 5 次/分钟速率限制对批量处理不够友好,且高级 tier 的定价不透明,影响企业级采用决策;团队规模较小,功能迭代和问题响应速度可能慢于商业化产品。
未来观察点:商业化定价方案的透明度是否会改善;是否会引入用户账号体系以支持图谱收藏、笔记等协作功能;API 的速率和配额是否会随着用户增长而调整;团队是否有融资或加入加速器计划,从而加速产品迭代。
采购/采用风险评估:对于个人研究者或单个课题组,C 端免费功能已能覆盖大部分文献探索需求,零成本进入几乎无风险。对于计划围绕 API 构建文献自动化管线的团队,建议先使用 TEST_TOKEN 验证 API 的图谱质量和延迟能否满足需求,再联系团队获取正式 Token 和商务报价。企业级采用前需要确认 SLA、数据隐私条款和高级配额方案——这些信息当前均未公开,需通过 [email protected] 逐一确认。
核心参数与统计
相关信息未公开,以官方实时页面为准。
用户与市场认可
相关信息未公开,以官方实时页面为准。
成本优势
相关信息未公开,以官方实时页面为准。
主要功能
相关信息未公开,以官方实时页面为准。
模型与版本演进
相关信息未公开,以官方实时页面为准。
技术优势
相关信息未公开,以官方实时页面为准。
如何使用
相关信息未公开,以官方实时页面为准。
产品定价
相关信息未公开,以官方实时页面为准。
应用场景
相关信息未公开,以官方实时页面为准。
适用人群
相关信息未公开,以官方实时页面为准。
总结与展望
相关信息未公开,以官方实时页面为准。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- Connected Papers API v2 (2025-11) :API 更新:引入 OVERLOADED 状态码替代 HTTP 500;新增指数退避重试机制(5/10/20/40 秒);支持异步迭代器模式实时追踪图谱构建进度。
- Python & JS SDK 发布 :发布官方 Python 客户端 connectedpapers-py 和 JavaScript 客户端 connectedpapers-js,支持同步/异步 API 调用,提供图谱获取、用量查询、免费论文列表接口。
- Chrome 扩展发布 :发布 Chrome 浏览器扩展,支持在 Google Scholar、arXiv、Semantic Scholar 等页面一键生成论文图谱。暂无官方精确日期。
- 公开上线 :Connected Papers 正式面向公众开放,支持输入论文标题/DOI/URL 生成相似论文图谱,提供 Prior Works 和 Derivative Works 视图。暂无官方精确日期。
用户评价