From 96b2abbb6a27d0f82e6901f807d8925e1ef9729d Mon Sep 17 00:00:00 2001 From: wehub-skill-sync Date: Mon, 13 Jul 2026 21:36:33 +0800 Subject: [PATCH] chore: import zh skill huggingface-papers --- README.wehub.md | 9 ++ SKILL.md | 239 ++++++++++++++++++++++++++++++++++++++++++++++++ 2 files changed, 248 insertions(+) create mode 100644 README.wehub.md create mode 100644 SKILL.md diff --git a/README.wehub.md b/README.wehub.md new file mode 100644 index 0000000..8e3e2cc --- /dev/null +++ b/README.wehub.md @@ -0,0 +1,9 @@ +# WeHub 来源说明 + +- Skill 名称:`huggingface-papers` +- 中文类目:Hugging Face 论文页读取与总结 +- 上游仓库:`huggingface__skills` +- 上游路径:`skills/huggingface-papers/SKILL.md` +- 上游链接:https://github.com/huggingface/skills/blob/HEAD/skills/huggingface-papers/SKILL.md +- 本仓库为 WeHub 中文 Skill 汉化包,基于 skill 市场筛选 Top200 清单整理 +- 原作者、版权和许可证信息以上游仓库为准 diff --git a/SKILL.md b/SKILL.md new file mode 100644 index 0000000..f36e8a2 --- /dev/null +++ b/SKILL.md @@ -0,0 +1,239 @@ +--- +name: huggingface-papers +description: 以 Markdown 格式查阅 Hugging Face 论文页面,并通过论文 API 获取结构化元数据,如作者、关联的模型/数据集/Spaces、GitHub 仓库及项目主页。当用户分享 Hugging Face 论文页面 URL、arXiv URL 或 ID,或要求总结、解释、分析某篇 AI 研究论文时使用。 +--- + +# Hugging Face 论文页面 + +Hugging Face 论文页面(hf.co/papers)是一个基于 arXiv(arxiv.org)构建的平台,专门面向人工智能(AI)和计算机科学领域的研究论文。Hugging Face 用户可在 hf.co/papers/submit 提交自己的论文,论文会展示在每日论文推荐(Daily Papers)信息流(hf.co/papers)上。每天,用户可以对论文进行点赞和评论。每篇论文页面允许作者: +- 认领自己的论文(点击 `authors` 字段中的自己的名字)。这会使论文页面显示在作者的 Hugging Face 个人主页上。 +- 通过在模型卡片、数据集卡片或 Space 的 README 中包含 Hugging Face 论文或 arXiv URL,关联相应的模型检查点、数据集和 Spaces。 +- 关联 GitHub 仓库和/或项目主页 URL。 +- 关联 Hugging Face 组织。这也会使论文页面显示在该组织的 Hugging Face 组织页面上。 + +每当有人在模型卡片、数据集卡片或 Space 仓库的 README 中提及 Hugging Face 论文或 arXiv 摘要/PDF URL 时,该论文将被自动索引。请注意,并非所有在 Hugging Face 上被索引的论文都会被提交到每日论文推荐中。后者更多地是一种推广研究论文的方式。论文在 arXiv 上发布之日起 14 天内才能被提交到每日论文推荐中。 + +Hugging Face 团队构建了一个易于使用的 API 来与论文页面交互。可以获取论文的 Markdown 格式内容,也可以返回结构化元数据,例如作者姓名、关联的模型/数据集/Spaces、关联的 GitHub 仓库及项目主页。 + +## 何时使用 + +- 用户分享 Hugging Face 论文页面 URL(例如 `https://huggingface.co/papers/2602.08025`) +- 用户分享 Hugging Face Markdown 论文页面 URL(例如 `https://huggingface.co/papers/2602.08025.md`) +- 用户分享 arXiv URL(例如 `https://arxiv.org/abs/2602.08025` 或 `https://arxiv.org/pdf/2602.08025`) +- 用户提及 arXiv ID(例如 `2602.08025`) +- 用户要求你总结、解释或分析某篇 AI 研究论文 + +## 解析论文 ID + +建议从用户提供的内容中解析出论文 ID(arXiv ID): + +| 输入 | 论文 ID | +| --- | --- | +| `https://huggingface.co/papers/2602.08025` | `2602.08025` | +| `https://huggingface.co/papers/2602.08025.md` | `2602.08025` | +| `https://arxiv.org/abs/2602.08025` | `2602.08025` | +| `https://arxiv.org/pdf/2602.08025` | `2602.08025` | +| `2602.08025v1` | `2602.08025v1` | +| `2602.08025` | `2602.08025` | + +这样你就可以将论文 ID 用于下面提到的任何 Hub API 端点。 + +### 以 Markdown 格式获取论文页面 + +论文内容可以通过如下方式以 Markdown 格式获取: + +```bash +curl -s "https://huggingface.co/papers/{PAPER_ID}.md" +``` + +这将返回 Hugging Face 论文页面的 Markdown 内容。该功能依赖于 https://arxiv.org/html/{PAPER_ID} 上论文的 HTML 版本。 + +存在两种例外情况: +- 并非所有 arXiv 论文都有 HTML 版本。如果论文的 HTML 版本不存在,则内容会回退到 Hugging Face 论文页面的 HTML。 +- 如果返回 404,说明该论文尚未在 hf.co/papers 上索引。详见[错误处理](#error-handling)。 + +或者,你也可以通过普通论文页面 URL 请求 Markdown 内容,方式如下: + +```bash +curl -s -H "Accept: text/markdown" "https://huggingface.co/papers/{PAPER_ID}" +``` + +### 论文页面 API 端点 + +所有端点均使用基础 URL `https://huggingface.co`。 + +#### 获取结构化元数据 + +使用 Hugging Face REST API 以 JSON 格式获取论文元数据: + +```bash +curl -s "https://huggingface.co/api/papers/{PAPER_ID}" +``` + +返回的结构化元数据可包含: + +- 作者(姓名及 Hugging Face 用户名,如果他们已认领该论文) +- 媒体 URL(提交论文到每日论文推荐时上传的) +- 摘要(摘要)及 AI 生成的摘要 +- 项目主页和 GitHub 仓库 +- 组织及互动元数据(点赞数) + +要查找与论文关联的模型,请使用: + +```bash +curl https://huggingface.co/api/models?filter=arxiv:{PAPER_ID} +``` + +要查找与论文关联的数据集,请使用: + +```bash +curl https://huggingface.co/api/datasets?filter=arxiv:{PAPER_ID} +``` + +要查找与论文关联的 Spaces,请使用: + +```bash +curl https://huggingface.co/api/spaces?filter=arxiv:{PAPER_ID} +``` + +#### 认领论文作者身份 + +为 Hugging Face 用户认领论文的作者身份: + +```bash +curl "https://huggingface.co/api/settings/papers/claim" \ + --request POST \ + --header "Content-Type: application/json" \ + --header "Authorization: Bearer $HF_TOKEN" \ + --data '{ + "paperId": "{PAPER_ID}", + "claimAuthorId": "{AUTHOR_ENTRY_ID}", + "targetUserId": "{USER_ID}" + }' +``` + +- 端点:`POST /api/settings/papers/claim` +- 请求体: + - `paperId`(字符串,必填):正在认领的 arXiv 论文标识符 + - `claimAuthorId`(字符串):正在认领的论文中的作者条目,24 字符十六进制 ID + - `targetUserId`(字符串):应接收该认领的 Hugging Face 用户,24 字符十六进制 ID +- 响应:论文作者认领结果,包含认领的论文 ID + +#### 获取每日论文 + +获取每日论文推荐信息流: + +```bash +curl -s -H "Authorization: Bearer $HF_TOKEN" \ + "https://huggingface.co/api/daily_papers?p=0&limit=20&date=2017-07-21&sort=publishedAt" +``` + +- 端点:`GET /api/daily_papers` +- 查询参数: + - `p`(整数):页码 + - `limit`(整数):结果数量,介于 1 和 100 之间 + - `date`(字符串):RFC 3339 完整日期,例如 `2017-07-21` + - `week`(字符串):ISO 周,例如 `2024-W03` + - `month`(字符串):月份值,例如 `2024-01` + - `submitter`(字符串):按提交者筛选 + - `sort`(枚举):`publishedAt` 或 `trending` +- 响应:每日论文列表 + +#### 列出论文 + +按发布日期排序列出 arXiv 论文: + +```bash +curl -s -H "Authorization: Bearer $HF_TOKEN" \ + "https://huggingface.co/api/papers?cursor={CURSOR}&limit=20" +``` + +- 端点:`GET /api/papers` +- 查询参数: + - `cursor`(字符串):分页游标 + - `limit`(整数):结果数量,介于 1 和 100 之间 +- 响应:论文列表 + +#### 搜索论文 + +对论文执行混合语义与全文搜索: + +```bash +curl -s -H "Authorization: Bearer $HF_TOKEN" \ + "https://huggingface.co/api/papers/search?q=vision+language&limit=20" +``` + +该功能会搜索论文标题、作者和内容。 + +- 端点:`GET /api/papers/search` +- 查询参数: + - `q`(字符串):搜索查询,最大长度 250 + - `limit`(整数):结果数量,介于 1 和 120 之间 +- 响应:匹配的论文 + +#### 索引论文 + +通过 ID 从 arXiv 插入论文。如果论文已被索引,则只有其作者可以重新索引: + +```bash +curl "https://huggingface.co/api/papers/index" \ + --request POST \ + --header "Content-Type: application/json" \ + --header "Authorization: Bearer $HF_TOKEN" \ + --data '{ + "arxivId": "{ARXIV_ID}" + }' +``` + +- 端点:`POST /api/papers/index` +- 请求体: + - `arxivId`(字符串,必填):要索引的 arXiv ID,例如 `2301.00001` +- 模式:`^\d{4}\.\d{4,5}$` +- 响应:成功时返回空 JSON 对象 + +#### 更新论文链接 + +更新论文的项目主页、GitHub 仓库或提交组织。请求者必须是论文作者、每日论文提交者或论文管理员: + +```bash +curl "https://huggingface.co/api/papers/{PAPER_OBJECT_ID}/links" \ + --request POST \ + --header "Content-Type: application/json" \ + --header "Authorization: Bearer $HF_TOKEN" \ + --data '{ + "projectPage": "https://example.com", + "githubRepo": "https://github.com/org/repo", + "organizationId": "{ORGANIZATION_ID}" + }' +``` + +- 端点:`POST /api/papers/{paperId}/links` +- 路径参数: + - `paperId`(字符串,必填):Hugging Face 论文对象 ID +- 请求体: + - `githubRepo`(字符串,可为空):GitHub 仓库 URL + - `organizationId`(字符串,可为空):组织 ID,24 字符十六进制 ID + - `projectPage`(字符串,可为空):项目主页 URL +- 响应:成功时返回空 JSON 对象 + +## 错误处理 + +- **访问 `https://huggingface.co/papers/{PAPER_ID}` 或 `md` 端点返回 404**:该论文尚未在 Hugging Face 论文页面上被索引。 +- **访问 `/api/papers/{PAPER_ID}` 返回 404**:该论文可能尚未在 Hugging Face 论文页面上被索引。 +- **论文 ID 未找到**:请验证提取出的 arXiv ID,包括任何版本后缀 + +### 回退方案 + +如果 Hugging Face 论文页面包含的细节不足以回答用户的问题: + +- 查看常规论文页面 `https://huggingface.co/papers/{PAPER_ID}` +- 回退到 arXiv 页面或 PDF 以获取原始来源: + - `https://arxiv.org/abs/{PAPER_ID}` + - `https://arxiv.org/pdf/{PAPER_ID}` + +## 备注 + +- 公共论文页面无需身份验证。 +- 写入端点(如认领作者身份、索引论文、更新论文链接)需要 `Authorization: Bearer $HF_TOKEN`。 +- 建议使用 `.md` 端点以获得可靠的机器可读输出。 +- 当你需要结构化 JSON 字段而非页面 Markdown 时,建议使用 `/api/papers/{PAPER_ID}`。