chore: import zh skill huggingface-papers

This commit is contained in:
wehub-skill-sync
2026-07-13 21:36:33 +08:00
commit 96b2abbb6a
2 changed files with 248 additions and 0 deletions
+9
View File
@@ -0,0 +1,9 @@
# WeHub 来源说明
- Skill 名称:`huggingface-papers`
- 中文类目:Hugging Face 论文页读取与总结
- 上游仓库:`huggingface__skills`
- 上游路径:`skills/huggingface-papers/SKILL.md`
- 上游链接:https://github.com/huggingface/skills/blob/HEAD/skills/huggingface-papers/SKILL.md
- 本仓库为 WeHub 中文 Skill 汉化包,基于 skill 市场筛选 Top200 清单整理
- 原作者、版权和许可证信息以上游仓库为准
+239
View File
@@ -0,0 +1,239 @@
---
name: huggingface-papers
description: 以 Markdown 格式查阅 Hugging Face 论文页面,并通过论文 API 获取结构化元数据,如作者、关联的模型/数据集/Spaces、GitHub 仓库及项目主页。当用户分享 Hugging Face 论文页面 URL、arXiv URL 或 ID,或要求总结、解释、分析某篇 AI 研究论文时使用。
---
# Hugging Face 论文页面
Hugging Face 论文页面(hf.co/papers)是一个基于 arXivarxiv.org)构建的平台,专门面向人工智能(AI)和计算机科学领域的研究论文。Hugging Face 用户可在 hf.co/papers/submit 提交自己的论文,论文会展示在每日论文推荐(Daily Papers)信息流(hf.co/papers)上。每天,用户可以对论文进行点赞和评论。每篇论文页面允许作者:
- 认领自己的论文(点击 `authors` 字段中的自己的名字)。这会使论文页面显示在作者的 Hugging Face 个人主页上。
- 通过在模型卡片、数据集卡片或 Space 的 README 中包含 Hugging Face 论文或 arXiv URL,关联相应的模型检查点、数据集和 Spaces。
- 关联 GitHub 仓库和/或项目主页 URL。
- 关联 Hugging Face 组织。这也会使论文页面显示在该组织的 Hugging Face 组织页面上。
每当有人在模型卡片、数据集卡片或 Space 仓库的 README 中提及 Hugging Face 论文或 arXiv 摘要/PDF URL 时,该论文将被自动索引。请注意,并非所有在 Hugging Face 上被索引的论文都会被提交到每日论文推荐中。后者更多地是一种推广研究论文的方式。论文在 arXiv 上发布之日起 14 天内才能被提交到每日论文推荐中。
Hugging Face 团队构建了一个易于使用的 API 来与论文页面交互。可以获取论文的 Markdown 格式内容,也可以返回结构化元数据,例如作者姓名、关联的模型/数据集/Spaces、关联的 GitHub 仓库及项目主页。
## 何时使用
- 用户分享 Hugging Face 论文页面 URL(例如 `https://huggingface.co/papers/2602.08025`
- 用户分享 Hugging Face Markdown 论文页面 URL(例如 `https://huggingface.co/papers/2602.08025.md`
- 用户分享 arXiv URL(例如 `https://arxiv.org/abs/2602.08025``https://arxiv.org/pdf/2602.08025`
- 用户提及 arXiv ID(例如 `2602.08025`
- 用户要求你总结、解释或分析某篇 AI 研究论文
## 解析论文 ID
建议从用户提供的内容中解析出论文 ID(arXiv ID):
| 输入 | 论文 ID |
| --- | --- |
| `https://huggingface.co/papers/2602.08025` | `2602.08025` |
| `https://huggingface.co/papers/2602.08025.md` | `2602.08025` |
| `https://arxiv.org/abs/2602.08025` | `2602.08025` |
| `https://arxiv.org/pdf/2602.08025` | `2602.08025` |
| `2602.08025v1` | `2602.08025v1` |
| `2602.08025` | `2602.08025` |
这样你就可以将论文 ID 用于下面提到的任何 Hub API 端点。
### 以 Markdown 格式获取论文页面
论文内容可以通过如下方式以 Markdown 格式获取:
```bash
curl -s "https://huggingface.co/papers/{PAPER_ID}.md"
```
这将返回 Hugging Face 论文页面的 Markdown 内容。该功能依赖于 https://arxiv.org/html/{PAPER_ID} 上论文的 HTML 版本。
存在两种例外情况:
- 并非所有 arXiv 论文都有 HTML 版本。如果论文的 HTML 版本不存在,则内容会回退到 Hugging Face 论文页面的 HTML。
- 如果返回 404,说明该论文尚未在 hf.co/papers 上索引。详见[错误处理](#error-handling)。
或者,你也可以通过普通论文页面 URL 请求 Markdown 内容,方式如下:
```bash
curl -s -H "Accept: text/markdown" "https://huggingface.co/papers/{PAPER_ID}"
```
### 论文页面 API 端点
所有端点均使用基础 URL `https://huggingface.co`
#### 获取结构化元数据
使用 Hugging Face REST API 以 JSON 格式获取论文元数据:
```bash
curl -s "https://huggingface.co/api/papers/{PAPER_ID}"
```
返回的结构化元数据可包含:
- 作者(姓名及 Hugging Face 用户名,如果他们已认领该论文)
- 媒体 URL(提交论文到每日论文推荐时上传的)
- 摘要(摘要)及 AI 生成的摘要
- 项目主页和 GitHub 仓库
- 组织及互动元数据(点赞数)
要查找与论文关联的模型,请使用:
```bash
curl https://huggingface.co/api/models?filter=arxiv:{PAPER_ID}
```
要查找与论文关联的数据集,请使用:
```bash
curl https://huggingface.co/api/datasets?filter=arxiv:{PAPER_ID}
```
要查找与论文关联的 Spaces,请使用:
```bash
curl https://huggingface.co/api/spaces?filter=arxiv:{PAPER_ID}
```
#### 认领论文作者身份
为 Hugging Face 用户认领论文的作者身份:
```bash
curl "https://huggingface.co/api/settings/papers/claim" \
--request POST \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $HF_TOKEN" \
--data '{
"paperId": "{PAPER_ID}",
"claimAuthorId": "{AUTHOR_ENTRY_ID}",
"targetUserId": "{USER_ID}"
}'
```
- 端点:`POST /api/settings/papers/claim`
- 请求体:
- `paperId`(字符串,必填):正在认领的 arXiv 论文标识符
- `claimAuthorId`(字符串):正在认领的论文中的作者条目,24 字符十六进制 ID
- `targetUserId`(字符串):应接收该认领的 Hugging Face 用户,24 字符十六进制 ID
- 响应:论文作者认领结果,包含认领的论文 ID
#### 获取每日论文
获取每日论文推荐信息流:
```bash
curl -s -H "Authorization: Bearer $HF_TOKEN" \
"https://huggingface.co/api/daily_papers?p=0&limit=20&date=2017-07-21&sort=publishedAt"
```
- 端点:`GET /api/daily_papers`
- 查询参数:
- `p`(整数):页码
- `limit`(整数):结果数量,介于 1 和 100 之间
- `date`(字符串):RFC 3339 完整日期,例如 `2017-07-21`
- `week`(字符串):ISO 周,例如 `2024-W03`
- `month`(字符串):月份值,例如 `2024-01`
- `submitter`(字符串):按提交者筛选
- `sort`(枚举):`publishedAt``trending`
- 响应:每日论文列表
#### 列出论文
按发布日期排序列出 arXiv 论文:
```bash
curl -s -H "Authorization: Bearer $HF_TOKEN" \
"https://huggingface.co/api/papers?cursor={CURSOR}&limit=20"
```
- 端点:`GET /api/papers`
- 查询参数:
- `cursor`(字符串):分页游标
- `limit`(整数):结果数量,介于 1 和 100 之间
- 响应:论文列表
#### 搜索论文
对论文执行混合语义与全文搜索:
```bash
curl -s -H "Authorization: Bearer $HF_TOKEN" \
"https://huggingface.co/api/papers/search?q=vision+language&limit=20"
```
该功能会搜索论文标题、作者和内容。
- 端点:`GET /api/papers/search`
- 查询参数:
- `q`(字符串):搜索查询,最大长度 250
- `limit`(整数):结果数量,介于 1 和 120 之间
- 响应:匹配的论文
#### 索引论文
通过 ID 从 arXiv 插入论文。如果论文已被索引,则只有其作者可以重新索引:
```bash
curl "https://huggingface.co/api/papers/index" \
--request POST \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $HF_TOKEN" \
--data '{
"arxivId": "{ARXIV_ID}"
}'
```
- 端点:`POST /api/papers/index`
- 请求体:
- `arxivId`(字符串,必填):要索引的 arXiv ID,例如 `2301.00001`
- 模式:`^\d{4}\.\d{4,5}$`
- 响应:成功时返回空 JSON 对象
#### 更新论文链接
更新论文的项目主页、GitHub 仓库或提交组织。请求者必须是论文作者、每日论文提交者或论文管理员:
```bash
curl "https://huggingface.co/api/papers/{PAPER_OBJECT_ID}/links" \
--request POST \
--header "Content-Type: application/json" \
--header "Authorization: Bearer $HF_TOKEN" \
--data '{
"projectPage": "https://example.com",
"githubRepo": "https://github.com/org/repo",
"organizationId": "{ORGANIZATION_ID}"
}'
```
- 端点:`POST /api/papers/{paperId}/links`
- 路径参数:
- `paperId`(字符串,必填):Hugging Face 论文对象 ID
- 请求体:
- `githubRepo`(字符串,可为空):GitHub 仓库 URL
- `organizationId`(字符串,可为空):组织 ID,24 字符十六进制 ID
- `projectPage`(字符串,可为空):项目主页 URL
- 响应:成功时返回空 JSON 对象
## 错误处理
- **访问 `https://huggingface.co/papers/{PAPER_ID}``md` 端点返回 404**:该论文尚未在 Hugging Face 论文页面上被索引。
- **访问 `/api/papers/{PAPER_ID}` 返回 404**:该论文可能尚未在 Hugging Face 论文页面上被索引。
- **论文 ID 未找到**:请验证提取出的 arXiv ID,包括任何版本后缀
### 回退方案
如果 Hugging Face 论文页面包含的细节不足以回答用户的问题:
- 查看常规论文页面 `https://huggingface.co/papers/{PAPER_ID}`
- 回退到 arXiv 页面或 PDF 以获取原始来源:
- `https://arxiv.org/abs/{PAPER_ID}`
- `https://arxiv.org/pdf/{PAPER_ID}`
## 备注
- 公共论文页面无需身份验证。
- 写入端点(如认领作者身份、索引论文、更新论文链接)需要 `Authorization: Bearer $HF_TOKEN`
- 建议使用 `.md` 端点以获得可靠的机器可读输出。
- 当你需要结构化 JSON 字段而非页面 Markdown 时,建议使用 `/api/papers/{PAPER_ID}`