Chuyển tới nội dung chính

{/* Trang này được tạo tự động từ SKILL.md của kỹ năng bởi website/scripts/generate-skill-docs.py. Chỉnh sửa nguồn SKILL.md, không phải trang này. */}

Arxiv

Tìm kiếm các bài viết arXiv theo từ khóa, tác giả, danh mục hoặc ID.

Siêu dữ liệu kỹ năng

NguồnĐi kèm (được cài đặt theo mặc định)
Đường dẫn

skills/research/arxiv ` | | Phiên bản |

1.0.0 ` | | Tác giả | Đại lý Hermes | | Giấy phép | MIT | | Nền tảng | Linux, macOS, Windows | | Thẻ |

Research

, `Arxiv

, `Papers

, `Academic

, `Science

, API | | Kỹ năng liên quan | XPROTECTX22XPROTECTX |

Tham khảo: đầy đủ SKILL.md

thông tin

Sau đây là định nghĩa kỹ năng đầy đủ mà Hermes tải khi kỹ năng này được kích hoạt. Đây là những gì tác nhân coi là hướng dẫn khi kỹ năng được kích hoạt.

Nghiên cứu arXiv

Tìm kiếm và truy xuất các bài viết học thuật từ arXiv thông qua API REST miễn phí của họ. Không có khóa API, không phụ thuộc - chỉ cần cuộn tròn.

Tham khảo nhanh

Hành độngLệnh
Tìm kiếm giấy tờ

curl "https://export.arxiv.org/API/query?search_query=all:QUERY&max_results=5" ` | | Nhận giấy tờ cụ thể |

curl "https://export.arxiv.org/API/query?id_list=2402.03300" ` | | Đọc tóm tắt (web) |

web_extract(urls=["https://arxiv.org/abs/2402.03300"]) ` | | Đọc toàn văn (PDF) |

web_extract(urls=["https://arxiv.org/pdf/2402.03300"]) ` |

Tìm kiếm giấy tờ

API trả về Atom XML. Phân tích cú pháp bằng `grep

/ sed hoặc chuyển qua Python3 để có đầu ra rõ ràng.

Tìm kiếm cơ bản

curl -s "https://export.arxiv.org/API/query?search_query=all:GRPO+reinforcement+learning&max_results=5"

`

### Đầu ra sạch (phân tích cú pháp XML thành định dạng có thể đọc được)

`bash
curl -s "https://export.arxiv.org/API/query?search_query=all:GRPO+reinforcement+learning&max_results=5&sortBy=submittedDate&sortOrder=descending" | Python3 -c "
import sys, xml.etree.ElementTree as ET
ns = \{'a': 'http://www.w3.org/2005/Atom'}
root = ET.parse(sys.stdin).getroot()
for i, entry in enumerate(root.findall('a:entry', ns)):
title = entry.find('a:title', ns).text.strip().replace('\n', ' ')
arxiv_id = entry.find('a:id', ns).text.strip().split('/abs/')[-1]
published = entry.find('a:published', ns).text[:10]
authors = ', '.join(a.find('a:name', ns).text for a in entry.findall('a:author', ns))
summary = entry.find('a:summary', ns).text.strip()[:200]
cats = ', '.join(c.get('term') for c in entry.findall('a:category', ns))
print(f'\{i+1}. [\{arxiv_id}] \{title}')
print(f' Authors: \{authors}')
print(f' Published: \{published} | Categories: \{cats}')
print(f' Abstract: \{summary}...')
print(f' PDF: https://arxiv.org/pdf/\{arxiv_id}')
print()
"

`

## Cú pháp truy vấn tìm kiếm

| Tiền tố | Tìm kiếm | Ví dụ |
|--------|----------|---------|
|
`all:
` | Tất cả các lĩnh vực |

all:transformer+attention
` |
|
`ti:
` | Tiêu đề |

ti:large+language+models
` |
|
`au:
` | Tác giả |

au:vaswani
` |
|
`abs:
` | Tóm tắt |

abs:reinforcement+learning
` |
|
`cat:
` | Danh mục |

cat:cs.AI
` |
|
`co:
` | Bình luận |

co:accepted+NeurIPS
` |

### Toán tử Boolean

`

# AND (default when using +)
search_query=all:transformer+attention

# OR
search_query=all:GPT+OR+all:BERT

# AND NOT
search_query=all:language+model+ANDNOT+all:vision

# Exact phrase
search_query=ti:"chain+of+thought"

# Combined
search_query=au:hinton+AND+cat:cs.LG

`

## Sắp xếp và phân trang

| Tham số | Tùy chọn |
|----------||----------|
|
`sortBy
` |
`relevance

,
`lastUpdatedDate

,
`submittedDate
` |
|
`sortOrder
` |
`ascending

,
`descending
` |
|
`start
` | Bù kết quả (dựa trên 0) |
|
`max_results
` | Số kết quả (mặc định 10, tối đa 30000) |

``` bash

# Latest 10 papers in cs.AI
curl -s "https://export.arxiv.org/API/query?search_query=cat:cs.AI&sortBy=submittedDate&sortOrder=descending&max_results=10"

`

## Đang tìm nạp các giấy tờ cụ thể

``` bash

# By arXiv ID
curl -s "https://export.arxiv.org/API/query?id_list=2402.03300"

# Multiple papers
curl -s "https://export.arxiv.org/API/query?id_list=2402.03300,2401.12345,2403.00001"

`

## Thế hệ BibTeX

Sau khi tìm nạp siêu dữ liệu cho một bài viết, hãy tạo mục nhập BibTeX:`{% thô %}

`
``` bash
curl -s "https://export.arxiv.org/API/query?id_list=1706.03762" | Python3 -c "
import sys, xml.etree.ElementTree as ET
ns = \{'a': 'http://www.w3.org/2005/Atom', 'arxiv': 'http://arxiv.org/schemas/atom'}
root = ET.parse(sys.stdin).getroot()
entry = root.find('a:entry', ns)
if entry is None: sys.exit('Paper not found')
title = entry.find('a:title', ns).text.strip().replace('\n', ' ')
authors = ' and '.join(a.find('a:name', ns).text for a in entry.findall('a:author', ns))
year = entry.find('a:published', ns).text[:4]
raw_id = entry.find('a:id', ns).text.strip().split('/abs/')[-1]
cat = entry.find('arxiv:primary_category', ns)
primary = cat.get('term') if cat is not None else 'cs.LG'
last_name = entry.find('a:author', ns).find('a:name', ns).text.split()[-1]
print(f'@article\{\{\{last_name}\{year}_\{raw_id.replace(\".\", \"\")},')
print(f' title = \{\{\{title}}},')
print(f' author = \{\{\{authors}}},')
print(f' year = \{\{\{year}}},')
print(f' eprint = \{\{\{raw_id}}},')
print(f' archivePrefix = \{\{arXiv}},')
print(f' primaryClass = \{\{\{primary}}},')
print(f' url = \{\{https://arxiv.org/abs/\{raw_id}}}')
print('}')
"

`

{% rút %}

## Nội dung bài đọc

Sau khi tìm thấy một bài báo, hãy đọc nó:

`

# Abstract page (fast, metadata + abstract)
web_extract(urls=["https://arxiv.org/abs/2402.03300"])

# Full paper (PDF → markdown via Firecrawl)
web_extract(urls=["https://arxiv.org/pdf/2402.03300"])

`
``Để xử lý PDF cục bộ, hãy xem kỹ năng
`ocr-and-documents

.

## Danh mục phổ biến

| Danh mục | Lĩnh vực |
|----------|-------|
|
`cs.AI
` | Trí tuệ nhân tạo |
|
`cs.CL
` | Tính toán và Ngôn ngữ (NLP) |
|
`cs.CV
` | Thị giác máy tính |
|
`cs.LG
` | Học máy |
|
`cs.CR
` | Mật mã và bảo mật |
|
`stat.ML
` | Học máy (Thống kê) |
|
`math.OC
` | Tối ưu hóa và Kiểm soát |
|
`physics.comp-ph
` | Vật lý tính toán |

Danh sách đầy đủ: https://arxiv.org/category_taxonomy

## Tập lệnh trợ giúp

Tập lệnh
`scripts/search_arxiv.py
` xử lý phân tích cú pháp XML và cung cấp đầu ra rõ ràng:

``` bash
Python scripts/search_arxiv.py "GRPO reinforcement learning"
Python scripts/search_arxiv.py "transformer attention" --max 10 --sort date
Python scripts/search_arxiv.py --author "Yann LeCun" --max 5
Python scripts/search_arxiv.py --category cs.AI --sort date
Python scripts/search_arxiv.py --id 2402.03300
Python scripts/search_arxiv.py --id 2402.03300,2401.12345

`
``Không phụ thuộc - chỉ sử dụng Python stdlib.

---

## Semantic Scholar (Trích dẫn, Tài liệu liên quan, Hồ sơ tác giả)

arXiv không cung cấp dữ liệu trích dẫn hoặc khuyến nghị. Sử dụng **Semantic Scholar API** để làm điều đó — miễn phí, không cần khóa cho mục đích sử dụng cơ bản (1 req/giây), trả về JSON.

### Lấy chi tiết giấy tờ + trích dẫn

`bash

# By arXiv ID
curl -s "https://API.semanticscholar.org/graph/v1/paper/arXiv:2402.03300?fields=title,authors,citationCount,referenceCount,influentialCitationCount,year,abstract" | Python3 -m JSON.tool

# By Semantic Scholar paper ID or DOI
curl -s "https://API.semanticscholar.org/graph/v1/paper/DOI:10.1234/example?fields=title,citationCount"

`

### Nhận trích dẫn của một bài báo (người đã trích dẫn nó)

``` bash
curl -s "https://API.semanticscholar.org/graph/v1/paper/arXiv:2402.03300/citations?fields=title,authors,year,citationCount&limit=10" | Python3 -m JSON.tool

`

### Nhận tài liệu tham khảo TỪ một bài báo (những gì nó trích dẫn)

`bash
curl -s "https://API.semanticscholar.org/graph/v1/paper/arXiv:2402.03300/references?fields=title,authors,year,citationCount&limit=10" | Python3 -m JSON.tool

`

### Giấy tờ tìm kiếm (thay thế cho tìm kiếm arXiv, trả về JSON)

`bash
curl -s "https://API.semanticscholar.org/graph/v1/paper/search?query=GRPO+reinforcement+learning&limit=5&fields=title,authors,year,citationCount,externalIds" | Python3 -m JSON.tool

`

### Nhận đề xuất giấy

`bash
curl -s -X POST "https://API.semanticscholar.org/recommendations/v1/papers/" \

-H "Content-Type: application/JSON" \
-d '\{"positivePaperIds": ["arXiv:2402.03300"], "negativePaperIds": []}' | Python3 -m JSON.tool

`

### Hồ sơ tác giả

``` bash
curl -s "https://API.semanticscholar.org/graph/v1/author/search?query=Yann+LeCun&fields=name,hIndex,citationCount,paperCount" | Python3 -m JSON.tool

`

### Các trường Học giả ngữ nghĩa hữu ích``title

,
`authors

,
`year

,
`abstract

,
`citationCount

,
`referenceCount

,
`influentialCitationCount

,
`isOpenAccess

,
`openAccessPdf

,
`fieldsOfStudy

,
`publicationVenue

,
`externalIds
` (chứa ID arXiv, DOI, v.v.)

---

## Hoàn thành quy trình nghiên cứu1. **Khám phá**:
`Python scripts/search_arxiv.py "your topic" --sort date --max 10

`
2. **Đánh giá tác động**:
`curl -s "https://API.semanticscholar.org/graph/v1/paper/arXiv:ID?fields=citationCount,influentialCitationCount"

3. **Đọc tóm tắt**:
`web_extract(urls=["https://arxiv.org/abs/ID"])

4. **Đọc toàn văn**:
`web_extract(urls=["https://arxiv.org/pdf/ID"])

5. **Tìm công việc liên quan**:
`curl -s "https://API.semanticscholar.org/graph/v1/paper/arXiv:ID/references?fields=title,citationCount&limit=20"

6. **Nhận đề xuất**: Điểm cuối đề xuất POST tới Semantic Scholar
7. **Theo dõi tác giả**:
`curl -s "https://API.semanticscholar.org/graph/v1/author/search?query=NAME"

## Giới hạn tỷ lệ

| API | Tỷ lệ | Xác thực |
|------|------|------|
| arXiv | ~1 yêu cầu / 3 giây | Không cần thiết |
| Học giả ngữ nghĩa | 1 yêu cầu/giây | Không có (100/giây với khóa API) |

## Ghi chú
- arXiv trả về Atom XML — sử dụng tập lệnh trợ giúp hoặc đoạn mã phân tích cú pháp để có kết quả rõ ràng
- Semantic Scholar trả về JSON — chuyển qua
`Python3 -m JSON.tool
` để dễ đọc
- ID arXiv: định dạng cũ (
`hep-th/0601001

) so với định dạng mới (
`2402.03300

)
- PDF:
`https://arxiv.org/pdf/\{id}
` — Tóm tắt:
`https://arxiv.org/abs/\{id}

- HTML (nếu có):
`https://arxiv.org/html/\{id}

- Để xử lý PDF cục bộ, hãy xem kỹ năng
`ocr-and-documents

## Phiên bản ID
-
`arxiv.org/abs/1706.03762
` luôn phân giải thành phiên bản **mới nhất**
-
`arxiv.org/abs/1706.03762v1
` trỏ đến một phiên bản bất biến **cụ thể**
- Khi tạo trích dẫn, hãy giữ nguyên hậu tố phiên bản bạn thực sự đọc để tránh sai lệch trích dẫn (phiên bản mới hơn có thể thay đổi đáng kể nội dung)
- Trường API

<id>
` trả về URL đã được phiên bản (ví dụ:
`http://arxiv.org/abs/1706.03762v7

)

## Giấy tờ bị rút

Giấy tờ có thể được rút sau khi nộp. Khi điều này xảy ra:
- Trường

<summary>
` chứa thông báo rút tiền (tìm "đã rút" hoặc "đã rút")
- Các trường siêu dữ liệu có thể không đầy đủ
- Luôn kiểm tra phần tóm tắt trước khi coi kết quả là bài viết hợp lệ