claude-scraper-skill
用遵守 robots 的方式抓取网页并断点续跑
- Stars
- 0
- Forks
- 0
- 更新时间
- 更新于 2026年6月21日
用遵守 robots 的方式抓取网页并断点续跑
scraper 提供 article 和 soup 两种抓取模式:前者提取干净文章文本与元数据,后者按 CSS 选择器读取结构化内容。它尊重 robots.txt、处理重试与退避、按 JSONL 增量保存并在中断后续跑,还能从 sitemap 发现 URL 和识别 HTML、PDF、JSON。ScraperAPI 与 JavaScript 渲染可选,适合需要可审计抓取的 Claude Code 任务。
资源类型
使用场景
运行平台
GitHub 公开事实最近同步于 2026年7月10日。
按研究设计生成临床研究 Table 1 的 HTML、Word 和 LaTeX
从古兰经、布哈里圣训实录和穆斯林圣训实录检索原文
用六层框架定义产品问题,再进入方案设计。
让 Claude 按证据链审阅机器学习论文并核验关键引用。