项目概览
scraper 提供 article 和 soup 两种抓取模式:前者提取干净文章文本与元数据,后者按 CSS 选择器读取结构化内容。它尊重 robots.txt、处理重试与退避、按 JSONL 增量保存并在中断后续跑,还能从 sitemap 发现 URL 和识别 HTML、PDF、JSON。ScraperAPI 与 JavaScript 渲染可选,适合需要可审计抓取的 Claude Code 任务。
仓库事实
- 主要语言
- HTML
- 许可证
- MIT
- 仓库更新时间
- 2026年6月21日
- 默认分支
- main
资源类型
通用技能
使用场景
研究与知识
运行平台
Claude Code、Codex 等