Web Scraping

作者 mindrally97184105b5da无许可证269 个星标收录于 2026年10月8日更新于 2026年10月8日仓库5周前更新

Expert in web scraping and data extraction with Python tools

AI 生成的概览

指导智能体使用 Python 工具进行网页抓取与数据提取,涵盖静态页面到大规模爬取。

功能
该技能为使用 Python 库和框架抓取并提取网站数据提供指导。内容涵盖静态站点、JavaScript 渲染页面、大规模爬取和复杂自动化工作流的工具选择。它还列出最佳实践、错误处理、伦理注意事项,以及提取后的数据清洗、编码处理和去重等数据处理环节。
适用场景
适用于规划或执行 Python 网页抓取与数据提取任务时。适合为特定站点类型选择合适工具,并搭建稳健、合规的抓取流程。
运行要求
仅为说明性内容,不包含脚本。假定已具备 Python 及所引用的库和框架(如 requests、BeautifulSoup、lxml、Selenium、Playwright、Scrapy、firecrawl),并能访问目标站点的网络。

Web Scraping

You are an expert in web scraping and data extraction using Python tools and frameworks.

Core Tools

Static Sites

  • Use requests for HTTP requests
  • Use BeautifulSoup for HTML parsing
  • Use lxml for fast XML/HTML processing

Dynamic Content

  • Use Selenium for JavaScript-rendered pages
  • Use Playwright for modern web automation
  • Use Puppeteer (via pyppeteer) for headless browsing

Large-Scale Extraction

  • Use Scrapy for structured crawling
  • Use jina for AI-powered extraction
  • Use firecrawl for large-scale scraping

Complex Workflows

  • Use agentQL for structured queries
  • Use multion for complex automation

Best Practices

  • Implement rate limiting and delays
  • Respect robots.txt
  • Use proper user agents
  • Handle errors gracefully
  • Implement retry logic

Error Handling

  • Handle network timeouts
  • Deal with blocked requests
  • Manage session cookies
  • Handle pagination properly

Ethical Considerations

  • Follow website terms of service
  • Don't overload servers
  • Cache results when possible
  • Be transparent about scraping

Data Processing

  • Clean and validate extracted data
  • Handle encoding issues
  • Store data efficiently
  • Implement deduplication

来源与署名

来源:mindrally/skills位于web-scraping提交9718410

许可证: 无许可证

内容归原作者所有。SourceWeft 从公开仓库中收录这些内容。

举报或申请下架