Crawl4ai Skill

lancelin111/crawl4ai-skill/skills/crawl4ai-skill

作者 lancelin111e1bdcff8034f685977bfea661b90e4456bc708bcMIT-0收录于 2026年10月9日更新于 2026年10月9日

Web crawling and scraping tool with LLM-optimized output. 网页爬虫爬取工具 | Web crawler, web scraper, spider. DuckDuckGo search, site crawling, dynamic page scraping. 智能搜索爬取 | Free, no API key required.

AI 生成的概览

网页爬取与抓取工具,支持搜索、全站爬取,并输出面向大模型优化的 Markdown。

功能
该技能介绍了一个用于网页搜索、单页抓取和全站爬取的命令行工具。它使用 DuckDuckGo 进行搜索,可渲染 JavaScript 较重的页面,并输出 Markdown,支持精简的 fit_markdown 或完整的 raw_markdown 格式。它还支持先搜索再抓取搜索结果前列内容的工作流。
适用场景
当你需要采集网页内容时使用,例如爬取文档站点、抓取单个页面,或先搜索再提取排名靠前的结果。它也适用于需要等待网络空闲或特定元素的 JavaScript 渲染页面。
运行要求
需要安装 crawl4ai-skill 命令行工具(通过 pip 安装)。搜索和爬取需要网络访问。无需 API key。该技能不附带脚本,仅为说明文档。

Crawl4AI Skill - Web Crawler & Scraper

Web Crawling 网页爬虫 | Web Scraping 网页爬取 | LLM 优化输出

智能网页爬虫和爬取工具,支持搜索、全站爬取、动态页面抓取。Free web crawler and scraper with LLM-optimized Markdown output.

核心功能 | Core Features

  • 🔍 Web Search 网页搜索 - DuckDuckGo search, 免 API key
  • 🕷️ Web Crawling 网页爬虫 - Site crawler, spider, sitemap 识别
  • 📝 Web Scraping 网页抓取 - Smart scraper, data extraction
  • 📄 LLM-Optimized Output - Fit Markdown, 省 Token 80%
  • ⚡ Dynamic Page Scraping - JavaScript 渲染页面爬取

快速开始 | Quick Start

安装 | Installation

bash
pip install crawl4ai-skill

Web Search | 网页搜索

bash
# Search the web with DuckDuckGocrawl4ai-skill search "python web scraping"

Web Scraping | 单页爬取

bash
# Scrape a single web pagecrawl4ai-skill crawl https://example.com

Web Crawling | 全站爬虫

bash
# Crawl entire website / spidercrawl4ai-skill crawl-site https://docs.python.org --max-pages 50

使用场景 | Use Cases

场景 1:Web Crawler for Documentation | 文档站爬虫

bash
# Crawl documentation site with spidercrawl4ai-skill crawl-site https://docs.fastapi.com --max-pages 100

爬虫效果 | Crawler Output:

  • ❌ 移除:导航栏、侧边栏、广告
  • ✅ 保留:标题、正文、代码块
  • 📊 Token:50,000 → 10,000(-80%)

场景 2:Search + Scrape | 搜索+爬取

bash
# Search and scrape top resultscrawl4ai-skill search-and-crawl "Vue 3 best practices" --crawl-top 3

场景 3:Dynamic Page Scraping | 动态页面抓取

JavaScript 渲染的页面爬取(雪球、知乎等):

bash
# Scrape JavaScript-heavy pagescrawl4ai-skill crawl https://xueqiu.com/S/BIDU --wait-until networkidle --delay 2

命令参考 | Commands

命令 Command说明 Description
search <query>Web search 网页搜索
crawl <url>Web scraping 单页爬取
crawl-site <url>Web crawling 全站爬虫
search-and-crawl <query>Search + scrape 搜索并爬取

常用参数 | Common Options

bash
# Web Search 搜索--num-results 10          # Number of results
# Web Scraping 爬取--format fit_markdown     # Output format--output result.md        # Output file--wait-until networkidle  # Wait strategy for dynamic pages--delay 2                 # Additional wait time (seconds)--wait-for ".selector"    # Wait for specific element
# Web Crawling 爬虫--max-pages 100          # Max pages to crawl--max-depth 3            # Max crawl depth

输出格式 | Output Formats

fit_markdown(推荐 Recommended)

智能提取,节省 80% Token。Smart extraction, save 80% tokens.

bash
crawl4ai-skill crawl https://example.com --format fit_markdown

raw_markdown

保留完整结构。Preserve full structure.

bash
crawl4ai-skill crawl https://example.com --format raw_markdown

为什么选择这个爬虫?| Why This Crawler?

✅ 免费爬虫 Free Crawler - 无需 API key,开箱即用
✅ 智能爬取 Smart Scraper - 自动去噪,提取核心内容
✅ 全站爬虫 Site Crawler - 支持 sitemap,递归爬取
✅ 动态爬取 Dynamic Scraping - JavaScript 渲染页面支持
✅ 搜索集成 Search Integration - DuckDuckGo 搜索内置


链接 | Links

来源与署名

来源:lancelin111/crawl4ai-skill位于skills/crawl4ai-skill提交e1bdcff

许可证: MIT-0

内容归原作者所有。SourceWeft 从公开仓库中收录这些内容。

举报或申请下架