开源爬虫把网页转 LLM 可用 Markdown
推荐指数 52.0 NO. 005 · 2026.08.31
Stars80,170
为什么值得看
Crawl4AI 是一个专为 LLM 设计的网页爬取与清洗工具,能将任意网页转为结构化的 Markdown 输出,直接喂给 RAG 和 Agent 使用。8 万星、50k+ 社区验证,v0.9.2 刚修复了流式爬取的任务泄漏问题,稳定性进一步提升。
🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN
媒体预览
编辑判断
做 RAG 的团队之前处理网页数据,通常要过一道 BeautifulSoup + html2text 或 Jina AI Reader,但格式混乱、广告残留、动态渲染一直是头疼问题。Crawl4AI 的优势在于内置了浏览器自动化、智能分块和元数据提取,输出直接是带结构的 Markdown,省去了大量清洗代码。
跟 Firecrawl 比,它是完全开源可自托管的,成本可控;跟传统爬虫框架比,它原生为 LLM 上下文优化,不是通用抓取。如果你正在搭 RAG 知识库,需要持续抓取文档站或博客内容,这个比写一堆自定义解析器快得多。Cloud API 即将公测,大规模场景可以先排 waitlist。
Star History
生态分析
Production
LLM原生爬虫基础设施,连接开放网页与RAG/Agent应用的关键数据层
独特价值:8万星社区验证的开源LLM专用爬虫,一键输出结构化Markdown直连RAG
竞品: