AMAZINGINDEX.COM 日报快照
52.2
VOL. 2026.08
2026.08.31
← 返回 2026.08.31 日报
日报快照 · Daily Snapshot
NO. 005

开源爬虫把网页转 LLM 可用 Markdown

#REPO GitHub Trending 2026.08.31
推荐指数 52.0 NO. 005 · 2026.08.31
Stars80,170

Crawl4AI 是一个专为 LLM 设计的网页爬取与清洗工具,能将任意网页转为结构化的 Markdown 输出,直接喂给 RAG 和 Agent 使用。8 万星、50k+ 社区验证,v0.9.2 刚修复了流式爬取的任务泄漏问题,稳定性进一步提升。

🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN

开源爬虫把网页转 LLM 可用 Markdown

做 RAG 的团队之前处理网页数据,通常要过一道 BeautifulSoup + html2text 或 Jina AI Reader,但格式混乱、广告残留、动态渲染一直是头疼问题。Crawl4AI 的优势在于内置了浏览器自动化、智能分块和元数据提取,输出直接是带结构的 Markdown,省去了大量清洗代码。

跟 Firecrawl 比,它是完全开源可自托管的,成本可控;跟传统爬虫框架比,它原生为 LLM 上下文优化,不是通用抓取。如果你正在搭 RAG 知识库,需要持续抓取文档站或博客内容,这个比写一堆自定义解析器快得多。Cloud API 即将公测,大规模场景可以先排 waitlist。

Star History
Production

LLM原生爬虫基础设施,连接开放网页与RAG/Agent应用的关键数据层

独特价值:8万星社区验证的开源LLM专用爬虫,一键输出结构化Markdown直连RAG

竞品:
Scrapy/Scrapy ★ 53.2k 通用爬虫框架,非LLM原生,需自行处理数据清洗与结构化
microsoft/playwright ★ 67.0k 浏览器自动化工具,非专为LLM设计,输出需二次加工
jina-ai/reader ★ 8.9k LLM网页读取工具,功能较单一,社区规模与成熟度不足
langchain-ai/langchain ★ 96.0k LLM应用框架,含文档加载器但非核心,爬虫非其专长
firecrawl/firecrawl ★ 23.4k 直接竞品,商业闭源为主,开源版功能受限,定价模式不同
查看原文 →