网站99%流量是机器人
推荐指数 44.0 NO. 020 · 2026.08.08
发布2026/08/07Score286Comments273
为什么值得看
一位站长披露其网站访问量中仅1%为真实人类,其余全是爬虫、AI训练机器人等自动化流量。这揭示了当前互联网生态的深层扭曲——真实用户行为数据已被严重稀释,基于流量的商业模式和数据分析都需要重新校准。
编辑判断
这个案例的普遍性被严重低估。Cloudflare 2024年报告显示全球互联网流量中机器人占比已达 49%,但多数站长的真实比例远高于此——因为检测手段本身就在漏报。
对 AI 工程师的直接影响是:如果你用 Common Crawl 或自建爬虫做预训练数据,你的清洗 pipeline 必须假设源数据极度脏污,大量是机器人互抓的噪声。对创业者而言,任何依赖页面浏览量(PV)或 DAU 估值的商业模式都需要引入 bot-free 指标,否则就是在用虚增数字融资。
建议立即行动:检查自己的 analytics 是否过滤了 headless browser,以及训练数据里有多少来自其他机器人的输出——这会导致模型坍缩。
社区反馈
意见分歧 214 条评论
核心争论:爬虫是否合理:站长自身也是爬虫者,却抱怨被爬,引发道德双重标准争论
相关内容
> And yes, my site gets its data by scraping those public documents. So I'm a scraper writing a blog post complaining about scrapers. I'm aware of how that sounds.
Who scrapes the scrapemen?
There's a difference between someone running a scraping tool occasionally and bots constantly and rapidly re-scraping the same site over and over again