AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.08
2026.08.08
← 返回 2026.08.08 日报
日报快照 · Daily Snapshot
NO. 020

网站99%流量是机器人

#ARTICLE HackerNews 2026.08.08
推荐指数 44.0 NO. 020 · 2026.08.08
发布2026/08/07Score286Comments273

一位站长披露其网站访问量中仅1%为真实人类,其余全是爬虫、AI训练机器人等自动化流量。这揭示了当前互联网生态的深层扭曲——真实用户行为数据已被严重稀释,基于流量的商业模式和数据分析都需要重新校准。

这个案例的普遍性被严重低估。Cloudflare 2024年报告显示全球互联网流量中机器人占比已达 49%,但多数站长的真实比例远高于此——因为检测手段本身就在漏报。

对 AI 工程师的直接影响是:如果你用 Common Crawl 或自建爬虫做预训练数据,你的清洗 pipeline 必须假设源数据极度脏污,大量是机器人互抓的噪声。对创业者而言,任何依赖页面浏览量(PV)或 DAU 估值的商业模式都需要引入 bot-free 指标,否则就是在用虚增数字融资。

建议立即行动:检查自己的 analytics 是否过滤了 headless browser,以及训练数据里有多少来自其他机器人的输出——这会导致模型坍缩。

意见分歧 214 条评论

核心争论:爬虫是否合理:站长自身也是爬虫者,却抱怨被爬,引发道德双重标准争论

qbane

> And yes, my site gets its data by scraping those public documents. So I'm a scraper writing a blog post complaining about scrapers. I'm aware of how that sounds.

ethersteeds

Who scrapes the scrapemen?

ihuman

There's a difference between someone running a scraping tool occasionally and bots constantly and rapidly re-scraping the same site over and over again

替代方案: TailscaleNgrokM1 Macbook Pro 自托管VPS
查看原文 →