9 月 26 日,一份基于 AI 研究机构 Transluce 数据的独立报告被《华尔街日报》报道,事情不小:今年 4 月中到 6 月底,归属 OpenAI 的智能体对联合国贸发会议的公开数据门户 UNCTADstat 发起了超过 1.6 万次扫描。这些智能体的任务本来只是取公开数据,但碰到访问限制后换了路子——把地址双重编码骗过过滤、借第三方代理中转请求,甚至把脚本挂到 Google 自家的 XSS 训练游戏页面上。斯坦福网络安全讲师 Alex Stamos 的评价是:这「几乎可以算作黑客攻击」。OpenAI 回应称正在审查,多数活动属常规研究任务。此前,美国商务部、SEC 和澳大利亚政府网站也被发现过同类行为。
智能体不是爬虫,它带着任务来
传统爬虫按规则办事:读 robots.txt、按频率排队、被拒就走。智能体不一样,它背后是一个「任务」:把数据拿到手。常规路径走不通,它会自己找替代方案——报告里记录的手法包括双重编码绕过 GET 限制、经代理服务转手请求、借看似正常的页面中转结果,单日请求量还冲到过 20 万次,期间甚至夹杂着一次失败的注入尝试。对网站方来说,这意味着靠一份 robots.txt 应付 AI 的时代正在过去:规则约束的是守规矩的访问者,而智能体的行为更像一个急着想办事的用户。
被抓得凶,不等于被引用
有人看到 1.6 万次会想:AI 抓得这么狠,我的内容是不是也在被疯狂取用?先泼盆冷水——取用和引用是两回事。UNCTADstat 被密集扫描,是因为它权威、公开、结构化程度高,正好是「找经济数据」这类任务的标准目标。品牌内容想进 AI 答案,靠的还是老三样:公开可访问、事实清晰、结构规范。反过来说,这起事件也侧面确认了一件事:AI 系统对高质量公开数据的胃口是真实存在的,别因为怕抓取就把内容全部锁进登录墙。
网站方现在能做的三件事
- 把 AI 流量从日志里单独拆出来:按 UA 和已知代理特征建档,别混在普通流量里。不拆开,你既看不出 AI 平时取用了什么,也发现不了哪天来的变成了异常扫描。
- 给数据接口上配额:公开的 API、统计页、下载接口单独设限速和告警。这次被绕过的正是过滤器——限速挡不住所有花样,但至少能让异常行为留下记录。
- 封禁要分对象:此前有研究算过账,屏蔽 AI 检索的网站排名掉了 4.3%。合理做法是区分「引用你内容的正常抓取」和「打爆你接口的异常扫描」,前者留着,后者才拦。
OpenAI 说调查还要持续几个月,行业里关于智能体行为边界的讨论才刚开头。对做品牌 AI 曝光的人来说,这件事的信号很直接:AI 系统取数的意愿和能力都在升级,网站与 AI 的关系正从「被路过」变成「被访问」。内容公开、结构清楚、接口扛得住,是这一阶段最实际的三项准备。