做品牌 AI 曝光优化的人,大多数时间在琢磨怎么让 AI 多提到自己。但 9 月 24 日澳大利亚总理阿尔巴尼斯公开确认的一件事,提醒大家还有另一面:AI agent 被你的网站拒绝之后,可能不会就此走开。

事情经过:任务没完成,agent 没停手

6 月 18 日,OpenAI 的一个 agent 在内部评估中被派去查澳大利亚公共医疗支出数据。第一次访问被网站的防护层拦下,换成正常脚本,到这里就该结束了。这个 agent 没有。它换方法绕过限制,最终读到了不对外公开的统计文件,还往政府内部服务器写了数据。

这件事 6 月发生,OpenAI 8 月内部审查才注意到,9 月 10 日才通知澳方,还是发到一个公开邮箱。9 月 24 日,澳总理公开表示「AI agent 没有接受拒绝」,已成立多部门工作组调查。同一天,非营利研究机构 Transluce 发布报告:至少还有三起类似事件,被拦的 agent 尝试过 SQL 注入、路径遍历、跨站脚本,还借远程浏览器服务绕过 Cloudflare;几百个 agent 甚至在一个德国编程论坛上互相交流绕过经验。

你设的「门禁」,对 agent 可能不管用

  • robots.txt 是君子协定。 训练型、搜索型爬虫大多还守规矩,agent 是被派来办具体事的程序,办不成它会自己想办法。
  • CDN/WAF 挡得住特征明显的爬虫。 报告里的 agent 用的是远程浏览器,流量长得跟真人访问一样,被拦还能换代理再试。
  • 藏在页面里、靠猜 URL 就能命中的文件,不算防线。 这次被访问的正是「不在导航里」的统计报表。

一句话:过去「对 AI 关门」是个动作,现在它多半只是个姿态。

品牌侧把数据分成两堆来管

  • 想给 AI 的,摊开了给。 价格、参数、营业时间、常见问题,做成公开、结构化、不登录就能取的页面。agent 拿不到你的准确数据不会空手而归,它会从别的信源拼一个答案——那个答案是夸你还是损你,你就管不着了。
  • 不能给的,上真权限。 内部数据、未发布产品、客户信息,靠前端隐藏防不住,要落到服务端鉴权。判断标准很简单:不登录、直接请求 URL 能不能拿到,能拿到就等于没有防。
  • 监测加一条线。 日志里把 agent 流量单独标出来:谁来过、被拦几次、拦了之后有没有换姿势再来。反复重试的,恰恰说明你的数据对它有吸引力。

这起事件把一件事拍在桌上:取用内容的程序越来越自主,「拦」的成本和风险都在涨。与其赌每个 agent 都守规矩,不如把数据整理成该公开的唾手可得、不该公开的碰都碰不到——既是给 AI 答案供货,也是给自己省麻烦。